SAFFRON-1: Safety Inference Scaling

SAFFRON-1: استنتاج مقیاس‌شده برای ایمنی

بروزرسانی مهر 27, 1404

ثبت کننده سارا کردستانی

تعداد بازدید 92

این پژوهش برای اولین بار مقیاس‌دهی استنتاج را برای تضمین ایمنی مدل‌های زبانی بزرگ معرفی می‌کند، معضل کارایی-اکتشاف را در روش‌های موجود شناسایی کرده و سافران را به عنوان یک پارادایم نوین با استفاده از مدل پاداش چندشاخه‌ای (MRM) برای کاهش فراخوانی‌های مدل پاداش پیشنهاد می‌دهد. این روش، نظارت جزئی برای آموزش MRM، یک محدودیت اکتشاف محافظه‌کارانه و استراتژی حافظه‌نهان کلید-مقدار مبتنی بر درخت پیشوندی را معرفی می‌کند. ارزیابی‌ها بهبود چشمگیر در کارایی مقیاس‌دهی و مقاومت در برابر حملات جیلبریک را نشان می‌دهند.

 

This work pioneers inference scaling for LLM safety assurance, identifying the exploration-efficiency dilemma in existing methods and proposing SAFFRON, a novel paradigm using a multifurcation reward model (MRM) to reduce reward model calls. It introduces partial supervision for MRM training, a conservative exploration constraint, and Trie-based KV caching. Evaluations show significant improvements in scaling efficiency and robustness against jailbreak attacks.

  • عنوان مقاله: AI Safety
  • محور مقاله: تکنیک نوین (استنتاج مقیاس‌شده)
  • افیلیشن نویسنده مسئول: University of Illinois Urbana-Champaign, IL, USA
  • ایمیل نویسنده فقط برای کاربران ورود / عضویت
  • سال انتشار مقاله: 2025
  • زبان: انگلیسی
  • کشور: ایالات متحده آمریکا
  • کد مقاله: 22497
  • کلمات کلیدی فارسی: ایمنی مدل‌های زبانی بزرگ، مقیاس‌دهی استنتاج، حملات جیلبریک، مدل‌سازی پاداش، مدل پاداش چندشاخه‌ای
  • کلمات کلیدی انگلیسی: LLM Safety, Inference Scaling, Jailbreak Attacks, Reward Modeling, Multifurcation Reward Model
  • لینک کوتاه: https://wikisaffron.org?p=22497

دیدگاهتان را بنویسید

نشانی ایمیل شما منتشر نخواهد شد. بخش‌های موردنیاز علامت‌گذاری شده‌اند *