این پژوهش برای اولین بار مقیاسدهی استنتاج را برای تضمین ایمنی مدلهای زبانی بزرگ معرفی میکند، معضل کارایی-اکتشاف را در روشهای موجود شناسایی کرده و سافران را به عنوان یک پارادایم نوین با استفاده از مدل پاداش چندشاخهای (MRM) برای کاهش فراخوانیهای مدل پاداش پیشنهاد میدهد. این روش، نظارت جزئی برای آموزش MRM، یک محدودیت اکتشاف محافظهکارانه و استراتژی حافظهنهان کلید-مقدار مبتنی بر درخت پیشوندی را معرفی میکند. ارزیابیها بهبود چشمگیر در کارایی مقیاسدهی و مقاومت در برابر حملات جیلبریک را نشان میدهند.
This work pioneers inference scaling for LLM safety assurance, identifying the exploration-efficiency dilemma in existing methods and proposing SAFFRON, a novel paradigm using a multifurcation reward model (MRM) to reduce reward model calls. It introduces partial supervision for MRM training, a conservative exploration constraint, and Trie-based KV caching. Evaluations show significant improvements in scaling efficiency and robustness against jailbreak attacks.
- Authors: Ruizhong Qiu, Gaotang Li, Tianxin Wei, Jingrui He, Hanghang Tong
- URL: https://arxiv.org/abs/2506.06444v2
- DOI URL: https://doi.org/10.48550/arXiv.2506.06444
- عنوان مقاله: AI Safety
- محور مقاله: تکنیک نوین (استنتاج مقیاسشده)
- افیلیشن نویسنده مسئول: University of Illinois Urbana-Champaign, IL, USA
- ایمیل نویسنده فقط برای کاربران ورود / عضویت
- سال انتشار مقاله: 2025
- زبان: انگلیسی
- کشور: ایالات متحده آمریکا
- کد مقاله: 22497
- کلمات کلیدی فارسی: ایمنی مدلهای زبانی بزرگ، مقیاسدهی استنتاج، حملات جیلبریک، مدلسازی پاداش، مدل پاداش چندشاخهای
- کلمات کلیدی انگلیسی: LLM Safety, Inference Scaling, Jailbreak Attacks, Reward Modeling, Multifurcation Reward Model
- لینک کوتاه: https://wikisaffron.org?p=22497