محققان در مطالعه اخیر خود، راهکار جدیدی برای «همسوسازی مدلها با بازخورد انسانی» (RLHF) معرفی کردهاند که به جای تکیه بر میانگین هزینهها، روی کنترل ریسکهای دمتوزیعی (Tail Risks) تمرکز دارد.
مدل جدیدی که تحت عنوان RAD ارائه شده، از مفهوم «سلطه تصادفی» (Stochastic Dominance) استفاده میکند تا مدلهای زبانی را در برابر اتفاقات نادر و پیشبینینشده مقاومتر کند. این روش به جای بهینهسازی صرف بر اساس یک عدد (انتظار ریاضی)، کل توزیع هزینه را تحلیل میکند تا امنیت خروجیها در شرایط بحرانی تضمین شود. این دستاورد گام بزرگی برای کاربردیتر و ایمنتر کردن هوش مصنوعی در محیطهای حساس است. 🛡🧠
منبع: arXiv AI
