محققان در یک دستاورد تازه، راهکار هوشمندانهای برای حل مشکل «ناپایداری» در فرآیند RLHF (یادگیری تقویتی از بازخورد انسانی) ارائه دادهاند.
مشکل اصلی مدلهای فعلی این است که بازخوردهای کلی (در سطح کل پاسخ)، وقتی به سطح توکنها خرد میشوند، باعث سردرگمی مدل و افت کیفیت آموزش میشوند. متد جدید «S2T-RLHF» با استفاده از «جملات» به عنوان یک لایه میانی، بازخوردها را به شکلی متعادلتر توزیع میکند تا مدل بدون نیاز به بازآموزی مدلِ پاداش، بسیار پایدارتر و دقیقتر آموزش ببیند. این یعنی پاسخهای دقیقتر و هوشمندتر از مدلهای زبانی! 🧠✨
منبع: arXiv AI
