🚀 انقلابی در ثبات آموزش مدل‌های هوش مصنوعی با روش S2T-RLHF

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک دستاورد تازه، راهکار هوشمندانه‌ای برای حل مشکل «ناپایداری» در فرآیند RLHF (یادگیری تقویتی از بازخورد انسانی) ارائه داده‌اند.

مشکل اصلی مدل‌های فعلی این است که بازخوردهای کلی (در سطح کل پاسخ)، وقتی به سطح توکن‌ها خرد می‌شوند، باعث سردرگمی مدل و افت کیفیت آموزش می‌شوند. متد جدید «S2T-RLHF» با استفاده از «جملات» به عنوان یک لایه میانی، بازخوردها را به شکلی متعادل‌تر توزیع می‌کند تا مدل بدون نیاز به بازآموزی مدلِ پاداش، بسیار پایدارتر و دقیق‌تر آموزش ببیند. این یعنی پاسخ‌های دقیق‌تر و هوشمندتر از مدل‌های زبانی! 🧠✨

منبع: arXiv AI