محققان به تازگی راهکار نوآورانهای برای چالش همیشگیِ «بهینهسازی ترجیحات» (Preference Optimization) در مدلهای زبانی ارائه دادهاند. مشکل بسیاری از روشهای فعلی این است که هنگام آموزش مدل برای یادگیریِ پاسخهای بهتر، ناخواسته پاسخهای «خوب» را هم سرکوب میکنند.
این تحقیق جدید با معرفی مفهوم «باند گسست» (DB) و روش «کالیبراسیون پاداش» (RC)، به مدل یاد میدهد که چطور دقیقتر عمل کند: یعنی «بازنده» را سرکوب کند اما «برنده» را حفظ کند! این روش به عنوان یک ابزار جانبی (Plug-and-play) عمل میکند و بدون نیاز به طراحی دوباره کل مدل، عملکرد نهایی را بهبود میبخشد.
برای برنامهنویسان و محققانی که روی همسو کردن مدلها (Alignment) کار میکنند، این مقاله جدید میتواند کلید افزایش دقت خروجیها باشد. 💡
🔗 جزئیات بیشتر و کد پروژه در گیتهاب:
https://github.com/IceyWuu/DisentangledPreferenceOptimization
منبع: arXiv AI
