محققان در مقاله جدیدی، راهکار نوآورانهای برای رفع یکی از مشکلات رایج در آموزش مدلهای بزرگ زبانی (LLMs) ارائه دادهاند. الگوریتمهای همسوسازی مانند DPO، گاهی بیش از حد روی مدلهای پاداشِ ضمنی تمرکز میکنند که منجر به رفتارهای ناخواسته در خروجیها میشود.
این پژوهش جدید با استفاده از یک جمله «نرمالسازی طول» (Length-normalized) در فرآیند آموزش، به مدل کمک میکند تا بدون از دست دادن کیفیت پاسخدهی، توازن بهتری میان عملکرد در بنچمارکهای کلی و دقت در ترجیحات انسانی برقرار کند. نتایج آزمایش روی مدل Llama-3.1-8B خیرهکننده است: بیش از ۲۰ درصد بهبود در امتیازات AlpacaEval2 و جهش قابل توجه در عملکرد کلی مدل!
این یعنی هوش مصنوعی در آینده نه تنها دقیقتر، بلکه با استانداردها و ترجیحات ما هماهنگتر خواهد بود. ✨
منبع: arXiv AI
