🚀 بهینه‌سازی دقیق‌تر مدل‌های زبانی: معرفی روش Normalized Rewards

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی، راهکار نوآورانه‌ای برای رفع یکی از مشکلات رایج در آموزش مدل‌های بزرگ زبانی (LLMs) ارائه داده‌اند. الگوریتم‌های هم‌سوسازی مانند DPO، گاهی بیش از حد روی مدل‌های پاداشِ ضمنی تمرکز می‌کنند که منجر به رفتارهای ناخواسته در خروجی‌ها می‌شود.

این پژوهش جدید با استفاده از یک جمله «نرمال‌سازی طول» (Length-normalized) در فرآیند آموزش، به مدل کمک می‌کند تا بدون از دست دادن کیفیت پاسخ‌دهی، توازن بهتری میان عملکرد در بنچ‌مارک‌های کلی و دقت در ترجیحات انسانی برقرار کند. نتایج آزمایش روی مدل Llama-3.1-8B خیره‌کننده است: بیش از ۲۰ درصد بهبود در امتیازات AlpacaEval2 و جهش قابل توجه در عملکرد کلی مدل!

این یعنی هوش مصنوعی در آینده نه تنها دقیق‌تر، بلکه با استانداردها و ترجیحات ما هماهنگ‌تر خواهد بود. ✨

منبع: arXiv AI