🚀 بهینه‌سازی دقیق‌تر برای مدل‌های زبانی: معرفی متد OR

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید به سراغ بهبود روش‌های محبوب آموزش مدل‌های زبانی یعنی PPO و GRPO رفته‌اند. آن‌ها با معرفی رویکردی به نام Output Reset (OR) که جایگزینِ قانون «برش» (clipping) در توابع هدف می‌شود، سعی دارند پایداری و عملکرد مدل‌ها را در فاز پس‌آموزش (Post-training) ارتقا دهند.

نتایج آزمایش‌ها روی مدل Llama-3.2 نشان می‌دهد که این روش جدید، با مدیریت بهترِ خروجی‌ها و کاهش نوساناتِ آموزش، می‌تواند در شرایط خاص جایگزین بهینه‌تری برای الگوریتم‌های فعلی باشد. این گام کوچک ولی مهم، به توسعه‌دهندگان کمک می‌کند تا مدل‌های دقیق‌تر و پایدارتری بسازند. 🧠🤖

منبع: arXiv AI