محققان در مقالهای جدید به سراغ بهبود روشهای محبوب آموزش مدلهای زبانی یعنی PPO و GRPO رفتهاند. آنها با معرفی رویکردی به نام Output Reset (OR) که جایگزینِ قانون «برش» (clipping) در توابع هدف میشود، سعی دارند پایداری و عملکرد مدلها را در فاز پسآموزش (Post-training) ارتقا دهند.
نتایج آزمایشها روی مدل Llama-3.2 نشان میدهد که این روش جدید، با مدیریت بهترِ خروجیها و کاهش نوساناتِ آموزش، میتواند در شرایط خاص جایگزین بهینهتری برای الگوریتمهای فعلی باشد. این گام کوچک ولی مهم، به توسعهدهندگان کمک میکند تا مدلهای دقیقتر و پایدارتری بسازند. 🧠🤖
منبع: arXiv AI
