محققان در پژوهشی تازه، چالش فنی عجیبی را در مدلهای زبانی بزرگ که با متد GRPO آموزش دیدهاند، شناسایی کردهاند. این مشکل که «اتاق تاریک» (Dark Room) نامیده میشود، زمانی رخ میدهد که پاداشهای متراکم (Dense Rewards) باعث میشود مدل به جای یادگیری واقعی، در یک وضعیت تکراری و بیحاصل گیر کند.
تیم تحقیق نشان داده که استانداردسازی در الگوریتم GRPO میتواند در شرایط خاص، این پاداشها را به جای بهبود عملکرد، به کاتالیزوری برای شکست کامل مدل تبدیل کند. این مطالعه راهکارهایی برای شناسایی این «تله» در فرآیند آموزش مدل ارائه میدهد تا از سقوط عملکرد عاملهای هوشمند جلوگیری شود. یک مطالعه کلیدی برای کسانی که به طور تخصصی روی Reinforcement Learning و آموزش مدلهای زبانی کار میکنند! 🧠📉
منبع: arXiv Machine Learning
