محققان در مطالعه جدیدی به بررسی پدیدهای جالب به نام «وارونگی Pass@k» پرداختهاند. اگرچه یادگیری تقویتی با پاداشهای قابلتأیید (RLVR) باعث بهبود دقت مدل در پاسخهای تکی میشود، اما جالب است بدانید که میتواند عملکرد مدل را در استدلالهای پیچیدهتر (در مقیاس بزرگ) تضعیف کند!
این مطالعه توضیح میدهد که چگونه آموزش RLVR ممکن است مسیرهای صحیح و نایابِ استدلال را در مدلهای پایه از بین ببرد. آنها راهکاری به نام «لنگر انداختن پایه» (PBA) پیشنهاد دادهاند تا از این افت عملکرد جلوگیری کرده و مدلها را هم در دقتِ تکنمونه و هم در پایداری استدلال، هوشمندتر نگه دارند. این یافته برای بهبودِ آموزشِ مدلهای استدلالیِ آینده بسیار کلیدی است. 🔍✨
منبع: arXiv AI
