🚀 چرا مدل‌های هوش مصنوعی با آموزش RLVR «کم‌هوش‌تر» می‌شوند؟ 🧠

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه جدیدی به بررسی پدیده‌ای جالب به نام «وارونگی Pass@k» پرداخته‌اند. اگرچه یادگیری تقویتی با پاداش‌های قابل‌تأیید (RLVR) باعث بهبود دقت مدل در پاسخ‌های تکی می‌شود، اما جالب است بدانید که می‌تواند عملکرد مدل را در استدلال‌های پیچیده‌تر (در مقیاس بزرگ) تضعیف کند!

این مطالعه توضیح می‌دهد که چگونه آموزش RLVR ممکن است مسیرهای صحیح و نایابِ استدلال را در مدل‌های پایه از بین ببرد. آن‌ها راهکاری به نام «لنگر انداختن پایه» (PBA) پیشنهاد داده‌اند تا از این افت عملکرد جلوگیری کرده و مدل‌ها را هم در دقتِ تک‌نمونه و هم در پایداری استدلال، هوشمندتر نگه دارند. این یافته برای بهبودِ آموزشِ مدل‌های استدلالیِ آینده بسیار کلیدی است. 🔍✨

منبع: arXiv AI