محققان در مطالعه جدیدی به بررسی عمیق الگوریتمهای آموزش مدلهای زبانی (مثل آنچه در DeepSeek-R1 دیدیم) پرداختهاند و یک «قضیه عدم امکان» را در این حوزه اثبات کردهاند! 📉
ماجرا از این قرار است که روشهای محبوب آموزش مانند GRPO و اصلاحیه آن یعنی Dr. GRPO، هر دو دارای نقاط ضعف بنیادی هستند. به گفته محققان، در حال حاضر هیچ راهکار طولمبنایی وجود ندارد که همزمان «تخمین گرادیان بدون سوگیری» و «عدم وابستگی طول مسیر به خروجی» را تضمین کند. به عبارت سادهتر، شما یا باید با سوگیری در گرادیان کنار بیایید یا با تاثیر ناخواسته طول پاسخها بر یادگیری مدل.
این تحقیق نشان میدهد که دنیای آموزش مدلهای هوش مصنوعی هنوز تا رسیدن به روشهای «بینقص» فاصله دارد و ما فعلاً در حال انتخاب بین دو کفه نامتعادل ترازو هستیم. دنیای تحقیق در AI هر روز پیچیدهتر و جذابتر میشود! 🤖✨
منبع: arXiv Machine Learning
