مدلهای بزرگ استدلالی (LRM) معمولاً با مصرف تعداد زیادی توکن، هزینههای محاسباتی بالا و تأخیر زیادی را ایجاد میکنند. خبر خوب اینکه محققان در پژوهشی جدید، با استفاده از «یادگیری تقویتی تنزیلشده» (Discounted Reinforcement Learning) روشی هوشمندانه پیدا کردهاند تا مدلها بدون پرگویی و اتلاف منابع، به نتیجه درست برسند.
در این رویکرد، به جای افزایش بیپایان طول زنجیره فکر (Chain of Thought)، به مدل یاد داده میشود که مانند حل یک مسئله کوتاهترین مسیر، سریعترین و دقیقترین پاسخ را انتخاب کند. نتیجه این تحقیق؟ کاهش هزینهها و افزایش سرعت بدون افت دقت در استدلالهای پیچیده! 🔥
منبع: arXiv Machine Learning
