محققان در پژوهشی جدید، متد نوآورانهای به نام CLEANER را معرفی کردهاند که مشکل بزرگ مدلهای زبانی کوچک (4B تا 7B) را در حل مسائل پیچیده حل میکند.
مدلهای کوچک معمولاً هنگام استفاده از ابزارهایی مثل پایتون، دچار خطا میشوند و این «ردپایِ اشتباه» باعث یادگیری نادرست آنها میشود. اما تکنیک CLEANER با استفاده از قابلیت خوداصلاحی مدل، مسیرهای حل مسئله را قبل از آموزش «پاکسازی» میکند. این یعنی مدل یاد میگیرد چگونه از ابتدا درست فکر کند، نه اینکه فقط چرخههای تکرار خطا را حفظ کند! این روش در بنچمارکهای سخت مثل LiveCodeBench عملکرد خیرهکنندهای داشته است. ✨
منبع: arXiv Machine Learning
