محققان در یک پژوهش جدید، فریمورک نوآورانه MADA-RL را معرفی کردهاند که به مدلهای زبانی کوچک (کمتر از ۴ میلیارد پارامتر) اجازه میدهد با استفاده از یادگیری تقویتی و روش «مناظرهمحور»، قدرت استدلال خود را به شدت افزایش دهند.
🔹 نکته کلیدی: در این روش، مدل به دو نقش «تولیدکننده» و «منتقد» تقسیم میشود و با بهینهسازی پارامترها از طریق LoRA، مدلهای سبک هم میتوانند دقت خود را در مسائل ریاضی و منطقی بهطور چشمگیری بهبود ببخشند (مثلاً افزایش ۲ درصدی دقت در مدل ۱.۵ میلیاردی Qwen).
این دستاورد یک گام بزرگ برای اجرای مدلهای هوشمند و دقیق روی سختافزارهای محدود و گوشیهای موبایل است. 📱🧠
منبع: arXiv AI
