دانشمندان هوش مصنوعی به روشی نوآورانه برای انتقال تواناییهای استدلالی مدلهای بزرگ به مدلهای کوچکتر (Distillation) دست یافتهاند. چالش اصلی این است که مدلهای بزرگ معمولاً خیلی طولانی حرف میزنند!
این تحقیق با استفاده از یک “برنامه درسی سه مرحلهای” و تکنیک GRPO، به مدلهای کوچک یاد میدهد که چطور ضمن حفظ دقت، خروجیهای بسیار کوتاهتر و دقیقتری داشته باشند. نتیجه آزمایشها روی مدل Qwen2.5-3B فوقالعاده بوده: حدود ۱۱ درصد بهبود دقت همراه با کاهش ۲۷ درصدی طول پاسخها! این یک گام بزرگ برای اجرای مدلهای هوشمند روی گوشیها و دستگاههای ضعیفتر است. 🚀
منبع: arXiv Machine Learning
