محققان در مطالعه اخیر خود به نکته جالبی در مورد «خود-تقطیر» (Self-Distillation) در مدلهای زبانی متفکر (Thinking Models) دست یافتند. برخلاف انتظار، استفاده از اطلاعاتِ حلشدهی مسائل (privileged information) برای آموزشِ خودِ مدل، در مدلهای پیشرفتهی استدلالگر نه تنها کمکی نمیکند، بلکه میتواند دقت آنها را تا ۱۷ درصد کاهش دهد! 📉
این تحقیق نشان میدهد که وقتی مدلهای متفکر در حال تحلیل مسیرهای پیچیده منطقی هستند، دسترسی به «جوابهای آماده» میتواند باعث ایجاد اختلال در فرآیند یادگیری آنها در نقاط حساس تصمیمگیری (forking points) شود. در واقع، این روش که برای مدلهای معمولی مفید است، برای مدلهای پیشرفتهی فعلی نتیجه معکوس دارد.
این یافتهها مسیر جدیدی را برای توسعهدهندگان باز میکند تا روشهای بهینهسازی دقیقتری برای نسل آینده مدلهای هوشمند طراحی کنند. 🧐
های_زبانی
منبع: arXiv AI
