محققان در پژوهشی جذاب بررسی کردهاند که تفاوت اصلی مدلهای پایه و مدلهای «متفکر» (Reasoning Models) در چیست. نتیجه جالب این تحقیق نشان میدهد که:
✅ مدلهای پایه از قبل «مکانیسمهای استدلال» را در خود دارند.
✅ روشهای تقویت یادگیری (RL) در واقع به مدل یاد میدهند که «چه زمانی» از این مکانیسمها استفاده کند (یادگیری استراتژی).
✅ روشهای SFT-distillation (تنظیم دقیق) بیشتر به دنبال «ایجاد» مکانیسمهای جدید در مدل هستند.
این کشف جدید، دیدگاه متفاوتی برای ساخت مدلهای هوشمندتر و کارآمدتر پیش روی مهندسان قرار میدهد. حالا بهتر میدانیم که وقتی یک مدل را آموزش میدهیم، دقیقاً چه تغییری در ذهن آن ایجاد میکنیم! 🔍✨
منبع: arXiv AI
