🧠 راز توانایی استدلال در مدل‌های زبانی کشف شد!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی به بررسی این موضوع پرداخته‌اند که چرا ترکیب «آموزش نظارت‌شده» (SFT) و «یادگیری تقویتی» (RL) باعث می‌شود مدل‌های زبانی (LLMs) در استدلال بسیار قوی‌تر عمل کنند.

نکته کلیدی این پژوهش، مفهوم «تعمیم ترکیبی» (Compositional Generalization) است. این مطالعه نشان می‌دهد که SFT مواد اولیه (ماژول‌های پایه) را برای مدل فراهم می‌کند و RL با تجزیه و تحلیل مسیرهای استدلال، یاد می‌گیرد که چطور این قطعات را مانند پازل کنار هم بچیند تا مسائل پیچیده و جدید را حل کند.

به زبان ساده: مدل یاد می‌گیرد به جای حفظ کردن، «مهارت‌های کوچک» را به شکلی هوشمندانه ترکیب کند تا قدرت حل مسئله‌اش به شدت افزایش یابد. این یافته مسیر را برای ساخت مدل‌های منطقی‌تر و خلاق‌تر هموارتر می‌کند. 🚀

منبع: arXiv Machine Learning