محققان در مقاله جدیدی به بررسی این موضوع پرداختهاند که چرا ترکیب «آموزش نظارتشده» (SFT) و «یادگیری تقویتی» (RL) باعث میشود مدلهای زبانی (LLMs) در استدلال بسیار قویتر عمل کنند.
نکته کلیدی این پژوهش، مفهوم «تعمیم ترکیبی» (Compositional Generalization) است. این مطالعه نشان میدهد که SFT مواد اولیه (ماژولهای پایه) را برای مدل فراهم میکند و RL با تجزیه و تحلیل مسیرهای استدلال، یاد میگیرد که چطور این قطعات را مانند پازل کنار هم بچیند تا مسائل پیچیده و جدید را حل کند.
به زبان ساده: مدل یاد میگیرد به جای حفظ کردن، «مهارتهای کوچک» را به شکلی هوشمندانه ترکیب کند تا قدرت حل مسئلهاش به شدت افزایش یابد. این یافته مسیر را برای ساخت مدلهای منطقیتر و خلاقتر هموارتر میکند. 🚀
منبع: arXiv Machine Learning
