محققان به یک چالش مهم در آموزش مدلهای زبانی بزرگ (LLM) پی بردهاند: این که استراتژی مدل برای یادگیری و استنتاج نباید لزوماً یکی باشد. روش جدید R²PO با اضافه کردن یک «هد» سبک به مدل، این دو فرآیند را از هم جدا میکند.
نتیجه؟ مدلها در حین یادگیری اکتشاف بیشتری میکنند و در نهایت پاسخهای دقیقتر و منسجمتری ارائه میدهند! این روش توانسته دقت مدلها در مسائل ریاضی و برنامهنویسی را به شکل قابل توجهی افزایش دهد. 🧠✨
منبع: arXiv AI
