محققان در یک دستاورد تازه، چارچوب جدیدی به نام SRRL را معرفی کردهاند که یادگیری تقویتی (RL) در مدلهای زبانی را متحول میکند. برخلاف روشهای معمول که در محیطهای دارای بازخورد تأخیری به مشکل میخورند، این روش با گنجاندن یک مرحله «خود-نقد» (Self-Review) در هر مرحله، به مدل کمک میکند خطاهای خود را ریشهیابی کرده و در تلاشهای بعدی، عملکرد خود را بهبود ببخشد.
نکته کلیدی اینجاست که این مدلها نه تنها اشتباهاتشان را تحلیل میکنند، بلکه این اصلاحات را در حافظه بلندمدت خود ذخیره کرده و به دانش عمومی مدل تبدیل میکنند. نتایج تستها روی مدلهای Qwen و OLMo نشاندهنده افزایش چشمگیر دقت و بهرهوری در حل مسائل منطقی است.
منبع: arXiv AI
