محققان در مقالهی جدید خود، چارچوب نوآورانهای به نام SPRO معرفی کردهاند که دنیای «یادگیری تقویتی فرآیند-محور» (PRL) را متحول میکند. برخلاف روشهای قبلی، SPRO بدون نیاز به مدلهای پاداش اضافی و پرهزینه، مستقیماً از خودِ مدل برای استخراج پاداش استفاده میکند.
نتایج آزمایشها فوقالعاده است:
✅ بهبود ۱۲.۹ درصدی در دقت مدل.
✅ افزایش ۳.۴ برابری سرعت و بهرهوری در آموزش.
✅ کاهش طول پاسخها و جلوگیری از «پاداشخواری» (Reward Hacking).
این یعنی مدلهای هوش مصنوعی در آینده نهتنها باهوشتر، بلکه بسیار بهینهتر و سریعتر خواهند شد. خبر خوبی برای توسعهدهندگان که به دنبال کاهش هزینههای محاسباتی در پیادهسازیهای صنعتی هستند!
منبع: arXiv AI
