محققان در تازهترین دستاورد خود، چارچوب جدیدی به نام PACS را برای بهبود یادگیری تقویتی (RLVR) معرفی کردهاند. این روش با تبدیل فرآیند یادگیری به یک مدل نظارتشده (Supervised Learning)، مشکل ناپایداری و پاداشهای پراکنده در مدلهای زبانی را حل میکند.
نتایج این تحقیق نشان میدهد که استفاده از PACS میتواند کارایی مدلهای هوش مصنوعی در حل مسائل پیچیده ریاضی و برنامهنویسی را تا ۹.۵ درصد افزایش دهد. این پیشرفت مسیر جدیدی برای آموزش بهینهتر مدلهای زبانی پس از مرحله پیشآموزش باز کرده است.
🔗 کد و دیتای این تحقیق به صورت متنباز در دسترس قرار گرفته است.
منبع: arXiv Machine Learning
