محققان در پژوهشی جدید، فریمورک نوآورانه «Prefix-GRPO» را برای بهبود عاملهای هوشمند (AI Agents) معرفی کردند. این متد با ترکیب یادگیری تقویتشده و بهینهسازی پیشوندها، به مدلهای کوچک کمک میکند تا در محیطهای پیچیده و طولانیمدت، عملکردی بسیار دقیقتر و کارآمدتر نسبت به روشهای سنتی داشته باشند. این دستاورد گام مهمی در آموزش عاملهایی است که باید در دنیای واقعی تصمیمات متوالی بگیرند.
🔗 جزئیات بیشتر و دسترسی به کد پروژه:
https://github.com/HappynessI/Prefix_GRPO
منبع: arXiv Machine Learning
