محققان در مقالهای جدید، رویکردی هوشمندانه برای بهبود «آموزش پس از یادگیری» (Post-training) در ایجنتهای مبتنی بر مدلهای زبانی بزرگ (LLM) ارائه دادهاند. چالش اصلی، شکاف بین دادههای آموزشی و شرایط واقعی است که ایجنت در حین انجام کار با آنها مواجه میشود.
این تحقیق نشان میدهد که به جای استفاده از دموهای طولانی، استفاده از «چند گام کوتاه» از راهنماییهای معلم در لحظاتی که ایجنت در حال تصمیمگیری است، بسیار بهینهتر و موثرتر عمل میکند. این روش باعث میشود بودجه محاسباتی بهتر مدیریت شود و ایجنتها در محیطهایی مثل HotpotQA عملکرد بسیار دقیقتری داشته باشند. گامی دیگر به سوی هوش مصنوعی عملگرا و اقتصادیتر! 💡🤖
منبع: arXiv AI
