محققان در مقاله جدیدی، روشی نوآورانه به نام ReOPD (مخفف Replayed-Prefix On-Policy Distillation) را معرفی کردهاند که تحولی در نحوه آموزش مدلهای زبانی ایجنتیک ایجاد میکند.
💡 نکته اصلی این دستاورد چیست؟
در حالت عادی، آموزش مدلهای ایجنتیک بسیار هزینهبر و کند است. روش جدید ReOPD با استفاده مجدد از دادههای قبلی (Replay) و حذف نیاز به اجرای تعاملات محیطی در هر مرحله آموزشی، توانسته است سرعت آموزش را حداقل ۴ برابر بیشتر کند، آن هم بدون افت دقت مدل!
این روش با حل مشکل «تله پیشوند» (Prefix Trap) و مدیریت بهتر توزیع دادهها، گامی بزرگ در جهت ساخت ایجنتهای هوشمندِ کارآمدتر و اقتصادیتر محسوب میشود.
منبع: arXiv AI
