محققان روش جدیدی به نام «ReOPD» معرفی کردهاند که یادگیری مدلهای هوش مصنوعی (Agentic Tasks) را متحول میکند. مشکل اصلی روشهای فعلی این است که برای آموزش، نیاز به تعاملات پرهزینه با محیط و استفاده مداوم از مدل معلم دارند.
ویژگیهای کلیدی ReOPD:
✅ حذف نیاز به اجرای محیط در هر مرحله (Off-environment)
✅ استفاده از پیشفرضهای بازیابی شده (Replayed-Prefix) برای نظارت دقیق
✅ حداقل ۴ برابر سریعتر از روشهای متداول (OPD)
✅ دقت بالا در مسائل استدلال ریاضی و جستجو بدون نیاز به فراخوانی ابزارها در حین آموزش
این روش با مدیریت هوشمندانه توزیع دادهها، مانع از خطاهای رایج در سیستمهای چندمرحلهای میشود و گامی مهم برای توسعه مدلهای ایجنتیک کارآمدتر است.
منبع: arXiv Machine Learning
