محققان در مقالهای جدید، تکنیک نوآورانهای به نام «ReOPD» را برای آموزش مدلهای زبانی معرفی کردهاند که چالش هزینههای بالای تعامل با محیط را بهطور هوشمندانهای حل میکند.
💡 نکات کلیدی این دستاورد:
🔹 حذف نیاز به اجرای محیط در حین آموزش (صفر بار استفاده از ابزار در زمان آموزش دانشآموز).
🔹 افزایش ۴ برابری سرعت نسبت به روشهای سنتی (OPD).
🔹 حل مشکل «تلهی پیشوند» (Prefix Trap) برای بهبود دقت در استدلالهای ریاضی و محاسباتی.
این روش با استفاده از دادههای از پیش جمعآوری شده، مسیر آموزش ایجنتهای هوشمند را بسیار کارآمدتر و سریعتر کرده است.
منبع: arXiv Machine Learning
