محققان در تازهترین مقاله خود راهکار هوشمندانهای به نام ACRL (Adaptive Control Reinforcement Learning) معرفی کردند تا مشکل «عدم تطابق آموزش و استنتاج» (Training-Inference Discrepancy) را در یادگیری تقویتی مدلهای زبانی حل کنند.
این ناهماهنگی که اغلب به دلیل تفاوت دقت محاسباتی در زمان آموزش و استنتاج رخ میدهد، عامل اصلی ناپایداری مدلهاست. روش ACRL با کنترل هوشمندانه این شکاف، نه تنها پایداری آموزش را تضمین میکند، بلکه با افزایش آنتروپی، باعث بهبود یادگیری و دقت نهایی مدل میشود. این دستاورد به ویژه برای بهینهسازی مدلهایی که از کوانتایزیشن FP8 استفاده میکنند، یک گام بزرگ رو به جلو است.
منبع: arXiv Machine Learning
