یکی از چالشهای اصلی در آموزش مدلهای مولد (مانند مدلهای تصویرساز) با استفاده از یادگیری تقویتی (RL)، افت کیفیت خروجیهاست. محققان متوجه شدهاند که فرآیند Fine-tuning باعث «تورم نرم» (Norm Inflation) در محاسبات مدل میشود که به کاهش کیفیت منجر میشود.
حالا با معرفی روش جدید «NormGuard»، راهکاری ارائه شده که در حین آموزش، از این تورم غیرضروری جلوگیری میکند. این روش برخلاف اصلاحات در زمان اجرا (Inference)، بسیار موثرتر عمل کرده و باعث میشود مدل هم دقت بالایی در پاداش (Reward) داشته باشد و هم خروجیهای باکیفیتتری تولید کند.
این یک قدم مهم برای پایدارتر کردن مدلهای هوش مصنوعی پس از مرحله آموزش تقویتی است! 💡
منبع: arXiv Computer Vision
