محققان در مقاله جدیدی راهکار نوآورانه «QUADS» را معرفی کردهاند که مشکل ناپایداری در یادگیری تقویتی (RL) مدلهای بزرگ زبانی از نوع Mixture-of-Experts را حل میکند.
چالش اصلی، استفاده از فرمت کمدقت NVFP4 بود که باعث فروپاشی آموزش مدل میشد. روش QUADS با تراز کردن خطاهای کوانتیزاسیون و اصلاح فعالسازها، اجازه میدهد مدلهای MoE با همان دقت مدلهای BF16 و سرعتی بسیار بالاتر آموزش ببینند. این دستاورد میتواند سرعت آموزش مدلهای هوش مصنوعی را به شکل چشمگیری افزایش دهد. 🔥
منبع: arXiv Machine Learning
