🚀 انقلابی در آموزش مدل‌های زبانی: آموزش پایدار با دقت FP4! ⚡️

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید، راهکار هوشمندانه‌ای برای کاهش دقت آموزش مدل‌های زبانی بزرگ (LLM) پیدا کرده‌اند. تا پیش از این، حرکت از دقت FP8 به FP4 به دلیل بی‌ثباتی در محاسبات و خطا در زمان جابه‌جایی تنسورها (Transposition) چالش‌برانگیز بود.

این روش جدید با استفاده از «کوانتیزاسیون بلوکی دوبعدی» (2D Block Quantization)، این بی‌ثباتی را رفع کرده و باعث شده مدل‌های هوش مصنوعی با دقت FP4، عملکردی بسیار نزدیک به دقت استاندارد BF16 داشته باشند. این یعنی کاهش چشمگیر در هزینه‌ها و منابع پردازشی بدون افت محسوس در کیفیت مدل! 📉💡

منبع: arXiv AI