محققان در پژوهشی جدید، راهکار هوشمندانهای برای کاهش دقت آموزش مدلهای زبانی بزرگ (LLM) پیدا کردهاند. تا پیش از این، حرکت از دقت FP8 به FP4 به دلیل بیثباتی در محاسبات و خطا در زمان جابهجایی تنسورها (Transposition) چالشبرانگیز بود.
این روش جدید با استفاده از «کوانتیزاسیون بلوکی دوبعدی» (2D Block Quantization)، این بیثباتی را رفع کرده و باعث شده مدلهای هوش مصنوعی با دقت FP4، عملکردی بسیار نزدیک به دقت استاندارد BF16 داشته باشند. این یعنی کاهش چشمگیر در هزینهها و منابع پردازشی بدون افت محسوس در کیفیت مدل! 📉💡
منبع: arXiv AI



