یکی از بزرگترین چالشهای آموزش مدلهای زبانی بزرگ (LLM)، گلوگاههای ارتباطی در حین انتقال گرادیانهاست. محققان به تازگی روشی به نام «GIFT» را معرفی کردهاند که با استفاده از محاسبات هندسی-محور، اجازه میدهد گرادیانها با دقت پایینتر (مانند FP8) اما با حفظ کیفیت ارسال شوند.
نتیجه این نوآوری، کاهش ۷.۶ درصدی زمان آموزش مدلهای بزرگ روی سختافزارهای پیشرفتهای مثل NVIDIA GH200 است، بدون اینکه نیاز باشد ساختار بهینهساز (Optimizer) یا متد آموزش تغییر کند. قدمی بزرگ برای کاهش هزینهها و زمان در توسعه هوش مصنوعی!
منبع: arXiv Machine Learning
