🚀 افزایش سرعت آموزش مدل‌های زبانی با متد جدید GIFT

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از بزرگترین چالش‌های آموزش مدل‌های زبانی بزرگ (LLM)، گلوگاه‌های ارتباطی در حین انتقال گرادیان‌هاست. محققان به تازگی روشی به نام «GIFT» را معرفی کرده‌اند که با استفاده از محاسبات هندسی-محور، اجازه می‌دهد گرادیان‌ها با دقت پایین‌تر (مانند FP8) اما با حفظ کیفیت ارسال شوند.

نتیجه این نوآوری، کاهش ۷.۶ درصدی زمان آموزش مدل‌های بزرگ روی سخت‌افزارهای پیشرفته‌ای مثل NVIDIA GH200 است، بدون اینکه نیاز باشد ساختار بهینه‌ساز (Optimizer) یا متد آموزش تغییر کند. قدمی بزرگ برای کاهش هزینه‌ها و زمان در توسعه هوش مصنوعی!

منبع: arXiv Machine Learning