🚀 جهش در آموزش مدل‌های فوق‌بزرگ با تکنولوژی جدید SLAI T-Rex!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در دستاوردی تازه، موفق به بهینه‌سازی آموزش مدل‌های غول‌آسای خانواده DeepSeek-V4 روی زیرساخت‌های پردازشی Ascend NPU شدند. سیستم «SLAI T-Rex» با بهینه‌سازی دقیق در لایه‌های مدل، محاسبات و ارتباطات، توانسته کارایی آموزش (MFU) را تا ۳۴.۲۲٪ افزایش دهد.

این تیم همچنین با تمرکز بر مسائل پیچیده ریاضی و تحقیق در عملیات (OR)، مدل اختصاصی خود را آموزش داده‌اند که در تست‌های استدلال zero-shot، عملکردی خیره‌کننده و حتی فراتر از رقبا به ثبت رسانده است. این یک گام مهم دیگر در اثبات قدرت سخت‌افزارهای غیر از GPU در پیشبرد مدل‌های هوش مصنوعی است. 🤖⚙️

منبع: arXiv NLP