🚀 بهینه‌سازی انقلابی در آموزش مدل‌های زبانی: معرفی Ember

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا تا به حال به محدودیت‌های حافظه هنگام آموزش مدل‌های عظیم فکر کرده‌اید؟ محققان در مقاله جدیدی با عنوان «Token Geometry»، بهینه‌ساز فوق‌سبکی به نام Ember را معرفی کرده‌اند که بازی را تغییر می‌دهد!

🔹 چرا این خبر مهم است؟
این ابزار جدید به جای استفاده از حافظه سنگین بهینه‌سازهای رایج مثل Adam، با استفاده از هندسه گرادیان در لایه‌های Embedding و LM-head، نیاز به VRAM را به طرز چشمگیری کاهش می‌دهد. این یعنی:
✅ کاهش مصرف حافظه (O(V+D))
✅ حذف نیاز به شارد کردن جداگانه جداول توکن‌ها
✅ سرعت و کارایی بالاتر در آموزش و تنظیم دقیق (Finetuning) مدل‌های بزرگ.

محققان حتی ثابت کردند که برخلاف تصور رایج، مسیر بهینه‌سازی توکن‌ها در فضای مدل‌های عصبی بسیار ساده‌تر از آن چیزی است که فکر می‌کردیم. کد این پروژه برای علاقه‌مندان به حوزه بهینه‌سازی مدل‌های زبانی در گیت‌هاب منتشر شده است.

🔗 لینک گیت‌هاب پروژه Ember

‌سازی

منبع: arXiv AI