آیا تا به حال به محدودیتهای حافظه هنگام آموزش مدلهای عظیم فکر کردهاید؟ محققان در مقاله جدیدی با عنوان «Token Geometry»، بهینهساز فوقسبکی به نام Ember را معرفی کردهاند که بازی را تغییر میدهد!
🔹 چرا این خبر مهم است؟
این ابزار جدید به جای استفاده از حافظه سنگین بهینهسازهای رایج مثل Adam، با استفاده از هندسه گرادیان در لایههای Embedding و LM-head، نیاز به VRAM را به طرز چشمگیری کاهش میدهد. این یعنی:
✅ کاهش مصرف حافظه (O(V+D))
✅ حذف نیاز به شارد کردن جداگانه جداول توکنها
✅ سرعت و کارایی بالاتر در آموزش و تنظیم دقیق (Finetuning) مدلهای بزرگ.
محققان حتی ثابت کردند که برخلاف تصور رایج، مسیر بهینهسازی توکنها در فضای مدلهای عصبی بسیار سادهتر از آن چیزی است که فکر میکردیم. کد این پروژه برای علاقهمندان به حوزه بهینهسازی مدلهای زبانی در گیتهاب منتشر شده است.
سازی
منبع: arXiv AI
