محققان در مقاله جدیدی روشی نوآورانه به نام «Looped Latent Attention» (LLA) را معرفی کردهاند که تحولی در مدیریت حافظه کش (KV Cache) در مدلهای ترنسفورمر ایجاد میکند.
💡 چرا این خبر مهم است؟
مدلهای زبانی در هنگام تولید متن، حجم عظیمی از حافظه را برای ذخیره وضعیتهای قبلی اشغال میکنند. روش LLA با فشردهسازی هوشمند دادهها، نه تنها دقت مدل را حفظ میکند، بلکه باعث میشود ظرفیت پردازش مدلها (مثل Ouro) تا بیش از ۲۱ برابر افزایش یابد! این یعنی سرعت بیشتر و هزینههای عملیاتی کمتر برای مدلهای هوش مصنوعی بزرگ.
این دستاورد فنی، راه را برای اجرای مدلهای بسیار پیچیده بر روی سختافزارهای محدودتر هموار میکند. 🧠✨
منبع: arXiv Machine Learning
