محققان به تازگی هسته (Kernel) جدیدی به نام «LiteTopK» معرفی کردهاند که به طور خاص برای بهینهسازی عملیات «Sparse Attention» در مدلهای زبانی بزرگ (LLM) طراحی شده است.
💡 چرا این خبر مهم است؟
مدلهای فعلی در پردازش متون طولانی (Long-Context) با چالش کندی و مصرف حافظه بالا روبرو هستند. LiteTopK با استفاده از پدیدهی «تمرکز امتیازات» (Score Concentration)، محاسبات را هوشمندتر کرده و باعث میشود:
✅ کاهش چشمگیر ترافیک حافظه جهانی (Global Memory).
✅ افزایش سرعت عملیات Indexer-TopK در سختافزارهای GPU.
✅ بهبود عملکرد مدلهای زبانی در پردازشهای سنگین و طولانی.
این پیشرفت زیرساختی میتواند سرعت خروجی مدلهای هوش مصنوعی را در کاربردهای دنیای واقعی به شکل محسوسی افزایش دهد. 📈
منبع: arXiv Machine Learning
