یکی از بزرگترین چالشهای مدلهای زبانی فعلی (LLMs)، هزینهی سنگین حافظه برای پردازش متون طولانی (Long-Context) است. اما خبر خوب اینکه محققان متد جدیدی به نام L2A (Learning To Attend) معرفی کردهاند که به جای درگیر کردن تمام توکنها، یاد میگیرد چه زمانی از حافظه جهانی استفاده کند.
ویژگیهای کلیدی این دستاورد:
✅ افزایش موثر طول متن از ۳۲ هزار به ۱۲۸ هزار توکن.
✅ افزایش ۲ برابری سرعت آموزش و زمان تولید پاسخ (Time-to-First-Token).
✅ کاهش ۵۰ درصدی مصرف حافظه KV Cache بدون افت دقت.
این یعنی در آینده نزدیک، مدلهای هوش مصنوعی میتوانند کتابهای کامل یا کدهای بسیار طولانی را با سرعت و دقت بسیار بیشتری پردازش کنند بدون اینکه نیاز به سختافزارهای فوققدرتمند داشته باشند! 🧠💻
منبع: arXiv Machine Learning
