یکی از بزرگترین چالشهای مدلهای زبانی (LLM)، مصرف سنگین حافظه در زمان پردازش متنهای طولانی (Context Windows) است. محققان به تازگی چارچوب جدیدی به نام DynaCalKV را معرفی کردهاند که با استفاده از تکنیک فشردهسازی لایه Key-Value (KV Cache)، این مشکل را حل میکند.
این روش چه تفاوتی دارد؟
✅ برخلاف متدهای قدیمی، در این مدل به صورت مجزا برای Key و Value تصمیمگیری میشود.
✅ استفاده از الگوریتم CKA برای گروه بندی هوشمند Headها و تخصیص بهینه منابع.
✅ کاهش چشمگیر مصرف حافظه بدون افت دقت مدل در مدلهای Multi-Head Attention.
این تحقیق نشان میدهد که میتوان با بهینهسازی دقیقتر ساختار داخلی مدلها، آنها را برای پردازش متون بسیار طولانیتر و کارآمدتر آماده کرد. قدمی دیگر به سوی هوش مصنوعی سریعتر و بهینهتر! ⚡️
منبع: arXiv Machine Learning
