محققان در مقالهای جدید، راهکار نوآورانهای به نام JoLT برای فشردهسازی حافظه KV Cache در مدلهای ترنسفورمر (LLM) معرفی کردهاند. همانطور که میدانید، حجم بالای این حافظه در پردازش متنهای طولانی، گلوگاه اصلی سرعت و هزینه است.
ویژگیهای این روش جدید:
🔹 استفاده از تجزیه تانسوری (Tucker) برای شناسایی بخشهای اضافی در توکنها و ویژگیها.
🔹 بازیابی دقت با استفاده از کوانتش باقیمانده (Residual Quantization).
🔹 دستیابی به فشردهسازی ۲ تا ۳ برابری بدون افت محسوس در دقت (Near-Lossless).
این یعنی به زودی میتوانیم مدلهای بزرگتر را روی سختافزارهای محدودتر با سرعت و کارایی بسیار بالاتر اجرا کنیم! 🧠💡
منبع: arXiv Machine Learning
