🚀 جهش در کارایی مدل‌های زبانی: فشرده‌سازی هوشمند KV Cache با روش JoLT!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله‌ای جدید، راهکار نوآورانه‌ای به نام JoLT برای فشرده‌سازی حافظه KV Cache در مدل‌های ترنسفورمر (LLM) معرفی کرده‌اند. همان‌طور که می‌دانید، حجم بالای این حافظه در پردازش متن‌های طولانی، گلوگاه اصلی سرعت و هزینه است.

ویژگی‌های این روش جدید:
🔹 استفاده از تجزیه تانسوری (Tucker) برای شناسایی بخش‌های اضافی در توکن‌ها و ویژگی‌ها.
🔹 بازیابی دقت با استفاده از کوانتش باقی‌مانده (Residual Quantization).
🔹 دستیابی به فشرده‌سازی ۲ تا ۳ برابری بدون افت محسوس در دقت (Near-Lossless).

این یعنی به زودی می‌توانیم مدل‌های بزرگتر را روی سخت‌افزارهای محدودتر با سرعت و کارایی بسیار بالاتر اجرا کنیم! 🧠💡

منبع: arXiv Machine Learning