اگر با مدلهای زبانی بزرگ (LLM) کار میکنید، حتماً با چالش «KV-Cache» و محدودیتهای حافظه در متنهای طولانی آشنا هستید. یک تحقیق جدید و جامع، تکنیکهای مختلف فشردهسازی مثل KIVI، TurboQuant و SnapKV را روی مدلهای قدرتمندی مثل Llama-3.1 و Mistral بررسی کرده است.
نکته کلیدی این پژوهش اینجاست: صرفاً فشردهسازی زیاد به معنی عملکرد بهتر نیست! نتیجه نشان میدهد که انتخاب روش بهینه، کاملاً به نوع «کاربرد» و «وظیفهای» (مثل خلاصهسازی یا پاسخ به سوالات) بستگی دارد و باید هوشمندانه انتخاب شود.
این تحقیق نقشه راهی عالی برای مهندسان سیستم است تا تعادلی دقیق بین سرعت، کیفیت خروجی و حافظه مصرفی پیدا کنند.
سازی
منبع: arXiv AI
