یکی از بزرگترین چالشهای اجرای مدلهای زبانی (LLM) در متنهای طولانی، هزینه سنگین ذخیرهسازی و دسترسی به حافظه کش KV است. محققان با معرفی فریمورک جدید «C^2KV» این مشکل را هدف قرار دادهاند.
این متد نوآورانه با ترکیب فشردهسازی و استفاده مجدد از کش (KV Cache Reuse)، اجازه میدهد بدون آسیب به دقت مدل، هزینههای استقرار و حافظه را به شدت کاهش دهید. به عبارت سادهتر، این مدل با ساختار «ماژولار» و «موقعیتمحور»، باعث میشود پردازش درخواستهای طولانی بسیار بهینهتر و سریعتر انجام شود.
این دستاورد میتواند گام بزرگی برای کاربردهای هوش مصنوعی در تحلیل اسناد طولانی و سیستمهای RAG باشد.
سازی
منبع: arXiv NLP
