مدلهای زبانی بزرگ (LLM) معمولاً هنگام کار با متنهای طولانی به دلیل محاسبات پیچیده «توجه» (Attention)، کند میشوند. اما تکنیک جدیدی به نام CompLLM معرفی شده که این مشکل را حل میکند!
💡 این روش با تقسیم متن به بخشهای کوچکتر و فشردهسازی مستقل آنها، سه ویژگی فوقالعاده ایجاد کرده است:
۱. سرعت بالا: مقیاسپذیری خطی که باعث کاهش چشمگیر زمان پاسخدهی (TTFT) میشود.
۲. صرفهجویی: کاهش ۵۰ درصدی حافظه KV Cache.
۳. قابلیت استفاده مجدد: امکان ذخیره و استفاده از بخشهای فشردهشده در پرسشهای مختلف.
با CompLLM، مدلهایی که برای متنهای کوتاه آموزش دیدهاند، حالا میتوانند تا ۱۰۰ هزار توکن را به راحتی پردازش کنند! این یعنی هوش مصنوعی هوشمندتر و سریعتر برای همه ما.
منبع: arXiv NLP
