یکی از بزرگترین چالشهای مدلهای زبانی در پردازش متون طولانی، مصرف بالای حافظه KV Cache است. محققان به تازگی تکنیک جدیدی به نام «VarRate» معرفی کردهاند که بدون نیاز به آموزش مجدد (Training-Free)، مدیریت حافظه را متحول میکند.
تفاوت اصلی VarRate با روشهای قبلی اینجاست که به جای حذف توکنهای به ظاهر کماهمیت (که باعث افت دقت مدل میشود)، برای تمام توکنها یک بودجه رتبهبندی متغیر قائل میشود. نتیجه؟ مدل بدون از دست دادن اطلاعات حیاتی، به شدت سبکتر و سریعتر عمل میکند و در بنچمارکهای معتبر، رقابتی شانه به شانه با مدلهای غیرفشرده دارد. 🧠💡
سازی
منبع: arXiv Machine Learning
