آیا با چالش فضای حافظه در مدلهای زبانی بزرگ (LLM) دست و پنجه نرم میکنید؟ روش جدیدی با نام REAL معرفی شده که انقلابی در مدیریت حافظه KV Cache ایجاد کرده است.
این متد برخلاف روشهای قدیمی که فقط روی موفقیتها تمرکز داشتند، با تحلیل رفتارهای مختلف مدل (موفقیتها و شکستها)، نویزهای حاصل از پیشبینیهای غلط را حذف میکند. نتیجه؟ کاهش ۳۲ برابری فضای مورد نیاز در بنچمارکهای مدلهای با متن طولانی (Long-Context) بدون افت کیفیت! یک گام مهم دیگر برای سبکتر و سریعتر شدن هوش مصنوعی.
منبع: arXiv AI
