یکی از چالشهای بزرگ مدلهای چندوجهی (VLMs)، حجم بسیار زیاد توکنهای تصویری است که باعث سنگین شدن محاسبات و مصرف زیاد حافظه (KV-cache) میشود. حالا محققان چارچوب جدیدی به نام «ETC» (Extreme Token Compression) معرفی کردهاند که با استفاده از تقطیر اطلاعات (Information Distillation)، توکنهای زائد را حذف میکند.
ویژگی کلیدی این روش این است که حتی با فشردهسازی بسیار بالا، همچنان دقت مدل را در انجام وظایف حفظ میکند. نتایج آزمایشها روی مدلهای معروفی مثل LLaVA و Qwen3 نشان داده که این تکنیک تأثیر فوقالعادهای در بهینهسازی سرعت پردازش و کاهش هزینههای محاسباتی دارد. ⚡️
منبع: arXiv Computer Vision
