🚀 افزایش سرعت و بهره‌وری مدل‌های بینایی-زبانی با تکنیک ETC! 🖼️💬

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از چالش‌های بزرگ مدل‌های چندوجهی (VLMs)، حجم بسیار زیاد توکن‌های تصویری است که باعث سنگین شدن محاسبات و مصرف زیاد حافظه (KV-cache) می‌شود. حالا محققان چارچوب جدیدی به نام «ETC» (Extreme Token Compression) معرفی کرده‌اند که با استفاده از تقطیر اطلاعات (Information Distillation)، توکن‌های زائد را حذف می‌کند.

ویژگی کلیدی این روش این است که حتی با فشرده‌سازی بسیار بالا، همچنان دقت مدل را در انجام وظایف حفظ می‌کند. نتایج آزمایش‌ها روی مدل‌های معروفی مثل LLaVA و Qwen3 نشان داده که این تکنیک تأثیر فوق‌العاده‌ای در بهینه‌سازی سرعت پردازش و کاهش هزینه‌های محاسباتی دارد. ⚡️

منبع: arXiv Computer Vision