مدلهای چندوجهی بزرگ (MLLMs) مثل Qwen2.5-VL به دلیل تولید حجم عظیمی از توکنهای تصویری، معمولاً هزینهی محاسباتی بسیار بالایی دارند. حالا محققان روش نوآورانهای به نام «SepPrune» معرفی کردهاند که این مشکل را حل میکند.
ویژگیهای کلیدی SepPrune:
✅ بدون نیاز به آموزش مجدد (Training-free) و به صورت Plug-and-Play.
✅ حذف ۸۰٪ از توکنهای تصویریِ غیرضروری تنها با تکیه بر توکنهای جداکننده (Separator Tokens).
✅ حفظ ۹۶.۳٪ از دقت مدل با کاهش چشمگیر بار محاسباتی.
این یعنی میتوانیم مدلهای هوشمند بینایی ماشین را با سرعت بسیار بالاتر و در دستگاههای سبکتر اجرا کنیم! ⚡️
منبع: arXiv Computer Vision
