محققان روش جدیدی به نام SPARE معرفی کردند که میتواند انقلابی در بهینهسازی مدلهای بینایی-زبانی (VLMs) ایجاد کند. مشکل اصلی مدلهای فعلی، پردازش حجم عظیمی از توکنهای تصویری است که باعث کندی و هزینه بالا میشود.
ویژگیهای کلیدی SPARE:
✅ حذف تا ۹۴٪ از توکنهای زاید تصویری بدون افت دقت (حفظ ۹۵٪ عملکرد).
✅ استفاده از روش بازسازی زیرفضا به جای حذف ساده توکنها.
✅ بدون نیاز به آموزش مجدد (Training-free) و قابل اجرا روی مدلهایی مثل LLaVA.
این نوآوری ثابت میکند که برای داشتن هوش مصنوعی قدرتمند، همیشه به قدرت محاسباتی سنگین نیاز نیست!
منبع: arXiv Computer Vision
