مدلهای پیشرفته بازیابی بینایی-زبانی به دلیل تعداد بسیار زیاد توکنهای تصویری، معمولاً بسیار سنگین و پرهزینه هستند. اما حالا محققان فریمورک جدیدی به نام SaMer را معرفی کردهاند که این مشکل را بهخوبی حل میکند.
ویژگیهای کلیدی SaMer:
🔹 فشردهسازی هوشمند: با تبدیل توکنهای تصویری به ۶۴ مرکز (Centroid)، بیش از ۹۳٪ توکنها را حذف میکند.
🔹 حفظ جزئیات: بر خلاف روشهای قبلی، این متد «شواهد مربوط به اشیاء» را حفظ میکند تا دقت بازیابی در مدلهایی مثل ColPali بهشدت افزایش یابد.
🔹 بدون نیاز به دادههای اضافی: در زمان اجرا (Inference) نیازی به جعبههای محدودکننده (Bounding Boxes) یا آشکارسازهای خاص ندارد.
این یعنی در آیندهای نزدیک، مدلهای VLM سریعتر و ارزانتر از همیشه در اپلیکیشنهای جستجوی تصویر عمل خواهند کرد!
منبع: arXiv AI
