مدلهای زبانی-تصویری (Video MLLMs) همیشه با یک چالش بزرگ دست و پنجه نرم کردهاند: چطور هم جزئیات دقیق بصری را ببینند و هم رویدادهای زمانی سریع را درک کنند؟
محققان در مقاله جدید، متد «Fre-Res» را معرفی کردند که با ترکیب دو تکنیک هوشمندانه، این مشکل را حل میکند:
🔹 حفظ لنگرهای فضایی با دقت بالا برای درک جزئیات اشیاء.
🔹 استفاده از فشردهسازی مبتنی بر فرکانس برای نمایش تغییرات زمانی با حجم بسیار کمتر.
نتیجه این روش، مدلهایی است که با کاهش چشمگیر تعداد توکنهای بصری، همچنان عملکردی در حد مدلهای سنگین و پرهزینه دارند! این یعنی پردازش ویدیوهای طولانی در آینده بسیار سریعتر و بهینهتر خواهد شد. 🎥✨
منبع: arXiv AI
