مدلهای زبانی ویدیو (Video LLMs) برای درک بهتر محتوا معمولاً به حجم عظیمی از توکنهای بصری نیاز دارند که پردازش را کند و پرهزینه میکند. اما خبر خوب اینکه محققان با معرفی متد جدید GeoTrace، این چالش را هدف قرار دادهاند.
این چارچوب نوآورانه به جای روشهای سنتی، با ترکیب استخوانبندی ویدیو (Skeleton) و جزئیات حرکتی، توکنهای بصری را تا حد زیادی فشرده میکند. نتیجه چه بوده؟
✅ کاهش ۱۲.۹ برابری عملیات پردازشی (TFLOPs)
✅ حفظ ۹۹٪ عملکرد اصلی مدل
✅ امکان پردازش بسیار سریعتر و بهینهتر برای مدلهایی مثل LLaVA-OneVision
این دستاورد یک گام بزرگ برای اجرای مدلهای بینایی-زبانی پیچیده روی سختافزارهای محدودتر است.
منبع: arXiv Computer Vision
