🚀 بهینه‌سازی خیره‌کننده در پردازش ویدیو: با GeoTrace هوش مصنوعی سریع‌تر می‌شود!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی ویدیو (Video LLMs) برای درک بهتر محتوا معمولاً به حجم عظیمی از توکن‌های بصری نیاز دارند که پردازش را کند و پرهزینه می‌کند. اما خبر خوب اینکه محققان با معرفی متد جدید GeoTrace، این چالش را هدف قرار داده‌اند.

این چارچوب نوآورانه به جای روش‌های سنتی، با ترکیب استخوان‌بندی ویدیو (Skeleton) و جزئیات حرکتی، توکن‌های بصری را تا حد زیادی فشرده می‌کند. نتیجه چه بوده؟

✅ کاهش ۱۲.۹ برابری عملیات پردازشی (TFLOPs)
✅ حفظ ۹۹٪ عملکرد اصلی مدل
✅ امکان پردازش بسیار سریع‌تر و بهینه‌تر برای مدل‌هایی مثل LLaVA-OneVision

این دستاورد یک گام بزرگ برای اجرای مدل‌های بینایی-زبانی پیچیده روی سخت‌افزارهای محدودتر است.

منبع: arXiv Computer Vision