مدلهای چندوجهی هوش مصنوعی در تحلیل ویدیوهای طولانی با چالشهای بزرگی مثل هزینه بالا و دادههای پراکنده روبرو هستند. اما حالا محققان چارچوب جدیدی به نام «OmniReasoner» معرفی کردهاند که مثل یک انسان هوشمند عمل میکند!
این مدل ابتدا یک پیشنمایش کلی از ویدیو تهیه کرده و فقط در صورت نیاز، روی بخشهای خاصی زوم میکند تا با جزئیات دقیق و دقت بالا به سوالات پاسخ دهد. این رویکرد نه تنها باعث صرفهجویی در محاسبات میشود، بلکه درک مدل از رویدادهای زمانی را نیز به شدت بهبود میبخشد. 🧠✨
آینده تحلیل هوشمند ویدیوها با ابزارهایی از این دست بسیار درخشانتر شده است.
منبع: arXiv Computer Vision
