آیا تا به حال به این فکر کردهاید که چرا مدلهای ویدئویی هوشمند گاهی کند عمل میکنند؟ دلیلش معمولاً «استدلالهای سنگین و مرحلهبهمرحله» برای درک محیط است.
محققان در مقاله جدیدی، مدل Light-Omni را معرفی کردهاند که این قاعده را تغییر میدهد. این مدل به جای درگیری با فرآیندهای طولانیِ منطقی، از یک سیستم «دوگانه» برای درک ویدئو استفاده میکند:
۱. حافظه جهانی: خلاصهای لحظهای از اتفاقات گذشته.
۲. وضعیت نهفته: که مستقیماً اقدامات ربات یا مدل را هدایت میکند.
نتیجه؟ پاسخهای بسیار سریعتر، دقیقتر و بدون نیاز به استدلالهای خستهکننده. Light-Omni توانسته در بنچمارکها از مدلهای مشابه پیشی بگیرد و تحولی در دنیای «Agentic Video Understanding» ایجاد کند! 🧠✨
منبع: arXiv Computer Vision
