مدلهای فعلی هوش مصنوعی برای درک ویدیوهای طولانی، معمولاً تمام فریمها را بررسی میکنند که هزینه محاسباتی بسیار بالایی دارد. اما محققان مدل جدیدی به نام «OmniAgent» را معرفی کردهاند که با استفاده از رویکرد «ادراک فعال» (Active Perception)، ویدیوها را مانند یک انسان به صورت مرحلهبهمرحله تحلیل میکند.
ویژگیهای کلیدی OmniAgent:
✅ تحلیل چرخهای و هدفمند (Observation-Thought-Action) به جای اسکن کامل ویدیو.
✅ کاهش چشمگیر هزینههای محاسباتی بدون توجه به طول ویدیو.
✅ عملکرد فوقالعاده در بنچمارکهای ویدئویی (مثل LVBench) که حتی مدل ۷ میلیاردی آن از مدلهای بزرگتر پیشی میگیرد.
✅ یادگیری تقویتی برای تصمیمگیری هوشمندانه در هر لحظه.
این مدل ثابت میکند که هوش مصنوعی با یادگیری «چگونه دیدن» به جای «دیدنِ همه چیز»، چقدر میتواند کارآمدتر شود! 🧠✨
منبع: arXiv NLP
