🚀 معرفی OmniAgent: تحولی بزرگ در درک ویدیوها با هوش مصنوعی! 🎬

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های فعلی هوش مصنوعی برای درک ویدیوهای طولانی، معمولاً تمام فریم‌ها را بررسی می‌کنند که هزینه محاسباتی بسیار بالایی دارد. اما محققان مدل جدیدی به نام «OmniAgent» را معرفی کرده‌اند که با استفاده از رویکرد «ادراک فعال» (Active Perception)، ویدیوها را مانند یک انسان به صورت مرحله‌به‌مرحله تحلیل می‌کند.

ویژگی‌های کلیدی OmniAgent:
✅ تحلیل چرخه‌ای و هدفمند (Observation-Thought-Action) به جای اسکن کامل ویدیو.
✅ کاهش چشمگیر هزینه‌های محاسباتی بدون توجه به طول ویدیو.
✅ عملکرد فوق‌العاده در بنچمارک‌های ویدئویی (مثل LVBench) که حتی مدل ۷ میلیاردی آن از مدل‌های بزرگتر پیشی می‌گیرد.
✅ یادگیری تقویتی برای تصمیم‌گیری هوشمندانه در هر لحظه.

این مدل ثابت می‌کند که هوش مصنوعی با یادگیری «چگونه دیدن» به جای «دیدنِ همه چیز»، چقدر می‌تواند کارآمدتر شود! 🧠✨

منبع: arXiv NLP