🚀 پایان دوران تأخیر در هوش مصنوعی؛ معرفی Light-Omni

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا تا به حال به این فکر کرده‌اید که چرا مدل‌های ویدئویی هوشمند گاهی کند عمل می‌کنند؟ دلیلش معمولاً «استدلال‌های سنگین و مرحله‌به‌مرحله» برای درک محیط است.

محققان در مقاله جدیدی، مدل Light-Omni را معرفی کرده‌اند که این قاعده را تغییر می‌دهد. این مدل به جای درگیری با فرآیندهای طولانیِ منطقی، از یک سیستم «دوگانه» برای درک ویدئو استفاده می‌کند:

۱. حافظه جهانی: خلاصه‌ای لحظه‌ای از اتفاقات گذشته.
۲. وضعیت نهفته: که مستقیماً اقدامات ربات یا مدل را هدایت می‌کند.

نتیجه؟ پاسخ‌های بسیار سریع‌تر، دقیق‌تر و بدون نیاز به استدلال‌های خسته‌کننده. Light-Omni توانسته در بنچمارک‌ها از مدل‌های مشابه پیشی بگیرد و تحولی در دنیای «Agentic Video Understanding» ایجاد کند! 🧠✨

منبع: arXiv Computer Vision