آیا تا به حال فکر کردهاید که چگونه یک هوش مصنوعی میتواند محتوای یک ویدیوی بسیار طولانی را دقیقاً درک کند و پاسخ سوال شما را در آن پیدا کند؟ محققان به تازگی چارچوب جدیدی به نام VideoTreeSearch (VTS) معرفی کردهاند که دنیای «پاسخدهی به سوالات ویدیویی» (LVQA) را متحول میکند.
در روشهای قبلی، عاملهای هوش مصنوعی پس از یک اشتباه کوچک در جستجو، مسیر را گم میکردند. اما VTS با استفاده از ساختار درختی و عملیاتهایی مثل «بزرگنمایی» و «بازگشت به عقب»، توانایی یادگیری خوداصلاحی پیدا کرده است؛ دقیقاً مثل انسانی که در جستجوی یک صحنه خاص، مسیرش را اصلاح میکند! این مدل موفق شده است در بنچمارکهای معتبر، رقبا را با اختلاف چشمگیری پشت سر بگذارد.
فناوریهای اینچنینی قدم بزرگی برای درک بهتر محتوای ویدیویی توسط مدلهای چندوجهی (Multimodal) هستند. آینده جستجو در ویدیوها همینقدر هوشمند است! 🤖✨
منبع: arXiv Computer Vision
