دانشمندان یک چارچوب جدید به نام CADER (مخفف Confidence-Aware Dynamic Evidence Reasoning) معرفی کردند که به مدلهای بینایی-زبانی کمک میکند تا ویدیوهای طولانی را بسیار هوشمندانهتر و بهینهتر تحلیل کنند.
🔹 نکته کلیدی: این سیستم با تشخیص اینکه سوال چقدر سخت است، تصمیم میگیرد که آیا نیاز به تحلیل عمیق و ابزارهای پیچیده دارد یا خیر. این کار باعث میشود پردازش ویدیو برای سوالات ساده بسیار سریعتر انجام شود و در موارد پیچیده، دقتِ استدلال به شدت بالا برود.
این یعنی خداحافظی با اتلاف منابع محاسباتی برای سوالات ساده و سلام به دقت بالاتر در تحلیلهای ویدیویی! 🎥✨
منبع: arXiv Computer Vision
