🚀 پایان فراموشی بصری در ویدیوها؛ معرفی Latent-VC

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا تا به حال دقت کرده‌اید که مدل‌های هوش مصنوعی هنگام پردازش ویدیوهای طولانی، جزئیات بصری ابتدای ویدیو را فراموش می‌کنند؟ این پدیده که به «Visual Anchoring Decay» معروف است، دقت تحلیل‌ها را پایین می‌آورد.

محققان با معرفی روش نوآورانه Latent Video Cache (Latent-VC)، این مشکل را حل کرده‌اند! این سیستم با تعبیه یک «حافظه پنهان» (Cache) در لایه‌های مدل Qwen3.5، جزئیات بصری را در طول کل فرآیند تحلیل حفظ می‌کند.

نتیجه؟ مدل‌های هوش مصنوعی حالا می‌توانند بدون نیاز به تولید متن‌های طولانی و خسته‌کننده، با دقت بسیار بیشتری ویدیوها را درک کنند و در بنچمارک‌های مختلف، عملکردی خیره‌کننده از خود نشان داده‌اند. قدمی بزرگ برای ویدیوهای طولانی و تحلیل‌های دقیق‌تر! 🎥✨

منبع: arXiv Computer Vision