آیا تا به حال دقت کردهاید که مدلهای هوش مصنوعی هنگام پردازش ویدیوهای طولانی، جزئیات بصری ابتدای ویدیو را فراموش میکنند؟ این پدیده که به «Visual Anchoring Decay» معروف است، دقت تحلیلها را پایین میآورد.
محققان با معرفی روش نوآورانه Latent Video Cache (Latent-VC)، این مشکل را حل کردهاند! این سیستم با تعبیه یک «حافظه پنهان» (Cache) در لایههای مدل Qwen3.5، جزئیات بصری را در طول کل فرآیند تحلیل حفظ میکند.
نتیجه؟ مدلهای هوش مصنوعی حالا میتوانند بدون نیاز به تولید متنهای طولانی و خستهکننده، با دقت بسیار بیشتری ویدیوها را درک کنند و در بنچمارکهای مختلف، عملکردی خیرهکننده از خود نشان دادهاند. قدمی بزرگ برای ویدیوهای طولانی و تحلیلهای دقیقتر! 🎥✨
منبع: arXiv Computer Vision
