تا حالا دقت کردید که مدلهای هوش مصنوعی وقتی ویدیوهای طولانی (مثل فیلمهای سینمایی یا مستندها) را تحلیل میکنند، چقدر زود جزئیات زمانی را فراموش میکنند یا دچار توهم میشوند؟
محققان بهتازگی بنچمارک جدیدی به نام LVSum را معرفی کردهاند که به طور اختصاصی برای ارزیابی «خلاصهسازی ویدیوهای طولانی» طراحی شده است.
چند نکته جالب از نتایج این تحقیق:
✅ نقش متن (Transcripts) در درک محتوای ویدیو، بسیار پررنگتر از تحلیل فریمهای تصویری است.
✅ هنوز یک شکاف بزرگ بین دقتِ خلاصههای انسانی و هوش مصنوعی وجود دارد.
✅ مدلهای فعلی در زمینههایی مثل «درک توالی زمانی» و «هماهنگی بین تصویر و متن» ضعفهای سیستماتیک دارند.
این بنچمارک کمک میکند تا در آینده مدلهای دقیقتر و هوشمندتری برای تحلیل ویدیوهای طولانی داشته باشیم.
منبع: arXiv AI
