محققان در مقالهای جدید، متد نوآورانهای به نام HAS (مخفف Highlight-guided Attention Steering) را برای بهبود خلاصهسازی ویدیوها در مدلهای چندوجهی (M-LLM) معرفی کردهاند.
مشکل روشهای فعلی این است که با تمرکز بر فریمهای گسسته، بسیاری از جزئیات مهم ویدیو را از دست میدهند. متد HAS با نگاهی «جهانی» به ویدیو، توزیع نقاط کلیدی را شناسایی کرده و از آن به عنوان یک «فرماندهنده توجه» (Attention Steering) استفاده میکند تا مدل بتواند درک عمیقتر، منسجمتر و دقیقتری از محتوای ویدیویی داشته باشد. این روش نه تنها سرعت پردازش را بالا میبرد، بلکه کیفیت خروجی را برای کاربردهای بازیابی اطلاعات به شدت افزایش میدهد.
منبع: arXiv AI
