محققان روش جدیدی به نام FORGE معرفی کردهاند که مشکل بزرگ مدلهای زبانی چندوجهی (MLLM) در تحلیل ویدیوهای طولانی را حل میکند. معمولاً با افزایش طول ویدیو، محتوای غیرضروری زیاد میشود و دقت مدل پایین میآید.
این روشِ هوشمندانه، بدون نیاز به آموزش اضافه، بهترین فریمهای مرتبط با پرسش کاربر را در ویدیو پیدا میکند. نتایج نشان میدهد که FORGE میتواند دقت پاسخدهی مدلها به سوالات ویدیویی را تا ۸.۷ درصد بهبود دهد و انتخاب کلیدی فریمها را بسیار دقیقتر کند. این یعنی درک بهتر و سریعتر محتواهای ویدیویی بلند توسط هوش مصنوعی! 🎬🧠
منبع: arXiv Computer Vision
