🚀 انقلابی در درک ویدیوهای طولانی با هوش مصنوعی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان روش جدیدی به نام FORGE معرفی کرده‌اند که مشکل بزرگ مدل‌های زبانی چندوجهی (MLLM) در تحلیل ویدیوهای طولانی را حل می‌کند. معمولاً با افزایش طول ویدیو، محتوای غیرضروری زیاد می‌شود و دقت مدل پایین می‌آید.

این روشِ هوشمندانه، بدون نیاز به آموزش اضافه، بهترین فریم‌های مرتبط با پرسش کاربر را در ویدیو پیدا می‌کند. نتایج نشان می‌دهد که FORGE می‌تواند دقت پاسخ‌دهی مدل‌ها به سوالات ویدیویی را تا ۸.۷ درصد بهبود دهد و انتخاب کلیدی فریم‌ها را بسیار دقیق‌تر کند. این یعنی درک بهتر و سریع‌تر محتواهای ویدیویی بلند توسط هوش مصنوعی! 🎬🧠

منبع: arXiv Computer Vision