🎥 تحول در درک ویدیوهای طولانی با مدل جدید ReMem!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از چالش‌های بزرگ مدل‌های زبانی چندوجهی (MLLM)، محدودیت در پردازش ویدیوهای طولانی و از دست دادن جزئیات مهم است. حالا محققان فریم‌ورک جدیدی به نام «ReMem» را معرفی کرده‌اند که بدون نیاز به آموزش مجدد، درک ویدیوهای طولانی را متحول می‌کند.

این مدل با استفاده از حافظه هوشمند، به‌صورت تطبیقی فریم‌های کلیدی را انتخاب می‌کند تا دقیقاً همان اطلاعاتی که برای پاسخ به سوال کاربر نیاز است، استخراج شود. نتایج اولیه نشان‌دهنده جهش چشمگیر در دقت مدل‌هایی مثل LLaVA-Video است که کارایی آن‌ها را در تحلیل ویدیوهای پیچیده به‌شدت بالا برده است. 🚀

منبع: arXiv AI