یکی از چالشهای بزرگ مدلهای زبانی چندوجهی (MLLM)، محدودیت در پردازش ویدیوهای طولانی و از دست دادن جزئیات مهم است. حالا محققان فریمورک جدیدی به نام «ReMem» را معرفی کردهاند که بدون نیاز به آموزش مجدد، درک ویدیوهای طولانی را متحول میکند.
این مدل با استفاده از حافظه هوشمند، بهصورت تطبیقی فریمهای کلیدی را انتخاب میکند تا دقیقاً همان اطلاعاتی که برای پاسخ به سوال کاربر نیاز است، استخراج شود. نتایج اولیه نشاندهنده جهش چشمگیر در دقت مدلهایی مثل LLaVA-Video است که کارایی آنها را در تحلیل ویدیوهای پیچیده بهشدت بالا برده است. 🚀
منبع: arXiv AI
