یکی از چالشهای بزرگ در مدلهای زبانی-تصویری (Video LLMs)، تحلیل دقیق ویدیوهای طولانی است. حالا محققان مدل جدیدی به نام MoD-VLLM معرفی کردهاند که به جای پردازش کلی، از یک ساختار «ماژولار و پویا» استفاده میکند.
این هوش مصنوعی با استفاده از یک چرخه بازخورد هوشمند، بخشهای مرتبط ویدیو را شناسایی کرده و با دقت بالا تحلیل میکند، در حالی که بخشهای غیرضروری را به صورت خلاصه پردازش میکند تا در مصرف منابع صرفهجویی شود. این یعنی درک بهتر، سریعتر و دقیقتر از محتوای ویدیویی! 🧠✨
منبع: arXiv AI
