مدلهای چندمنظوره ویدیویی (Video MLLMs) علیرغم پیشرفتهای زیاد، هنوز در تشخیص تغییرات جزئی در زمان یا مکان (مثل تفاوتهای کوچک بین دو ویدیو) ضعف دارند. حالا پژوهشگران چارچوب جدیدی به نام «DELTAVID» معرفی کردهاند که این مشکل را حل میکند! 🚀
این مدل با استفاده از یک تکنیک یادگیری خلاقانه (مشابه بازی «پیدا کردن تفاوتها»)، به هوش مصنوعی کمک میکند تا جزئیات مکانی و زمانی را با دقت بسیار بالاتری درک کند. همچنین ابزارهای جدید DELTAVID-10K و DELTAVID-Bench برای ارزیابی دقیقتر این مدلها در دسترس قرار گرفته است. این یعنی ویدیوها برای هوش مصنوعیِ آینده، معنای عمیقتری خواهند داشت. 🧠✨
منبع: arXiv AI
