تا به حال دقت کردید که هوش مصنوعی در ساخت ویدیو (T2V) چقدر در بازنمایی فرهنگهای مختلف ناتوان است؟ 🌍 محققان فریمورک جدیدی به نام «MAVEN» را معرفی کردهاند که با استفاده از چند «عامل» (Agent) هوشمند، پرامپتها را به بخشهای مجزا (شخص، عمل و مکان) تقسیم میکند تا ویدیوهایی با دقت فرهنگی بسیار بالاتر تولید کند.
این پروژه شامل یک بنچمارک جدید با بیش از ۹۰۰ ویدیو در فرهنگهای مختلف (از جمله چینی، آمریکایی و رومانیایی) است تا خروجیهای هوش مصنوعی واقعیتر و دقیقتر شوند. قدمی بزرگ برای اینکه دنیای مدلهای ویدیویی دیگر فقط یک دیدگاه خاص را نبیند! ✨
📌 کد و دیتاسِت این پروژه در گیتهاب برای علاقهمندان در دسترس است.
منبع: arXiv AI
