🎬 فراتر از ویدیوهای معمولی: هوش مصنوعی و چالش تنوع فرهنگی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا به حال دقت کردید که هوش مصنوعی در ساخت ویدیو (T2V) چقدر در بازنمایی فرهنگ‌های مختلف ناتوان است؟ 🌍 محققان فریم‌ورک جدیدی به نام «MAVEN» را معرفی کرده‌اند که با استفاده از چند «عامل» (Agent) هوشمند، پرامپت‌ها را به بخش‌های مجزا (شخص، عمل و مکان) تقسیم می‌کند تا ویدیوهایی با دقت فرهنگی بسیار بالاتر تولید کند.

این پروژه شامل یک بنچمارک جدید با بیش از ۹۰۰ ویدیو در فرهنگ‌های مختلف (از جمله چینی، آمریکایی و رومانیایی) است تا خروجی‌های هوش مصنوعی واقعی‌تر و دقیق‌تر شوند. قدمی بزرگ برای اینکه دنیای مدل‌های ویدیویی دیگر فقط یک دیدگاه خاص را نبیند! ✨

📌 کد و دیتاسِت این پروژه در گیت‌هاب برای علاقه‌مندان در دسترس است.

منبع: arXiv AI