تولید ویدیوهای باکیفیت و هماهنگ از روی چندین تصویر مرجع، یکی از چالشهای بزرگ هوش مصنوعی است. حالا محققان بنچمارک جدیدی به نام «MultiRef-Compass» را معرفی کردهاند که میتواند عملکرد مدلها را در درک جزئیات، هماهنگی صدا و تصویر، و وفاداری به تصاویر مرجع به صورت دقیق و سیستماتیک ارزیابی کند.
این بنچمارک با استفاده از ۳۵۰ نمونه تست و یک سیستم داوری پیشرفته (MLLM-as-a-Judge)، راه را برای ساخت مدلهای ویدیویی هوشمندتر و دقیقتر هموار میکند. گامی مهم برای رسیدن به ویدیوهای واقعیتر! 🎬🚀
منبع: arXiv Computer Vision
