محققان گام مهمی در بهبود هوش مصنوعی برای ویرایش ویدیو برداشتهاند! تا امروز، اکثر ابزارهای هوش مصنوعی یا فقط بر بخش بصری تمرکز داشتند یا صدا را جداگانه ویرایش میکردند، اما حالا با معرفی معیار ارزیابی «AVE-Compass»، شاهد جهشی در هماهنگی دقیق بین صدا و تصویر هستیم.
این تحقیق نه تنها استانداردی برای سنجش کیفیت ویرایشهای چندرسانهای ارائه میدهد، بلکه چارچوب جدیدی به نام «AVE-Agent» را معرفی کرده که با تحلیل مرحلهبهمرحله و خوداصلاحی، ویدیوهایی بسیار واقعیتر و دقیقتر تولید میکند. این یعنی در آینده نزدیک، ویرایشهای پیچیده ویدیویی با دستورات متنی ساده، بسیار حرفهایتر و هماهنگتر انجام خواهند شد! 🚀
منبع: arXiv Computer Vision
