محققان در تازهترین پژوهش خود، ابزار جدیدی به نام «MEDit-Bench» را معرفی کردهاند که دنیای تدوین ویدیو را متحول میکند. تا پیش از این، اکثر ابزارهای هوش مصنوعی بر اساس معیارهای ساده عمل میکردند، اما این بنچمارک جدید به هوش مصنوعی میآموزد که چگونه بر اساس «روایت» و «پیام مورد نظر»، تدوینهای متفاوتی را از یک ویدیو استخراج کند. 🎥
این تحقیق نشان میدهد که اگرچه مدلهای بزرگ چندوجهی (MLLM) پیشرفتهای زیادی داشتهاند، اما هنوز در درکِ مفاهیم عمیقِ روایی و رسیدن به دقتِ تدوینگران انسانی راه زیادی در پیش دارند. گامی جذاب به سوی سینمای هوشمند!
منبع: arXiv Computer Vision
