آیا تا به حال سعی کردهاید با هوش مصنوعی ویدیویی بسازید که در آن چند شخصیت به طور همزمان و با حفظ هویت دقیق حضور داشته باشند؟ این یکی از بزرگترین چالشهای دنیای ویدیوهای تولیدی است.
محققان در مقاله جدیدی از فریمورک «Aura» رونمایی کردند که با استفاده از مدلهای زبانی-تصویری (VLM) و قابلیتهای پیشرفته در درک صحنهها، میتواند ویدیوهایی با جزئیات بالا و هماهنگی بصری عالی تولید کند. Aura با تکنیکهای نوآورانه خود، مشکلاتی مثل «کپی-پیست» مصنوعی اشیاء در ویدیو را کاهش داده و به کاربران اجازه میدهد کنترل بسیار دقیقتری روی پویایی صحنهها داشته باشند.
دنیای ویدیوهای هوش مصنوعی هر روز واقعیتر از قبل میشود! نظر شما چیست؟ آیا این فناوری میتواند جایگزین تدوینهای سنتی شود؟
منبع: arXiv Computer Vision
