تولید ویدیوهای شخصیسازیشده با هوش مصنوعی پیشرفتهای زیادی داشته، اما تا امروز «حفظ هویت» چندین نفر بهطور همزمان در یک ویدیو چالشبرانگیز بود. اکثر مدلها در این شرایط دچار سردرگمی میشدند یا چهرهها را غیرطبیعی نمایش میدادند.
محققان با معرفی فریمورک «GroupVideo»، این مشکل را حل کردند. این مدل با استفاده از:
✅ همترازی بصری و معنایی برای حرکات طبیعیتر
✅ ماژول مکانیابی چهره (ID Localization)
✅ و یک دیتاسایت غنی با ۲۰ هزار ویدیو اختصاصی
توانسته کیفیت و وفاداری به هویت افراد را در ویدیوهای چندنفره به شکل چشمگیری ارتقا دهد. حالا میتوانیم منتظر ویدیوهای باکیفیتتر و واقعگرایانهتری باشیم که در آنها خبری از «کپی-پیست» شدن مصنوعی چهرهها نیست! 🎥✨
منبع: arXiv Computer Vision
