🚀 جهش بزرگ در تولید ویدیو با هوش مصنوعی: معرفی مدل «GroupVideo»! 🎬

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تولید ویدیوهای شخصی‌سازی‌شده با هوش مصنوعی پیشرفت‌های زیادی داشته، اما تا امروز «حفظ هویت» چندین نفر به‌طور همزمان در یک ویدیو چالش‌برانگیز بود. اکثر مدل‌ها در این شرایط دچار سردرگمی می‌شدند یا چهره‌ها را غیرطبیعی نمایش می‌دادند.

محققان با معرفی فریم‌ورک «GroupVideo»، این مشکل را حل کردند. این مدل با استفاده از:
✅ هم‌ترازی بصری و معنایی برای حرکات طبیعی‌تر
✅ ماژول مکان‌یابی چهره (ID Localization)
✅ و یک دیتاسایت غنی با ۲۰ هزار ویدیو اختصاصی
توانسته کیفیت و وفاداری به هویت افراد را در ویدیوهای چندنفره به شکل چشم‌گیری ارتقا دهد. حالا می‌توانیم منتظر ویدیوهای باکیفیت‌تر و واقع‌گرایانه‌تری باشیم که در آن‌ها خبری از «کپی-پیست» شدن مصنوعی چهره‌ها نیست! 🎥✨

منبع: arXiv Computer Vision