تا امروز مدلهای هوش مصنوعی یا فقط میتوانستند حرکات را از ویدیو تحلیل کنند (درک)، یا فقط میتوانستند حرکات جدیدی بسازند (تولید). حالا محققان با معرفی معماری جدیدی به نام Superman، این دو دنیای جداگانه را به هم پیوند زدهاند! 🏃♂️✨
این مدل با استفاده از یک «توکنایزر حرکتی هدایتشده با بینایی» (Vision-Guided Motion Tokenizer)، میتواند دادههای تصویری و اسکلتهای سهبعدی را به یک زبان مشترک تبدیل کند. نتیجه این کار چیست؟ یک هوش مصنوعی واحد که هم در تشخیص دقیق حرکات از روی ویدیو فوقالعاده است و هم میتواند حرکات پیچیده انسانی را به بهترین شکل پیشبینی و تولید کند.
این پیشرفت نه تنها دقت تحلیلهای حرکتی را بالا میبرد، بلکه دریچهای تازه برای توسعه انیمیشنهای دقیقتر و سیستمهای نظارتی هوشمند باز میکند. نظر شما چیست؟ آیا این همگرایی مدلها، آینده انیمیشنسازی را متحول میکند؟
منبع: arXiv Computer Vision
