محققان در پروژه جدید «ViDiHand»، راهکار جالبی برای بازسازی دقیق حرکات دو دست در فضای سهبعدی و چهاربعدی ارائه دادهاند. این ابزار با استفاده از مدلهای انتشار ویدیویی (Video Diffusion Models) یاد میگیرد که حتی در زمانهایی که دستها پشت اشیاء پنهان میشوند یا حرکات پیچیدهای دارند، موقعیت دقیق آنها را بدون نیاز به سنسورهای پیچیده بازسازی کند.
این تکنولوژی گام بزرگی برای سیستمهای «هوش مصنوعی تجسمیافته» (Embodied AI) است تا درک بهتری از نحوه تعامل انسان با اشیاء محیط پیرامونش داشته باشند. این مدلها دیگر نیازی به بهینهسازیهای سنگین زمان اجرا ندارند و بهصورت مستقیم روی فریمهای ویدیویی عمل میکنند. 🚀
منبع: arXiv Computer Vision
