تا حالا شده بخواهید بدانید در یک ویدیو، دقیقاً «چه کسی، چه چیزی را و چه زمانی» گفته است؟ مدلهای چندوجهی فعلی معمولاً در تحلیل دینامیکِ پیچیده مکالمات انسانی دچار خطا میشوند و به «توهمِ توانمندی» مبتلا هستند.
حالا محققان با معرفی مدل جدید HumanOmni-Speaker، این مشکل را حل کردهاند. این مدل با استفاده از معماری «Visual Delta Encoder» و پردازش دقیق حرکات لب و مسیر حرکتی گویندگان، میتواند بدون نیاز به کادربندیهای پیچیده و با دقت بسیار بالا، مکالمات را تحلیل کند. این یعنی گامی بزرگ برای بهبود هوش مصنوعی در درک واقعی تعاملات انسانی! 🤖✨
منبع: arXiv Computer Vision
