🎙️ تشخیص دقیق گوینده در ویدیو با مدل HumanOmni-Speaker!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا حالا شده بخواهید بدانید در یک ویدیو، دقیقاً «چه کسی، چه چیزی را و چه زمانی» گفته است؟ مدل‌های چندوجهی فعلی معمولاً در تحلیل دینامیکِ پیچیده مکالمات انسانی دچار خطا می‌شوند و به «توهمِ توانمندی» مبتلا هستند.

حالا محققان با معرفی مدل جدید HumanOmni-Speaker، این مشکل را حل کرده‌اند. این مدل با استفاده از معماری «Visual Delta Encoder» و پردازش دقیق حرکات لب و مسیر حرکتی گویندگان، می‌تواند بدون نیاز به کادربندی‌های پیچیده و با دقت بسیار بالا، مکالمات را تحلیل کند. این یعنی گامی بزرگ برای بهبود هوش مصنوعی در درک واقعی تعاملات انسانی! 🤖✨

منبع: arXiv Computer Vision