محققان در مقاله جدیدی، مدل پیشرفتهای به نام «TVTA» را معرفی کردهاند که تحولی در حوزه لبخوانی (Lip Reading) ایجاد میکند.
این مدل با تمرکز بر دوربینهای «رویداد» (Event Cameras) که دقت بالایی در ثبت حرکت دارند، دو تکنیک نوآورانه به کار برده است:
1️⃣ مدلسازی زمانی در هر نقطه مکانی قبل از ترکیب آنها (TDA).
2️⃣ استفاده از ساختار «واجها» (Visemes) برای درک بهتر کلمات و افزایش دقت تشخیص (VGA).
این دستاورد نه تنها باعث بهبود دقت در خواندن حرکات لب میشود، بلکه در شرایط نویز محیطی نیز بسیار مقاومتر از مدلهای قبلی عمل میکند. تکنولوژیهایی از این دست، پتانسیل بالایی در بهبود ارتباطات انسانی و سیستمهای کمکرسان هوشمند دارند. 🚀✨
منبع: arXiv Computer Vision
