محققان در یک پیشرفت جدید، مجموعه داده بزرگ VSRo-200 را برای یادگیری تشخیص گفتار بصری (Lip Reading) در زبان رومانیایی معرفی کردند. این مجموعه داده که شامل ۲۰۰ ساعت ویدیوی پادکست است، به پژوهشگران کمک میکند تا در محیطهای کممنابع، مدلهای هوش مصنوعی دقیقتری برای خواندن لبها و درک گفتار صوتی-تصویری (AVSR) بسازند.
نکته جالب این تحقیق، مقایسه کیفیت نظارت (Supervision) بین برچسبهای انسانی و خودکار (Pseudo-labels) است که نشان میدهد با مقیاسپذیری دادهها، مدلهای هوش مصنوعی میتوانند عملکرد خیرهکنندهای حتی در شرایط نویز دار داشته باشند. این دیتاست جدید میتواند مرزهای مدلهای چندوجهی را برای درک بهتر حرکات صورت در محیطهای واقعی جابجا کند. 🤖✨
منبع: arXiv Computer Vision
