تشخیص اینکه چه کسی در یک ویدیو در حال صحبت است (Active Speaker Detection)، وقتی نویز محیط زیاد باشد یا چهره فرد پوشیده شده باشد، برای هوش مصنوعی همیشه یک چالش بزرگ بوده است.
محققان به تازگی چارچوب جدیدی به نام $C^3$ASD معرفی کردهاند که با استفاده از «سازگاری چندسطحی»، مدل را در برابر شرایط محیطی دشوار بسیار مقاوم میکند. این سیستم با ایجاد هماهنگی دقیق بین دادههای صوتی و تصویری، از یادگیری مسیرهای میانبر غلط توسط مدل جلوگیری کرده و باعث میشود تشخیصها حتی در شرایط نویزی و ناپایدار هم با دقت خیرهکنندهای انجام شود. 🚀
این پیشرفت گام بزرگی برای بهبود تعامل انسان و کامپیوتر و تحلیل دقیقتر ویدیوهای کنفرانسها و محیطهای شلوغ است.
منبع: arXiv Computer Vision
