محققان در یازدهمین دوره رقابتهای ABAW، مدل جدیدی برای شناسایی «ابهام و تردید» در رفتار انسان معرفی کردهاند. برخلاف سیستمهای سنگین و پیچیده قبلی، این متد جدید با تمرکز بر «متن» به عنوان محور اصلی و ترکیب آن با ویژگیهای صوتی، چهره و صحنه، توانسته دقت تشخیص را به طرز چشمگیری افزایش دهد.
این مدل با استفاده از تکنیک Text Residual Fusion، بدون نیاز به مدلهای چندلایه سنگین، توانسته در آزمونهای عملی نتایج بسیار درخشانی کسب کند. گامی رو به جلو در درک بهتر تعاملات انسانی توسط ماشین! 🤖✨
منبع: arXiv Computer Vision
