تا امروز بیشتر بنچمارکهای هوش مصنوعی روی پردازش متن و صوت تمرکز داشتند، اما تحقیقات جدید نشان میدهد این مدلها در درک رفتارهای غیرکلامی (مثل لبخند، تکان دادن سر و ژستها) در گفتگوهای واقعی لنگ میزنند! 🧐
محققان بهتازگی بنچمارک جدیدی به نام «VideoFDB» معرفی کردهاند که اولین معیار برای سنجش توانایی ایجنتهای هوشمند در مکالمات «دو طرفه» (Full-Duplex) به صورت صوتی و تصویری است. نتیجه بررسیها نشان میدهد مدلهای فعلی، حتی مدلهای پیشرو، هنگام تحلیل همزمان تصویر و صدا در حین مکالمه دچار اختلال میشوند و عملاً درک درستی از ارتباط انسانی ندارند.
این تحقیق گام بزرگی برای ساخت ایجنتهای واقعگرایانهتر است تا دیگر فقط «گوش» ندهند، بلکه «حضور» ما را هم درک کنند! ✨
منبع: arXiv Computer Vision
