محققان در یک مطالعه جدید به چالش جذابی در مدلهای زبانی-تصویری (VLM) پرداختهاند: چرا این مدلها با وجود هوشمندی بالا، در تشخیص دقیق احساسات چهره انسان به خوبی عمل نمیکنند؟
طبق یافتههای این پژوهش، دو دلیل اصلی برای این ضعف وجود دارد:
۱. تعصب دادهها: دادههای آموزشی این مدلها اغلب روی احساسات رایج متمرکز است و احساسات نادر یا پیچیدهتر را بهدرستی یاد نمیگیرند.
۲. ناتوانی در تحلیل زمانی: مدلهای فعلی نمیتوانند تغییرات سریع و گذرا در حالات چهره (Micro-expressions) را بهدرستی پردازش کنند، زیرا استراتژیهای نمونهبرداری آنها با این حرکات سریع همخوانی ندارد.
این کشف میتواند نقشه راه جدیدی برای توسعه سیستمهای هوشمند با هوش هیجانی بالاتر باشد! 🤖💡
منبع: arXiv AI
