محققان در مطالعهای جدید، چالش بزرگی را در مدلهای زبانی چندوجهی (MLLM) هدف قرار دادهاند: هوش هیجانی بصری! 🖼️✨
مدلهای فعلی در درک احساساتِ نهفته در تصاویر ضعیف هستند. حالا با معرفی متد جدیدی به نام «Emotion Statement Judgement» (ESJ) و بنچمارک جدید «MVEI»، مدل جدیدی به نام EmObserver طراحی شده که میتواند با دقت بسیار بالاتری احساسات، سیاق صحنه و مفاهیم ذهنی را در تصاویر تحلیل کند.
این یعنی قدمی بزرگتر به سمت هوش مصنوعی عمومی (AGI) که نه تنها متن، بلکه عواطف پشت هر تصویر را هم حس میکند!
منبع: arXiv Computer Vision
