مدلهای زبانی بزرگ در شناسایی تصاویر مهارت دارند، اما در درک «چرایی» رفتار انسان و تحلیل زنجیرهای انگیزهها هنوز ضعف دارند. محققان به تازگی بنچمارک جدیدی به نام MultivationBench طراحی کردهاند که بر اساس نظریات روانشناسی (مثل هرم مازلو)، توانایی مدلهای چندوجهی را در تحلیل انگیزههای نهفته در داستانهای تصویری به چالش میکشد.
نتایج نشان میدهد که هوش مصنوعی هنوز در حفظ پیوستگیِ استدلال در موقعیتهای متوالی مشکل دارد و بین شناساییِ صرفِ اشیاء و درکِ عمیقِ رفتارهای انسانی، فاصله زیادی وجود دارد. گامی دیگر به سوی هوش مصنوعیِ اجتماعیتر! 🤖📊
منبع: arXiv AI
