محققان در پژوهش جدیدی، مسیر ۱۰ ساله پیشرفت مدلهای «بینایی-زبانی» (VLM) را زیر ذرهبین بردهاند. برخلاف گذشته که مدلها فقط صحنههای ساده را تشخیص میدادند، نسل جدید MLLMها حالا میتوانند رفتارهای پیچیده انسانی و تعاملات اجتماعی را با دقتی در حد انسان تحلیل کنند! 🧠✨
این مطالعه با معرفی مجموعه داده CSB نشان میدهد که هوش مصنوعی در درک صحنههای پیچیده، تقریبا تمامی خطاهای رایج مثل «توهم بصری» یا اشتباهات فضایی را به حداقل رسانده است. به نظر میرسد فاصله بین «درک ماشین» و «نگاه انسان» به سرعت در حال از بین رفتن است.
منبع: arXiv AI
