مدلهای زبانی بزرگ (MLLMs) شاید در ظاهر نابغه به نظر برسند، اما وقتی پای «استدلال فضایی» وسط میآید، در بسیاری از تستهای ساده هم شکست میخورند. محققان به تازگی چارچوبی به نام Spatial-IQ را معرفی کردهاند که مثل یک کالبدشکافی دقیق، نقاط ضعف این مدلها را در درک ساختارهای سهبعدی شناسایی میکند.
این تحقیق با استفاده از ۸۰ هزار نمونه شبیهسازیشده نشان میدهد که مدلها اغلب به جای «درک» فضا، فقط با میانبر زدن، پاسخهای درستی میدهند که در دنیای واقعی کارایی ندارند. این گام بزرگی برای ساخت هوش مصنوعی با درک واقعی از محیط پیرامون ماست! 🔍✨
منبع: arXiv Computer Vision
