محققان در یک مطالعه جدید به نقطه ضعف بزرگی در مدلهای زبانی-تصویری (VLM) پی بردهاند! با وجود توانایی بالای این مدلها در درک مفاهیم پیچیده، آنها در انجام سادهترین کارهای هندسی مثل تشخیص یک شیء پس از چرخش، تغییر مقیاس یا تغییرات ساده هندسی ضعف دارند. 📐
این تحقیق نشان میدهد که این مدلها علیرغم هوشمندی ظاهری، هنوز در «درک فضایی» دچار مشکل هستند و با حذف محتوای معنایی و تمرکز بر ساختار هندسی، عملکردشان به شدت افت میکند. این یافته اهمیتِ افزودن «درک هندسی» به سیستمهای چندوجهی (Multimodal) آینده را بیش از پیش نمایان میکند. 🤖✨
منبع: arXiv Computer Vision
