محققان در پژوهشی جدید، بنچمارک جذابی به نام «HumanCLAW» را معرفی کردهاند تا بفهمند آیا مدلهای زبانی-تصویری (VLM) واقعاً میتوانند کنترل یک بدن فیزیکی را در محیط واقعی بر عهده بگیرند یا نه.
نتایج این تحقیق چالشبرانگیز است: از میان ۹ مدل پیشرفته بررسی شده، هیچکدام نتوانستند در این آزمون موفق شوند (بهترین عملکرد تنها ۱۶.۸٪ بوده!).
مشکل اصلی کجاست؟ طبق این مطالعه، هوش مصنوعی فعلی دچار فقدان «خودآگاهی بدنی» است؛ یعنی مدلها نمیتوانند موقعیت دقیق بدن خود را در فضا تشخیص دهند و نمیفهمند آیا به هدف رسیدهاند یا با مانعی برخورد کردهاند. این یافته گام مهمی در مسیر ساخت رباتهای خودمختار واقعیتر است! 🦾🧠
منبع: arXiv Computer Vision
