آیا ایجنتهای هوش مصنوعی واقعاً میتوانند در محیطهای سهبعدی عمل کنند؟ تحقیقات جدید نشان میدهد که اکثر مدلهای زبانی-تصویری (VLM) در تعامل با محیطهای پیچیده سهبعدی عملکرد ضعیفی دارند.
بنچمارک جدید «SceneActBench» با بررسی ۵ وظیفه مختلف در فضای سهبعدی، به دنبال ارزیابی توانایی واقعی ایجنتها برای درک و انجام عملیات روی اشیاء است. نتایج اولیه نشان میدهد هنوز فاصله زیادی تا رسیدن به یک ایجنت هوشمندِ همهفنحریف در محیطهای سهبعدی داریم.
این تحقیق نشاندهنده گام بعدی در پیشرفت هوش مصنوعی از «متن و تصویر ثابت» به سمت «تعامل فیزیکی و فضایی» است.
منبع: arXiv AI
