🤖 معرفی SceneActBench: بنچمارکی برای سنجش هوش مصنوعی در دنیای سه‌بعدی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا ایجنت‌های هوش مصنوعی واقعاً می‌توانند در محیط‌های سه‌بعدی عمل کنند؟ تحقیقات جدید نشان می‌دهد که اکثر مدل‌های زبانی-تصویری (VLM) در تعامل با محیط‌های پیچیده سه‌بعدی عملکرد ضعیفی دارند.

بنچمارک جدید «SceneActBench» با بررسی ۵ وظیفه مختلف در فضای سه‌بعدی، به دنبال ارزیابی توانایی واقعی ایجنت‌ها برای درک و انجام عملیات روی اشیاء است. نتایج اولیه نشان می‌دهد هنوز فاصله زیادی تا رسیدن به یک ایجنت هوشمندِ همه‌فن‌حریف در محیط‌های سه‌بعدی داریم.

این تحقیق نشان‌دهنده گام بعدی در پیشرفت هوش مصنوعی از «متن و تصویر ثابت» به سمت «تعامل فیزیکی و فضایی» است.

منبع: arXiv AI