محققان در مقاله جدیدی، بنچمارک جذابی به نام «MissionBench» را برای ارزیابی مدلهای زبانی چندوجهی (MLLM) در محیطهای سهبعدی و هوایی ارائه کردند.
نکته جالب اینجاست که حتی قویترین مدلهای هوش مصنوعی فعلی هم در انجام ماموریتهای پیچیده و چندمرحلهای (مثل برنامهریزی، ناوبری و گزارشدهی خودکار بدون آموزش اختصاصی)، فاصله زیادی تا عملکرد انسان دارند (زیر ۳۵٪ موفقیت در برابر ۸۴٪ انسان!).
این تحقیق نشان میدهد که برای رسیدن به ایجنتهای هوشمند واقعی، مدلها باید علاوه بر درک فضا، قدرت برنامهریزی و استدلال چندمرحلهای خود را بهشدت تقویت کنند. مسیر ایجنتهای خودمختار همچنان پر از چالشهای جذاب است! 🧠✨
منبع: arXiv AI
