🚀 چالش جدید هوش مصنوعی در دنیای پهپادها؛ MissionBench معرفی شد! 🤖🚁

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی، بنچمارک جذابی به نام «MissionBench» را برای ارزیابی مدل‌های زبانی چندوجهی (MLLM) در محیط‌های سه‌بعدی و هوایی ارائه کردند.

نکته جالب اینجاست که حتی قوی‌ترین مدل‌های هوش مصنوعی فعلی هم در انجام ماموریت‌های پیچیده و چندمرحله‌ای (مثل برنامه‌ریزی، ناوبری و گزارش‌دهی خودکار بدون آموزش اختصاصی)، فاصله زیادی تا عملکرد انسان دارند (زیر ۳۵٪ موفقیت در برابر ۸۴٪ انسان!).

این تحقیق نشان می‌دهد که برای رسیدن به ایجنت‌های هوشمند واقعی، مدل‌ها باید علاوه بر درک فضا، قدرت برنامه‌ریزی و استدلال چندمرحله‌ای خود را به‌شدت تقویت کنند. مسیر ایجنت‌های خودمختار همچنان پر از چالش‌های جذاب است! 🧠✨

منبع: arXiv AI