محققان در مقاله جدیدی، بنچمارک پیشرفتهای به نام «AgentGym2» معرفی کردند. برخلاف تستهای آزمایشگاهی که در محیطهای ایدهآل انجام میشوند، این چارچوب هوش مصنوعی را در شرایط پیچیده، پر سر و صدا و غیرقابل پیشبینی دنیای واقعی به چالش میکشد.
نتایج اولیه این آزمایش نشان میدهد که حتی مدلهای قدرتمندی مثل Gemini و GPT-5 نیز برای انجام کارهای چندمرحلهای و مواجهه با ابزارهای ناشناخته در دنیای واقعی با مشکلاتی روبرو هستند. این یعنی فاصله زیادی تا رسیدن به ایجنتهای کاملاً خودمختار و عملیاتی داریم! 🧩
منبع: arXiv AI
