محققان با معرفی بنچمارک جدیدی به نام Workflow-GYM، توانمندی واقعی مدلهای هوش مصنوعی را در انجام وظایف پیچیده و طولانیمدت در محیطهای نرمافزاری تخصصی به چالش کشیدند.
نتایج این بررسی نشان میدهد که حتی پیشرفتهترین مدلهای فعلی، در انجام جریانهای کاری حرفهای نرخ موفقیت بسیار پایینی (حدود ۳۰٪) دارند. مشکل اصلی مدلها؟ ناتوانی در حفظ پایداری در طول اجرای مراحل طولانی، اشتباهات متوالی و درک ناقص از محیطهای نرمافزاری تخصصی. این بنچمارک نقشه راه جدیدی برای نسل بعدی ایجنتهای خودمختار ترسیم میکند.
منبع: arXiv AI
