🤖 آیا ایجنت‌های هوش مصنوعی در محیط‌های کاری حرفه‌ای واقعاً کارآمد هستند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان با معرفی بنچمارک جدیدی به نام Workflow-GYM، توانمندی واقعی مدل‌های هوش مصنوعی را در انجام وظایف پیچیده و طولانی‌مدت در محیط‌های نرم‌افزاری تخصصی به چالش کشیدند.

نتایج این بررسی نشان می‌دهد که حتی پیشرفته‌ترین مدل‌های فعلی، در انجام جریان‌های کاری حرفه‌ای نرخ موفقیت بسیار پایینی (حدود ۳۰٪) دارند. مشکل اصلی مدل‌ها؟ ناتوانی در حفظ پایداری در طول اجرای مراحل طولانی، اشتباهات متوالی و درک ناقص از محیط‌های نرم‌افزاری تخصصی. این بنچمارک نقشه راه جدیدی برای نسل بعدی ایجنت‌های خودمختار ترسیم می‌کند.

منبع: arXiv AI