🤖 شکست مدل‌های هوش مصنوعی در پروژه‌های نرم‌افزاری طولانی‌مدت!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا هوش مصنوعی واقعاً می‌تواند جایگزین توسعه‌دهندگان در پروژه‌های بزرگ شود؟ نتایج یک تحقیق جدید نشان می‌دهد که مدل‌های هوش مصنوعی (Frontier Models) در وظایف کدنویسی تک‌مرحله‌ای عملکرد خیره‌کننده‌ای دارند (>۸۰٪)، اما وقتی صحبت از پروژه‌های واقعی و «توسعه مداوم» می‌شود، دقت آن‌ها به شدت افت کرده و به کمتر از ۳۸٪ می‌رسد!

محققان با معرفی بنچمارک جدیدی به نام SWE-Milestone، ثابت کردند که ایجنت‌های فعلی هنوز در مدیریت بدهی‌های فنی، جلوگیری از انباشت خطا و حفظ یکپارچگی سیستم در طول زمان، چالش‌های جدی دارند. این یعنی مسیر تا رسیدن به ایجنت‌های مستقل در دنیای نرم‌افزار، همچنان پر از پیچ و خم است.

این خبر زنگ خطری برای شرکت‌هایی است که می‌خواهند صفر تا صد توسعه را به هوش مصنوعی بسپارند. نظر شما چیست؟ آیا هوش مصنوعی در نهایت می‌تواند در پروژه‌های پیچیده و بزرگ هم به تنهایی مدیریت کد را بر عهده بگیرد؟

منبع: arXiv AI