آیا هوش مصنوعی واقعاً میتواند جایگزین توسعهدهندگان در پروژههای بزرگ شود؟ نتایج یک تحقیق جدید نشان میدهد که مدلهای هوش مصنوعی (Frontier Models) در وظایف کدنویسی تکمرحلهای عملکرد خیرهکنندهای دارند (>۸۰٪)، اما وقتی صحبت از پروژههای واقعی و «توسعه مداوم» میشود، دقت آنها به شدت افت کرده و به کمتر از ۳۸٪ میرسد!
محققان با معرفی بنچمارک جدیدی به نام SWE-Milestone، ثابت کردند که ایجنتهای فعلی هنوز در مدیریت بدهیهای فنی، جلوگیری از انباشت خطا و حفظ یکپارچگی سیستم در طول زمان، چالشهای جدی دارند. این یعنی مسیر تا رسیدن به ایجنتهای مستقل در دنیای نرمافزار، همچنان پر از پیچ و خم است.
این خبر زنگ خطری برای شرکتهایی است که میخواهند صفر تا صد توسعه را به هوش مصنوعی بسپارند. نظر شما چیست؟ آیا هوش مصنوعی در نهایت میتواند در پروژههای پیچیده و بزرگ هم به تنهایی مدیریت کد را بر عهده بگیرد؟
منبع: arXiv AI
