دانشمندان در پژوهشی تازه، بنچمارک جدیدی به نام «DeepCommit» معرفی کردند تا توانایی مدلهای هوش مصنوعی را در پروژههای نرمافزاری طولانیمدت بسنجند. نتیجه ناامیدکننده بود: عملکرد مدلهای پیشرو در دنیای واقعی و کارهای پیچیده، از ۸۰٪ در وظایف ساده به حدود ۳۸٪ سقوط میکند!
این یعنی هوش مصنوعی هنوز در مدیریت تغییرات مداوم و جلوگیری از انباشت خطا در کدهای بزرگ، چالشهای جدی دارد. به نظر میرسد تا جایگزینی کامل برنامهنویسان انسانی، راه درازی باقی مانده است.
منبع: arXiv AI
