اگر در حوزه توسعه هوش مصنوعی و مدلهای برنامهنویس (AI Coding Agents) فعالیت میکنید، احتمالاً میدانید که سنجش توانایی این مدلها چقدر دشوار است. اخیراً بنچمارک جدیدی با نام «DeepSWE» معرفی شده که هدف آن ارزیابی دقیقتر و تخصصیتر عملکرد این عاملهای هوشمند در دنیای مهندسی نرمافزار است.
این بنچمارک به ما کمک میکند تا بفهمیم مدلهای زبانی تا چه حد واقعاً در حل مسائل پیچیده کدنویسی و اجرای چرخههای مهندسی نرمافزار هوشمند هستند. به نظر میرسد دوران «توسعه مبتنی بر مشخصات» (Spec-driven development) با قدرت گرفتن هوش مصنوعی در حال تغییر مسیر است!
نظر شما چیست؟ آیا فکر میکنید این بنچمارکها بالاخره میتوانند جایگزین اعتماد ذهنی ما به مدلهای کدنویس شوند؟
نویسی
منبع: Hacker News AI
