اگر در حوزه توسعه هوش مصنوعی و مدلهای برنامهنویس (Coding Agents) فعالیت میکنید، حتماً میدانید که سنجش عملکرد واقعی آنها چقدر دشوار است. حالا بنچمارک جدیدی به نام «DeepSWE» معرفی شده که هدف آن ارزیابی دقیقتر و عمیقتر توانایی مدلها در حل مسائل پیچیده مهندسی نرمافزار است.
این بنچمارک میتواند مسیر جدیدی برای مقایسه هوشمندتر مدلهای برنامهنویس باز کند. نظر شما چیست؟ آیا بالاخره میتوانیم به عملکرد ایجنتهای کدنویس در محیطهای واقعی اعتماد کنیم؟
منبع: Hacker News AI
