تا به حال فکر کردید که چطور میتوان فهمید یک مدل هوش مصنوعی واقعاً در «مهندسی نرمافزار» چقدر حرفهای است؟ محققان بهتازگی بنچمارک جدیدی به نام «DeepSWE» را معرفی کردند که با استفاده از ۱۱۳ تسکِ مهندسیِ واقعی و پیچیده، عملکردِ دستیارهای هوشمند کدنویس را به چالش میکشد.
✅ چرا این خبر مهم است؟
بسیاری از بنچمارکهای فعلی چون از روی مخازن عمومی گیتهاب ساخته شدهاند، ممکن است مدلها قبلاً جوابها را در دادههای آموزشی خود دیده باشند (حفظ کردن به جای حل مسئله!). اما DeepSWE با طراحی تسکهای کاملاً جدید و ایزوله، قدرت واقعی استدلال و حل مسئله مدلهای AI را در پروژههای طولانیمدت ارزیابی میکند. این یک گام بزرگ برای رسیدن به کدنویسهای هوشمند و قابلاعتمادتر است! 💻🤖
منبع: arXiv Machine Learning
