دنیای هوش مصنوعی به سرعت به سمت ایجنتهای نرمافزاری (Coding Agents) حرکت میکند، اما محققان در پژوهش جدیدی هشدار دادهاند که معیارهای ارزیابی (Benchmarks) ما قدیمی هستند! 📉
نکات کلیدی این نقد علمی:
۱. اشتباه در ارزیابی: بنچمارکهای فعلی، مدل هوش مصنوعی را با کل «هارنس» (زیرساخت، محیط، ابزارها) یکی میبینند، در حالی که ایجنت یک سیستمِ ترکیبی است.
۲. تکجوابی بودن: اغلبِ این آزمونها فقط یک پاسخ درست را معیار قرار میدهند و راهحلهای خلاقانه دیگر را ناعادلانه رد میکنند.
۳. فقدان بازخورد مرحلهای: این سیستمها معمولاً فقط «خروجی نهایی» را میبینند و نمیتوانند به توسعهدهندگان بگویند در کدام بخش از فرآیندِ تولید کد، ایجنت دچار مشکل شده است.
این تحقیق هشدار میدهد که برای پیشرفت واقعی در ایجنتهای برنامهنویس، باید استانداردهای سنجش خود را بازنگری کنیم.
منبع: arXiv AI
