آیا میدانستید یکی از بزرگترین چالشهای شرکتهای بزرگ نرمافزاری، تست کردن هوش مصنوعیهای کدنویس (Coding Agents) در محیطهای واقعی است؟
محققان به تازگی ابزاری به نام REAP را معرفی کردهاند که میتواند بدون نیاز به برچسبگذاری دستی، از دلِ فعالیتهای واقعی توسعهدهندگان، بنچمارکهای (معیارهای سنجش) بسیار دقیق استخراج کند.
این ابزار با استفاده از سیستمهای خودکار، کیفیت تسکها را بررسی کرده و مطمئن میشود که نتایجِ ارزیابی ایجنتهای کدنویس، کاملاً قابل اعتماد و پایدار هستند. این یعنی قدمی بزرگ برای حذف حدس و گمان و ورود به عصر توسعه نرمافزارِ واقعاً هوشمند!
نظر شما چیست؟ آیا فکر میکنید روزی ایجنتهای هوش مصنوعی جای تسترهای انسانی را میگیرند؟
نویسی
منبع: arXiv AI
