تنسنت به تازگی یک بنچمارک جدید و پیشرفته برای ارزیابی «ایجنتهای کدنویس» (Coding Agents) معرفی کرده که ادعا میکند نسبت به مدلهای فعلی، در برابر نشت داده و تقلب مقاومتر است.
ویژگیهای کلیدی این ابزار:
🔹 پوشش چهار حوزه عملیاتی: کدنویسی، توسعه وب، امور اداری و امنیت.
🔹 روش ساخت متفاوت: برخلاف بنچمارکهای معمولی که از متون عمومی وب استفاده میکنند، وظایف در این پروژه از دل پروژههای واقعی (Commitها و PRها) استخراج شده و به صورت سناریوهای بازنویسیشده درآمدهاند تا امکان جستجو و تقلب توسط مدلها به حداقل برسد.
🔹 شفافیت کامل: این مجموعه داده به صورت عمومی منتشر شده تا محققان بتوانند عملکرد مدلهای خود را با پروتکلی دقیق و یکسان بسنجند.
این یعنی در آینده نزدیک، مدلهای هوش مصنوعی که ادعای برنامهنویسی دارند باید از سدهای سختتری عبور کنند تا واقعی بودن توانایی آنها ثابت شود! 💻⚙️
منبع: arXiv NLP
