🚀 محک‌زنی دقیق‌تر برای هوش مصنوعی؛ معرفی Tencent WorkBuddy Bench

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

تنسنت به تازگی یک بنچمارک جدید و پیشرفته برای ارزیابی «ایجنتهای کدنویس» (Coding Agents) معرفی کرده که ادعا می‌کند نسبت به مدل‌های فعلی، در برابر نشت داده و تقلب مقاوم‌تر است.

ویژگی‌های کلیدی این ابزار:
🔹 پوشش چهار حوزه عملیاتی: کدنویسی، توسعه وب، امور اداری و امنیت.
🔹 روش ساخت متفاوت: برخلاف بنچمارک‌های معمولی که از متون عمومی وب استفاده می‌کنند، وظایف در این پروژه از دل پروژه‌های واقعی (Commitها و PRها) استخراج شده و به صورت سناریوهای بازنویسی‌شده درآمده‌اند تا امکان جستجو و تقلب توسط مدل‌ها به حداقل برسد.
🔹 شفافیت کامل: این مجموعه داده به صورت عمومی منتشر شده تا محققان بتوانند عملکرد مدل‌های خود را با پروتکلی دقیق و یکسان بسنجند.

این یعنی در آینده نزدیک، مدل‌های هوش مصنوعی که ادعای برنامه‌نویسی دارند باید از سدهای سخت‌تری عبور کنند تا واقعی بودن توانایی آن‌ها ثابت شود! 💻⚙️

منبع: arXiv NLP