دنیای برنامهنویسیِ هوش مصنوعی هر روز تخصصیتر میشود! محققان به تازگی «RuBench 1.0» را معرفی کردهاند؛ یک بنچمارک جدید که برخلاف بسیاری از ابزارهای موجود، به جای ترجمه متون انگلیسی، از درخواستهای واقعی برنامهنویسان به زبان روسی برای ارزیابی «ایجنتهای کدنویس» (Coding Agents) استفاده میکند.
نکته جالب اینجاست که این بنچمارک ۲۵ تسک واقعی از مخازن متنباز معتبر را در بر میگیرد و عملکرد مدلهای قدرتمندی مثل Claude و مدلهای مبتنی بر GPT را در حل این چالشها به چالش کشیده است. این تحقیق نشان میدهد که گاهی اوقات، محصول نهایی و لایههای محافظتی آن، تأثیر بسیار بیشتری از خودِ مدل بر نتیجه نهایی دارند.
این پیشرفت نشان میدهد که هوش مصنوعی در حال حرکت به سمت درکِ زبانهای غیرانگلیسی در محیطهای عملیاتی و واقعی است.
منبع: arXiv AI
