محققان به تازگی بنچمارک جدیدی به نام «RuBench 1.0» معرفی کردهاند که به طور خاص توانایی مدلهای برنامهنویسی (Coding Agents) را در درک درخواستهای واقعی کاربران به زبان روسی به چالش میکشد.
برخلاف بنچمارکهای رایج که فقط بر اساس دستورات انگلیسی طراحی شدهاند، RuBench با استفاده از سناریوهای واقعی در ۵ مخزن متنباز (مثل aiogram و aiohttp)، بررسی میکند که آیا هوش مصنوعی میتواند همانند یک توسعهدهنده انسانی، درخواستهای غیررسمی و تخصصی کاربران را درک و اجرا کند یا خیر. این تحقیق نشان میدهد که مدلهای قدرتمندی مثل Claude و GPT-5.5 با وجود پیشرفتها، هنوز در درک دقیق نیازهای کاربران در زبانهای غیرانگلیسی با چالشهای جالبی روبرو هستند.
آینده دستیارهای برنامهنویسی به سمت بومیسازی و درک بهتر زبانهای مختلف در حال حرکت است! 💻✨
منبع: arXiv AI
