🚀 معرفی RuBench: وقتی هوش مصنوعی به زبان روسی کد می‌زند!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی بنچمارک جدیدی به نام «RuBench 1.0» معرفی کرده‌اند که به طور خاص توانایی مدل‌های برنامه‌نویسی (Coding Agents) را در درک درخواست‌های واقعی کاربران به زبان روسی به چالش می‌کشد.

برخلاف بنچمارک‌های رایج که فقط بر اساس دستورات انگلیسی طراحی شده‌اند، RuBench با استفاده از سناریوهای واقعی در ۵ مخزن متن‌باز (مثل aiogram و aiohttp)، بررسی می‌کند که آیا هوش مصنوعی می‌تواند همانند یک توسعه‌دهنده انسانی، درخواست‌های غیررسمی و تخصصی کاربران را درک و اجرا کند یا خیر. این تحقیق نشان می‌دهد که مدل‌های قدرتمندی مثل Claude و GPT-5.5 با وجود پیشرفت‌ها، هنوز در درک دقیق نیازهای کاربران در زبان‌های غیرانگلیسی با چالش‌های جالبی روبرو هستند.

آینده دستیارهای برنامه‌نویسی به سمت بومی‌سازی و درک بهتر زبان‌های مختلف در حال حرکت است! 💻✨

منبع: arXiv AI