بیشتر ابزارهای هوش مصنوعی که میبینیم، در محیطهای تکزبانه (عمدتا انگلیسی) تست میشوند، اما دنیای واقعی خیلی پیچیدهتر است. محققان به تازگی بنچمارک جدیدی به نام «PolyWorkBench» را معرفی کردهاند که عملکرد ایجنتهای هوشمند را در جریانهای کاری چندزبانه ارزیابی میکند.
این بنچمارک شامل ۶۷ تسک در حوزههای مختلفی مثل تجارت، حقوق و تولید است. نتایج نشان میدهد که مدلهای پیشرفته فعلی وقتی با ترکیبی از زبانها در محیطهای کاری پیچیده مواجه میشوند، افت عملکرد قابلتوجهی دارند. این پژوهش گامی مهم برای ساخت ایجنتهای واقعی است که بتوانند در دنیای چندفرهنگی امروز، بدون خطا و با دقت بالا کار کنند. 🤖✨
منبع: arXiv AI
