محققان در پژوهشی جدید، برای اولین بار بنچمارک GSM-Plus-BN را جهت ارزیابی استدلال ریاضی در زبان بنگالی معرفی کردهاند. این مطالعه با استفاده از ۹۰۰۰ نمونه داده، قدرت مدلهای بزرگ (مانند Qwen3 و سری Llama) را در شرایط مختلف به چالش کشیده است. این دستاورد گام مهمی در جهت توسعه عادلانهتر هوش مصنوعی برای مناطق مختلف جهان و درک واقعی مدلها فراتر از تشخیص الگوهای ساده است. 🧠✨
منبع: arXiv NLP
