محققان در پژوهشی جدید، بنچمارک جامع و جذابی به نام JOR-Bench را معرفی کردهاند که به طور اختصاصی توانایی مدلهای زبانی (LLM) را در حل مسائل «تحقیق در عملیات» (OR) به زبان ژاپنی به چالش میکشد. 🇯🇵
این مجموعه شامل بیش از ۱۳۰۰ مسئله متنوع در حوزههای برنامهنویسی خطی، غیرخطی و بهینهسازی ترکیبی است. نکته جالب اینجاست که نتایج نشان میدهد مدلهای قدرتمند چندزبانه، در فرمولبندی این مسائل تفاوت عملکرد ناچیزی (تنها ۰.۳ درصد) بین انگلیسی و ژاپنی دارند که نشاندهنده هوشمندی بالای این مدلها در درک مفاهیم ریاضی فراتر از مرزهای زبانی است. با این حال، هنوز چالشهای ظریفی در درک دقیق صورتمسئلهها وجود دارد که میتواند منجر به خطاهای جالبی شود. 🧠⚙️
منبع: arXiv AI
