محققان به تازگی از یک مجموعه داده و بنچمارک جامع به نام «MathNet» رونمایی کردهاند که شامل بیش از ۳۰ هزار مسئله ریاضی المپیادی از ۴۷ کشور و به ۱۷ زبان مختلف است.
این بنچمارک که با هدف ارزیابی استدلال ریاضی و بازیابی اطلاعات طراحی شده، نشان میدهد که حتی مدلهای قدرتمندی مثل GPT-5 و Gemini-3.1-Pro نیز در حل مسائل سطح بالا هنوز با چالشهای جدی روبرو هستند. این پیشرفت میتواند گام بزرگی برای بهبود دقت مدلهای هوش مصنوعی در حل مسائل پیچیده علمی و منطقی باشد.
آیا به نظر شما هوش مصنوعی میتواند به زودی جایگاه نوابغ ریاضی را بگیرد؟ نظراتتان را برای ما بنویسید! 👇
منبع: arXiv AI
