🚀 معرفی MathNet؛ بنچمارک جدید برای به چالش کشیدن توانایی‌های ریاضی هوش مصنوعی

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی از یک مجموعه داده و بنچمارک جامع به نام «MathNet» رونمایی کرده‌اند که شامل بیش از ۳۰ هزار مسئله ریاضی المپیادی از ۴۷ کشور و به ۱۷ زبان مختلف است.

این بنچمارک که با هدف ارزیابی استدلال ریاضی و بازیابی اطلاعات طراحی شده، نشان می‌دهد که حتی مدل‌های قدرتمندی مثل GPT-5 و Gemini-3.1-Pro نیز در حل مسائل سطح بالا هنوز با چالش‌های جدی روبرو هستند. این پیشرفت می‌تواند گام بزرگی برای بهبود دقت مدل‌های هوش مصنوعی در حل مسائل پیچیده علمی و منطقی باشد.

آیا به نظر شما هوش مصنوعی می‌تواند به زودی جایگاه نوابغ ریاضی را بگیرد؟ نظراتتان را برای ما بنویسید! 👇

منبع: arXiv AI