آیا مدلهای زبانی بزرگ (LLMs) واقعاً در ریاضیات پیشرفته به بلوغ رسیدهاند؟ تحقیق جدیدی با معرفی بنچمارک QEDBench نشان میدهد که ابزارهای ارزیابی خودکار (LLM-as-a-Judge) دچار «شکاف همسویی» (Alignment Gap) هستند.
نکات کلیدی این پژوهش:
🔹 توهم هوشمندی: مدلهای قدرتمندی مثل Claude Opus 4.5 و DeepSeek-V3 در ارزیابی اثباتهای ریاضی دانشگاهی دچار تورم نمره (Score Inflation) میشوند.
🔹 شکاف در استدلال: در حالی که Gemini 3.0 Pro عملکرد خوبی در ریاضیات گسسته دارد، مدلهای دیگری مانند GPT-5 Pro و Claude Sonnet 4.5 در حوزههای تخصصی مثل نظریه گراف عملکرد ضعیفی نشان دادهاند.
🔹 ضرورت دقت: این مطالعه ثابت میکند که هنوز تا جایگزینی کامل داوری انسانی در محیطهای علمی فاصله داریم.
این بنچمارک جدید قرار است استانداردی برای سنجش دقیقترِ قابلیتهای استدلالی مدلهای هوش مصنوعی باشد. 🧠📐
منبع: arXiv Machine Learning
