📊 چالش بزرگ هوش مصنوعی در حل مسائل ریاضی دانشگاهی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا مدل‌های زبانی بزرگ (LLMs) واقعاً در ریاضیات پیشرفته به بلوغ رسیده‌اند؟ تحقیق جدیدی با معرفی بنچمارک QEDBench نشان می‌دهد که ابزارهای ارزیابی خودکار (LLM-as-a-Judge) دچار «شکاف هم‌سویی» (Alignment Gap) هستند.

نکات کلیدی این پژوهش:
🔹 توهم هوشمندی: مدل‌های قدرتمندی مثل Claude Opus 4.5 و DeepSeek-V3 در ارزیابی اثبات‌های ریاضی دانشگاهی دچار تورم نمره (Score Inflation) می‌شوند.
🔹 شکاف در استدلال: در حالی که Gemini 3.0 Pro عملکرد خوبی در ریاضیات گسسته دارد، مدل‌های دیگری مانند GPT-5 Pro و Claude Sonnet 4.5 در حوزه‌های تخصصی مثل نظریه گراف عملکرد ضعیفی نشان داده‌اند.
🔹 ضرورت دقت: این مطالعه ثابت می‌کند که هنوز تا جایگزینی کامل داوری انسانی در محیط‌های علمی فاصله داریم.

این بنچمارک جدید قرار است استانداردی برای سنجش دقیق‌ترِ قابلیت‌های استدلالی مدل‌های هوش مصنوعی باشد. 🧠📐

منبع: arXiv Machine Learning