🧠 آیا مدل‌های هوش مصنوعی واقعاً در ریاضیات قوی هستند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک تحقیق جدید، بنچمارک جدیدی به نام «Robust Reasoning Benchmark» را معرفی کرده‌اند که ضعف‌های پنهان مدل‌های زبانی (LLM) را برملا می‌کند. این مطالعه نشان می‌دهد که عملکرد مدل‌های بزرگ در حل مسائل ریاضی، به‌شدت به نحوه چیدمان متن وابسته است.

نکته جالب اینجاست که حتی مدل‌های پیشرفته نیز با تغییرات جزئی در صورت سوال یا افزایش حجم محاسبات در یک پنجره متنی، دچار اختلال می‌شوند (پدیده‌ای به نام رقیق‌سازی توجه). این تحقیق به ما یادآوری می‌کند که هوش مصنوعی هنوز تا رسیدن به «استدلال منطقیِ خلل‌ناپذیر» فاصله دارد.

منبع: arXiv AI