محققان در یک تحقیق جدید، بنچمارک جدیدی به نام «Robust Reasoning Benchmark» را معرفی کردهاند که ضعفهای پنهان مدلهای زبانی (LLM) را برملا میکند. این مطالعه نشان میدهد که عملکرد مدلهای بزرگ در حل مسائل ریاضی، بهشدت به نحوه چیدمان متن وابسته است.
نکته جالب اینجاست که حتی مدلهای پیشرفته نیز با تغییرات جزئی در صورت سوال یا افزایش حجم محاسبات در یک پنجره متنی، دچار اختلال میشوند (پدیدهای به نام رقیقسازی توجه). این تحقیق به ما یادآوری میکند که هوش مصنوعی هنوز تا رسیدن به «استدلال منطقیِ خللناپذیر» فاصله دارد.
منبع: arXiv AI
