یکی از چالشهای بزرگ مدلهای زبانی (LLM) این است که با اعتمادبهنفس بالا، پاسخهای غلط میدهند! در تحقیق جدیدی، بنچمارک «ConfidenceBench» معرفی شده که میزان «کالیبراسیون اطمینان» مدلها را بررسی میکند.
در این ارزیابی، عملکرد ۱۵ مدل بزرگ (از جمله Claude Opus 4.6 و Gemini 3.1) تست شده تا مشخص شود کدام مدلها در تشخیص درست بودنِ پاسخ خودشان بهتر عمل میکنند. نتیجه جالب اینکه: دقت بالا همیشه به معنای خودآگاهی بالا نیست! 🎯
این بنچمارک ابزار مهمی برای توسعهدهندگانی است که میخواهند هوش مصنوعی را در کاربردهای حساس (مثل پزشکی یا ریاضی) قابلاعتمادتر کنند.
منبع: arXiv AI
