🧠 آیا هوش مصنوعی می‌داند کِی جوابش اشتباه است؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

یکی از چالش‌های بزرگ مدل‌های زبانی (LLM) این است که با اعتمادبه‌نفس بالا، پاسخ‌های غلط می‌دهند! در تحقیق جدیدی، بنچمارک «ConfidenceBench» معرفی شده که میزان «کالیبراسیون اطمینان» مدل‌ها را بررسی می‌کند.

در این ارزیابی، عملکرد ۱۵ مدل بزرگ (از جمله Claude Opus 4.6 و Gemini 3.1) تست شده تا مشخص شود کدام مدل‌ها در تشخیص درست بودنِ پاسخ خودشان بهتر عمل می‌کنند. نتیجه جالب اینکه: دقت بالا همیشه به معنای خودآگاهی بالا نیست! 🎯

این بنچمارک ابزار مهمی برای توسعه‌دهندگانی است که می‌خواهند هوش مصنوعی را در کاربردهای حساس (مثل پزشکی یا ریاضی) قابل‌اعتمادتر کنند.

منبع: arXiv AI