⚠️ آیا هوش مصنوعی واقعاً ریسک‌ها را می‌فهمد؟ چالش بزرگ کالیبراسیون در مدل‌های زبانی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

آیا می‌توان به تحلیل‌های هوش مصنوعی در مورد احتمالات و ریسک‌ها اعتماد کرد؟ محققان در پژوهشی جدید ۹ مدل زبانی بزرگ (LLM) را بررسی کردند تا ببینند آیا این مدل‌ها در بیان احتمال‌ها و عدم‌قطعیت‌ها (Uncertainty) دقیق عمل می‌کنند یا خیر.

نتیجه جالب اینجاست: اگرچه این مدل‌ها در کلمات خود «منسجم» هستند، اما در واقعیت «بدکالیبره» (Miscalibrated) عمل می‌کنند؛ یعنی درک درستی از بزرگی احتمالات ندارند و در تحلیل عدم‌قطعیت‌ها به شدت ضعیف‌تر از حد انتظار ظاهر می‌شوند! 📉

این تحقیق نشان می‌دهد که هوش مصنوعی هنوز برای ایفای نقش به عنوان یک «ارزیاب ریسک» مستقل، مسیر طولانی در پیش دارد و مشکل اصلی در مرحله تبدیل آمار به زبان طبیعی (Verbalization) نهفته است.

منبع: arXiv AI