🧠 آیا مدل‌های زبانی در بیان احتمالات قابل اعتمادند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تحقیقات جدید arXiv نشان می‌دهد که اگرچه مدل‌های زبانی بزرگ (LLMs) در ارائه توضیحات کلامی برای داده‌های عددی «ثبات» خوبی دارند، اما در بحث «کالیبراسیون» یا دقتِ بیانِ احتمالات با چالش‌های جدی روبرو هستند.

نتایج این ارزیابی بر روی ۹ مدل مختلف نشان می‌دهد که مدل‌ها در درک «عدم قطعیت» (Uncertainty) ضعیف‌تر از درک «احتمال» (Likelihood) عمل می‌کنند. حتی با ارائه آمارهای خلاصه، این مدل‌ها در تبدیل آمار به زبان طبیعی دچار خطا می‌شوند که یعنی هنوز برای استفاده در سناریوهای حساس (مثل ارتباطات ریسک) به بلوغ کامل نرسیده‌اند.

این یافته‌ها زنگ خطری است برای کسانی که می‌خواهند هوش مصنوعی را به عنوان یک «تفسیرگر خودکار» در تصمیم‌گیری‌های مهم به کار بگیرند. نظر شما چیست؟ آیا به تحلیل‌های احتمالاتِ مدل‌های هوش مصنوعی اعتماد دارید؟

منبع: arXiv AI