تحقیقات جدید arXiv نشان میدهد که اگرچه مدلهای زبانی بزرگ (LLMs) در ارائه توضیحات کلامی برای دادههای عددی «ثبات» خوبی دارند، اما در بحث «کالیبراسیون» یا دقتِ بیانِ احتمالات با چالشهای جدی روبرو هستند.
نتایج این ارزیابی بر روی ۹ مدل مختلف نشان میدهد که مدلها در درک «عدم قطعیت» (Uncertainty) ضعیفتر از درک «احتمال» (Likelihood) عمل میکنند. حتی با ارائه آمارهای خلاصه، این مدلها در تبدیل آمار به زبان طبیعی دچار خطا میشوند که یعنی هنوز برای استفاده در سناریوهای حساس (مثل ارتباطات ریسک) به بلوغ کامل نرسیدهاند.
این یافتهها زنگ خطری است برای کسانی که میخواهند هوش مصنوعی را به عنوان یک «تفسیرگر خودکار» در تصمیمگیریهای مهم به کار بگیرند. نظر شما چیست؟ آیا به تحلیلهای احتمالاتِ مدلهای هوش مصنوعی اعتماد دارید؟
منبع: arXiv AI
