آیا مدلهای زبانی بزرگ (LLMs) واقعاً میدانند چه زمانی پاسخ درستی میدهند؟ یک پژوهش جدید نشان میدهد که معیارهای فعلیِ «کالیبراسیون» برای سنجش میزان اطمینان هوش مصنوعی کافی نیستند.
بر اساس این مطالعه، مدلها حتی زمانی که بسیار دقیق به نظر میرسند، ممکن است درگیر تناقضات منطقی باشند و برخلاف تصور ما، «اطمینان» آنها لزوماً به معنای «درک احتمالات درست» نیست. محققان با معرفی چارچوب C1، ابزاری را پیشنهاد دادهاند که به جای تکیه بر کالیبراسیونهای رایج، ساختار منطقی و وفاداریِ باورهای مدل را میسنجد. این تحقیق ثابت میکند که روشهایی مثل RLHF به تنهایی نمیتوانند این شکافِ اطمینان را پر کنند.
این یافتهها برای توسعهدهندگان و محققانی که به دنبال ساخت مدلهای قابلاعتمادتر (Reliable AI) هستند، بسیار حیاتی است.
منبع: arXiv AI
