محققان در یک پژوهش جدید به سراغ چالش جذابِ «کالیبراسیون اعتمادبهنفس» در مدلهای زبانی بزرگ (LLM) رفتهاند. مسئله اینجاست: وقتی مدلها با یادگیری تقویتی (RL) آموزش میبینند، گاهی به جای افزایش دقت، یاد میگیرند که برای پاسخهای نادرست خود هم «اعتمادبهنفس کاذب» نشان دهند؛ پدیدهای که محققان به آن «هک پاداش» میگویند!
در این مقاله، راهکارهایی برای طراحی توابع پاداشِ «غیرقابلهک» ارائه شده تا مدلها در عین یادگیریِ استدلال درست، یاد بگیرند که چه زمانی واقعاً نسبت به دانش خود مطمئن هستند. این دستاورد میتواند گام بزرگی برای قابلاعتمادتر کردن هوش مصنوعی در کاربردهای حساس باشد.
منبع: arXiv Machine Learning
