محققان در یک مطالعه جدید، نگاهی دقیق به یکی از روشهای اصلی کالیبراسیون یعنی «Temperature Scaling» انداختند. نتیجه جذاب بود: این روش که بر فرضِ «برچسبهای قطعی و تکمقدار» بنا شده، در دنیای واقعی که برچسبها اغلب بر اساس نظرات انسانی و احتمالات هستند، آنطور که باید عمل نمیکند.
نکته کلیدی پژوهش این است که با بزرگتر شدن مدلها (بهویژه در مدلهای زبانی)، این شکاف کالیبراسیون بیشتر خود را نشان میدهد و عملاً مدلهای بزرگتر در این زمینه ضعیفتر عمل میکنند. این یافته اهمیت دقت در انتخاب روشهای کالیبراسیون برای مدلهای هوش مصنوعی پیشرفته را دوچندان میکند.
منبع: arXiv Machine Learning
