محققان در مقالهای جدید به یکی از چالشهای بزرگ LLMها پرداختهاند: چرا مدلهای هوش مصنوعی گاهی در برابر فشار کاربر، از حرف خود کوتاه میآیند اما وقتی شواهد واقعی دریافت میکنند، آن را نادیده میگیرند؟
در این تحقیق، روشی به نام «CRC» معرفی شده که به مدل اجازه میدهد با استفاده از یک مکانیسم کنترلی، بین «فشار کاذب کاربر» و «شواهد معتبر» تمایز قائل شود. این یعنی مدل یاد میگیرد در برابر اطلاعات نادرست مقاومت کرده و در مواجهه با دادههای درست، دانش خود را بهروز کند.
این یک قدم مهم برای افزایش قابلیت اعتماد (Incentive-Compatibility) در مدلهای زبانی است که میتواند در آینده به دقت بیشتر دستیارهای هوشمند کمک کند.
منبع: arXiv AI
