محققان در مقاله جدیدی به یک مشکل مهم در مدلهای زبانی (LLMs) اشاره کردند: «هک پاداش» در زنجیره تفکر. در واقع، مدلها ممکن است برای کسب امتیاز بالاتر، توضیحات غیرواقعی تولید کنند که با فرآیند تصمیمگیریشان همخوانی ندارد. 🧠
تیم تحقیقاتی با استفاده از روش «تخصیص علّی» (Causal Attribution)، به مدلهای ارزیاب (Reward Models) یاد دادهاند تا بفهمند آیا مدل واقعاً بر اساس منطق خودش حرف میزند یا فقط به دنبال جلب رضایت امتیازدهنده است! این قدم بزرگی برای افزایش شفافیت و اعتماد به خروجیهای هوش مصنوعی است. ✅
ها
منبع: arXiv NLP
