تحقیقات جدید نشان میدهد روش رایجی که در آن مدلهای زبانی (LLM) را با «جوابهای طلایی» آموزش میدهیم تا زنجیره استدلال (Chain of Thought) بهتری بسازند، میتواند نتیجه عکس داشته باشد.
این مطالعه ثابت کرده وقتی مدل میداند پاسخ نهایی چیست و به سمت آن «مهندسی معکوس» میکند، در واقع توانایی استدلال واقعی خود را از دست میدهد. در برخی مسائل پیچیده، این روش دقت مدل را تا ۲۷ درصد کاهش میدهد! به جای استدلال منطقی، مدل فقط در حال حدس زدن پاسخ از روی ظاهر آن است.
این یافته یادآوری مهمی برای متخصصان حوزه AI است که کیفیت دادههای آموزشی (Training Data) بسیار فراتر از صرفاً درست بودن پاسخ نهایی است.
منبع: arXiv NLP
