محققان در یک پژوهش جدید، عملکرد مدلهای زبانی در حوزه «شیمی» را زیر ذرهبین بردهاند. نتیجه جالب و تأملبرانگیز است: مدلهای هوش مصنوعی هنگام حل مسائل شیمی، از روش «زنجیره تفکر» (CoT) استفاده میکنند، اما این زنجیرهها اغلب حاوی «توهم» (Hallucination) هستند!
نکته کلیدی اینجاست که حتی وقتی مدل به پاسخ درست میرسد، مراحل استدلال آن ممکن است پر از ادعاهای ساختاری غلط باشد. این تحقیق نشان میدهد که CoT در اینجا بیشتر شبیه به یک «چرکنویس مولکولی» عمل میکند تا یک استدلال منطقیِ قابلاعتماد. این یافتهها هشداری جدی برای پژوهشگرانی است که به زنجیره تفکر به عنوان گواهی بر استدلالِ درستِ مدل تکیه میکنند.
این مقاله بر اهمیتِ نظارت فرآیندی (Process-level supervision) به جای تمرکز صرف بر خروجی نهایی تاکید دارد.
منبع: arXiv NLP
