یکی از بزرگترین چالشهای مدلهای هوش مصنوعی، خطاهای منطقی و «توهم» در استدلالهای طولانی است. محققان به تازگی روش نوآورانهای به نام «SSC-GRPO» معرفی کردهاند که با استفاده از امتیازدهی مرحلهبهمرحله به زنجیره تفکر مدل (Reasoning Trace)، مانع از ایجاد تداخلهای متنی میشود.
این روش که بر پایه بهینهسازی سیاست گروهی و خودسازگاری است، توانسته در بنچمارکهای ریاضی و تشخیص توهم، نتایج فوقالعادهای کسب کند. با این تکنیک، مدلهای زبانی در حل مسائل پیچیده، دقیقتر و منطقیتر عمل خواهند کرد. 🤖💡
منبع: arXiv NLP
