بسیاری از ما فکر میکنیم وقتی یک مدل زبانی (LLM) به سوالات دقیق پاسخ میدهد، یعنی منطق را درک کرده است. اما پژوهش جدیدی نشان داده که این مدلها وقتی صورت سوال کمی تغییر میکند، دچار سردرگمی میشوند! 📉
محققان با طراحی بنچمارک جدیدی به نام «CRTBench»، بررسی کردند که چطور تغییرات ساده مثل استفاده از «دو منفی» یا «جملات مجهول» باعث میشود مدلهایی که در دقت اولیه عالی هستند، در حفظ ثبات منطقی شکست بخورند. نتیجه تکاندهنده بود: دقت بالا لزوماً به معنای درک منطقی نیست!
این تحقیق تاکید میکند که برای پیشرفت در هوش مصنوعی، نباید فقط به اعداد و ارقام بنچمارکهای معمول اکتفا کرد، بلکه باید «سازگاری منطقی» مدلها را در شرایط پیچیده سنجید. 🔍
منبع: arXiv NLP
