🧠 آیا هوش مصنوعی واقعاً منطقی فکر می‌کند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

بسیاری از ما فکر می‌کنیم وقتی یک مدل زبانی (LLM) به سوالات دقیق پاسخ می‌دهد، یعنی منطق را درک کرده است. اما پژوهش جدیدی نشان داده که این مدل‌ها وقتی صورت سوال کمی تغییر می‌کند، دچار سردرگمی می‌شوند! 📉

محققان با طراحی بنچمارک جدیدی به نام «CRTBench»، بررسی کردند که چطور تغییرات ساده مثل استفاده از «دو منفی» یا «جملات مجهول» باعث می‌شود مدل‌هایی که در دقت اولیه عالی هستند، در حفظ ثبات منطقی شکست بخورند. نتیجه تکان‌دهنده بود: دقت بالا لزوماً به معنای درک منطقی نیست!

این تحقیق تاکید می‌کند که برای پیشرفت در هوش مصنوعی، نباید فقط به اعداد و ارقام بنچمارک‌های معمول اکتفا کرد، بلکه باید «سازگاری منطقی» مدل‌ها را در شرایط پیچیده سنجید. 🔍

منبع: arXiv NLP