بسیاری از مدلهای زبانی امروزی در ظاهر بسیار دقیق هستند، اما در استدلالهای پیچیده و طولانی دچار «نزدیکبینی واقعی» میشوند؛ یعنی حقایق را درست میگویند اما زنجیره استدلالشان حفرههای منطقی دارد.
محققان در مقاله جدیدی، متد جدید LogicScore را معرفی کردهاند که به جای تمرکز صرف بر فکتها، «یکپارچگی منطقی» پاسخهای هوش مصنوعی را در سه سطح بررسی میکند:
✅ کامل بودن (دقت در استنتاج)
✅ ضروری بودن (حذف اطلاعات اضافی)
✅ قطعیت (انسجام پاسخ)
جالب است بدانید در آزمایش روی مدلهای بزرگی مثل GPT-5 و Gemini-3، مشخص شد که این مدلها علیرغم دقت بالا در فکتها، هنوز در درک منطقِ جهانی (Global Reasoning) چالشهای جدی دارند. این ابزار استاندارد جدیدی برای توسعهدهندگان است تا مدلهایی منطقیتر بسازند.
منبع: arXiv NLP
