🧠 هوش مصنوعی هنوز در «تفکر علّی» ضعف دارد! معرفی بنچمارک CausalGame

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

تا به حال فکر کرده‌اید که چرا مدل‌های زبانی (LLMs) در حل مسائل پیچیده علمی گاهی دچار خطاهای عجیب می‌شوند؟ محققان به‌تازگی متوجه شده‌اند که این مدل‌ها در درک روابط «علت و معلولی» و تفکیک آن از همبستگی‌های ساده، هنوز راه زیادی در پیش دارند.

بنچمارک جدیدی به نام CausalGame طراحی شده تا توانایی تحلیلِ عامل‌های هوش مصنوعی (AI Agents) را در محیط‌های تعاملی و علمی به چالش بکشد. نتایج شوکه‌کننده است: از میان ۳۰ مدل قدرتمند بررسی‌شده، هیچ‌کدام نتوانستند عملکرد قابل قبولی در شرایط واقعی مثل خطاهای اندازه‌گیری یا متغیرهای پنهان داشته باشند. این ابزار کمک می‌کند تا نسل آینده‌ی «دانشمندان هوش مصنوعی» دقیق‌تر و منطقی‌تر عمل کنند. 🚀

منبع: arXiv AI