تا به حال فکر کردهاید که چرا مدلهای زبانی (LLMs) در حل مسائل پیچیده علمی گاهی دچار خطاهای عجیب میشوند؟ محققان بهتازگی متوجه شدهاند که این مدلها در درک روابط «علت و معلولی» و تفکیک آن از همبستگیهای ساده، هنوز راه زیادی در پیش دارند.
بنچمارک جدیدی به نام CausalGame طراحی شده تا توانایی تحلیلِ عاملهای هوش مصنوعی (AI Agents) را در محیطهای تعاملی و علمی به چالش بکشد. نتایج شوکهکننده است: از میان ۳۰ مدل قدرتمند بررسیشده، هیچکدام نتوانستند عملکرد قابل قبولی در شرایط واقعی مثل خطاهای اندازهگیری یا متغیرهای پنهان داشته باشند. این ابزار کمک میکند تا نسل آیندهی «دانشمندان هوش مصنوعی» دقیقتر و منطقیتر عمل کنند. 🚀
منبع: arXiv AI
