🧠 آیا هوش مصنوعی در «اطلاعات عمومی» ضعیف است؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک پژوهش جدید، عملکرد ۳۰ مدل زبانی بزرگ (LLM) را با بنچ‌مارک جدید «TriviaRoomQA» به چالش کشیده‌اند. نتایج جالبی به دست آمده:

✅ مدل‌ها در حوزه‌های تخصصی مثل تاریخ و ریاضیات عالی هستند.
❌ اما در مسائل «فرهنگ عامه» (موسیقی، سینما، چهره‌های معروف و اخبار روزمره) ضعف قابل‌توجهی دارند.

این تحقیق نشان می‌دهد که دانش مدل‌ها همیشه مستقل از زبان نیست و یک شکاف بزرگ بین دانسته‌های آکادمیک و اطلاعات روزمره در مدل‌های فعلی وجود دارد. این یافته‌ها به توسعه‌دهندگان کمک می‌کند تا درک مدل‌ها از فرهنگ و جزئیات زندگی واقعی را تقویت کنند. نظر شما چیست؟ آیا هوش مصنوعی در سوالات عمومی هم شما را غافلگیر کرده است؟

منبع: arXiv NLP