محققان در یک پژوهش جدید، عملکرد ۳۰ مدل زبانی بزرگ (LLM) را با بنچمارک جدید «TriviaRoomQA» به چالش کشیدهاند. نتایج جالبی به دست آمده:
✅ مدلها در حوزههای تخصصی مثل تاریخ و ریاضیات عالی هستند.
❌ اما در مسائل «فرهنگ عامه» (موسیقی، سینما، چهرههای معروف و اخبار روزمره) ضعف قابلتوجهی دارند.
این تحقیق نشان میدهد که دانش مدلها همیشه مستقل از زبان نیست و یک شکاف بزرگ بین دانستههای آکادمیک و اطلاعات روزمره در مدلهای فعلی وجود دارد. این یافتهها به توسعهدهندگان کمک میکند تا درک مدلها از فرهنگ و جزئیات زندگی واقعی را تقویت کنند. نظر شما چیست؟ آیا هوش مصنوعی در سوالات عمومی هم شما را غافلگیر کرده است؟
منبع: arXiv NLP
