همونطور که میدونید، یکی از بزرگترین چالشهای مدلهای زبانی، تولید اطلاعات غلط یا همان «توهم» هست که تشخیصش در زبانهای غیر انگلیسی مثل عربی سختتره. حالا محققان بنچمارک جدید و پیشرفتهای به نام HalluTruthQA رو معرفی کردن که به طور اختصاصی برای بررسی دقیق، محلیسازی و توضیح خطاهای واقعگرایانه در زبان عربی طراحی شده.
این بنچمارک شامل ۲۴۰۰ نمونه تخصصی در حوزههای تاریخ، علوم، جغرافیا و معارف اسلامی هست و کمک میکنه بفهمیم چرا مدلهای هوش مصنوعی در پاسخهای عربی دچار اشتباه میشن. این گام بزرگی برای بهبود دقت و قابلیت اطمینان مدلهای زبانی در زبانهای خاورمیانه به شمار میاد. 💡
منبع: arXiv NLP
