پژوهش جدیدی در arXiv نشان میدهد که مدلهای زبانی (LLM) که به عنوان «داور» برای ارزیابی محتوا استفاده میشوند، در زبانهای مختلف عملکرد یکسانی ندارند. این تحقیق نشان داده که این مدلها در مواجهه با زبانهای کممنابع، به صورت سخاوتمندانهتری امتیاز میدهند؛ موضوعی که میتواند باعث شود محتوای غیراخلاقی یا خطرناک در این زبانها از فیلترهای امنیتی عبور کند! 🛡️⚠️
نکته جالب اینجاست که حتی مدلهای پیشرو و قدرتمند هم دچار این سوگیری هستند و معیارهای فعلی ارزیابی (Pairwise Accuracy) نمیتوانند این تبعیض زبانی را شناسایی کنند. این یعنی راه درازی تا دستیابی به ارزیابیهای واقعاً منصفانه و جهانی برای هوش مصنوعی داریم.
منبع: arXiv NLP
