🚩 آیا داوران هوش مصنوعی به زبان‌های مختلف تبعیض قائل می‌شوند؟ 🤖🌐

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

پژوهش جدیدی در arXiv نشان می‌دهد که مدل‌های زبانی (LLM) که به عنوان «داور» برای ارزیابی محتوا استفاده می‌شوند، در زبان‌های مختلف عملکرد یکسانی ندارند. این تحقیق نشان داده که این مدل‌ها در مواجهه با زبان‌های کم‌منابع، به صورت سخاوتمندانه‌تری امتیاز می‌دهند؛ موضوعی که می‌تواند باعث شود محتوای غیراخلاقی یا خطرناک در این زبان‌ها از فیلترهای امنیتی عبور کند! 🛡️⚠️

نکته جالب اینجاست که حتی مدل‌های پیشرو و قدرتمند هم دچار این سوگیری هستند و معیارهای فعلی ارزیابی (Pairwise Accuracy) نمی‌توانند این تبعیض زبانی را شناسایی کنند. این یعنی راه درازی تا دستیابی به ارزیابی‌های واقعاً منصفانه و جهانی برای هوش مصنوعی داریم.

منبع: arXiv NLP