🔍 آیا یافته‌های قبلی درباره «تنوع برچسب‌های انسانی» (HLV) در هوش مصنوعی درست است؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

در دنیای مدل‌های زبانی، درک اینکه چرا انسان‌ها در وظایف «استنباط زبان طبیعی» (NLI) اختلاف‌نظر دارند، بسیار حیاتی است. مطالعات قبلی ادعا می‌کردند که مدل‌ها در مواجهه با برخی ساختارهای زبانی خاص (مثل عملگرهای یکنواخت) دچار سردرگمی بیشتری می‌شوند.

اما یک پژوهش جدید و بسیار دقیق (Replication Study) نشان داده که این ادعاها احتمالاً به دلیل انتخاب داده‌های خاص در تحقیقات قبلی بوده است. وقتی محققان روی مجموعه‌داده‌های اصلی و بدون دستکاری (unselected populations) تست کردند، نتایج قبلی تکرار نشد! این یعنی ساختارهای زبانی به آن اندازه‌ای که فکر می‌کردیم باعث اختلاف‌نظر نمی‌شوند.

نکته مهم برای محققان: همیشه در گزارش‌های علمی خود، نحوه فیلتر کردن و انتخاب داده‌ها را شفاف بیان کنید تا نتایج دچار سوگیری نشوند. 📉⚖️

منبع: arXiv NLP