اخیراً مقالهای منتشر شده که پرده از یک خطای مهم در ارزیابی مدلهای هوش مصنوعی (LLM) برمیدارد: «سوگیری موقعیتی» (Position Bias). طبق این پژوهش، وقتی سوالات چندگزینهای را به هوش مصنوعی میدهیم، ترتیب گزینهها میتواند روی پاسخ مدل تاثیر بگذارد.
نکات کلیدی این تحقیق:
✅ معرفی ابزار جدید inspect_permute برای شناسایی دقیق سوگیریها.
✅ بررسی مدلهای مطرحی مثل GPT-4o-mini، Claude-Haiku و Gemini-2.5.
✅ کشف اینکه در سطوح دقت بسیار بالا (که اکثر مدلهای پیشرفته در آن قرار دارند)، به دلیل «اثر سقف»، نمیتوان سوگیری را بهدرستی اندازهگیری کرد. به زبان ساده: نبود سوگیری در نتایج فعلی به معنای بیطرف بودن مدل نیست، بلکه ابزارهای فعلی ما در این سطح دقت دچار محدودیت هستند!
این یافته برای توسعهدهندگان و محققانی که روی بنچمارکهای استاندارد مثل MMLU کار میکنند، بسیار حیاتی است تا درک دقیقتری از عملکرد واقعی مدلها داشته باشند. 🧠💡
منبع: arXiv Machine Learning
