🔍 چالش جدید در ارزیابی مدل‌های زبانی: آیا نتایج بنچمارک‌ها قابل اعتماد هستند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

اخیراً مقاله‌ای منتشر شده که پرده از یک خطای مهم در ارزیابی مدل‌های هوش مصنوعی (LLM) برمی‌دارد: «سوگیری موقعیتی» (Position Bias). طبق این پژوهش، وقتی سوالات چندگزینه‌ای را به هوش مصنوعی می‌دهیم، ترتیب گزینه‌ها می‌تواند روی پاسخ مدل تاثیر بگذارد.

نکات کلیدی این تحقیق:
✅ معرفی ابزار جدید inspect_permute برای شناسایی دقیق سوگیری‌ها.
✅ بررسی مدل‌های مطرحی مثل GPT-4o-mini، Claude-Haiku و Gemini-2.5.
✅ کشف اینکه در سطوح دقت بسیار بالا (که اکثر مدل‌های پیشرفته در آن قرار دارند)، به دلیل «اثر سقف»، نمی‌توان سوگیری را به‌درستی اندازه‌گیری کرد. به زبان ساده: نبود سوگیری در نتایج فعلی به معنای بی‌طرف بودن مدل نیست، بلکه ابزارهای فعلی ما در این سطح دقت دچار محدودیت هستند!

این یافته برای توسعه‌دهندگان و محققانی که روی بنچمارک‌های استاندارد مثل MMLU کار می‌کنند، بسیار حیاتی است تا درک دقیق‌تری از عملکرد واقعی مدل‌ها داشته باشند. 🧠💡

منبع: arXiv Machine Learning