تا حالا فکر کردید که اگر چند مدل هوش مصنوعی با هم موافق باشند، یعنی جوابشان درست است؟ تحقیقات جدید نشان میدهد این تصور یک باور اشتباه است! 🧠⚠️
محققان در مطالعهای گسترده روی ۲۶۵ هزار خروجی مدلهای زبانی (LLM) دریافتند که «توافق مدلها» لزوماً نشانه دقت نیست. گاهی اوقات مدلها به دلیل سوگیریهای مشترک یا الگوهای یادگرفتهشده، با هم همنظر میشوند، در حالی که هر دو در حال ارائه یک جواب غلطِ با اعتمادبهنفس هستند! بهویژه مدلهای بسیار پیشرفته (Frontier Models) در این زمینه دچار بیشاعتمادی کاذب میشوند.
این یافته برای توسعهدهندگانی که از سیستمهای “LLM-as-a-judge” یا ارزیابی خودکار استفاده میکنند، زنگ خطری است که نباید فقط به تکرارپذیری پاسخها اعتماد کنند.
منبع: arXiv AI
