در پژوهشی جدید، محققان به یک مشکل ساختاری در استفاده از LLMها به عنوان «داور» (LLM-as-a-judge) پی بردهاند. این مطالعه نشان میدهد که فرآیند تولید دادههای مصنوعی برای سنجش دقت مدلها، گاهی دچار نقصهای فنی پنهان میشود؛ نقصهایی که نه با آمارهای کلان، بلکه فقط با بررسی دستی و دقیق قابل شناسایی هستند.
این تحقیق هشدار میدهد که استفاده از مدلهای زبانی برای تولید نمونههای منفی (Negative Examples) در ارزیابی، بدون مکانیسمهای تایید یکپارچگی داده، میتواند منجر به نتایج کاذب و گمراهکننده شود. این یک یادآوری مهم برای توسعهدهندگان است که در دنیای هوش مصنوعی، همیشه نباید به خروجیهای خودکار تکیه کرد!
منبع: arXiv NLP
