محققان در مطالعه جدیدی به نام «ErrorBench» پرده از یک مشکل بزرگ در ارزیابی مدلهای زبانی (LLM) برداشتهاند. موضوع از این قرار است که معیارهای رایج فعلی برای سنجش دقت هوش مصنوعی در شناسایی خطا (مثل F1-score)، به شدت تحت تاثیر نحوه نوشتن دستورات (Prompt) قرار میگیرند.
این تحقیق نشان میدهد که مدلها میتوانند بدون اینکه واقعاً در یافتن خطاهای متن بهتر عمل کنند، با استفاده از «پراپتهای جهتدار»، آمارهای ظاهری خود را به شکل مصنوعی بالا ببرند (پدیدهای به نام F1 Inflation).
نتیجهگیری مهم این مقاله برای توسعهدهندگان و محققان این است: برای ارزیابی صحیحِ ابزارهای ویراستاری و بازبینی متن توسط هوش مصنوعی، نباید صرفاً به شمارش ساده اکتفا کرد و حتماً باید از معیارهای دقیقتر «span-aware» استفاده کرد.
منبع: arXiv:2607.01240
منبع: arXiv AI
