⚠️ هشداری برای ارزیابی مدل‌های هوش مصنوعی: فریب آمارهای کاذب را نخورید!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مطالعه جدیدی به نام «ErrorBench» پرده از یک مشکل بزرگ در ارزیابی مدل‌های زبانی (LLM) برداشته‌اند. موضوع از این قرار است که معیارهای رایج فعلی برای سنجش دقت هوش مصنوعی در شناسایی خطا (مثل F1-score)، به شدت تحت تاثیر نحوه نوشتن دستورات (Prompt) قرار می‌گیرند.

این تحقیق نشان می‌دهد که مدل‌ها می‌توانند بدون اینکه واقعاً در یافتن خطاهای متن بهتر عمل کنند، با استفاده از «پراپت‌های جهت‌دار»، آمارهای ظاهری خود را به شکل مصنوعی بالا ببرند (پدیده‌ای به نام F1 Inflation).

نتیجه‌گیری مهم این مقاله برای توسعه‌دهندگان و محققان این است: برای ارزیابی صحیحِ ابزارهای ویراستاری و بازبینی متن توسط هوش مصنوعی، نباید صرفاً به شمارش ساده اکتفا کرد و حتماً باید از معیارهای دقیق‌تر «span-aware» استفاده کرد.

منبع: arXiv:2607.01240

منبع: arXiv AI