🔍 آیا معیارهای متداول برای سنجش تست‌های تولید شده توسط هوش مصنوعی واقعاً قابل اعتمادند؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در یک مطالعه جدید و جامع، به بررسی صحت معیارهایی مثل «کد کاوریج» و «امتیاز جهش» (Mutation Score) در تست‌های تولید شده توسط LLMها پرداخته‌اند. برخلاف باورهای قدیمی درباره کدهای انسانی، این تحقیق نشان می‌دهد که اثربخشی این معیارها در دنیای هوش مصنوعی کاملاً به «بافتار» یا Context بستگی دارد.

نتایج جالب این پژوهش می‌گوید در شرایطی که کدها بی‌نقص فرض می‌شوند، این معیارها همچنان سیگنال‌های مفیدی برای مقایسه مدل‌ها هستند؛ اما وقتی هدف یافتن باگ در کدهای مشکوک باشد، دیگر نمی‌توان به این معیارهای کلاسیک تکیه کرد. یک یافته کلیدی برای متخصصان تست نرم‌افزار و توسعه‌دهندگان مدل‌های زبانی! 🛠️💡

منبع: arXiv Machine Learning