محققان در یک مطالعه جدید و جامع، به بررسی صحت معیارهایی مثل «کد کاوریج» و «امتیاز جهش» (Mutation Score) در تستهای تولید شده توسط LLMها پرداختهاند. برخلاف باورهای قدیمی درباره کدهای انسانی، این تحقیق نشان میدهد که اثربخشی این معیارها در دنیای هوش مصنوعی کاملاً به «بافتار» یا Context بستگی دارد.
نتایج جالب این پژوهش میگوید در شرایطی که کدها بینقص فرض میشوند، این معیارها همچنان سیگنالهای مفیدی برای مقایسه مدلها هستند؛ اما وقتی هدف یافتن باگ در کدهای مشکوک باشد، دیگر نمیتوان به این معیارهای کلاسیک تکیه کرد. یک یافته کلیدی برای متخصصان تست نرمافزار و توسعهدهندگان مدلهای زبانی! 🛠️💡
منبع: arXiv Machine Learning
