استفاده از مدلهای زبانی (LLM) برای بررسی درستی خروجیهای نرمافزار یا همان «تست اوراکل» (Test Oracle) حسابی داغ شده، اما یک سوال اساسی باقی است: منبع اعتبار این داوری کجاست؟
در یک مطالعه سیستماتیک جدید، محققان ۵۴ پژوهش کلیدی را بررسی کردند تا بفهمند این مدلها بر چه اساسی تصمیم میگیرند که یک خروجی «درست» یا «غلط» است. نتایج نشان میدهد که در نیمی از موارد، هوش مصنوعی بدون داشتن هیچ مشخصه (Specification) فنی خاصی داوری میکند که این موضوع چالشهای جدی برای اعتماد و امنیت نرمافزار ایجاد میکند. این پژوهش راهنمای مهمی برای توسعهدهندگان است تا بفهمند مدلهای هوش مصنوعی چطور در مسیر تست و کنترل کیفیت شکست میخورند.
منبع: arXiv AI
