🔍 تست هوشمند مدل‌های زبانی: چطور به داوری AI اعتماد کنیم؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

استفاده از مدل‌های زبانی (LLM) برای بررسی درستی خروجی‌های نرم‌افزار یا همان «تست اوراکل» (Test Oracle) حسابی داغ شده، اما یک سوال اساسی باقی است: منبع اعتبار این داوری کجاست؟

در یک مطالعه سیستماتیک جدید، محققان ۵۴ پژوهش کلیدی را بررسی کردند تا بفهمند این مدل‌ها بر چه اساسی تصمیم می‌گیرند که یک خروجی «درست» یا «غلط» است. نتایج نشان می‌دهد که در نیمی از موارد، هوش مصنوعی بدون داشتن هیچ مشخصه (Specification) فنی خاصی داوری می‌کند که این موضوع چالش‌های جدی برای اعتماد و امنیت نرم‌افزار ایجاد می‌کند. این پژوهش راهنمای مهمی برای توسعه‌دهندگان است تا بفهمند مدل‌های هوش مصنوعی چطور در مسیر تست و کنترل کیفیت شکست می‌خورند.

منبع: arXiv AI