یکی از چالشهای بزرگ در استفاده از مدلهای زبانی (LLM) برای کارهای حساس، اعتماد به خروجیهای آنهاست. محققان به تازگی چارچوب سبک و کاربردی جدیدی را معرفی کردهاند که منطق «تولید توسط هوش مصنوعی، اعتبارسنجی توسط ما» را دنبال میکند.
این متدولوژی با سه گام کلیدی، خروجیهای هوش مصنوعی را به سطح استانداردهای سازمانی میرساند:
۱. تولید مبتنی بر تست: اگر کدی یا متنی خطا داشته باشد، هوش مصنوعی با بازخورد دقیق متوجه اشتباهش شده و آن را اصلاح میکند.
۲. ترکیب تستهای قطعی و معنایی: هم خطاهای ساختاری (مثل سینتکس) و هم خطاهای منطقی با این سیستم شناسایی میشوند.
۳. استفاده از داوران متخصص: به جای بازبینی انسانی، از هوش مصنوعی برای شبیهسازی قضاوتهای کارشناسان خبره استفاده میشود تا فرآیندها سریعتر و دقیقتر شوند.
این فریمورک در حال حاضر در مایکروسافت سنتینل برای کارهای امنیتی استفاده میشود و نشان میدهد که چطور میتوانیم با روشهای هوشمندانه، ضریب اطمینان خروجیهای AI را به شدت بالا ببریم. 🤖💡
نویسی
منبع: arXiv AI
