آیا اعداد و ارقام بنچمارکها واقعاً امنیت مدلهای هوش مصنوعی را نشان میدهند؟ محققان در مقاله جدیدی با معرفی چارچوب «EvalSafetyGap»، به چالشهای بنیادین در ارزیابی ایمنی LLMها پرداختهاند. این مطالعه با تحلیل ۸ جریان شواهد مختلف (از جمله تفسیرپذیری و استحکام در برابر جیلبریک)، توضیح میدهد که چگونه گاهی با بهبود امتیازها، خواص پنهان و ایمنی مدلها تغییر چندانی نمیکند. این تحقیق برای توسعهدهندگان و متخصصان ایمنی هوش مصنوعی، دیدگاههای جدیدی درباره «سهگانه همترازی» (Alignment Trilemma) ارائه میدهد.
منبع: arXiv Machine Learning
