همانطور که مدلهای هوش مصنوعی (LLM) پیشرفتهتر میشوند، روشهای فعلی ما برای سنجش «ایمنی» و «هوش» آنها دچار مشکل شده است. محققان در پژوهش جدیدی با نام EvalSafetyGap، ۳۷۳ مطالعه اخیر را بررسی کردند تا بفهمند چرا مدلها گاهی در بنچمارکها نمره عالی میگیرند اما در دنیای واقعی دچار خطاهای ایمنی میشوند!
💡 نکته کلیدی این تحقیق، معرفی چارچوبی است که هشدار میدهد نباید «قابلیتها»، «رفتار» و «ایمنی» مدلها را در یک نمره واحد خلاصه کرد. این مقاله پیشنهاد میدهد برای درک واقعی رفتار مدلها، باید لایههای مختلف شواهد را به صورت جداگانه گزارش کنیم تا فریبِ نمراتِ گمراهکننده را نخوریم.
این یک گام مهم برای حرکت به سمت هوش مصنوعی شفافتر و ایمنتر است. 🛡️
منبع: arXiv Machine Learning
