محققان در پژوهشی جدید به بررسی ضعفهای «نظارتگرهای جعبهسفید» (White-box Monitors) در مدلهای زبانی بزرگ پرداختهاند. این مدلها که برای اطمینان از عملکرد ایمن هوش مصنوعی طراحی شدهاند، گاهی با ترفندهای هوشمندانه دور زده میشوند.
این مطالعه نشان میدهد که مهاجمان با تغییر هندسی اطلاعات و دستکاری کوواریانس، هوش مصنوعی را فریب میدهند. برای مقابله با این تهدید، ابزار جدیدی به نام SafetyNet معرفی شده که با رویکردی چندلایه، امنیت و دقت تشخیص خطرات را بهطور چشمگیری بهبود میبخشد و در بنچمارکهای مهم، عملکردی درخشان داشته است. این پیشرفت گام بزرگی برای ساخت هوش مصنوعی ایمنتر و قابلاعتمادتر محسوب میشود. 🤖✨
منبع: arXiv AI
