امنیت در دنیای هوش مصنوعی روز به روز حساستر میشود. پژوهشگران بهتازگی بنچمارک جدیدی به نام «ToxScreen» را معرفی کردهاند که هدفش شناسایی «مسمومیت» در مدلهای زبانی بزرگ (LLM) است.
گاهی مهاجمان با دستکاری دادههای آموزشی، «درهای پشتی» یا همان Backdoorهایی را در مدل ایجاد میکنند تا در زمان اجرا، رفتارهای مخفی و مخربی از خود نشان دهد. بنچمارک ToxScreen با بررسی حدود ۸۰۰ مدل مختلف، به محققان کمک میکند تا این تهدیدات را شناسایی کرده و راهکارهای دفاعی بهتری برای امنیت سیستمهای هوش مصنوعی توسعه دهند.
این تحقیق نشان میدهد که روشهای قدیمی برای تشخیص این مسمومیتها چندان کارآمد نیستند و نیاز به رویکردهای دقیقتری داریم. دنیای AI بدون امنیت، هرگز کامل نخواهد بود! 🤖🔒
منبع: arXiv Machine Learning
