دنیای هوش مصنوعی روز به روز قدرتمندتر میشود، اما همچنان در برابر حملات «جیلبریک» یا دور زدن محدودیتهای ایمنی آسیبپذیر است. حالا محققان در یک مقاله جدید (arXiv:2607.07903)، رویکرد جالبی را برای درک دلیل این اتفاق معرفی کردهاند.
در این روش، با استفاده از «گرافهای انتساب داخلی»، نحوه تغییرات درونی مدل هنگام مواجهه با درخواستهای مخرب ردیابی میشود. به جای نگاه صرف به ورودی و خروجی، دانشمندان حالا میتوانند ببینند که چطور یک حمله باعث سرکوب مفاهیم ایمنی و فعال شدن مسیرهای فکری خطرناک در مدل میشود.
این پیشرفت نه تنها به درک بهتر مدلها کمک میکند، بلکه راه را برای ساخت «گاردریلهای» هوشمندتر و ایمنتر باز میکند تا مدلها در برابر دستکاریها مقاومتر شوند. یک گام علمی و بسیار مهم برای امنیت هوش مصنوعی! 🛡️🤖
منبع: arXiv AI
