محققان در پژوهش جدیدی به چالش جیلبریک (Jailbreak) در مدلهای زبانی بزرگ پرداختهاند. آنها متوجه شدهاند که مدلهای هوش مصنوعی «تمایل به پاسخدهی» و «محتوای مخرب» را به صورت جهتهای خاص در حافظه خود ذخیره میکنند.
با معرفی روش جدید HARC، محققان توانستهاند با جفتسازی دقیق این دو مفهوم در زمان پردازش، امنیت مدلها را بدون کاهش کیفیت و هوشمندی آنها به شدت افزایش دهند. این یعنی بدون اینکه مدل بیش از حد در پاسخدهی لکنت پیدا کند، در برابر نفوذهای امنیتی بسیار مقاومتر شده است! 🚀
منبع: arXiv AI
