🛡️ راهکار جدید برای افزایش امنیت LLMها: معرفی روش HARC

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهش جدیدی به چالش جیل‌بریک (Jailbreak) در مدل‌های زبانی بزرگ پرداخته‌اند. آن‌ها متوجه شده‌اند که مدل‌های هوش مصنوعی «تمایل به پاسخ‌دهی» و «محتوای مخرب» را به صورت جهت‌های خاص در حافظه خود ذخیره می‌کنند.

با معرفی روش جدید HARC، محققان توانسته‌اند با جفت‌سازی دقیق این دو مفهوم در زمان پردازش، امنیت مدل‌ها را بدون کاهش کیفیت و هوشمندی آن‌ها به شدت افزایش دهند. این یعنی بدون اینکه مدل بیش از حد در پاسخ‌دهی لکنت پیدا کند، در برابر نفوذهای امنیتی بسیار مقاوم‌تر شده است! 🚀

منبع: arXiv AI