تا به حال فکر کردید چطور امنیت مدلهای زبانی بزرگ (LLM) را در برابر حملات «Jailbreak» بسنجیم؟ محققان بهتازگی فریمورک قدرتمند «JailMeter» را معرفی کردند که به جای روشهای سنتی، با استفاده از نظریه «Information Bottleneck» و بهینهسازی بازخورد دوگانه، حملات مخرب را با دقت فوقالعاده ۹۷.۲۷٪ شناسایی میکند.
نکته جذاب اینجاست که برای پروژههای بزرگ، نسخه کوچکسازیشده آن (JailMeter-SLM) هم طراحی شده تا بدون نیاز به هزینههای سنگین پردازشی، امنیت سیستمهای هوش مصنوعی تأمین شود. این گامی بزرگ برای رسیدن به مدلهای ایمنتر و قابلاعتمادتر است! 🚀
منبع: arXiv NLP
