محققان در مقاله جدیدی نشان دادند که مدلهای متنباز همچنان در برابر حملات «Prefilling» آسیبپذیر هستند و با استفاده از روش جدیدی به نام RAP میتوانند لایههای امنیتی آنها را دور بزنند.
اما خبر خوب اینجاست که آنها راهکار دفاعی جدیدی با نام PRESTO معرفی کردهاند که با تمرکز بر رتبهبندی توکنها، «تراز ایمنی» (Safety Alignment) مدلها را به شکل عمیقتری تقویت میکند. این گام بزرگی برای جلوگیری از سوءاستفاده از مدلهای هوش مصنوعی قدرتمند است!
منبع: arXiv AI
