🛡️ حمله جدید به امنیت مدل‌های هوش مصنوعی؛ معرفی تکنیک PRESTO

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی نشان دادند که مدل‌های متن‌باز همچنان در برابر حملات «Prefilling» آسیب‌پذیر هستند و با استفاده از روش جدیدی به نام RAP می‌توانند لایه‌های امنیتی آن‌ها را دور بزنند.

اما خبر خوب اینجاست که آن‌ها راهکار دفاعی جدیدی با نام PRESTO معرفی کرده‌اند که با تمرکز بر رتبه‌بندی توکن‌ها، «تراز ایمنی» (Safety Alignment) مدل‌ها را به شکل عمیق‌تری تقویت می‌کند. این گام بزرگی برای جلوگیری از سوءاستفاده از مدل‌های هوش مصنوعی قدرتمند است!

منبع: arXiv AI