مدلهای تبدیل متن به تصویر (Text-to-Image) علیرغم قدرت خیرهکنندهشان، گاهی با ترفندهای خاصی برای تولید تصاویر نامناسب (Jailbreak) فریب میخورند. این ترفندها که به «مترادفهای بصری» معروفند، سیستمهای امنیتی فعلی را دور میزنند.
محققان به تازگی سیستم دفاعی هوشمندی به نام AEGIS را معرفی کردهاند. برخلاف روشهای قدیمی که فقط کلمات خاصی را مسدود میکردند، AEGIS در لحظه تولید تصویر، به تحلیل مکانیکی مدل میپردازد و مسیرهای عصبیِ تولید محتوای مخرب را شناسایی و اصلاح میکند. این روش باعث میشود امنیت مدلها بدون کاهش کیفیت تصاویر، به طرز چشمگیری افزایش یابد. گامی بزرگ برای رسیدن به هوش مصنوعی ایمنتر! 🚀
منبع: arXiv Computer Vision
