مدلهای تولید تصویر (Text-to-Image) به پیشرفتهای خیرهکنندهای رسیدهاند، اما همچنان با چالشِ تولید محتوای نامناسب (NSFW) دست و پنجه نرم میکنند. حالا پژوهشگران فریمورک جدیدی به نام «MIND» معرفی کردهاند که فرآیند «جیلبریک» (دور زدن فیلترهای امنیتی) را به یک مسئلهی استنتاجِ هوشمند تبدیل میکند.
تفاوت اصلی MIND در این است که به جای روشهای سنتی (تلاش و خطا)، سیستمهای دفاعی مدل را تحلیل کرده و با استفاده از «حافظهی متا» و بازخوردهای چندوجهی، به شکلی دقیقتر لایههای حفاظتی را دور میزند. این تحقیق زنگ خطری جدی برای توسعهدهندگان است تا به فکر لایههای دفاعی مقاومتر باشند. 🧐
منبع: arXiv AI
