محققان در مقاله جدیدی، فریمورک نوآورانهای به نام CGCE را معرفی کردهاند که بدون تغییر دادن وزنهای اصلی مدلهای هوش مصنوعی (مثل مدلهای تولید تصویر و ویدیو)، جلوی تولید محتوای نامناسب و ناامن را میگیرد.
نکته جذاب اینجاست که اکثر روشهای قبلی با حذف مفاهیم ناامن، کیفیت خروجی مدل برای بقیه محتواهای مفید را کاهش میدادند یا در برابر حملات ضعیف بودند؛ اما CGCE با استفاده از یک طبقهبندیکننده (Classifier) سبک در زمان استنتاج (Inference)، فقط امبیدینگهای مرتبط با مفاهیم ناامن را فیلتر میکند تا هم امنیت حفظ شود و هم کیفیت خروجی همچنان بالا باقی بماند. این یک گام بزرگ برای کاربردیتر و امنتر کردن هوش مصنوعی است! ✨
منبع: arXiv AI
