🛡️ حذف مفاهیم ناامن از مدل‌های مولد با روش جدید CGCE

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در مقاله جدیدی، فریم‌ورک نوآورانه‌ای به نام CGCE را معرفی کرده‌اند که بدون تغییر دادن وزن‌های اصلی مدل‌های هوش مصنوعی (مثل مدل‌های تولید تصویر و ویدیو)، جلوی تولید محتوای نامناسب و ناامن را می‌گیرد.

نکته جذاب اینجاست که اکثر روش‌های قبلی با حذف مفاهیم ناامن، کیفیت خروجی مدل برای بقیه محتواهای مفید را کاهش می‌دادند یا در برابر حملات ضعیف بودند؛ اما CGCE با استفاده از یک طبقه‌بندی‌کننده (Classifier) سبک در زمان استنتاج (Inference)، فقط امبیدینگ‌های مرتبط با مفاهیم ناامن را فیلتر می‌کند تا هم امنیت حفظ شود و هم کیفیت خروجی همچنان بالا باقی بماند. این یک گام بزرگ برای کاربردی‌تر و امن‌تر کردن هوش مصنوعی است! ✨

منبع: arXiv AI