محققان به راهکار جذابی دست یافتهاند که میتواند امنیت مدلهای چندوجهی (مثل مدلهایی که تصویر و ویدیو را درک میکنند) را بدون نیاز به دادههای آموزشی پیچیده افزایش دهد.
این متد جدید که MARS نام دارد، از «جهتهای امتناع متنی» (Textual Refusal Directions) در مدلهای زبانی استفاده میکند و آنها را برای مدلهای بینایی-زبانی تعمیم میدهد. به زبان ساده، مدل یاد میگیرد بدون نیاز به آموزش مجدد و صرف هزینههای سنگین، در برابر درخواستهای مخرب ایمنتر شود و «نه» گفتن را از بخش زبانی به بخش بینایی منتقل کند! 🧠✨
این دستاورد گامی مهم برای ایمنتر کردن سیستمهای هوش مصنوعی چندوجهی در دنیای واقعی است.
منبع: arXiv AI
