محققان به تازگی روش نوآورانهای برای مقابله با هکهای «Jailbreak» و توهمات (Hallucinations) در مدلهای بزرگ چندوجهی (MLLM) معرفی کردهاند.
در این روش، مدل با شناسایی و حذف توکنهای بصری «خارج از توزیع» (OOD) که باعث سردرگمی مدل میشوند، نه تنها امنیت را افزایش میدهد، بلکه هزینههای پردازشی (Inference Cost) را نیز به شکل چشمگیری کاهش میدهد. نتایج آزمایشها نشان میدهد که این متد توانسته دفاع در برابر حملات Jailbreak را بیش از ۱۳ درصد بهبود بخشد. 🚀
با این تکنیک، هوش مصنوعی هم امنتر عمل میکند و هم سریعتر!
منبع: arXiv Computer Vision


