دانشمندان در مقاله جدیدی به بررسی یک چالش امنیتی مهم در مدلهای چندوجهی (VLM) پرداختهاند: آیا وقتی به یک مدل یاد میدهیم اطلاعات مخرب را «فراموش» کند، این فراموشی واقعاً در تمام حواس مدل اعمال میشود یا خیر؟
🔹 نکته کلیدی: تحقیقات نشان داده که حذف دانش در بخش متنی همیشه به بخش تصویری منتقل نمیشود و گاهی با حملات تایپوگرافی، مدل میتواند اطلاعاتی که قرار بوده فراموش کند را دوباره بازیابی کند.
🔹 راهکار جدید: محققان متد «CrossInf» را معرفی کردهاند که به جای پاکسازی کلی، روی بخشهای کلیدی مغز مدل (ترنسفورمرها) که بیشترین نقش را در درک چندوجهی دارند تمرکز میکند. این کار باعث میشود فراموشی مدل عمیقتر و در برابر حملات مقاومتر شود.
این دستاورد گامی بزرگ برای ساخت مدلهای ایمنتر و قابلاعتمادتر است! 🚀
منبع: arXiv NLP
