محققان در پژوهشی جدید به کشف خطرناکی در زنجیره تأمین مدلهای «بینایی-زبان» (VLM) دست پیدا کردهاند. این مطالعه نشان میدهد که افراد یا شرکتهای بدخواه میتوانند بدون نیاز به تغییر دادههای آموزشی یا دستکاری پرامپتها، «دربهای پشتی» مخفی را در معماری مدل جاسازی کنند.
این روش که با نام «Representation Steering» شناخته میشود، به مهاجم اجازه میدهد رفتارهای ناخواسته یا بایاسهای خاصی را در مدل ایجاد کند که تنها با یک «ماشه» (Trigger) خاص فعال میشوند. این یعنی حتی مدلهایی که در ظاهر سالم به نظر میرسند، ممکن است در شرایط خاص رفتارهای مخربی از خود نشان دهند. این موضوع زنگ خطری جدی برای توسعهدهندگان و شرکتهایی است که از مدلهای متنباز یا پیشآموزشدیده در پروژههای خود استفاده میکنند.
منبع: arXiv AI
