🛡️ هشدار امنیتی: درب‌های پشتی (Backdoor) در مدل‌های هوش مصنوعی!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی جدید به کشف خطرناکی در زنجیره تأمین مدل‌های «بینایی-زبان» (VLM) دست پیدا کرده‌اند. این مطالعه نشان می‌دهد که افراد یا شرکت‌های بدخواه می‌توانند بدون نیاز به تغییر داده‌های آموزشی یا دستکاری پرامپت‌ها، «درب‌های پشتی» مخفی را در معماری مدل جاسازی کنند.

این روش که با نام «Representation Steering» شناخته می‌شود، به مهاجم اجازه می‌دهد رفتارهای ناخواسته یا بایاس‌های خاصی را در مدل ایجاد کند که تنها با یک «ماشه» (Trigger) خاص فعال می‌شوند. این یعنی حتی مدل‌هایی که در ظاهر سالم به نظر می‌رسند، ممکن است در شرایط خاص رفتارهای مخربی از خود نشان دهند. این موضوع زنگ خطری جدی برای توسعه‌دهندگان و شرکت‌هایی است که از مدل‌های متن‌باز یا پیش‌آموزش‌دیده در پروژه‌های خود استفاده می‌کنند.

منبع: arXiv AI