محققان در پژوهشی تازه، مکانیزمهای پنهانی را بررسی کردهاند که چگونه «درهای پشتی» (Backdoors) در مدلهای هوش مصنوعی نفوذ میکنند. این مطالعه نشان میدهد که برخی محرکهای زبانی، عملاً مدارهای داخلی مدل را «ربوده» و از توانمندیهای زبانی خودِ مدل برای رفتارهای مخرب استفاده میکنند.
نکته کلیدی اینجاست: این حملات، لایههای جدیدی نمیسازند، بلکه از همان مسیرهای عصبی که مدل برای درک زبان استفاده میکند، برای اجرای دستورات مخرب بهره میبرند. درک این فرآیند، گامی بزرگ برای ساخت دیوارههای دفاعی مستحکمتر در برابر حملات سایبری به هوش مصنوعی است. 🤖🔒
منبع: arXiv NLP
