🛡️ آیا مدل‌های زبانی بزرگ (LLM) می‌توانند هک شوند؟ 🧐

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی تازه، مکانیزم‌های پنهانی را بررسی کرده‌اند که چگونه «درهای پشتی» (Backdoors) در مدل‌های هوش مصنوعی نفوذ می‌کنند. این مطالعه نشان می‌دهد که برخی محرک‌های زبانی، عملاً مدارهای داخلی مدل را «ربوده» و از توانمندی‌های زبانی خودِ مدل برای رفتارهای مخرب استفاده می‌کنند.

نکته کلیدی اینجاست: این حملات، لایه‌های جدیدی نمی‌سازند، بلکه از همان مسیرهای عصبی که مدل برای درک زبان استفاده می‌کند، برای اجرای دستورات مخرب بهره می‌برند. درک این فرآیند، گامی بزرگ برای ساخت دیواره‌های دفاعی مستحکم‌تر در برابر حملات سایبری به هوش مصنوعی است. 🤖🔒

منبع: arXiv NLP