🛡️ هک مدل‌های زبانی با تغییر تنها چند بیت!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان به تازگی آسیب‌پذیری جدید و خطرناکی در مدل‌های زبانی بزرگ (LLM) کشف کرده‌اند که آن را «ربایش در سطح تصمیم‌گیری» (Decision-Level Hijacking) نامیده‌اند.

در این روش که با نام CogBias معرفی شده، مهاجمان می‌توانند با تغییر تعداد بسیار کمی از بیت‌های وزن مدل (Bit-Flip Attack)، سوگیری‌های شناختی خاصی را به هوش مصنوعی تزریق کنند. این یعنی بدون نیاز به تغییر در فرآیند آموزش یا دسترسی لحظه‌ای به سیستم، هوش مصنوعی طوری دستکاری می‌شود که در تصمیم‌گیری‌های حساس، خروجی‌های جهت‌دار و کنترل‌شده ارائه دهد.

این کشف زنگ خطری جدی برای توسعه‌دهندگانی است که از مدل‌های متن‌باز در حوزه‌های استراتژیک استفاده می‌کنند. امنیت مدل‌های زبانی بیش از هر زمان دیگری اهمیت پیدا کرده است! 🧠⚠️

منبع: arXiv Machine Learning