🛡️ هوش مصنوعی در برابر حملات تطبیقی؛ چالش جدید امنیت LLM‌ها

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه‌ای جدید، یک بنچمارک پیشرفته برای ارزیابی امنیت مدل‌های زبانی بزرگ معرفی کرده‌اند. این پژوهش نشان می‌دهد که اکثر مدل‌های فعلی در برابر «حملات چندمرحله‌ای تطبیقی» (Multi-turn Adaptive Attacks) آسیب‌پذیر هستند.

نکات کلیدی این تحقیق:
🔹 برخلاف حملات سنتی، در این روش هوش مصنوعیِ مهاجم، پاسخ‌های قبلی مدلِ مدافع را تحلیل کرده و استراتژی خود را در هر مرحله تغییر می‌دهد.
🔹 با افزایش تعداد دفعات حمله (تا ۱۵ مرحله)، میزان موفقیت مهاجم به‌شدت افزایش می‌یابد.
🔹 این بنچمارک که شامل ۲۱ سناریوی واقعی است، نقاط ضعف مدل‌های قدرتمندی مثل Claude Opus و GPT-5.4 را در شرایط مختلف به چالش می‌کشد.

این تحقیق گام مهمی در جهت ایمن‌سازی «ایجنت‌های هوش مصنوعی» است تا در تعاملات طولانی‌مدت با کاربران، در برابر تزریق دستورات (Prompt Injection) و دستکاری‌های هوشمندانه مقاوم‌تر باشند. 🤖💡

منبع: arXiv AI