محققان در مطالعهای جدید، یک بنچمارک پیشرفته برای ارزیابی امنیت مدلهای زبانی بزرگ معرفی کردهاند. این پژوهش نشان میدهد که اکثر مدلهای فعلی در برابر «حملات چندمرحلهای تطبیقی» (Multi-turn Adaptive Attacks) آسیبپذیر هستند.
نکات کلیدی این تحقیق:
🔹 برخلاف حملات سنتی، در این روش هوش مصنوعیِ مهاجم، پاسخهای قبلی مدلِ مدافع را تحلیل کرده و استراتژی خود را در هر مرحله تغییر میدهد.
🔹 با افزایش تعداد دفعات حمله (تا ۱۵ مرحله)، میزان موفقیت مهاجم بهشدت افزایش مییابد.
🔹 این بنچمارک که شامل ۲۱ سناریوی واقعی است، نقاط ضعف مدلهای قدرتمندی مثل Claude Opus و GPT-5.4 را در شرایط مختلف به چالش میکشد.
این تحقیق گام مهمی در جهت ایمنسازی «ایجنتهای هوش مصنوعی» است تا در تعاملات طولانیمدت با کاربران، در برابر تزریق دستورات (Prompt Injection) و دستکاریهای هوشمندانه مقاومتر باشند. 🤖💡
منبع: arXiv AI
