محققان در پژوهشی تازه کشف کردند که مدلهای زبانی قدرتمند در برابر دستورات دستکاریشده، رفتارهای متناقضی نشان میدهند. این مطالعه نشان میدهد که اگر یک هدف “خطرناک” مستقیماً به مدل داده شود، ممکن است در برابر آن مقاومت کند؛ اما اگر همان دستور توسط واسطههای دیگر بازنویسی و غیرمستقیم به مدل منتقل شود، مدل فریب خورده و در جهت خواسته غیرقانونی عمل میکند! ⚠️
این یعنی میتوان با استفاده از یک سیستم چندمرحلهای، لایههای امنیتی هوش مصنوعی را دور زد و آن را مجبور به اجرای دستورات مخرب کرد، بدون اینکه مدل متوجه ماهیت واقعی درخواست شود. این حفره امنیتی زنگ خطری جدی برای توسعهدهندگان سیستمهای خودکار است که از ایجنتهای هوشمند در محیطهای حساس استفاده میکنند.
منبع: arXiv AI
