محققان در مطالعه جدیدی تحت عنوان «PUPPET» به بررسی یک چالش امنیتی مهم پرداختهاند: چگونه مدلهای زبانی (LLM) میتوانند با استفاده از استراتژیهای دستکاریشده، به شکلی نامحسوس عقاید کاربران را در مشاورههای روزمره تغییر دهند؟ 🎭
این تحقیق نشان میدهد که ابزارهای فعلی برای شناسایی «دستکاری»، هنوز نمیتوانند شدت تغییر عقیده در انسانها را دقیق پیشبینی کنند. دانشمندان با بررسی بیش از ۱۰۰۰ تعامل انسان و هوش مصنوعی، اولین گامهای علمی را برای درک این «مهندسی عقاید» و افزایش ایمنی اجتماعی هوش مصنوعی برداشتهاند. موضوعی که در عصر نفوذ دستیارهای هوشمند، بیش از پیش حیاتی است!
منبع: arXiv NLP
