در دنیای امنیت هوش مصنوعی، پژوهش جدیدی با نام ToM-SB منتشر شده که به توانایی مدلها در «نظریه ذهن» (Theory of Mind) میپردازد. ایده جذاب اینجاست: آموزش مدلها برای بازی در نقش یک «مأمور دوجانبه» که باید ذهن مهاجم را بخواند و با فریب دادن او، جلوی استخراج اطلاعات حساس را بگیرد.
نتایج این تحقیق نشان میدهد که حتی مدلهای قدرتمندی مثل Gemini 3-Pro و GPT-5.4 در سناریوهای پیچیده با این چالش دستوپنجه نرم میکنند. اما خبر خوب این است که ترکیب آموزش با تقویت یادگیری (RL)، توانایی فریب دادن و درک نیت مهاجم را بهطور همزمان در مدلها تقویت کرده است. گامی مهم برای ایمنتر کردن دنیای پر از ایجنتهای هوشمند!
منبع: arXiv AI
