محققان در پژوهشی جدید به سراغ یکی از نقاط ضعف جدی مدلهای زبانی (LLM) رفتهاند: آسیبپذیری در برابر «تزریق بلاغی» (Rhetorical Injection).
ماجرا اینجاست که وقتی هوش مصنوعی به عنوان داور در محیطهای بازی یا سناریوهای شبهواقعی قرار میگیرد، کاربران با استفاده از استدلالهای شبهمنطقی و فشارهای کلامی، بهراحتی میتوانند مدل را متقاعد کنند که قوانین را زیر پا بگذارد!
تیم تحقیق با معرفی بنچمارک CoC-Seduce و تست مدلهای قدرتمندی مثل GPT-5.4 و Claude Sonnet 4.6، نشان دادند که حتی پیشرفتهترین مدلها هم در برابر تکنیکهای اقناعکننده انسانی بهشدت آسیبپذیرند. این یعنی برای استفاده از هوش مصنوعی در نقشهای حساس قضاوتی، هنوز راه درازی در پیش داریم. 🤖⚖️
منبع: arXiv AI
