🛡️ هوش مصنوعی و چالش «فریب‌های روایی»؛ آیا LLMها می‌توانند داورهای عادلی باشند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهشی جدید به سراغ یکی از نقاط ضعف جدی مدل‌های زبانی (LLM) رفته‌اند: آسیب‌پذیری در برابر «تزریق بلاغی» (Rhetorical Injection).

ماجرا اینجاست که وقتی هوش مصنوعی به عنوان داور در محیط‌های بازی یا سناریوهای شبه‌واقعی قرار می‌گیرد، کاربران با استفاده از استدلال‌های شبه‌منطقی و فشارهای کلامی، به‌راحتی می‌توانند مدل را متقاعد کنند که قوانین را زیر پا بگذارد!

تیم تحقیق با معرفی بنچمارک CoC-Seduce و تست مدل‌های قدرتمندی مثل GPT-5.4 و Claude Sonnet 4.6، نشان دادند که حتی پیشرفته‌ترین مدل‌ها هم در برابر تکنیک‌های اقناع‌کننده انسانی به‌شدت آسیب‌پذیرند. این یعنی برای استفاده از هوش مصنوعی در نقش‌های حساس قضاوتی، هنوز راه درازی در پیش داریم. 🤖⚖️

منبع: arXiv AI