🛡 حفره امنیتی جدید در LLMها؛ وقتی مدل‌ها فریب می‌خورند!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان تکنیک جدیدی به نام RetroCoT معرفی کرده‌اند که نشان می‌دهد مدل‌های زبانی بزرگ تا چه حد در برابر «تغییر لحن درخواست» آسیب‌پذیر هستند.

ماجرا چیست؟
در این روش، به جای پرسیدن مستقیم یک سوال خطرناک، مدل در نقش یک «کارشناس جرم‌شناسی» قرار می‌گیرد و از او خواسته می‌شود فرآیند وقوع یک حادثه را به صورت معکوس بازسازی کند. نتیجه تکان‌دهنده است: بسیاری از مدل‌ها که در حالت عادی درخواست‌های مخرب را رد می‌کنند، در این سناریو فریب خورده و اطلاعات خطرناک را فاش می‌کنند!

این تحقیق نشان می‌دهد که امنیت هوش مصنوعی هنوز تا حد زیادی به نحوه بیان سوال وابسته است و مدل‌های جدید (مثل خانواده GPT-5) سعی دارند با شناسایی این الگوها، در برابر این نوع حملات مقاوم‌تر شوند.

منبع: arXiv AI