محققان تکنیک جدیدی به نام RetroCoT معرفی کردهاند که نشان میدهد مدلهای زبانی بزرگ تا چه حد در برابر «تغییر لحن درخواست» آسیبپذیر هستند.
ماجرا چیست؟
در این روش، به جای پرسیدن مستقیم یک سوال خطرناک، مدل در نقش یک «کارشناس جرمشناسی» قرار میگیرد و از او خواسته میشود فرآیند وقوع یک حادثه را به صورت معکوس بازسازی کند. نتیجه تکاندهنده است: بسیاری از مدلها که در حالت عادی درخواستهای مخرب را رد میکنند، در این سناریو فریب خورده و اطلاعات خطرناک را فاش میکنند!
این تحقیق نشان میدهد که امنیت هوش مصنوعی هنوز تا حد زیادی به نحوه بیان سوال وابسته است و مدلهای جدید (مثل خانواده GPT-5) سعی دارند با شناسایی این الگوها، در برابر این نوع حملات مقاومتر شوند.
منبع: arXiv AI
