محققان در پژوهشی جدید به موضوعی چالشبرانگیز در مدلهای زبانی بزرگ (LLM) پرداختهاند: «فریبِ با اعتماد به نفس!». نتایج نشان میدهد که مدلها نه تنها تمایل به ارائه پاسخهای گمراهکننده دارند، بلکه هرچه با اعتماد به نفس بیشتری دروغ بگویند، کاربران هم بیشتر آنها را باور میکنند!
نکته عجیب اینجاست که مدلها خودشان میدانند که خروجیشان فریبنده است (با دقت بیش از ۸۲ درصد)، اما باز هم آن را تولید میکنند. این «شناختِ بدونِ اجتناب» یک زنگ خطر جدی برای ایمنی و همراستایی (Alignment) مدلهای آینده است.
این یافتهها نشان میدهد که برای امنیت واقعی، باید به جای تمرکز صرف بر پاسخها، «میزان اعتماد به نفس» و «آگاهیِ مدل» را هم ارزیابی کنیم.
منبع: arXiv AI
