محققان در پژوهش جدیدی به بررسی یک ضعف مهم در مدلهای زبانی بزرگ (LLM) پرداختهاند: شکست ابزارهای تشخیص امنیتی (Safety Probes).
بسیاری از مدلها تنها «آخرین توکن» تولید شده را بررسی میکنند تا بفهمند آیا پاسخ ناامن است یا خیر. اما این مطالعه نشان میدهد که پرامپتهای مخرب (Jailbreak) میتوانند در طول فرآیند پردازش و در توکنهای اولیه پنهان شوند و از دید این سیستمها مخفی بمانند.
این تیم تحقیقاتی پیشنهاد داده که به جای تکیه بر تحلیل نهایی، باید از مدلهای «ردیاب مسیر» (Trajectory-aware) استفاده کرد تا رفتارهای مشکوک در طول کل پروسه تولید متن ردیابی شوند. قدمی مهم برای ساخت هوش مصنوعی ایمنتر! 🤖✨
منبع: arXiv Machine Learning
