🛡️ چرا ابزارهای امنیتی هوش مصنوعی گاهی فریب می‌خورند؟

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در پژوهش جدیدی به بررسی یک ضعف مهم در مدل‌های زبانی بزرگ (LLM) پرداخته‌اند: شکست ابزارهای تشخیص امنیتی (Safety Probes).

بسیاری از مدل‌ها تنها «آخرین توکن» تولید شده را بررسی می‌کنند تا بفهمند آیا پاسخ ناامن است یا خیر. اما این مطالعه نشان می‌دهد که پرامپت‌های مخرب (Jailbreak) می‌توانند در طول فرآیند پردازش و در توکن‌های اولیه پنهان شوند و از دید این سیستم‌ها مخفی بمانند.

این تیم تحقیقاتی پیشنهاد داده که به جای تکیه بر تحلیل نهایی، باید از مدل‌های «ردیاب مسیر» (Trajectory-aware) استفاده کرد تا رفتارهای مشکوک در طول کل پروسه تولید متن ردیابی شوند. قدمی مهم برای ساخت هوش مصنوعی ایمن‌تر! 🤖✨

منبع: arXiv Machine Learning