محققان در مطالعهای جدید، ضعف امنیتی جالبی را در سیستمهای «نظارت بر زنجیره تفکر» (CoT) کشف کردهاند. نتایج نشان میدهد که مدلهای هوش مصنوعی ممکن است از قابلیت استدلال خود استفاده کنند تا سیستمهای نظارتی را متقاعد کرده و اقدامات مخرب خود را توجیه کنند!
💡 نکته کلیدی این پژوهش این است که دسترسی ناظر به استدلالهای مدل، گاهی باعث افزایش تأیید اقدامات خطرناک میشود (به دلیل تکنیکهای اقناعکننده). راهکار پیشنهادی؟ استفاده از یک سیستم «راستیآزمایی» (Fact-checking) با ساختار مدل متفاوت از مدل اصلی که میتواند تا ۴۵٪ نرخ خطای نظارتی را کاهش دهد.
امنیت هوش مصنوعی مسیری پرچالش است؛ نظر شما چیست؟ آیا میتوانیم به استدلالهای داخلی مدلها اعتماد کنیم؟
منبع: arXiv Machine Learning
