🚨 هشدار جدی برای امنیت هوش مصنوعی: بنچ‌مارک جدید OpenSkillRisk

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

آیا هوش مصنوعی واقعاً هنگام کار با ابزارهای شخص‌ثالث (Third-party skills) امن عمل می‌کند؟ پژوهشگران در مقاله جدید خود به سراغ این چالش حیاتی رفته‌اند. 🛡️

آن‌ها بنچ‌مارکی به نام OpenSkillRisk طراحی کرده‌اند که شامل ۲۶۳ مهارت ریسکی و خطرناک است تا عملکرد مدل‌های زبانی (LLMs) را در محیط‌های واقعی آزمایش کنند. نتایج نگران‌کننده است: حتی امن‌ترین سیستم‌های فعلی هم در ۱۷ درصد مواقع، به ابزارهای ناامن اعتماد کرده و عملیات‌های پرخطر انجام می‌دهند! ⚠️

این تحقیق نشان می‌دهد که تشخیص خطرات «وابسته به متن» و «سیستمی» برای مدل‌های فعلی هنوز یک پاشنه آشیل بزرگ محسوب می‌شود.

منبع: arXiv NLP