آیا مدلهای هوش مصنوعی واقعاً امن هستند؟ یکی از چالشهای بزرگ در آموزش LLMها، احتمال تزریق رفتارهای مخرب توسط تأمینکنندگان داده است. اما مقاله جدیدی با معرفی متد «ROPD»، راهکار جالبی برای این مشکل ارائه داده.
این روش به جای تمرکز بر قالبهای خاص (که توسط حملات نادیده گرفته میشوند)، بر تفاوت احتمالات خروجی تمرکز کرده و باعث میشود مدل در برابر تلاشهای جیلبریک و مسمومسازی دادهها بسیار مقاومتر شود و مهارتهای اصلی خود را هم فراموش نکند.
این تحقیق گامی مهم برای توسعه مدلهای ایمنتر و قابلاعتمادتر در دنیای هوش مصنوعی است. 🤖✨
منبع: arXiv AI
