🛡 آسیب‌پذیری جدید در مدل‌های زبانی: فریب سیستم‌های توصیه‌گر با تغییر ترتیب لیست‌ها! 🧐

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان متوجه شده‌اند که مدل‌های زبانی بزرگ (LLM) که به عنوان رتبه‌بند در سیستم‌های توصیه‌گر (مثل پیشنهاد فیلم یا کتاب) استفاده می‌شوند، دچار یک سوگیری عجیب هستند: «ترتیب نمایش لیست‌ها».

ماجرا اینجاست که یک مهاجم می‌تواند بدون تغییر در محتوای آیتم‌ها، صرفاً با جابه‌جا کردن ترتیبِ کاندیداها در ورودی مدل، آن را فریب دهد تا آیتم‌های نامرتبط (Label-0) را به عنوان گزینه‌های برتر به کاربر نشان دهد! 📉

این تحقیق نشان می‌دهد که درک این مدل‌ها از «ترتیب»، یک سطح حمله امنیتی جدی ایجاد کرده که می‌تواند در سیستم‌های توصیه‌گر تجاری مورد سوءاستفاده قرار بگیرد. برای حل این مشکل، راهکارهایی مثل «منظم‌سازی پایداری جایگشت» (Permutation-consistency) پیشنهاد شده است.

نظر شما چیست؟ آیا هوش مصنوعی در آینده می‌تواند سیستم‌های توصیه امن‌تری داشته باشد؟

‌گر

منبع: arXiv Machine Learning