محققان متوجه شدهاند که مدلهای زبانی بزرگ (LLM) که به عنوان رتبهبند در سیستمهای توصیهگر (مثل پیشنهاد فیلم یا کتاب) استفاده میشوند، دچار یک سوگیری عجیب هستند: «ترتیب نمایش لیستها».
ماجرا اینجاست که یک مهاجم میتواند بدون تغییر در محتوای آیتمها، صرفاً با جابهجا کردن ترتیبِ کاندیداها در ورودی مدل، آن را فریب دهد تا آیتمهای نامرتبط (Label-0) را به عنوان گزینههای برتر به کاربر نشان دهد! 📉
این تحقیق نشان میدهد که درک این مدلها از «ترتیب»، یک سطح حمله امنیتی جدی ایجاد کرده که میتواند در سیستمهای توصیهگر تجاری مورد سوءاستفاده قرار بگیرد. برای حل این مشکل، راهکارهایی مثل «منظمسازی پایداری جایگشت» (Permutation-consistency) پیشنهاد شده است.
نظر شما چیست؟ آیا هوش مصنوعی در آینده میتواند سیستمهای توصیه امنتری داشته باشد؟
گر
منبع: arXiv Machine Learning
