آیا سیستمهای پرسش و پاسخ هوش مصنوعی که به اسناد ما متصل هستند (RAG)، کاملاً امناند؟ محققان در مطالعهای جدید، روشی به نام «Polymorphic Sybil Poisoning» را معرفی کردند که در آن مهاجم با استفاده از اطلاعات متنوع اما مخرب، مدل را گمراه میکند.
این تحقیق نشان میدهد که روشهای سنتی تشخیص کپیبرداری در برابر این حملات هوشمندانه شکست میخورند. این کشف برای توسعهدهندگانی که روی امنیت مدلهای زبانی بزرگ کار میکنند، هشداری جدی برای بازنگری در پروتکلهای ارزیابی و جلوگیری از «توهم» یا «انحراف» (Drift) در خروجیهای مدل است. 🔍⚠️
منبع: arXiv AI
