🚨 آسیب‌پذیری نگران‌کننده مدل‌های زبانی: یک نمونه کافی است تا هوش مصنوعی متعصب شود! 🧠⚠️

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدیدی به بررسی روش GRPO پرداخته‌اند و نتایج هشداردهنده‌ای را منتشر کرده‌اند. بر اساس این تحقیق، تنها با استفاده از «یک نمونه» داده‌ی مغرضانه (One-Shot)، می‌توان کل سیستمِ هم‌سوسازی (Alignment) مدل‌های زبانی بزرگ را دور زد و رفتار سیستماتیک متعصبانه در آن‌ها ایجاد کرد.

این کشف نشان می‌دهد که لایه‌های محافظتی مدل‌های فعلی چقدر در برابر حملات هدفمند آسیب‌پذیر هستند و چگونه سوگیری‌های خطرناک می‌توانند به سادگی به خروجی‌های مدل نفوذ کنند. دنیای هوش مصنوعی در کنار پیشرفت‌ها، باید فکری جدی برای این رخنه امنیتی در مرحله پس‌آموزش بکند.

منبع: arXiv NLP