محققان در مطالعه جدیدی به بررسی روش GRPO پرداختهاند و نتایج هشداردهندهای را منتشر کردهاند. بر اساس این تحقیق، تنها با استفاده از «یک نمونه» دادهی مغرضانه (One-Shot)، میتوان کل سیستمِ همسوسازی (Alignment) مدلهای زبانی بزرگ را دور زد و رفتار سیستماتیک متعصبانه در آنها ایجاد کرد.
این کشف نشان میدهد که لایههای محافظتی مدلهای فعلی چقدر در برابر حملات هدفمند آسیبپذیر هستند و چگونه سوگیریهای خطرناک میتوانند به سادگی به خروجیهای مدل نفوذ کنند. دنیای هوش مصنوعی در کنار پیشرفتها، باید فکری جدی برای این رخنه امنیتی در مرحله پسآموزش بکند.
منبع: arXiv NLP
