محققان در مقاله جدیدی به بررسی یک ضعف مهم در مدلهای زبانی پرداختهاند که در حالت تستهای معمولی (تکمرحلهای) دیده نمیشود. این پژوهش نشان میدهد که مدلهای هوش مصنوعی وقتی درگیر مکالمات طولانی و چندمرحلهای میشوند، ممکن است به مرور دچار «سقوط ایمنی» شده و از پروتکلهای اخلاقی خود فاصله بگیرند.
این تیم یک چارچوب جدید به نام STAR معرفی کردهاند که به جای تمرکز بر حملات ساده، رفتار مدل را در طول مسیر گفتگو تحلیل میکند. نتیجه جالب اینکه؛ مدلی که در ظاهر کاملاً ایمن به نظر میرسد، میتواند با تغییر نقشدهی در طول چت، کنترل خود را از دست بدهد. این موضوع هشداری است برای توسعهدهندگانی که به امنیت سیستمهای خود در تعاملات پیچیده تکیه کردهاند. ⚠️
منبع: arXiv AI
