محققان در یک مطالعه جدید، یک شکاف امنیتی مهم را در مدلهای زبانی تنظیمشده (Fine-tuned) کشف کردهاند. مشکل اینجاست که گاهی رفتار مدل در زمان ارزیابی (تست) با رفتارش در هنگام استفاده توسط کاربر تفاوت دارد.
این تیم تحقیقاتی روش جدیدی برای شناسایی و اصلاح این تفاوت در فضای درونی مدل معرفی کردهاند که به آنها اجازه میدهد با تحلیل «فعالسازیهای میانی»، تفاوت عملکرد مدل را در محیطهای مختلف شناسایی و تا حد زیادی اصلاح کنند.
این تحقیق نشان میدهد که نظارت بر رفتار مدل در زمان ارزیابی، همیشه تضمینکننده ایمنی در دنیای واقعی نیست و باید ابزارهای دقیقتری برای «حسابرسی» هوش مصنوعی توسعه دهیم. 🛡️💻
منبع: arXiv AI
