🛡️ چرا هوش مصنوعی راحت گول می‌خورد؟ نفوذ به لایه‌های امنیتی مدل‌ها!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدیدی به بررسی یک حفره امنیتی جالب در مدل‌های زبانی پرداخته‌اند. مشخص شده که اضافه کردن یک عبارت کوتاه مثل “Sure, here is” در ابتدای پرامپت (Prefill)، می‌تواند سدهای امنیتی هوش مصنوعی را به راحتی دور بزند!

این تحقیق نشان می‌دهد که سیستم «امتناع» (Refusal) در مدل‌ها چندان عمیق نیست و بیشتر شبیه به یک واکنش سطحی در نیمه اول پاسخ‌دهی است. با درک این مکانیزم، دانشمندان توانستند دقیقا نقطه‌ای که مدل تصمیم به پاسخ دادن (یا ندادن) می‌گیرد را شناسایی کنند. این یافته‌ها گام مهمی برای ساخت مدل‌های ایمن‌تر در برابر تکنیک‌های Jailbreak است.

منبع: arXiv Machine Learning