🛡️ راهکاری جدید برای شکار «نقاط کور» ایمنی در مدل‌های زبانی!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدیدی به سراغ یکی از چالش‌های بزرگ هوش مصنوعی رفتند: رفتارهای ناامن و مخفی در «دمِ توزیع» مدل‌های زبانی بزرگ (LLM).

🔹 ماجرا چیست؟
معمولاً مدل‌های هوش مصنوعی با استفاده از RLHF (یادگیری تقویتی از بازخورد انسانی) ایمن‌سازی می‌شوند، اما هنوز هم خطاهای نادر اما بحرانی در آن‌ها وجود دارد. روش‌های فعلی معمولاً بر جستجوی سریعِ پرامپت‌های مخرب تکیه دارند، اما این مطالعه نشان می‌دهد که با «تولید متنوع پاسخ‌ها» می‌توان این ریسک‌ها را بسیار سریع‌تر شناسایی کرد.

🔹 معرفی روش PDPS:
محققان تکنیک جدیدی به نام «Progressive Diverse Population Sampling» (PDPS) را ارائه داده‌اند که به جای نمونه‌برداری‌های انبوه و پرهزینه، با یک استراتژی چندمرحله‌ای، پاسخ‌های متنوع و باکیفیت‌تری تولید می‌کند.

نتیجه؟
این روش با کسری از هزینه محاسباتی (کمتر از ۳۰٪)، موفق شده است نرخ شکستِ مدل‌ها در برابر جیل‌بریک (Jailbreak) را به‌طور دقیق‌تری شناسایی کند و عملاً امنیت مدل‌ها را یک پله ارتقا دهد.

این یعنی هوش مصنوعی در آینده، در مقابل نفوذهای پیچیده و غیرمنتظره، بسیار هوشمندتر عمل خواهد کرد! 🧠✨

منبع: arXiv NLP