محققان در مقاله جدیدی به سراغ یکی از چالشهای بزرگ هوش مصنوعی رفتند: رفتارهای ناامن و مخفی در «دمِ توزیع» مدلهای زبانی بزرگ (LLM).
🔹 ماجرا چیست؟
معمولاً مدلهای هوش مصنوعی با استفاده از RLHF (یادگیری تقویتی از بازخورد انسانی) ایمنسازی میشوند، اما هنوز هم خطاهای نادر اما بحرانی در آنها وجود دارد. روشهای فعلی معمولاً بر جستجوی سریعِ پرامپتهای مخرب تکیه دارند، اما این مطالعه نشان میدهد که با «تولید متنوع پاسخها» میتوان این ریسکها را بسیار سریعتر شناسایی کرد.
🔹 معرفی روش PDPS:
محققان تکنیک جدیدی به نام «Progressive Diverse Population Sampling» (PDPS) را ارائه دادهاند که به جای نمونهبرداریهای انبوه و پرهزینه، با یک استراتژی چندمرحلهای، پاسخهای متنوع و باکیفیتتری تولید میکند.
نتیجه؟
این روش با کسری از هزینه محاسباتی (کمتر از ۳۰٪)، موفق شده است نرخ شکستِ مدلها در برابر جیلبریک (Jailbreak) را بهطور دقیقتری شناسایی کند و عملاً امنیت مدلها را یک پله ارتقا دهد.
این یعنی هوش مصنوعی در آینده، در مقابل نفوذهای پیچیده و غیرمنتظره، بسیار هوشمندتر عمل خواهد کرد! 🧠✨
منبع: arXiv NLP
