🛡 امنیت LLMها در اولویت: معرفی روش MPSelectTune برای حذف مفاهیم مضر

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از چالش‌های اصلی مدل‌های زبانی بزرگ (LLM)، یادگیری مفاهیم ناخواسته، سوگیری‌ها و اطلاعات خطرناک است. حالا محققان روش جدیدی به نام MPSelectTune معرفی کرده‌اند که فرآیند «یادگیری‌زدایی» (Unlearning) را بسیار هوشمندتر کرده است.

تکنیک جدید چطور کار می‌کند؟
این مدل با تمرکز بر «بدترین نوع پرامپت» (یعنی پرامپتی که مدل بیشترین خطای مفهومی را در آن دارد)، به جای ترکیب تصادفی پرامپت‌ها، به طور دقیق مفاهیم ناخواسته را حذف می‌کند. نتیجه این کار:

✅ بهبود دقت در وظایف اصلی مدل (تا ۱۵ درصد)
✅ کاهش چشمگیر دقت در پاسخ به مفاهیم مضر (تا ۱۷ درصد)

این یعنی مدل‌های آینده نه تنها باهوش‌تر، بلکه بسیار امن‌تر و اخلاقی‌تر خواهند بود. قدمی بزرگ برای مقابله با خطرات احتمالی در هوش مصنوعی!

منبع: arXiv AI