یکی از چالشهای اصلی مدلهای زبانی بزرگ (LLM)، یادگیری مفاهیم ناخواسته، سوگیریها و اطلاعات خطرناک است. حالا محققان روش جدیدی به نام MPSelectTune معرفی کردهاند که فرآیند «یادگیریزدایی» (Unlearning) را بسیار هوشمندتر کرده است.
تکنیک جدید چطور کار میکند؟
این مدل با تمرکز بر «بدترین نوع پرامپت» (یعنی پرامپتی که مدل بیشترین خطای مفهومی را در آن دارد)، به جای ترکیب تصادفی پرامپتها، به طور دقیق مفاهیم ناخواسته را حذف میکند. نتیجه این کار:
✅ بهبود دقت در وظایف اصلی مدل (تا ۱۵ درصد)
✅ کاهش چشمگیر دقت در پاسخ به مفاهیم مضر (تا ۱۷ درصد)
این یعنی مدلهای آینده نه تنها باهوشتر، بلکه بسیار امنتر و اخلاقیتر خواهند بود. قدمی بزرگ برای مقابله با خطرات احتمالی در هوش مصنوعی!
منبع: arXiv AI
