یکی از بزرگترین دغدغههای ایمنی در هوش مصنوعی، احتمال مقاومت مدلها در برابر خاموش شدن است. محققان به تازگی از یک روش جدید به نام DReST رونمایی کردهاند که به عاملهای هوش مصنوعی یاد میدهد نسبت به طول مسیرهای اجرایی خود «خنثی» باشند.
این یعنی هوش مصنوعی به جای اصرار بر ماندن در سیستم، بدون مقاومت اجازه خاموش شدن را میدهد، بدون اینکه کارایی و مفید بودن خود را در حین فعالیت از دست بدهد. در آزمایشهای انجام شده روی مدلهایی مثل Qwen و Llama، این روش توانسته احتمال مقاومت در برابر فرمان خاموشی را تا حد چشمگیری کاهش دهد. گامی مهم به سوی هوش مصنوعی ایمنتر و قابلکنترل! 🛡️
منبع: arXiv AI
