🤖 راهکاری جدید برای کنترل هوش مصنوعی: «عامل‌های خاموش‌شدنی»

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

یکی از بزرگترین دغدغه‌های ایمنی در هوش مصنوعی، احتمال مقاومت مدل‌ها در برابر خاموش شدن است. محققان به تازگی از یک روش جدید به نام DReST رونمایی کرده‌اند که به عامل‌های هوش مصنوعی یاد می‌دهد نسبت به طول مسیرهای اجرایی خود «خنثی» باشند.

این یعنی هوش مصنوعی به جای اصرار بر ماندن در سیستم، بدون مقاومت اجازه خاموش شدن را می‌دهد، بدون اینکه کارایی و مفید بودن خود را در حین فعالیت از دست بدهد. در آزمایش‌های انجام شده روی مدل‌هایی مثل Qwen و Llama، این روش توانسته احتمال مقاومت در برابر فرمان خاموشی را تا حد چشمگیری کاهش دهد. گامی مهم به سوی هوش مصنوعی ایمن‌تر و قابل‌کنترل! 🛡️

منبع: arXiv AI