یکی از بزرگترین ترسهای دنیای تکنولوژی، عدم کنترل هوش مصنوعی در آینده یا مقاومت آنها در برابر خاموش شدن است. محققان به تازگی پروپوزال جدیدی به نام POST-Agents ارائه دادهاند که راهکاری هوشمندانه برای این چالش ارائه میکند.
این ایده بر اساس آموزش به هوش مصنوعی طراحی شده تا ترجیحات خود را صرفاً بر اساس طول مسیرهای رسیدن به هدف (Preferences Only Between Same-Length Trajectories) تنظیم کند. نتیجه این مدل، چیزی است که محققان آن را «خنثیسازی مثبت» مینامند؛ به این معنا که مدل در حین انجام کارهای مفید، تمایلی به مقاومت در برابر خاموش شدن ندارد و امنیت سیستم به طور ساختاری حفظ میشود.
گامهای کوچک اما مهم برای ساخت هوش مصنوعی ایمنتر! 🤖💡
منبع: arXiv AI
