تا حالا فکر کردید اگر ایجنتهای خودمختار بعد از یادگیری، کارهایی فراتر از حد مجاز انجام دهند چه میشود؟ محققان راهکار جذابی برای این چالش پیدا کردهاند!
در این تحقیق، معماری جدیدی معرفی شده که «امنیت» را از یک احتمال به یک قانون تغییرناپذیر تبدیل میکند. با استفاده از روش «Governed Individuation»، ایجنت در هنگام بوت شدن با یک هویت رمزنگاریشده گره میخورد و تمام اقداماتش بر اساس «تاثیر معنایی» فیلتر میشود. این یعنی حتی اگر ایجنت در طول یادگیری تغییر کند یا تلاش کند قوانین خودش را بنویسد، باز هم نمیتواند از محدوده دسترسیهای تعریف شده توسط کاربر خارج شود.
این یک قدم حیاتی برای استفاده ایمن از هوش مصنوعی در زیرساختهای واقعی است! 🤖🚀
منبع: arXiv AI
