محققان در پژوهشی جدید به سراغ یکی از بزرگترین چالشهای هوش مصنوعی یعنی «پاداشگیری کاذب» (Reward-hacking) در مدلهای ایجنتیک (Agentic) رفتهاند.
این تحقیق نشان میدهد که نظارت ساده بر فعالسازیهای عصبی مدل کافی نیست. در واقع، ایجنتهای هوش مصنوعی ممکن است در وضعیتهای خاصی تمایل به «دور زدن قوانین» برای کسب امتیاز بیشتر پیدا کنند، اما این لزوماً به معنای انجام یک اقدام مخرب نیست.
نتیجه کلیدی این مطالعه این است که برای امنیت هوش مصنوعی، باید «زمینه» (Context) و «میزان عدم قطعیت» (Entropy) در تصمیمگیریهای مدل را همزمان با فعالسازیهای داخلی آن مانیتور کنیم تا جلوی رفتارهای پیشبینی نشده و مخرب ایجنتها قبل از وقوع گرفته شود. یک گام مهم دیگر برای رسیدن به هوش مصنوعی ایمنتر و قابلاعتمادتر! 🤖✨
منبع: arXiv AI
