آیا هوش مصنوعی میتواند بدون دستورالعملهای خاص، مسیر درست را در محیطهای ناشناخته پیدا کند؟ پژوهشگران در مقاله جدید خود به سراغ حل یکی از چالشهای اصلی «یادگیری تقویتی بدون نظارت» (Unsupervised RL) رفتهاند.
این تحقیق با معرفی یک تابع پاداش جدید مبتنی بر «انرژی آزاد» (Free Energy)، به عاملهای هوش مصنوعی اجازه میدهد بدون سوگیری و تنها با تمرکز بر کسب اطلاعات جدید، محیط را کاوش کنند. این رویکرد به مدل کمک میکند که در بخشهای غیرقابل پیشبینی محیط بهتر یاد بگیرد و در بخشهای پایدار، کارآمدتر عمل کند.
این متد جدید میتواند تحولی در نحوه اکتشاف رباتها و سیستمهای خودمختار ایجاد کند!
منبع: arXiv AI
