محققان در مقاله جدیدی، چارچوب نوآورانهای به نام RENEW را معرفی کردهاند که مشکل بزرگ «بهرهبرداری نادرست» (Model Exploitation) در مدلهای جهانبین (World Models) در یادگیری تقویتی را هدف قرار داده است.
🔹 چالش چیست؟ مدلهای جهانبین اغلب در محیطهایی که دادههای کافی ندارند، دچار «توهم» میشوند و رفتارهای غیرواقعی نشان میدهند.
🔹 راهکار RENEW: این روش با استفاده از «بازخورد انسانی» (DLHF)، به مدل میآموزد که کجاها دچار خطا میشود. در واقع، هوش مصنوعی یاد میگیرد با تکیه بر درک شهودی انسان از فیزیک، خروجیهای خود را اصلاح کند تا مدل دقیقتر و کارآمدتر عمل کند.
این دستاورد گامی مهم برای افزایش پایداری هوش مصنوعی در محیطهای پیچیده و کاهش خطاهای احتمالی است! 🚀
منبع: arXiv Machine Learning
