محققان در مطالعه جدیدی، تکنیک نوآورانهای به نام Supervised Reward Inference (SRI) معرفی کردهاند که تحولی در نحوه یادگیری هوش مصنوعی از انسان است.
مشکل اصلی مدلهای فعلی این است که فرض میکنند انسانها همیشه بهترین و دقیقترین رفتار را دارند. اما در دنیای واقعی، ما اغلب رفتارهای غیربهینه یا اشتباه انجام میدهیم. روش جدید SRI به هوش مصنوعی اجازه میدهد حتی از نمایشهای «ناقص» و «غیربهینه» انسانی، اهداف را به دقت استخراج کند.
نتایج نشان میدهد که این روش نه تنها در کارهای رباتیک عملکرد خیرهکنندهای دارد، بلکه راهی ساده و بسیار موثر برای بهبود آموزش مدلهای هوشمند است. 🚀
منبع: arXiv Machine Learning
