محققان در پژوهشی جدید روشی به نام «Supervised Reward Inference» (به اختصار SRI) را معرفی کردهاند که تحولی در نحوه یادگیری ماشین از رفتارهای انسانی ایجاد میکند. 🤖✨
مشکل اصلی اینجاست که انسانها همیشه به صورت بهینه عمل نمیکنند؛ گاهی رفتار ما ناشی از اشتباه است و گاهی فقط برای انتقال یک مفهوم. روش SRI به هوش مصنوعی کمک میکند تا بدون درگیری با محدودیتهای قبلی، حتی از رفتارهای غیربهینه انسان هم پاداشهای دقیق استخراج کند.
این نوآوری به ویژه در دنیای رباتیک و مدلهای یادگیری تقویتی، گامی بزرگ برای هوشمندتر کردن عاملها در محیطهای واقعی محسوب میشود! 🛠️💡
منبع: arXiv Machine Learning
