🧠 استنباط پاداش به روش نظارت‌شده: یادگیری ماشین از رفتارهای غیربهینه انسان!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مطالعه جدیدی، تکنیک نوآورانه‌ای به نام Supervised Reward Inference (SRI) معرفی کرده‌اند که تحولی در نحوه یادگیری هوش مصنوعی از انسان است.

مشکل اصلی مدل‌های فعلی این است که فرض می‌کنند انسان‌ها همیشه بهترین و دقیق‌ترین رفتار را دارند. اما در دنیای واقعی، ما اغلب رفتارهای غیربهینه یا اشتباه انجام می‌دهیم. روش جدید SRI به هوش مصنوعی اجازه می‌دهد حتی از نمایش‌های «ناقص» و «غیربهینه» انسانی، اهداف را به دقت استخراج کند.

نتایج نشان می‌دهد که این روش نه تنها در کارهای رباتیک عملکرد خیره‌کننده‌ای دارد، بلکه راهی ساده و بسیار موثر برای بهبود آموزش مدل‌های هوشمند است. 🚀

منبع: arXiv Machine Learning