بسیاری از روشهای فعلی در یادگیری تقویتی مبتنی بر ترجیحات (Preference-based RL)، وابسته به فرضهای خاصی درباره نحوه مدلسازی ترجیحات انسان (مثل مدل Bradley-Terry) هستند که همیشه دقیق نیستند.
محققان در یک پژوهش جدید، الگوریتم Sign-SZPO را معرفی کردهاند که با استفاده از بهینهسازی مرتبه صفر (Zeroth-order)، این محدودیت را کنار میزند. نکته جذاب اینجاست که این مدل حتی بدون دانستن تابع لینک (Link Function) میتواند جهت آپدیت پارامترها را بهگونهای تخمین بزند که با گرادیان واقعی سیاست همسو باشد. این یعنی هوش مصنوعی حالا میتواند با انعطافپذیری بسیار بیشتری، ترجیحات پیچیده انسانی را درک و پیادهسازی کند. 🚀
منبع: arXiv Machine Learning
