🧠 یادگیری تقویتی بدون نیاز به فرض‌های سخت؛ معرفی الگوریتم Sign-SZPO

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

بسیاری از روش‌های فعلی در یادگیری تقویتی مبتنی بر ترجیحات (Preference-based RL)، وابسته به فرض‌های خاصی درباره نحوه مدل‌سازی ترجیحات انسان (مثل مدل Bradley-Terry) هستند که همیشه دقیق نیستند.

محققان در یک پژوهش جدید، الگوریتم Sign-SZPO را معرفی کرده‌اند که با استفاده از بهینه‌سازی مرتبه صفر (Zeroth-order)، این محدودیت را کنار می‌زند. نکته جذاب اینجاست که این مدل حتی بدون دانستن تابع لینک (Link Function) می‌تواند جهت آپدیت پارامترها را به‌گونه‌ای تخمین بزند که با گرادیان واقعی سیاست همسو باشد. این یعنی هوش مصنوعی حالا می‌تواند با انعطاف‌پذیری بسیار بیشتری، ترجیحات پیچیده انسانی را درک و پیاده‌سازی کند. 🚀

منبع: arXiv Machine Learning