بزرگترین چالش در آموزش مدلهای هوش مصنوعی از طریق بازخورد انسانی (RLHF)، خطاهای احتمالی لیبلزنها یا همان انسانهای ناظر است. اما محققان در یک دستاورد تازه، فریمورک جدیدی به نام «SARA» (Similarity as Reward Alignment) معرفی کردهاند که این مشکل را به شکلی هوشمندانه حل میکند.
ویژگیهای کلیدی SARA:
🔹 مقاومت بالا در برابر برچسبهای نویزدار و اشتباه
🔹 یادگیری بازنمایی نهفته از دادههای ترجیحی برای تعیین دقیقتر پاداش
🔹 پایداری فوقالعاده در بنچمارکهای یادگیری تقویتشده آفلاین
این مدل با تمرکز بر شباهت به جای روشهای سنتی، توانسته تطبیقپذیری بسیار بهتری با ترجیحات واقعی انسان ایجاد کند. قدمی مهم برای توسعه مدلهای قابلاعتمادتر که کمتر تحت تأثیر خطاهای انسانی قرار میگیرند. 🚀
منبع: arXiv Machine Learning
