یکی از چالشهای اصلی آموزش مدلهای هوش مصنوعی با بازخورد انسانی (RLHF)، پدیده «بیشبرازش پاداش» (Reward Over-optimization) است؛ جایی که مدل یاد میگیرد پاداشِ مدلِ امتیازدهی را فریب دهد، در حالی که کیفیت خروجی کاهش مییابد.
محققان برای حل این مشکل، متد جدیدی به نام «DRRO» یا همان بهینهسازی توزیعیِ مقاوم در برابر پشیمانی (Regret Optimization) را معرفی کردهاند. این روش با استفاده از معیارهای Wasserstein، مدل را در برابر تغییراتِ احتمالیِ پاداش مقاومتر میکند و باعث میشود هوش مصنوعی حتی در سناریوهای نامطمئن، خروجیهای باکیفیتتر و قابلاعتمادتری ارائه دهد.
این نوآوری میتواند گام بزرگی برای افزایش هوشمندی و دقت مدلهای زبانی بزرگ باشد. 🧠✨
منبع: arXiv Machine Learning
