محققان در مقالهای تازه، روشی نوآورانه به نام «بهینهسازی سیاست تقابلی» (CPO) را برای حل یکی از چالشهای بزرگ یادگیری تقویتی یعنی «ابهام در پاداشها» معرفی کردهاند.
تا پیش از این، استفاده از «آنتروپی» برای هدایت مدلها، گاهی باعث سردرگمی آنها میشد. اما CPO با استفاده از مقایسه هوشمندانه بین توزیعهای خروجی، تفاوت بین «عدم قطعیت مفید» و «خطای محض» را درک میکند. نتیجه این کار، مدلی است که بسیار دقیقتر آموزش میبیند و در سناریوهای مختلف، عملکردی فوقالعاده پایدارتر از روشهای قدیمی نشان میدهد. این قدم بزرگی برای کاهش توهمات (Hallucinations) در مدلهای زبانی است! ✨
منبع: arXiv Machine Learning
