محققان در تازهترین دستاورد خود، چارچوب نوآورانهای به نام rePIRL معرفی کردهاند که با الهام از یادگیری تقویتی معکوس (Inverse RL)، آموزش «مدلهای پاداش فرآیندی» (PRM) را متحول میکند.
چالش اصلی در مدلهای زبانی فعلی، ضعف در استدلال گامبهگام و وابستگی زیاد به دادههای انسانی یا فرضیات سختگیرانه است. متد rePIRL با طراحی یک فرآیند یادگیری دوگانه، این چالش را برطرف کرده و به مدل اجازه میدهد بدون نیاز به پیشفرضهای سنگین، استدلالهای دقیقتری در حوزههای ریاضی و کدنویسی داشته باشد. این یعنی مسیر برای رسیدن به LLMهای منطقیتر و قابلاعتمادتر هموارتر شده است! 💡🤖
منبع: arXiv AI
