محققان در مقالهای جدید، الگوریتم نوآورانه «GFlowRL» را معرفی کردهاند که میتواند جایگزین روشهای سنتی یادگیری تقویتی (RL) در مدلهای بزرگ زبانی شود. این متد با حذف شبکه کمکی پیچیده برای تخمین توزیعها، ثبات مدل را افزایش داده و در بنچمارکهای کدنویسی و ایمنی، رکوردهای خیرهکنندهای (در حد مدل o3-mini) ثبت کرده است. این یعنی مسیر تازهای برای ساخت مدلهایی که هم دقیقتر فکر میکنند و هم کمتر دچار خطاهای امنیتی میشوند. 🧠✨
منبع: arXiv Machine Learning
