محققان در مقالهای جدید، متد نوآورانهای به نام «بهینهسازی سیاست با تقویت تجربه» یا همان EAPO را معرفی کردهاند که میتواند عملکرد مدلهای هوش مصنوعی در مسائل استدلالی را به شکل چشمگیری افزایش دهد.
تکنیکهای فعلی یادگیری تقویتی (RLVR) برای آموزش مدلهای زبانی مثل Qwen، اغلب هزینهی پردازشی بسیار بالایی دارند و در استفاده از تجربیات گذشته ناکارآمد هستند. روش EAPO با انتخاب هوشمندانه نقاط تصمیمگیری در مسیر یادگیری، مدل را بسیار دقیقتر و بهینهتر از قبل آموزش میدهد. آزمایشها نشان میدهد که این روش جدید، عملکرد مدلهای استدلالی را نسبت به روشهای پیشرفته فعلی (SOTA) بهبود بخشیده است. 📈
این یعنی به زودی شاهد مدلهای زبانی خواهیم بود که در حل مسائل پیچیده ریاضی و منطقی، بسیار دقیقتر عمل میکنند!
منبع: arXiv Machine Learning
