مدلهای زبانی انتشاری (Diffusion LLMs) پتانسیل بالایی دارند اما آموزش آنها، بهویژه در بخش یادگیری تقویتی (RL)، همیشه چالشبرانگیز بوده است. حالا محققان با معرفی الگوریتم جدید «AGRPO»، این مشکل را حل کردهاند.
💡 نکته کلیدی:
این روش به جای بررسی کل توالیِ متن، روی مراحل مجزای «نویززدایی» تمرکز میکند که باعث بهینهسازی دقیقتر و کاهش سوگیری در خروجیها میشود.
نتایج فوقالعاده است: این مدل در حل مسائل ریاضی و منطقی مثل Sudoku و Countdown، جهش چشمگیر ۶۰ تا ۷۰ درصدی را نسبت به مدلهای پایه تجربه کرده است. اگر در حوزه آموزش مدلهای هوش مصنوعی فعال هستید، کد این پروژه در گیتهاب برای بررسی در دسترس است.
منبع: arXiv AI
