🚀 جهشی بزرگ در دقت مدل‌های زبانی انتشاری (dLLMs) با الگوریتم AGRPO!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

مدل‌های زبانی انتشاری (Diffusion LLMs) پتانسیل بالایی دارند اما آموزش آن‌ها، به‌ویژه در بخش یادگیری تقویتی (RL)، همیشه چالش‌برانگیز بوده است. حالا محققان با معرفی الگوریتم جدید «AGRPO»، این مشکل را حل کرده‌اند.

💡 نکته کلیدی:
این روش به جای بررسی کل توالیِ متن، روی مراحل مجزای «نویززدایی» تمرکز می‌کند که باعث بهینه‌سازی دقیق‌تر و کاهش سوگیری در خروجی‌ها می‌شود.

نتایج فوق‌العاده است: این مدل در حل مسائل ریاضی و منطقی مثل Sudoku و Countdown، جهش چشمگیر ۶۰ تا ۷۰ درصدی را نسبت به مدل‌های پایه تجربه کرده است. اگر در حوزه آموزش مدل‌های هوش مصنوعی فعال هستید، کد این پروژه در گیت‌هاب برای بررسی در دسترس است.

منبع: arXiv AI