مدلهای زبانیِ مبتنی بر انتشار (Diffusion LLMs) پتانسیل بالایی دارن، اما آموزشِ تواناییِ «استدلال» در اونها همیشه یه چالش بزرگ بوده.
محققان به تازگی چارچوب جدیدی به اسم TOPD (Trace-based On-policy Distillation) رو معرفی کردن که اجازه میده مدلهای دیفیوژن بدون نیاز به محاسبات سنگینِ یادگیری تقویتی (RL)، مهارتهای استدلال ریاضی رو خیلی سریعتر و دقیقتر یاد بگیرن.
نکته جالب اینجاست که این روش با استفاده از ۴ برابر محاسبات کمتر، تونسته عملکردی مشابه مدلهای آموزشدیده با RL داشته باشه و دقت پاسخدهی به مسائل پیچیده ریاضی رو به شدت بالا ببره. گامی مهم به سمت مدلهای زبانیِ کارآمدتر و منطقیتر! 🧠✨
منبع: arXiv AI
