محققان به تازگی چارچوب جدیدی را معرفی کردهاند که یادگیری تقویتی (RL) را در زمان پیوسته برای مدلهای دیفیوژن گسسته به کار میگیرد. این روش که مبتنی بر فرآیندهای کنترل تصادفی است، به مدلها اجازه میدهد حتی بدون نیاز به توابع پاداش مشتقپذیر، فرآیند تولید و تنظیم دقیق (Fine-tuning) را با دقت بسیار بالاتری انجام دهند. این دستاورد به ویژه برای مدلهای زبانی بزرگ مبتنی بر دیفیوژن (dLLMs) یک گام رو به جلو برای بهینهسازی هوشمندانه مسیرهای تولید محتوا محسوب میشود. 🧠✨
منبع: arXiv Machine Learning
