🚀 بهینه‌سازی پیشرفته مدل‌های دیفیوژن با یادگیری تقویتی در زمان پیوسته!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان به تازگی چارچوب جدیدی را معرفی کرده‌اند که یادگیری تقویتی (RL) را در زمان پیوسته برای مدل‌های دیفیوژن گسسته به کار می‌گیرد. این روش که مبتنی بر فرآیندهای کنترل تصادفی است، به مدل‌ها اجازه می‌دهد حتی بدون نیاز به توابع پاداش مشتق‌پذیر، فرآیند تولید و تنظیم دقیق (Fine-tuning) را با دقت بسیار بالاتری انجام دهند. این دستاورد به ویژه برای مدل‌های زبانی بزرگ مبتنی بر دیفیوژن (dLLMs) یک گام رو به جلو برای بهینه‌سازی هوشمندانه مسیرهای تولید محتوا محسوب می‌شود. 🧠✨

منبع: arXiv Machine Learning