مدلهای زبانی مبتنی بر دیفیوژن (DLMs) آیندهای جذاب برای تولید متن هستند، اما تا به حال درگیر کندیِ پردازشهای سنگینِ ترنسفورمرها بودند. حالا محققان با معرفی DiffuMamba این بازی را عوض کردهاند! 🧠
این معماری جدید با جایگزینی هستهی ترنسفورمر با ساختار Mamba (که به صورت خطی مقیاسپذیر است)، توانسته علاوه بر حفظ کیفیت مدلهای قبلی، سرعت استنتاج را تا بیش از ۸ برابر افزایش دهد. این یعنی تولید متن طولانیتر با سرعت بسیار بالاتر و بدون افت عملکرد! ⚡️
اگر در حوزه مدلهای زبانی فعالیت میکنید، این دستاورد یکی از جذابترین مسیرها برای نسل آینده سیستمهای مولد هوش مصنوعی است.
منبع: arXiv AI
