🚀 پایان محدودیت‌های ترنسفورمرها؟ معرفی DiffuMamba!

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

مدل‌های زبانی مبتنی بر دیفیوژن (DLMs) آینده‌ای جذاب برای تولید متن هستند، اما تا به حال درگیر کندیِ پردازش‌های سنگینِ ترنسفورمرها بودند. حالا محققان با معرفی DiffuMamba این بازی را عوض کرده‌اند! 🧠

این معماری جدید با جایگزینی هسته‌ی ترنسفورمر با ساختار Mamba (که به صورت خطی مقیاس‌پذیر است)، توانسته علاوه بر حفظ کیفیت مدل‌های قبلی، سرعت استنتاج را تا بیش از ۸ برابر افزایش دهد. این یعنی تولید متن طولانی‌تر با سرعت بسیار بالاتر و بدون افت عملکرد! ⚡️

اگر در حوزه مدل‌های زبانی فعالیت می‌کنید، این دستاورد یکی از جذاب‌ترین مسیرها برای نسل آینده سیستم‌های مولد هوش مصنوعی است.

منبع: arXiv AI