تولید ویدیو از متن (Text-to-Video) روزبهروز جذابتر میشود، اما مشکل اصلی همیشه «هزینه محاسباتی سنگین» ترنسفورمرها بوده است. حالا محققان با معرفی مدل M4V، از معماری کارآمد Mamba استفاده کردهاند تا این محدودیت را دور بزنند.
نکات کلیدی این دستاورد جدید:
✅ استفاده از معماری Mamba برای جایگزینی ترنسفورمرها.
✅ کاهش ۴۵ درصدی هزینههای پردازشی (FLOPs) نسبت به مدلهای مبتنی بر اتنشن.
✅ ایجاد سازگاری فضایی-زمانی بهتر برای تولید ویدیوهای باکیفیت.
این مدل جدید میتواند سرعت و بهرهوری ساخت ویدیو توسط هوش مصنوعی را به سطح کاملاً جدیدی ببرد. آینده شبیهسازهای واقعی دنیا همینجاست! 🎥✨
منبع: arXiv AI
