تولید تصویر با هوش مصنوعی (Text-to-Image) معمولاً با تأخیر همراه است، اما محققان در مدل جدید «UniGen-AR» با استفاده از معماری «خودبازگشتی تصویری» (VAR) این مشکل را حل کردهاند.
این مدل که یک مدل زبانی چندوجهی (MLLM) را با یک دکودر پیشرفته ترکیب میکند، میتواند تا ۱۹ برابر سریعتر از مدلهای مبتنی بر دیفیوژن عمل کند و در عین حال کیفیت خروجی را حفظ یا حتی بهتر کند. این یعنی گامی بزرگ به سوی اجرای مدلهای تولیدی پیچیده روی دستگاههای عادی با سرعت بسیار بالاتر! 🖼️⚡
منبع: arXiv Computer Vision
