مدلهای انتشار ترنسفورمر (DiTs) که امروزه سردمدار تولید تصاویر با کیفیت هستند، با یک چالش بزرگ روبرو بودند: هزینه سنگین محاسباتی برای پردازش توالیهای طولانی.
حالا محققان با معرفی مکانیزم «LLSA» (Log-linear Sparse Attention)، این گره را باز کردهاند! این روش جدید با استفاده از یک ساختار سلسلهمراتبی، محاسباتِ انتخاب و توجه (Attention) را از حالت پیچیده درجه دوم به «لگاریتمی-خطی» کاهش میدهد. نتیجه؟ امکان پردازش توالیهای بسیار طولانیتر با سرعت بالاتر و کیفیت خیرهکننده بدون افت دقت.
این نوآوری راه را برای نسل بعدی مدلهای تولید محتوا و هوش مصنوعی بصری هموارتر میکند. نظر شما چیست؟ آیا هوش مصنوعی بالاخره بر محدودیتهای حافظه غلبه میکند؟ 🧠✨
منبع: arXiv Computer Vision
