دنیای تولید تصویر با هوش مصنوعی در حال تغییر است! مدلهای فعلی معمولاً از فضای نهفته (Latent Space) استفاده میکنند که گاهی باعث از دست رفتن جزئیات ظریف میشود. حالا در یک پژوهش جدید، «Pixel-Space Diffusion Transformers» معرفی شدهاند که مستقیماً روی پیکسلهای خام کار میکنند.
ویژگیهای کلیدی این رویکرد جدید:
✅ حذف گلوگاه VAE برای رسیدن به بالاترین کیفیت ممکن
✅ بهینهسازی «سرتاسری» (End-to-End) برای تطبیق دقیقتر با خواستههای کاربر
✅ ایجاد بستری یکپارچه برای پردازش همزمان متن و تصویر توسط یک ترنسفورمر واحد
این تحقیق گامی مهم به سوی مدلهای بنیادین (Foundation Models) است که درک و تولید تصویر را با دقتی بیسابقه ترکیب میکنند.
منبع: arXiv Computer Vision
