🎨 خداحافظی با محدودیت‌های VAE؟ معرفی نسل جدید مدل‌های نفوذ پیکسل‌محور (pDiTs)

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

دنیای تولید تصویر با هوش مصنوعی در حال تغییر است! مدل‌های فعلی معمولاً از فضای نهفته (Latent Space) استفاده می‌کنند که گاهی باعث از دست رفتن جزئیات ظریف می‌شود. حالا در یک پژوهش جدید، «Pixel-Space Diffusion Transformers» معرفی شده‌اند که مستقیماً روی پیکسل‌های خام کار می‌کنند.

ویژگی‌های کلیدی این رویکرد جدید:
✅ حذف گلوگاه VAE برای رسیدن به بالاترین کیفیت ممکن
✅ بهینه‌سازی «سرتاسری» (End-to-End) برای تطبیق دقیق‌تر با خواسته‌های کاربر
✅ ایجاد بستری یکپارچه برای پردازش همزمان متن و تصویر توسط یک ترنسفورمر واحد

این تحقیق گامی مهم به سوی مدل‌های بنیادین (Foundation Models) است که درک و تولید تصویر را با دقتی بی‌سابقه ترکیب می‌کنند.

منبع: arXiv Computer Vision