محققان در مقاله جدیدی روشی تحت عنوان Dualin معرفی کردهاند که مشکل بزرگ مدلهای «متن به تصویر» (T2I) در بازسازی دقیق جزئیات را حل میکند.
مشکل روشهای قبلی این بود که یا متنهای تولید شده بیکیفیت بودند یا ساختار تصویر (نویز) به درستی حفظ نمیشد. «Dualin» با یک رویکرد دو مرحلهای، هم پرامپتهای دقیق و قابلفهم برای انسان استخراج میکند و هم با بازسازی دقیق نویز (Latent Noise)، ساختار تصویر را بدون نیاز به بهینهسازیهای سنگین و طولانی، کاملاً حفظ میکند.
این یعنی ویرایش تصاویر در آینده بسیار دقیقتر و سریعتر خواهد بود! 🚀
منبع: arXiv AI
