در دنیای مدلهای انتشار (Diffusion Models)، فرآیند تبدیل متن به تصویر و ویرایش آنها بسیار جذاب است، اما یک چالش بزرگ وجود دارد: وقتی از «Classifier-Free Guidance» یا همان CFG با مقادیر بالا استفاده میکنیم، معکوسسازی (Inversion) تصاویر گاهی با خطا مواجه میشود.
محققان در مطالعه جدید خود به بررسی این موضوع پرداختهاند که چه زمانی یک تصویر تولید شده با CFG بالا، قابلیت بازسازی دقیق را دارد. آنها متوجه شدند که برخی دستورات (Prompts) برای مدل بسیار آسان و برخی دیگر به شدت چالشبرانگیز هستند. این تحقیق به ما کمک میکند تا بفهمیم چطور تعامل بین «پرامپت» و «لاتنتها» بر کیفیت ویرایش نهایی تأثیر میگذارد. 🔍💡
منبع: arXiv Computer Vision
