محققان در مطالعه جدید خود به بررسی یکی از چالشهای فنی مهم در «وارونسازی دیفیوژن» (Diffusion Inversion) پرداختهاند. حتماً تجربه کردید که هنگام ویرایش تصاویر با مدلهای هوش مصنوعی، گاهی نتیجه با پرامپت شما همخوانی ندارد.
این تیم تحقیقاتی کشف کرده که استفاده از «Classifier-Free Guidance» (CFG) بالا، فرآیند معکوسسازی تصویر را با مشکل مواجه میکند. آنها با تعریف مفهوم «فشار پرامپت» (Prompt Pressure)، توضیح دادهاند که چرا برخی پرامپتها به راحتی بازسازی میشوند و برخی دیگر برای مدل بسیار گیجکننده هستند.
این تحقیق گامی مهم برای افزایش دقت ابزارهای ویرایش تصویر است که اجازه میدهد ویرایشهایی با وفاداری بسیار بالاتر به تصویر اصلی داشته باشیم.
منبع: arXiv Computer Vision
