🎨 چرا ادیت تصاویر با هوش مصنوعی گاهی شکست می‌خورد؟

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

در دنیای مدل‌های انتشار (Diffusion Models)، فرآیند تبدیل متن به تصویر و ویرایش آن‌ها بسیار جذاب است، اما یک چالش بزرگ وجود دارد: وقتی از «Classifier-Free Guidance» یا همان CFG با مقادیر بالا استفاده می‌کنیم، معکوس‌سازی (Inversion) تصاویر گاهی با خطا مواجه می‌شود.

محققان در مطالعه جدید خود به بررسی این موضوع پرداخته‌اند که چه زمانی یک تصویر تولید شده با CFG بالا، قابلیت بازسازی دقیق را دارد. آن‌ها متوجه شدند که برخی دستورات (Prompts) برای مدل بسیار آسان و برخی دیگر به شدت چالش‌برانگیز هستند. این تحقیق به ما کمک می‌کند تا بفهمیم چطور تعامل بین «پرامپت» و «لاتنت‌ها» بر کیفیت ویرایش نهایی تأثیر می‌گذارد. 🔍💡

منبع: arXiv Computer Vision