تا حالا دقت کردید که مدلهای تولید تصویر (Diffusion Models) گاهی در چیدن دقیق اجزا در کنار هم یا رعایت نسبتهای کوچک دچار خطا میشوند؟ محققان بهتازگی روشی هوشمندانه به نام ELBO-T2IAlign معرفی کردهاند.
این روش بدون نیاز به آموزش مجدد یا تغییر در معماری مدل، ناهماهنگی بین متن و پیکسلهای تصویر را کالیبره میکند. این یعنی خروجیهای مدل در زمینههایی مثل ویرایش تصویر و جداسازی سوژهها (Segmentation) بسیار دقیقتر و حرفهایتر میشود. خبر خوب اینکه این متد روی اکثر مدلهای انتشار (Diffusion Backbones) قابل اجراست!
منبع: arXiv AI
