مدلهای تولید تصویر که از روشهای خودبازگشت (Autoregressive) استفاده میکنند، گاهی با مشکل ناهماهنگی در جزئیات یا «سرگردانی» سیگنالهای هدایتکننده مواجه میشوند. اما حالا محققان فریمورک جدیدی به نام «Information-Grounding Guidance» یا همان IGG را معرفی کردهاند!
این روش با تمرکز بر وزندهی داینامیک در بخشهای مهم تصویر، باعث میشود مدل دقیقاً بداند کجا باید جزئیات را شفافتر و منسجمتر خلق کند. نتیجه؟ تصاویری با وضوح بالاتر و پایبندی بیشتر به پرامپتهای متنی.
اگر در حوزه تولید محتوای تصویری با هوش مصنوعی فعالیت میکنید، میتوانید جزئیات فنی و کدهای این پژوهش را در گیتهاب آنها بررسی کنید. 🚀
منبع: arXiv AI
