آیا تا به حال دقت کردید که مدلهای هوش مصنوعی (UMMs) گاهی در ویرایش تصویر دچار تناقض میشوند؟ مثلاً متنی که مینویسند با تصویری که تولید میکنند همخوانی ندارد؟
محققان در مقاله جدیدی برای حل این «شکاف فهم و تولید»، چارچوب جدیدی به نام STBridge را معرفی کردند. این مدل با ایجاد یک «هدف مشترک» (Shared-Target)، کاری میکند که مدلهای هوش مصنوعی در درک جزئیات ظریف، روابط فضایی و ویژگیهای محلی، هماهنگی بسیار بیشتری داشته باشند و خروجی نهایی دقیقاً همانی باشد که شما خواستهاید. 🚀
این یک قدم بزرگ برای واقعیتر شدن و دقیقتر شدن ابزارهای ویرایش تصویر مبتنی بر متن است.
منبع: arXiv Computer Vision
