آیا تا به حال سعی کردید با ترکیب یک عکس و یک دستور متنی، تصویر دقیقتری را جستجو کنید؟ این حوزه که به آن «بازیابی ترکیبی تصویر» (CIR) میگویند، معمولاً با چالشهای محاسباتی سنگینی همراه است.
محققان در مقاله جدیدی از روشی به نام DiCE-CIR رونمایی کردند که این فرآیند را بسیار بهینهتر کرده است. به جای استفاده از روشهای پیچیده و کندِ گذشته، این مدل با یادگیریِ مستقیمِ ترکیبِ تصویر و متن، نتایج خیرهکنندهای را روی بنچمارکهای معتبر ثبت کرده است. نکته جذاب اینجاست که این مدل برای آموزش نیاز به دادههای دستیِ گرانقیمت ندارد و از دادههای مقیاس بزرگ به صورت خودکار استفاده میکند. ✨
منبع: arXiv Computer Vision
