محققان در مقالهای جدید، رویکردی متفاوت برای تعامل میان درک و تولید تصویر معرفی کردهاند. برخلاف مدلهای فعلی که اغلب به صورت مجزا عمل میکنند، این پژوهش با معرفی فریمورک «SC-CMJP» و سمپلر «CO2Jump»، سیستمی ساخته که میتواند مانند یک انسان، در حین تولید محتوا، آن را اصلاح و بازنگری کند.
این یعنی هوش مصنوعی حالا میتواند تناقضهای احتمالی بین متن و تصویر را در لحظه تشخیص داده و با قابلیت «بازنویسی» (Remasking)، خروجی دقیقتری ارائه دهد. برای تست این قابلیت، مجموعهدادههای جدیدی نیز منتشر شده که نویدبخش نسل جدیدی از مدلهای مولد چندوجهی (Multimodal) است. 🚀
منبع: arXiv Machine Learning
