آیا مدلهای هوش مصنوعی که همزمان متن و تصویر را پردازش میکنند (UMMs)، واقعاً از یک فضای درک واحد استفاده میکنند؟ محققان در مطالعه جدید خود با روشی به نام «هدایت بینشاخه ای» (Cross-branch Steering) به این سوال پاسخ دادهاند.
نتایج نشان میدهد که اگرچه معماری این مدلها یکی است، اما درک معنایی آنها لزوماً یکپارچه نیست. جالب اینجاست که دستورات معنایی که برای درک مدل طراحی شدهاند، میتوانند باعث بهبود چشمگیر در تولید تصاویر شوند، اما مسیر برعکس چندان موثر نیست! این یعنی مدلهای ما هنوز در هماهنگسازیِ بین «فهمیدن» و «ساختن» فاصله دارند. 🎨🤖
این تحقیق گام بزرگی برای کنترلپذیری بهتر مدلهای تولید تصویر و درک عمیقتر از نحوه عملکرد آنهاست.
های_چندوجهی
منبع: arXiv Computer Vision
