آیا تا به حال دقت کردهاید که مدلهای هوش مصنوعی وقتی میخواهند همزمان متن بنویسند و تصویر تولید کنند، گاهی از مسیر خارج میشوند؟ محققان در پژوهش جدیدی به نام «MoTiF»، راهکار تازهای برای حل این مشکل پیدا کردهاند.
در مدلهای چندوجهی (Multimodal)، گاهی تصویر تولید شده با متن منطبق نیست یا متن بعدی، شواهد تصویری را نادیده میگیرد. این پدیده که «ایزولاسیون مدالیته» نام دارد، باعث افت دقت در کارهای پیچیده میشود. روش جدید MoTiF با نظارت دقیق بر نقاط اتصال متن و تصویر (Modality Transitions)، باعث میشود مدلها در استدلالهای گامبهگام، خروجیهای بسیار منسجمتر و دقیقتری داشته باشند.
این پیشرفت یک قدم مهم برای رسیدن به هوش مصنوعی است که واقعاً «میفهمد» و بین حواس مختلفش ارتباط منطقی برقرار میکند. 🚀
منبع: arXiv Computer Vision
