مدلهای چندوجهی مثل CLIP در یادگیریِ همزمان تصویر و متن بسیار قوی هستند، اما یک مشکل بزرگ دارند: «عدم تقارن اطلاعات». مثلاً یک تصویر ممکن است محتوای بصری زیادی داشته باشد، اما متنِ همراهش فقط روی یک جنبه خاص تمرکز کند. این تفاوت باعث میشود مدلها در آموزش دچار سردرگمی شوند.
محققان برای حل این چالش، فریمورک جدید AspectCLIP را معرفی کردند. این مدل با خوشهبندی تصاویر بر اساس شباهتهای متنی و اعمالِ یک فرآیندِ اصلاحیِ هوشمندانه، باعث میشود مدل دقیقاً بفهمد کدام بخش تصویر با کدام بخش متن هماهنگ است. نتیجه؟ یک فضای نمایش (Representation Space) بسیار دقیقتر و ساختاریافتهتر که در کارهای پردازش تصویر، عملکردی فوقالعاده بهتر از نسخههای قدیمی دارد. 🚀
منبع: arXiv Computer Vision
