محققان در پژوهشی تازه، چارچوبی نوآورانه به نام M-CPT معرفی کردهاند که مدلهای بینایی (VFMs) را متحول میکند. این روش به مدلها اجازه میدهد حتی با تغییر وضوح تصویر، دقت خود را حفظ کنند و هماهنگی بسیار بهتری با مدلهای زبانی داشته باشند.
نکته جالب اینجاست که این متد روی مدلهای قدرتمندی مثل DINOv2 و SigLIP آزمایش شده و بدون افت کیفیت در وظایف اصلی مثل طبقهبندی تصاویر، قدرت درک چندوجهی (Multimodal) آنها را به شدت افزایش داده است. این یعنی هوش مصنوعی در درک همزمان تصویر و متن، یک قدم دیگر به هوشمندی انسانی نزدیکتر شد! 🧠✨
منبع: arXiv Computer Vision
