🚀 جهشی جدید در دقت مدل‌های بینایی (Vision Models) با متد M-CPT!

🧠 چرا هوش مصنوعی گاهی «خیالات» می‌بیند؟

محققان در پژوهشی تازه، چارچوبی نوآورانه به نام M-CPT معرفی کرده‌اند که مدل‌های بینایی (VFMs) را متحول می‌کند. این روش به مدل‌ها اجازه می‌دهد حتی با تغییر وضوح تصویر، دقت خود را حفظ کنند و هماهنگی بسیار بهتری با مدل‌های زبانی داشته باشند.

نکته جالب اینجاست که این متد روی مدل‌های قدرتمندی مثل DINOv2 و SigLIP آزمایش شده و بدون افت کیفیت در وظایف اصلی مثل طبقه‌بندی تصاویر، قدرت درک چندوجهی (Multimodal) آن‌ها را به شدت افزایش داده است. این یعنی هوش مصنوعی در درک همزمان تصویر و متن، یک قدم دیگر به هوشمندی انسانی نزدیک‌تر شد! 🧠✨

منبع: arXiv Computer Vision