محققان در یک دستاورد جدید، متد نوآورانهای به نام «CoDoL» (Conditional Domain Prompt Learning) معرفی کردهاند که مشکل همیشگی مدلهای CLIP در درکِ خارج از توزیع (OOD) را هدف قرار داده است.
این روش با بهرهگیری از اطلاعات دامنه و یک شبکه متا (DMN)، دقت و هماهنگیِ بینِ تصویر و متن را به شدت بهبود میبخشد تا مدلها در شرایط واقعی و محیطهای ناشناخته، عملکرد بسیار دقیقتری داشته باشند. در واقع این متد، شکاف بین متنهای توصیفی و ویژگیهای بصری را پر میکند تا شاهد مدلهای بینایی هوشمندتر باشیم.
اگر در زمینه بینایی ماشین و مدلهای CLIP فعالیت میکنید، این رویکرد جدید میتواند برای افزایش پایداری و تعمیمپذیری پروژههای شما بسیار کارآمد باشد.
منبع: arXiv Computer Vision
