محققان در مقاله جدیدی به سراغ بهینهسازی مدلهای بینایی-زبانی مثل CLIP رفتهاند تا بدون نیاز به برچسبهای آموزشی، قدرت تحلیل تصاویر را افزایش دهند. این روش که تمرکز آن بر شناسایی جزئیاتِ متمایزِ تصاویر است، به مدل کمک میکند حتی در شرایطی که دادههای آموزشی کمی وجود دارد، عملکرد بسیار دقیقتری داشته باشد.
نکته جالب اینجاست که نتایج نشان میدهد روشهای «تصادفی» در انتخاب بخشهای تصویر، گاهی حتی بهتر از مدلهای پیچیده قطعهبندی (مانند SAM) عمل میکنند! این یعنی راهکارهای سبکتر و کارآمدتر برای تحلیلهای بصری در دسترستر خواهند بود.
منبع: arXiv Computer Vision
