مدل محبوب CLIP که پل ارتباطی بین تصویر و متن است، گاهی در درکِ دقیقِ جزئیاتِ درونِ تصویر ضعف دارد. محققان برای حل این مشکل، متد جدیدی به نام SFF-CLIP معرفی کردهاند.
✅ ویژگیهای مهم این روش:
• بدون نیاز به حاشیهنویسی (Annotation) دستی و پیچیده، تنها با استفاده از جفتهای تصویر و متن، جزئیات را درک میکند.
• برخلاف روشهای قبلی، تواناییِ درکِ کلیِ تصویر را فدایِ جزئیات نمیکند.
• با استفاده از نقشههای حرارتی (Heat Maps)، ارتباط بین عبارات متن و نواحی تصویر را بهینهسازی میکند.
این نوآوری گامی مهم برای افزایش دقت مدلهای بینایی-زبانی در کارهای تخصصی و تشخیص دقیق اجسام درون تصویر است.
منبع: arXiv Computer Vision
