مدلهای CLIP پایه و اساس بسیاری از سیستمهای هوش مصنوعی بینایی-زبانی هستند، اما همیشه در تشخیص جزئیات دقیق و مکانیابی اشیاء با چالش روبرو بودهاند. حالا محققان در یک پژوهش جدید، فریمورک «TraceCLIP» را معرفی کردهاند که بدون نیاز به آموزش مجدد، میتواند معنای نهفته در بخشهای کوچک تصویر (پچها) را استخراج کند.
ویژگی جذاب TraceCLIP این است که به صورت مستقیم بررسی میکند هر بخش از تصویر چگونه در خروجی نهایی مدل تاثیر میگذارد و با این کار، دقت تشخیص اشیاء و تقسیمبندی معنایی تصویر (Semantic Segmentation) را به طرز چشمگیری افزایش میدهد. این یعنی هوش مصنوعی حالا میتواند با جزئیات بسیار دقیقتر و هوشمندانهتری به محیط اطراف نگاه کند! 🤖🖼️
منبع: arXiv AI
