محققان در مقالهی اخیر خود به یک چالش مهم در مدلهای بینایی-زبانی (مثل CLIP) پی بردهاند: مدلهای زبانی (LLM) برای توصیف کلاسها، تمایل دارند مفاهیم کلی (مثلاً رنگ قرمز برای توتفرنگی) را بدون توجه به ویژگیهای واقعی تصویر (مثلاً وقتی توتفرنگی در یک نقاشی خطی بیرنگ است) بیان کنند. این باعث میشود مدل در مواجهه با تغییرات دادهها دچار خطا شود.
راهکار جدید؟ انتخاب ویژگیها مستقیماً از دلِ تصاویرِ مجموعه داده، نه فقط از نام کلاسها! این متد جدید نه تنها دقت مدل را به شکل قابل توجهی افزایش داده، بلکه بسیار سریعتر از روشهای کلاسیک (مثل CoOp) عمل میکند و در عین حال یک خلاصهی قابل درک از ویژگیهای کلیدی دادهها ارائه میدهد. این گامی بزرگ برای هوشمندتر شدن درک بصری ماشینهاست. 🚀✨
منبع: arXiv AI
