محققان در مطالعه جدیدی به بررسی این پرداختند که مدلهای بینایی ماشین (مانند CNNها و Vision Transformerها) چگونه اشیاء را تشخیص میدهند. آیا آنها به بافت (Texture) تکیه میکنند یا شکل (Shape)؟
نکته جالب اینجاست که با یک روش ارزیابی جدید، مشخص شد که برخلاف تصورات قبلی، مدلهای CNN به شدت تحت تأثیر «بافت» هستند. اما خبر بهتر برای طرفداران تکنولوژیهای جدید اینکه: مدلهای Vision Transformer (ViT) در برابر حذف دادههای بصری مقاومتر عمل کرده و دقت بالاتری را حفظ میکنند. این یافتهها به ما کمک میکند تا بهتر بفهمیم چرا مدلهای مدرن در سناریوهای واقعی عملکرد پایدارتری دارند. 🧠🤖
منبع: arXiv Computer Vision
