محققان در مطالعه اخیر خود به مقایسه جالبی بین مدلهای بینایی (CNNها) و ترنسفورمرهای بینایی (ViTs) پرداختهاند تا ببینند کدامیک در درک «بافتها» (Texture) به مغز انسان نزدیکتر است.
نتایج این تحقیق نشان میدهد که برخلاف مدلهای قدیمی CNN، مدلهای ViT درک بسیار دقیقتر و مشابهی با سیستم بینایی انسان از الگوهای بافت دارند. این یافتهها مسیر تازهای را برای بهبود مدلهای هوش مصنوعی در تحلیلهای بصری پیچیده باز میکند.
منبع: arXiv Computer Vision
