محققان در یک مقاله جدید، معماری خلاقانهای به نام «HashViT» را برای بهبود بازیابی تصاویر در مقیاس بزرگ معرفی کردهاند.
مشکل روشهای فعلی این است که ویژگیهای بصری ابتدا تولید و سپس به کدهای باینری تبدیل میشوند که این کار باعث افت دقت میشود. اما HashViT با معرفی یک «توکن اختصاصی HASH» مستقیماً در دلِ ترنسفورمر، فرآیند تولید کدهای باینری را بهینه کرده و کارایی جستجو در فضای Hamming را به شدت افزایش میدهد.
این روش یعنی یادگیری بومی هشینگ (Native Hash Learning) که میتواند آینده سیستمهای جستجوی تصویری را سریعتر و دقیقتر از قبل کند.
منبع: arXiv Computer Vision
