محققان در مقاله جدید خود به سراغ حل یکی از مشکلات قدیمی مدلهای بینایی ماشین، یعنی شکاف بین ویژگیهای پیوسته و کدهای باینری برای جستجوی سریع در مقیاس بزرگ رفتهاند.
مدل جدید HashViT با اضافه کردن یک توکن اختصاصی به نام «HASH Token» به ساختار ترنسفورمر، اجازه میدهد کدهای باینری بهصورت بومی (Native) در طول لایههای مدل یاد گرفته شوند. این یعنی به جای روشهای قدیمیِ تبدیل ویژگیها در مرحله آخر، شبکه بهطور هوشمندانه در حین پردازش، کدهای بهینه برای جستجوی سریع را تولید میکند. این دستاورد میتواند سرعت و دقت سیستمهای بازیابی تصویر را به شکل چشمگیری افزایش دهد. 🖼️🔍
منبع: arXiv Computer Vision
