🚀 انقلاب در بازیابی تصاویر: معرفی مدل HashViT

⚠️ هشدار به محققان: چرا دقت مدل‌های شناسایی پهپاد گاهی «واقعی» نیست؟

محققان در مقاله جدید خود به سراغ حل یکی از مشکلات قدیمی مدل‌های بینایی ماشین، یعنی شکاف بین ویژگی‌های پیوسته و کدهای باینری برای جستجوی سریع در مقیاس بزرگ رفته‌اند.

مدل جدید HashViT با اضافه کردن یک توکن اختصاصی به نام «HASH Token» به ساختار ترنسفورمر، اجازه می‌دهد کدهای باینری به‌صورت بومی (Native) در طول لایه‌های مدل یاد گرفته شوند. این یعنی به جای روش‌های قدیمیِ تبدیل ویژگی‌ها در مرحله آخر، شبکه به‌طور هوشمندانه در حین پردازش، کدهای بهینه برای جستجوی سریع را تولید می‌کند. این دستاورد می‌تواند سرعت و دقت سیستم‌های بازیابی تصویر را به شکل چشمگیری افزایش دهد. 🖼️🔍

منبع: arXiv Computer Vision