محققان در تحقیق جدید خود با تعریف یک مسئله تازه به نام VIMI-ReID، به سراغ شناسایی افراد در شرایطی رفتند که تصاویر ترکیبی (دید معمولی و فروسرخ) هستند. چالش اصلی در سیستمهای فعلی، تداخل در تشخیص به دلیل شباهتهای modality است که باعث کاهش دقت میشود.
مدل پیشنهادی با نام MAMT، با استفاده از یک معماری ترنسفورمر دوگانه، ویژگیهای مشترک و اختصاصی هر مودالیته را استخراج کرده و عملکرد سیستمهای شناسایی را در شرایط پیچیده به شدت ارتقا میدهد. این دستاورد به ویژه برای سیستمهای نظارتی هوشمند بسیار کلیدی است. 🤖📸
منبع: arXiv Computer Vision
