محققان در یک پژوهش نوآورانه، رویکرد متفاوتی را برای «ردیابی چند-شیئی» (MOT) معرفی کردهاند. به جای استفاده از روشهای کلاسیک که در آنها شناسایی و ردیابی مراحل جداگانهای هستند، این سیستم از یک مدل پیشرفته تبدیل متنبهویدیو (LTX-2.3) استفاده میکند.
در این روش، مدل یاد میگیرد ویدیو را به یک «نقشه هویت» تبدیل کند که در آن هر فرد با رنگی متمایز و ثابت در طول زمان مشخص میشود. این یعنی هوش مصنوعی بدون نیاز به هیچ ماژول ردیابی پیچیده یا مدل حرکتی، میتواند هویتها را در ویدیو حفظ کند. اگرچه این فناوری هنوز در مراحل اولیه است، اما پتانسیل بالایی برای تغییر استانداردهای ردیابی بصری دارد. 🚀
منبع: arXiv Computer Vision
