محققان در مقاله جدیدی، مدل «Structured Dynamics Model» (یا به اختصار SDM) را معرفی کردهاند که گام بزرگی در درک ویدیویی برمیدارد. چالش بزرگ اینجاست که در ویدیوها، حرکت دوربین و حرکت اشیا با هم ترکیب شدهاند و تفکیک آنها برای مدلهای یادگیری عمیق دشوار است.
مدل SDM با استفاده از یادگیری خودنظارتی (Self-Supervised Learning) یاد میگیرد که حرکات معنادار اشیا را از لرزشها یا حرکت دوربین جدا کند. این مدل با پیشبینی ویژگیهای آینده و ترکیب آموزش روی ویدیوهای واقعی و دادههای مصنوعی، توانسته نتایج بسیار دقیقتری نسبت به روشهای سنتی ارائه دهد. این دستاورد میتواند تحولی در پردازش ویدیویی و بینایی ماشین ایجاد کند. 🧠🤖
منبع: arXiv Computer Vision
