دنیای بینایی ماشین با معرفی «RDVSv2» یک قدم دیگر به درک دقیقتر ویدئوها نزدیکتر شد! این بنچمارک عظیم که شامل نزدیک به ۳۰ هزار فریم با جزئیات دقیق و استفاده از نقشههای عمق است، به مدلهای هوش مصنوعی کمک میکند تا اشیاء موجود در ویدئوها را با دقت بسیار بالاتری تشخیص دهند.
نکته جذاب این پژوهش، استفاده از مدل قدرتمند SAM2 است که با یک استراتژی هوشمندانه (PEFT) برای ترکیب دادههای RGB، عمق و جریان نوری بهینه شده است. این دستاورد میتواند تحولی در حوزه درک ویدئو و بینایی سهبعدی ایجاد کند. 🤖🎥
منبع: arXiv Computer Vision
