یکی از چالشهای اصلی در بازسازی محیطهای سهبعدی از روی ویدیو، تغییرات مداوم تنظیمات دوربین (مثل زوم و فوکوس) است که مدلهای فعلی در آن ضعف دارند. حالا با معرفی «InFlux++»، گام بزرگی برای حل این مشکل برداشته شده است!
این پروژه شامل دو بخش کلیدی است:
🔹 InFlux++ Synth: یک مجموعه داده عظیم و مصنوعی با بیش از ۴۴۱ هزار فریم که برای آموزش هوش مصنوعی در درک دقیق زوایای دوربین، عمق و حرکتهای پیچیده طراحی شده.
🔹 InFlux++ Real: یک بنچمارک جدید برای ارزیابی عملکرد مدلها در دنیای واقعی با بیش از ۵۱۴ هزار فریم ضبط شده.
این پیشرفت میتواند در آینده دقت رباتها و اپلیکیشنهای واقعیت افزوده (AR) را برای درک محیط اطرافشان چندین برابر کند. 🤖✨
منبع: arXiv Computer Vision
