محققان در مطالعه اخیر خود به یک ضعف مهم در مدلهای «تخمین عمق» (Monocular Depth) پی بردند. این مدلها که بر اساس تصاویر دوبعدی، ساختار سهبعدی محیط را حدس میزنند، گاهی دچار خطای «سراب سهبعدی» (3D Mirage) میشوند؛ یعنی در محیطهایی با ابهام بصری، ساختارهای غیرواقعی ایجاد میکنند.
این مقاله علاوه بر معرفی بنچمارک 3D-Mirage برای تست این مدلها، راهکار جدیدی به نام «تقطیر خودکار زمینبنیان» (Grounded Self-Distillation) ارائه داده تا دقت و پایداری مدلهایی مثل Depth-Anything-V2 را بدون فراموشی دانش قبلی، افزایش دهد. گامی مهم برای ایمنتر کردن بینایی ماشین در دنیای واقعی! 🤖📐
منبع: arXiv Computer Vision
