مدلهای فعلی در تخمین عمقِ تصویر (Depth Estimation) با یک چالش بزرگ روبرو هستند: نبود درک درست از مقیاسها در تصاویر تکدوربینه. اما محققان با معرفی فریمورک نوآورانه EpiDistill، این مشکل را حل کردهاند.
این متد با استفاده از «نشانههای اپیپلار» (Epipolar Cues)، دانش مدلهای چندتصویری را به مدلهای تکتصویری منتقل میکند. نتیجه؟ مدل بدون نیاز به چندین ورودی، حالا دنیای سهبعدی را با دقت بسیار بالاتر و مقیاس واقعیتر میبیند! این پیشرفت به طور خاص عملکرد مدلهای قدرتمندی مثل UniDepthV2 و DepthPro را به شدت ارتقا داده است. ✨
منبع: arXiv Computer Vision
