مدلهای ترنسفورمر برای بازسازی سهبعدی (F3R) با وجود دقت بالا، معمولاً در پردازش سکانسهای طولانی تصویر با چالش کندی مواجه هستند. حالا محققان با معرفی معماری جدید SAF3R، این مشکل را حل کردهاند!
این مدل با تحلیل دقیق «توجه» (Attention) در شبکهها، متوجه شده که الگوهای توجه بسیار پراکنده و پویا هستند. در نتیجه، یک چارچوب بهینه طراحی کردهاند که بدون نیاز به آموزش مجدد، سرعت بازسازی سهبعدی را بهشدت افزایش میدهد، بدون اینکه دقت تخمین دوربین یا کیفیت خروجی کاهش یابد. این یک گام بزرگ برای پردازشهای بلادرنگ و سریعتر در دنیای گرافیک هوشمند است.
🔗 لینک گیتهاب پروژه: https://github.com/jndeng/SAF3R
منبع: arXiv Computer Vision
