{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,14]],"date-time":"2026-07-14T14:53:06Z","timestamp":1784040786452,"version":"3.55.0"},"reference-count":95,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2021,6,18]],"date-time":"2021-06-18T00:00:00Z","timestamp":1623974400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,6,18]],"date-time":"2021-06-18T00:00:00Z","timestamp":1623974400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2021,9]]},"DOI":"10.1007\/s11263-021-01484-6","type":"journal-article","created":{"date-parts":[[2021,6,18]],"date-time":"2021-06-18T09:03:02Z","timestamp":1624006982000},"page":"2548-2564","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":202,"title":["Unsupervised Scale-Consistent Depth Learning from Video"],"prefix":"10.1007","volume":"129","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2046-3363","authenticated-orcid":false,"given":"Jia-Wang","family":"Bian","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huangying","family":"Zhan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Naiyan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhichao","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Le","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chunhua","family":"Shen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ming-Ming","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ian","family":"Reid","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,6,18]]},"reference":[{"issue":"3","key":"1484_CR1","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1023\/B:VISI.0000011205.11775.fd","volume":"56","author":"S Baker","year":"2004","unstructured":"Baker, S., & Matthews, I. (2004). Lucas-kanade 20 years on: A unifying framework. International Journal on Computer Vision (IJCV), 56(3), 221\u2013225.","journal-title":"International Journal on Computer Vision (IJCV)"},{"issue":"2","key":"1484_CR2","first-page":"4181","volume":"4","author":"J Bian","year":"2020","unstructured":"Bian, J., Lin, W.-Y., Liu, Y., Zhang, L., Yeung, S.-K., Cheng, M.-M., et al. (2020a). GMS: Grid-based motion statistics for fast, ultra-robust feature correspondence. International Journal on Computer Vision (IJCV), 4(2), 4181\u20134190.","journal-title":"International Journal on Computer Vision (IJCV)"},{"key":"1484_CR3","unstructured":"Bian, J.-W., Li, Z., Wang, N., Zhan, H., Shen, C., Cheng, M.-M., et\u00a0al. (2019a). Unsupervised scale-consistent depth and ego-motion learning from monocular video. In Neural Information Processing Systems (NeurIPS)."},{"key":"1484_CR4","unstructured":"Bian, J.-W., Wu, Y.-H., Zhao, J., Liu, Y., Zhang, L., Cheng, M.-M., et\u00a0al. (2019b). An evaluation of feature matchers for fundamental matrix estimation. In British Machine Vision Conference (BMVC)."},{"key":"1484_CR5","unstructured":"Bian, J.-W., Zhan, H., Wang, N., Chin, T.-J., Shen, C., & Reid, I. (2020b). Unsupervised depth learning in challenging indoor video: Weak rectification to rescue. arXiv preprintarXiv:2006.02708."},{"key":"1484_CR6","doi-asserted-by":"crossref","unstructured":"Bloesch, M., Czarnowski, J., Clark, R., Leutenegger, S., & Davison, A.\u00a0J. (2018). Codeslam\u2014learning a compact, optimisable representation for dense visual slam. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 2560\u20132568).","DOI":"10.1109\/CVPR.2018.00271"},{"key":"1484_CR7","doi-asserted-by":"crossref","unstructured":"Butler, D.\u00a0J., Wulff, J., Stanley, G.\u00a0B., & Black, M.\u00a0J. (2012). A naturalistic open source movie for optical flow evaluation. In European Conference on Computer Vision (ECCV) (pp. 611\u2013625).","DOI":"10.1007\/978-3-642-33783-3_44"},{"key":"1484_CR8","doi-asserted-by":"crossref","unstructured":"Casser, V., Pirk, S., Mahjourian, R., & Angelova, A. (2019a). Depth prediction without the sensors: Leveraging structure for unsupervised learning from monocular videos. In Association for the Advancement of Artificial Intelligence (AAAI).","DOI":"10.1609\/aaai.v33i01.33018001"},{"key":"1484_CR9","doi-asserted-by":"crossref","unstructured":"Casser, V., Pirk, S., Mahjourian, R., & Angelova, A. (2019b). Unsupervised monocular depth and ego-motion learning with structure and semantics. In CVPR Workshop on Visual Odometry and Computer Vision Applications Based on Location Cues (VOCVALC).","DOI":"10.1109\/CVPRW.2019.00051"},{"key":"1484_CR10","unstructured":"Chakrabarti, A., Shao, J., & Shakhnarovich, G. (2016). Depth from a single image by harmonizing overcomplete local network predictions. In Neural Information Processing Systems (NeurIPS)."},{"key":"1484_CR11","doi-asserted-by":"crossref","unstructured":"Chen, W., Qian, S., & Deng, J. (2019a). Learning single-image depth from videos using quality assessment networks. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 5604\u20135613).","DOI":"10.1109\/CVPR.2019.00575"},{"key":"1484_CR12","doi-asserted-by":"crossref","unstructured":"Chen, Y., Schmid, C., & Sminchisescu, C. (2019b). Self-supervised learning with geometric constraints in monocular video: Connecting flow, depth, and camera. In IEEE International Conference on Computer Vision (ICCV) (pp. 7063\u20137072).","DOI":"10.1109\/ICCV.2019.00716"},{"key":"1484_CR13","unstructured":"Clevert, D.-A., Unterthiner, T., & Hochreiter, S. (2015). Fast and accurate deep network learning by exponential linear units (elus). arXiv preprintarXiv:1511.07289."},{"key":"1484_CR14","doi-asserted-by":"crossref","unstructured":"Curless, B., & Levoy, M. (1996). A volumetric method for building complex models from range images. In ACM Transactions on Graphics (SIGGRAPH). CUMINCAD.","DOI":"10.1145\/237170.237269"},{"key":"1484_CR15","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., & Fei-Fei, L. (2009). ImageNet: A Large-Scale Hierarchical Image Database. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1484_CR16","doi-asserted-by":"crossref","unstructured":"Eigen, D., & Fergus, R. (2015). Predicting depth, surface normals and semantic labels with a common multi-scale convolutional architecture. In IEEE International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2015.304"},{"key":"1484_CR17","unstructured":"Eigen, D., Puhrsch, C., & Fergus, R. (2014). Depth map prediction from a single image using a multi-scale deep network. In Neural Information Processing Systems (NeurIPS)."},{"issue":"3","key":"1484_CR18","doi-asserted-by":"publisher","first-page":"611","DOI":"10.1109\/TPAMI.2017.2658577","volume":"40","author":"J Engel","year":"2017","unstructured":"Engel, J., Koltun, V., & Cremers, D. (2017). Direct sparse odometry. IEEE Transactions on Pattern Recognition and Machine Intelligence (TPAMI), 40(3), 611\u2013625.","journal-title":"IEEE Transactions on Pattern Recognition and Machine Intelligence (TPAMI)"},{"key":"1484_CR19","doi-asserted-by":"crossref","unstructured":"Forster, C., Pizzoli, M., & Scaramuzza, D. (2014). Svo: Fast semi-direct monocular visual odometry. In IEEE International Conference on Robotics and Automation (ICRA) (pp. 15\u201322). IEEE.","DOI":"10.1109\/ICRA.2014.6906584"},{"key":"1484_CR20","doi-asserted-by":"crossref","unstructured":"Fu, H., Gong, M., Wang, C., Batmanghelich, K., & Tao, D. (2018). Deep ordinal regression network for monocular depth estimation. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 2002\u20132011).","DOI":"10.1109\/CVPR.2018.00214"},{"key":"1484_CR21","doi-asserted-by":"crossref","unstructured":"Garg, R., BG, V.\u00a0K., Carneiro, G., & Reid, I. (2016). Unsupervised cnn for single view depth estimation: Geometry to the rescue. In European Conference on Computer Vision (ECCV). Springer.","DOI":"10.1007\/978-3-319-46484-8_45"},{"key":"1484_CR22","doi-asserted-by":"crossref","unstructured":"Garg, R., Wadhwa, N., Ansari, S., & Barron, J.\u00a0T. (2019). Learning single camera depth estimation using dual-pixels. In IEEE International Conference on Computer Vision (ICCV) (pp. 7628\u20137637).","DOI":"10.1109\/ICCV.2019.00772"},{"key":"1484_CR23","doi-asserted-by":"crossref","unstructured":"Geiger, A., Lenz, P., Stiller, C., & Urtasun, R. (2013). Vision meets Robotics: The kitti dataset. International Journal of Robotics Research (IJRR).","DOI":"10.1177\/0278364913491297"},{"key":"1484_CR24","doi-asserted-by":"crossref","unstructured":"Geiger, A., Ziegler, J., & Stiller, C. (2011). Stereoscan: Dense 3d reconstruction in real-time. In Intelligent Vehicles Symposium (IV).","DOI":"10.1109\/IVS.2011.5940405"},{"key":"1484_CR25","doi-asserted-by":"crossref","unstructured":"Godard, C., Mac\u00a0Aodha, O., & Brostow, G.\u00a0J. (2017). Unsupervised monocular depth estimation with left-right consistency. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2017.699"},{"key":"1484_CR26","doi-asserted-by":"crossref","unstructured":"Godard, C., Mac Aodha, O., Firman, M., & Brostow, G.\u00a0J. (2019). Digging into self-supervised monocular depth prediction. In IEEE International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2019.00393"},{"key":"1484_CR27","doi-asserted-by":"crossref","unstructured":"Gordon, A., Li, H., Jonschkowski, R., & Angelova, A. (2019). Depth from videos in the wild: Unsupervised monocular depth learning from unknown cameras. In IEEE International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2019.00907"},{"key":"1484_CR28","doi-asserted-by":"crossref","unstructured":"Guizilini, V., Ambrus, R., Pillai, S., Raventos, A., & Gaidon, A. (2020a). 3d packing for self-supervised monocular depth estimation. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR42600.2020.00256"},{"key":"1484_CR29","doi-asserted-by":"crossref","unstructured":"Guizilini, V., Hou, R., Li, J., Ambrus, R., & Gaidon, A. (2020b). Semantically-guided representation learning for self-supervised monocular depth. In International Conference on Learning Representations (ICLR).","DOI":"10.1109\/CVPR42600.2020.00256"},{"key":"1484_CR30","volume-title":"Multiple view geometry in computer vision","author":"R Hartley","year":"2003","unstructured":"Hartley, R., & Zisserman, A. (2003). Multiple view geometry in computer vision. Cambridge: Cambridge University Press."},{"key":"1484_CR31","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2016.90"},{"key":"1484_CR32","doi-asserted-by":"crossref","unstructured":"Hirschmuller, H. (2005). Accurate and efficient stereo processing by semi-global matching and mutual information. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR), volume\u00a02 (pp. 807\u2013814).","DOI":"10.1109\/CVPR.2005.56"},{"key":"1484_CR33","doi-asserted-by":"crossref","unstructured":"Huynh, L., Nguyen-Ha, P., Matas, J., Rahtu, E., & Heikkil\u00e4, J. (2020). Guiding monocular depth estimation using depth-attention volume. In European Conference on Computer Vision (ECCV) (pp. 581\u2013597). Springer.","DOI":"10.1007\/978-3-030-58574-7_35"},{"key":"1484_CR34","unstructured":"Jaderberg, M., Simonyan, K., Zisserman, A., et\u00a0al. (2015). Spatial transformer networks. In Neural Information Processing Systems (NeurIPS)."},{"key":"1484_CR35","doi-asserted-by":"crossref","unstructured":"Jeong, J., Cho, Y., Shin, Y.-S., Roh, H., & Kim, A. (2019). Complex urban dataset with multi-level sensors from highly diverse urban environments. The International Journal of Robotics Research, p. 0278364919843996.","DOI":"10.1177\/0278364919843996"},{"key":"1484_CR36","unstructured":"Kingma, D.\u00a0P., & Ba, J. (2014). ADAM: A method for stochastic optimization. arXiv preprintarXiv:1412.6980."},{"key":"1484_CR37","doi-asserted-by":"crossref","unstructured":"Klein, G., & Murray, D. (2007). Parallel tracking and mapping for small ar workspaces. In IEEE and ACM international symposium on mixed and augmented reality (pp. 225\u2013234). IEEE.","DOI":"10.1109\/ISMAR.2007.4538852"},{"key":"1484_CR38","doi-asserted-by":"crossref","unstructured":"Klingner, M., Term\u00f6hlen, J.-A., Mikolajczyk, J., & Fingscheidt, T. (2020). Self-supervised monocular depth estimation: Solving the dynamic object problem by semantic guidance. In European Conference on Computer Vision (ECCV) (pp. 582\u2013600). Springer.","DOI":"10.1007\/978-3-030-58565-5_35"},{"key":"1484_CR39","doi-asserted-by":"crossref","unstructured":"Kuznietsov, Y., Stuckler, J., & Leibe, B. (2017). Semi-supervised deep learning for monocular depth map prediction. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2017.238"},{"key":"1484_CR40","doi-asserted-by":"crossref","unstructured":"Laina, I., Rupprecht, C., Belagiannis, V., Tombari, F., & Navab, N. (2016). Deeper depth prediction with fully convolutional residual networks. In 3DV.","DOI":"10.1109\/3DV.2016.32"},{"key":"1484_CR41","doi-asserted-by":"crossref","unstructured":"Lee, S., Im, S., Lin, S., & Kweon, I.\u00a0S. (2021). Learning monocular depth in dynamic scenes via instance-aware projection consistency. In Proceedings of the AAAI Conference on Artificial Intelligence (AAAI).","DOI":"10.1609\/aaai.v35i3.16281"},{"key":"1484_CR42","unstructured":"Li, H., Gordon, A., Zhao, H., Casser, V., & Angelova, A. (2020). Unsupervised monocular depth learning in dynamic scenes. In Conference on Robot Learning."},{"key":"1484_CR43","doi-asserted-by":"crossref","unstructured":"Li, J., Klein, R., & Yao, A. (2017). A two-streamed network for estimating fine-scaled depth maps from single rgb images. In IEEE International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2017.365"},{"key":"1484_CR44","doi-asserted-by":"crossref","unstructured":"Li, R., Wang, S., Long, Z., & Gu, D. (2018). Undeepvo: Monocular visual odometry through unsupervised deep learning. In IEEE International Conference on Robotics and Automation (ICRA) (pp. 7286\u20137291). IEEE.","DOI":"10.1109\/ICRA.2018.8461251"},{"key":"1484_CR45","doi-asserted-by":"crossref","unstructured":"Li, Y., Ushiku, Y., & Harada, T. (2019a). Pose graph optimization for unsupervised monocular visual odometry. In IEEE International Conference on Robotics and Automation (ICRA) (pp. 5439\u20135445). IEEE.","DOI":"10.1109\/ICRA.2019.8793706"},{"key":"1484_CR46","doi-asserted-by":"crossref","unstructured":"Li, Z., Dekel, T., Cole, F., Tucker, R., Snavely, N., Liu, C., et\u00a0al. (2019b). Learning the depths of moving people by watching frozen people. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 4521\u20134530).","DOI":"10.1109\/CVPR.2019.00465"},{"key":"1484_CR47","doi-asserted-by":"crossref","unstructured":"Li, Z., & Snavely, N. (2018). Megadepth: Learning single-view depth prediction from internet photos. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 2041\u20132050).","DOI":"10.1109\/CVPR.2018.00218"},{"key":"1484_CR48","doi-asserted-by":"crossref","unstructured":"Liu, F., Shen, C., Lin, G., & Reid, I. (2016). Learning depth from single monocular images using deep convolutional neural fields. IEEE Transactions on Pattern Recognition and Machine Intelligence (TPAMI), 38(10).","DOI":"10.1109\/TPAMI.2015.2505283"},{"key":"1484_CR49","doi-asserted-by":"crossref","unstructured":"Loo, S.\u00a0Y., Amiri, A.\u00a0J., Mashohor, S., Tang, S.\u00a0H., & Zhang, H. (2019). Cnn-svo: Improving the mapping in semi-direct visual odometry using single-image depth prediction. In IEEE International Conference on Robotics and Automation (ICRA) (pp. 5218\u20135223). IEEE.","DOI":"10.1109\/ICRA.2019.8794425"},{"issue":"2","key":"1484_CR50","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D. G. (2004). Distinctive image features from scale-invariant keypoints. International Journal on Computer Vision (IJCV), 60(2), 91\u2013110.","journal-title":"International Journal on Computer Vision (IJCV)"},{"issue":"10","key":"1484_CR51","doi-asserted-by":"publisher","first-page":"2624","DOI":"10.1109\/TPAMI.2019.2930258","volume":"42","author":"C Luo","year":"2019","unstructured":"Luo, C., Yang, Z., Wang, P., Wang, Y., Xu, W., Nevatia, R., et al. (2019). Every pixel counts++: Joint learning of geometry and motion with 3d holistic understanding. IEEE Transactions on Pattern Recognition and Machine Intelligence (TPAMI), 42(10), 2624\u20132641.","journal-title":"IEEE Transactions on Pattern Recognition and Machine Intelligence (TPAMI)"},{"key":"1484_CR52","doi-asserted-by":"crossref","unstructured":"Luo, X., Huang, J.-B., Szeliski, R., Matzen, K., & Kopf, J. (2020). Consistent video depth estimation. ACM Transactions on Graphics (SIGGRAPH).","DOI":"10.1145\/3386569.3392377"},{"key":"1484_CR53","doi-asserted-by":"crossref","unstructured":"Mahjourian, R., Wicke, M., & Angelova, A. (2018). Unsupervised learning of depth and ego-motion from monocular video using 3d geometric constraints. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00594"},{"key":"1484_CR54","doi-asserted-by":"crossref","unstructured":"Menze, M., & Geiger, A. (2015). Object scene flow for autonomous vehicles. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 3061\u20133070).","DOI":"10.1109\/CVPR.2015.7298925"},{"key":"1484_CR55","doi-asserted-by":"crossref","unstructured":"Mur-Artal, R., Montiel, J. M. M., & Tardos, J. D. (2015). ORB-SLAM: a versatile and accurate monocular slam system. IEEE Transactions on Robotics (TRO), 31(5).","DOI":"10.1109\/TRO.2015.2463671"},{"key":"1484_CR56","doi-asserted-by":"crossref","unstructured":"Mur-Artal, R., & Tard\u00f3s, J.\u00a0D. (2014). Fast relocalisation and loop closing in keyframe-based slam. In IEEE International Conference on Robotics and Automation (ICRA) (pp. 846\u2013853). IEEE.","DOI":"10.1109\/ICRA.2014.6906953"},{"key":"1484_CR57","doi-asserted-by":"crossref","unstructured":"Mur-Artal, R., & Tard\u00f3s, J.\u00a0D. (2017). ORB-SLAM2: an open-source SLAM system for monocular, stereo and RGB-D cameras. IEEE Transactions on Robotics (TRO).","DOI":"10.1109\/TRO.2017.2705103"},{"key":"1484_CR58","unstructured":"Paszke, A., Gross, S., Chintala, S., Chanan, G., Yang, E., DeVito, Z., et\u00a0al. (2017). Automatic differentiation in pytorch. In NIPS-W."},{"key":"1484_CR59","doi-asserted-by":"crossref","unstructured":"Pillai, S., Ambru\u015f, R., & Gaidon, A. (2019). Superdepth: Self-supervised, super-resolved monocular depth estimation. In IEEE International Conference on Robotics and Automation (ICRA) (pp. 9250\u20139256). IEEE.","DOI":"10.1109\/ICRA.2019.8793621"},{"key":"1484_CR60","doi-asserted-by":"crossref","unstructured":"Pilzer, A., Xu, D., Puscas, M., Ricci, E., & Sebe, N. (2018). Unsupervised adversarial depth estimation using cycled generative networks. In International Conference on 3D Vision (3DV) (pp. 587\u2013595).","DOI":"10.1109\/3DV.2018.00073"},{"key":"1484_CR61","doi-asserted-by":"crossref","unstructured":"Poggi, M., Aleotti, F., Tosi, F., & Mattoccia, S. (2020). On the uncertainty of self-supervised monocular depth estimation. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR42600.2020.00329"},{"key":"1484_CR62","first-page":"00783","volume":"1708","author":"VA Prisacariu","year":"2017","unstructured":"Prisacariu, V. A., K\u00e4hler, O., Golodetz, S., Sapienza, M., Cavallari, T., Torr, P. H., et al. (2017). InfiniTAM v3: A Framework for Large-Scale 3D Reconstruction with Loop Closure. ArXiv e-prints., 1708, 00783.","journal-title":"ArXiv e-prints."},{"key":"1484_CR63","doi-asserted-by":"crossref","unstructured":"Ranftl, R., Lasinger, K., Hafner, D., Schindler, K., & Koltun, V. (2020). Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer. IEEE Transactions on Pattern Recognition and Machine Intelligence (TPAMI).","DOI":"10.1109\/TPAMI.2020.3019967"},{"key":"1484_CR64","doi-asserted-by":"crossref","unstructured":"Ranjan, A., Jampani, V., Kim, K., Sun, D., Wulff, J., & Black, M.\u00a0J. (2019). Competitive Collaboration: Joint unsupervised learning of depth, camera motion, optical flow and motion segmentation. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2019.01252"},{"key":"1484_CR65","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., & Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation. In International Conference on Medical Image Computing and Computer-Assisted Intervention (MICCAI). Springer.","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"1484_CR66","doi-asserted-by":"crossref","unstructured":"Rublee, E., Rabaud, V., Konolige, K., & Bradski, G.\u00a0R. (2011). Orb: An efficient alternative to sift or surf. In IEEE International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2011.6126544"},{"key":"1484_CR67","unstructured":"Saxena, A., Chung, S.\u00a0H., & Ng, A.\u00a0Y. (2006). Learning depth from single monocular images. In Neural Information Processing Systems (NeurIPS)."},{"key":"1484_CR68","doi-asserted-by":"crossref","unstructured":"Schonberger, J.\u00a0L., & Frahm, J.-M. (2016). Structure-from-motion revisited. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 4104\u20134113).","DOI":"10.1109\/CVPR.2016.445"},{"key":"1484_CR69","doi-asserted-by":"crossref","unstructured":"Sch\u00f6nberger, J.\u00a0L., Zheng, E., Pollefeys, M., & Frahm, J.-M. (2016). Pixelwise view selection for unstructured multi-view stereo. In European Conference on Computer Vision (ECCV).","DOI":"10.1007\/978-3-319-46487-9_31"},{"key":"1484_CR70","doi-asserted-by":"crossref","unstructured":"Shen, T., Luo, Z., Zhou, L., Deng, H., Zhang, R., Fang, T., et\u00a0al. (2019). Beyond photometric loss for self-supervised ego-motion estimation. In IEEE International Conference on Robotics and Automation (ICRA) (pp. 6359\u20136365). IEEE.","DOI":"10.1109\/ICRA.2019.8793479"},{"key":"1484_CR71","doi-asserted-by":"crossref","unstructured":"Silberman, N., Hoiem, D., Kohli, P., & Fergus, R. (2012). Indoor segmentation and support inference from rgbd images. In European Conference on Computer Vision (ECCV).","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"1484_CR72","doi-asserted-by":"crossref","unstructured":"Sturm, J., Engelhard, N., Endres, F., Burgard, W., & Cremers, D. (2012). A benchmark for the evaluation of rgb-d slam systems. In IEEE International Conference on Intelligent Robots and Systems (IROS).","DOI":"10.1109\/IROS.2012.6385773"},{"key":"1484_CR73","doi-asserted-by":"crossref","unstructured":"Tateno, K., Tombari, F., Laina, I., & Navab, N. (2017). Cnn-slam: Real-time dense monocular slam with learned depth prediction. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 6243\u20136252).","DOI":"10.1109\/CVPR.2017.695"},{"key":"1484_CR74","doi-asserted-by":"crossref","unstructured":"Tiwari, L., Ji, P., Tran, Q.-H., Zhuang, B., Anand, S., & Chandraker, M. (2020). Pseudo rgb-d for self-improving monocular slam and depth prediction. In European Conference on Computer Vision (ECCV) (pp. 437\u2013455). Springer.","DOI":"10.1007\/978-3-030-58621-8_26"},{"key":"1484_CR75","unstructured":"Vijayanarasimhan, S., Ricco, S., Schmid, C., Sukthankar, R., & Fragkiadaki, K. (2017). Sfm-net: Learning of structure and motion from video. arXiv preprintarXiv:1704.07804."},{"key":"1484_CR76","doi-asserted-by":"crossref","unstructured":"Wang, C., Lucey, S., Perazzi, F., & Wang, O. (2019). Web stereo video supervision for depth prediction from dynamic scenes. In International Conference on 3D Vision (3DV) (pp. 348\u2013357). IEEE.","DOI":"10.1109\/3DV.2019.00046"},{"key":"1484_CR77","doi-asserted-by":"crossref","unstructured":"Wang, C., Miguel\u00a0Buenaposada, J., Zhu, R., & Lucey, S. (2018). Learning depth from monocular videos using direct methods. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00216"},{"key":"1484_CR78","doi-asserted-by":"crossref","unstructured":"Wang, P., Shen, X., Lin, Z., Cohen, S., Price, B., & Yuille, A.\u00a0L. (2015). Towards unified depth and semantic prediction from a single image. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2015.7298897"},{"key":"1484_CR79","doi-asserted-by":"crossref","unstructured":"Wang, Z., Bovik, A. C., Sheikh, H. R., Simoncelli, E. P., et al. (2004). Image Quality Assessment: from error visibility to structural similarity. IEEE Transactions on Image Processing (TIP), 13(4).","DOI":"10.1109\/TIP.2003.819861"},{"key":"1484_CR80","doi-asserted-by":"crossref","unstructured":"Xian, K., Shen, C., Cao, Z., Lu, H., Xiao, Y., Li, R., et\u00a0al. (2018). Monocular relative depth perception with web stereo data supervision. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 311\u2013320).","DOI":"10.1109\/CVPR.2018.00040"},{"key":"1484_CR81","doi-asserted-by":"crossref","unstructured":"Yang, N., Stumberg, L.\u00a0v., Wang, R., & Cremers, D. (2020). D3vo: Deep depth, deep pose and deep uncertainty for monocular visual odometry. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (pp. 1281\u20131292).","DOI":"10.1109\/CVPR42600.2020.00136"},{"key":"1484_CR82","doi-asserted-by":"crossref","unstructured":"Yang, N., Wang, R., Stuckler, J., & Cremers, D. (2018a). Deep virtual stereo odometry: Leveraging deep depth prediction for monocular direct sparse odometry. In European Conference on Computer Vision (ECCV).","DOI":"10.1007\/978-3-030-01237-3_50"},{"key":"1484_CR83","doi-asserted-by":"crossref","unstructured":"Yang, Z., Wang, P., Xu, W., Zhao, L., & Nevatia, R. (2018b). Unsupervised learning of geometry with edge-aware depth-normal consistency. In Association for the Advancement of Artificial Intelligence (AAAI).","DOI":"10.1609\/aaai.v32i1.12257"},{"key":"1484_CR84","doi-asserted-by":"crossref","unstructured":"Yin, W., Liu, Y., Shen, C., & Yan, Y. (2019). Enforcing geometric constraints of virtual normal for depth prediction. In IEEE International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2019.00578"},{"key":"1484_CR85","unstructured":"Yin, W., Zhang, J., Wang, O., Niklaus, S., Mai, L., Chen, S., et\u00a0al. (2020). Learning to recover 3d scene shape from a single image. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"1484_CR86","doi-asserted-by":"crossref","unstructured":"Yin, X., Wang, X., Du, X., & Chen, Q. (2017). Scale recovery for monocular visual odometry using depth estimated with deep convolutional neural fields. In IEEE International Conference on Computer Vision (ICCV) (pp. 5870\u20135878).","DOI":"10.1109\/ICCV.2017.625"},{"key":"1484_CR87","doi-asserted-by":"crossref","unstructured":"Yin, Z., & Shi, J. (2018). GeoNet: Unsupervised learning of dense depth, optical flow and camera pose. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00212"},{"key":"1484_CR88","doi-asserted-by":"crossref","unstructured":"Zhan, H., Garg, R., Saroj\u00a0Weerasekera, C., Li, K., Agarwal, H., & Reid, I. (2018). Unsupervised learning of monocular depth estimation and visual odometry with deep feature reconstruction. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2018.00043"},{"issue":"2","key":"1484_CR89","doi-asserted-by":"publisher","first-page":"161","DOI":"10.1023\/A:1007941100561","volume":"27","author":"Z Zhang","year":"1998","unstructured":"Zhang, Z. (1998). Determining the epipolar geometry and its uncertainty: A review. International Journal on Computer Vision (IJCV), 27(2), 161\u2013195.","journal-title":"International Journal on Computer Vision (IJCV)"},{"key":"1484_CR90","doi-asserted-by":"crossref","unstructured":"Zhao, W., Liu, S., Shu, Y., & Liu, Y.-J. (2020). Towards better generalization: Joint depth-pose learning without posenet. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR42600.2020.00917"},{"key":"1484_CR91","doi-asserted-by":"crossref","unstructured":"Zhou, J., Wang, Y., Qin, K., & Zeng, W. (2019). Moving indoor: Unsupervised video depth learning in challenging environments. In IEEE International Conference on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2019.00871"},{"key":"1484_CR92","unstructured":"Zhou, Q.-Y., Park, J., & Koltun, V. (2018). Open3D: A modern library for 3D data processing. arXiv:1801.09847."},{"key":"1484_CR93","doi-asserted-by":"crossref","unstructured":"Zhou, T., Brown, M., Snavely, N., & Lowe, D.\u00a0G. (2017). Unsupervised learning of depth and ego-motion from video. In IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2017.700"},{"key":"1484_CR94","doi-asserted-by":"crossref","unstructured":"Zou, Y., Ji, P., Tran, Q.-H., Huang, J.-B., & Chandraker, M. (2020). Learning monocular visual odometry via self-supervised long-term modeling. In European Conference on Computer Vision (ECCV).","DOI":"10.1007\/978-3-030-58568-6_42"},{"key":"1484_CR95","doi-asserted-by":"crossref","unstructured":"Zou, Y., Luo, Z., & Huang, J.-B. (2018). DF-Net: Unsupervised joint learning of depth and flow using cross-task consistency. In European Conference on Computer Vision (ECCV).","DOI":"10.1007\/978-3-030-01228-1_3"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-021-01484-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-021-01484-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-021-01484-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,12,31]],"date-time":"2022-12-31T16:13:06Z","timestamp":1672503186000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-021-01484-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,6,18]]},"references-count":95,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2021,9]]}},"alternative-id":["1484"],"URL":"https:\/\/doi.org\/10.1007\/s11263-021-01484-6","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,6,18]]},"assertion":[{"value":"7 September 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 May 2021","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 June 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}