{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,27]],"date-time":"2025-03-27T19:42:00Z","timestamp":1743104520300,"version":"3.40.3"},"publisher-location":"Singapore","reference-count":33,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819607761"},{"type":"electronic","value":"9789819607778"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-981-96-0777-8_23","type":"book-chapter","created":{"date-parts":[[2025,2,4]],"date-time":"2025-02-04T13:56:48Z","timestamp":1738677408000},"page":"319-331","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["A Monocular Visual Odometry Model Based on\u00a0Transformer Using Shifted Windows"],"prefix":"10.1007","author":[{"given":"Jiaqi","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jituo","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wentang","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tingxi","family":"Xue","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jialu","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,2,5]]},"reference":[{"key":"23_CR1","doi-asserted-by":"crossref","unstructured":"DeTone, D., Malisiewicz, T., Rabinovich, A.: Superpoint: self-supervised interest point detection and description. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition Workshops, pp. 224\u2013236 (2018)","DOI":"10.1109\/CVPRW.2018.00060"},{"key":"23_CR2","unstructured":"Dosovitskiy, A., et\u00a0al.: An image is worth 16x16 words: transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)"},{"key":"23_CR3","doi-asserted-by":"crossref","unstructured":"Forster, C., Pizzoli, M., Scaramuzza, D.: SVO: fast semi-direct monocular visual odometry. In: 2014 IEEE International Conference on Robotics and Automation (ICRA), pp. 15\u201322. IEEE (2014)","DOI":"10.1109\/ICRA.2014.6906584"},{"key":"23_CR4","unstructured":"Fran\u00e7ani, A.O., Maximo, M.R.: Transformer-based model for monocular visual odometry: a video understanding approach. arXiv preprint arXiv:2305.06121 (2023)"},{"key":"23_CR5","doi-asserted-by":"crossref","unstructured":"Geiger, A., Lenz, P., Urtasun, R.: Are we ready for autonomous driving? the kitti vision benchmark suite. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition, pp. 3354\u20133361. IEEE (2012)","DOI":"10.1109\/CVPR.2012.6248074"},{"key":"23_CR6","doi-asserted-by":"crossref","unstructured":"Geiger, A., Ziegler, J., Stiller, C.: Stereoscan: dense 3d reconstruction in real-time. In: 2011 IEEE Intelligent Vehicles Symposium (IV), pp. 963\u2013968. IEEE (2011)","DOI":"10.1109\/IVS.2011.5940405"},{"key":"23_CR7","doi-asserted-by":"crossref","unstructured":"Godard, C., Mac\u00a0Aodha, O., Firman, M., Brostow, G.J.: Digging into self-supervised monocular depth estimation. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 3828\u20133838 (2019)","DOI":"10.1109\/ICCV.2019.00393"},{"key":"23_CR8","doi-asserted-by":"crossref","unstructured":"Henein, M., Zhang, J., Mahony, R., Ila, V.: Dynamic slam: the need for speed. In: 2020 IEEE International Conference on Robotics and Automation (ICRA), pp. 2123\u20132129. IEEE (2020)","DOI":"10.1109\/ICRA40945.2020.9196895"},{"key":"23_CR9","doi-asserted-by":"crossref","unstructured":"Ilg, E., Mayer, N., Saikia, T., Keuper, M., Dosovitskiy, A., Brox, T.: Flownet 2.0: evolution of optical flow estimation with deep networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2462\u20132470 (2017)","DOI":"10.1109\/CVPR.2017.179"},{"key":"23_CR10","doi-asserted-by":"crossref","unstructured":"Klein, G., Murray, D.: Parallel tracking and mapping for small AR workspaces. In: 2007 6th IEEE and ACM International Symposium on Mixed and Augmented Reality, pp. 225\u2013234. IEEE (2007)","DOI":"10.1109\/ISMAR.2007.4538852"},{"issue":"13","key":"23_CR11","doi-asserted-by":"publisher","first-page":"8031","DOI":"10.1007\/s00521-020-05545-8","volume":"33","author":"X Li","year":"2021","unstructured":"Li, X., Hou, Y., Wang, P., Gao, Z., Xu, M., Li, W.: Transformer guided geometry model for flow-based unsupervised visual odometry. Neural Comput. Appl. 33(13), 8031\u20138042 (2021). https:\/\/doi.org\/10.1007\/s00521-020-05545-8","journal-title":"Neural Comput. Appl."},{"key":"23_CR12","doi-asserted-by":"crossref","unstructured":"Liu, Z., et al.: Swin transformer: hierarchical vision transformer using shifted windows. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 10012\u201310022 (2021)","DOI":"10.1109\/ICCV48922.2021.00986"},{"issue":"5","key":"23_CR13","doi-asserted-by":"publisher","first-page":"1255","DOI":"10.1109\/TRO.2017.2705103","volume":"33","author":"R Mur-Artal","year":"2017","unstructured":"Mur-Artal, R., Tard\u00f3s, J.D.: Orb-slam2: an open-source slam system for monocular, stereo, and RGB-D cameras. IEEE Trans. Rob. 33(5), 1255\u20131262 (2017)","journal-title":"IEEE Trans. Rob."},{"key":"23_CR14","doi-asserted-by":"crossref","unstructured":"Newcombe, R.A., Lovegrove, S.J., Davison, A.J.: DTAM: dense tracking and mapping in real-time. In: 2011 International Conference on Computer Vision, pp. 2320\u20132327. IEEE (2011)","DOI":"10.1109\/ICCV.2011.6126513"},{"key":"23_CR15","doi-asserted-by":"crossref","unstructured":"Saputra, M.R.U., De\u00a0Gusmao, P.P., Wang, S., Markham, A., Trigoni, N.: Learning monocular visual odometry through geometry-aware curriculum learning. In: 2019 International Conference on Robotics and Automation (ICRA), pp. 3549\u20133555. IEEE (2019)","DOI":"10.1109\/ICRA.2019.8793581"},{"issue":"4","key":"23_CR16","doi-asserted-by":"publisher","first-page":"80","DOI":"10.1109\/MRA.2011.943233","volume":"18","author":"D Scaramuzza","year":"2011","unstructured":"Scaramuzza, D., Fraundorfer, F.: Visual odometry [tutorial]. IEEE Robot. Automat. Magaz. 18(4), 80\u201392 (2011)","journal-title":"IEEE Robot. Automat. Magaz."},{"key":"23_CR17","doi-asserted-by":"crossref","unstructured":"Shen, T., et al.: Beyond photometric loss for self-supervised ego-motion estimation. In: 2019 International Conference on Robotics and Automation (ICRA), pp. 6359\u20136365. IEEE (2019)","DOI":"10.1109\/ICRA.2019.8793479"},{"key":"23_CR18","doi-asserted-by":"publisher","first-page":"86","DOI":"10.1016\/j.neucom.2023.02.014","volume":"533","author":"R Song","year":"2023","unstructured":"Song, R., Zhu, R., Xiao, Z., Yan, B.: Contextavo: local context guided and refining poses for deep visual odometry. Neurocomputing 533, 86\u2013103 (2023)","journal-title":"Neurocomputing"},{"key":"23_CR19","unstructured":"Sukhbaatar, S., Weston, J., Fergus, R., et\u00a0al.: End-to-end memory networks. Adv. Neural Inf. Process. Syst. 28 (2015)"},{"key":"23_CR20","doi-asserted-by":"crossref","unstructured":"Tateno, K., Tombari, F., Laina, I., Navab, N.: CNN-slam: real-time dense monocular slam with learned depth prediction. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6243\u20136252 (2017)","DOI":"10.1109\/CVPR.2017.695"},{"key":"23_CR21","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"402","DOI":"10.1007\/978-3-030-58536-5_24","volume-title":"Computer Vision \u2013 ECCV 2020","author":"Z Teed","year":"2020","unstructured":"Teed, Z., Deng, J.: RAFT: recurrent all-pairs field transforms for optical flow. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12347, pp. 402\u2013419. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58536-5_24"},{"key":"23_CR22","first-page":"16558","volume":"34","author":"Z Teed","year":"2021","unstructured":"Teed, Z., Deng, J.: Droid-slam: deep visual slam for monocular, stereo, and RGB-D cameras. Adv. Neural. Inf. Process. Syst. 34, 16558\u201316569 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"23_CR23","doi-asserted-by":"crossref","unstructured":"Wang, R., Schworer, M., Cremers, D.: Stereo DSO: large-scale direct sparse visual odometry with stereo cameras. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 3903\u20133911 (2017)","DOI":"10.1109\/ICCV.2017.421"},{"key":"23_CR24","doi-asserted-by":"crossref","unstructured":"Wang, S., Clark, R., Wen, H., Trigoni, N.: Deepvo: towards end-to-end visual odometry with deep recurrent convolutional neural networks. In: 2017 IEEE International Conference on Robotics and Automation (ICRA), pp. 2043\u20132050. IEEE (2017)","DOI":"10.1109\/ICRA.2017.7989236"},{"key":"23_CR25","unstructured":"Wang, W., Hu, Y., Scherer, S.: Tartanvo: a generalizable learning-based vo. In: Conference on Robot Learning, pp. 1761\u20131772. PMLR (2021)"},{"key":"23_CR26","doi-asserted-by":"crossref","unstructured":"Wang, W., et al.: Tartanair: a dataset to push the limits of visual slam. In: 2020 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 4909\u20134916. IEEE (2020)","DOI":"10.1109\/IROS45743.2020.9341801"},{"key":"23_CR27","doi-asserted-by":"crossref","unstructured":"Yang, N., Wang, R., Stuckler, J., Cremers, D.: Deep virtual stereo odometry: leveraging deep depth prediction for monocular direct sparse odometry. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 817\u2013833 (2018)","DOI":"10.1007\/978-3-030-01237-3_50"},{"key":"23_CR28","doi-asserted-by":"crossref","unstructured":"Yin, X., Wang, X., Du, X., Chen, Q.: Scale recovery for monocular visual odometry using depth estimated with deep convolutional neural fields. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 5870\u20135878 (2017)","DOI":"10.1109\/ICCV.2017.625"},{"key":"23_CR29","doi-asserted-by":"crossref","unstructured":"Yin, Z., Shi, J.: Geonet: unsupervised learning of dense depth, optical flow and camera pose. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1983\u20131992 (2018)","DOI":"10.1109\/CVPR.2018.00212"},{"key":"23_CR30","unstructured":"Zhan, H., Weerasekera, C.S., Bian, J.W., Garg, R., Reid, I.: Df-vo: what should be learnt for visual odometry? arXiv preprint arXiv:2103.00933 (2021)"},{"key":"23_CR31","doi-asserted-by":"crossref","unstructured":"Zhou, H., Ummenhofer, B., Brox, T.: Deeptam: deep tracking and mapping. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 822\u2013838 (2018)","DOI":"10.1007\/978-3-030-01270-0_50"},{"key":"23_CR32","doi-asserted-by":"crossref","unstructured":"Zhou, T., Brown, M., Snavely, N., Lowe, D.G.: Unsupervised learning of depth and ego-motion from video. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1851\u20131858 (2017)","DOI":"10.1109\/CVPR.2017.700"},{"key":"23_CR33","doi-asserted-by":"publisher","first-page":"22","DOI":"10.1016\/j.neucom.2021.09.029","volume":"467","author":"R Zhu","year":"2022","unstructured":"Zhu, R., Yang, M., Liu, W., Song, R., Yan, B., Xiao, Z.: Deepavo: efficient pose refining with feature distilling for deep visual odometry. Neurocomputing 467, 22\u201335 (2022)","journal-title":"Neurocomputing"}],"container-title":["Lecture Notes in Computer Science","Intelligent Robotics and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-96-0777-8_23","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,4]],"date-time":"2025-02-04T13:57:16Z","timestamp":1738677436000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-96-0777-8_23"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9789819607761","9789819607778"],"references-count":33,"URL":"https:\/\/doi.org\/10.1007\/978-981-96-0777-8_23","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"5 February 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"We declare that we have none commercial or associative interest that represents a conflict of interest connecting to the work we are submitting.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Disclosure of Interests"}},{"value":"ICIRA","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Intelligent Robotics and Applications","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Xi'an","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"31 July 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2 August 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"17","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icira2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.icira2024.org","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}