{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,26]],"date-time":"2025-12-26T11:17:26Z","timestamp":1766747846746,"version":"3.41.0"},"reference-count":39,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2017,11,24]],"date-time":"2017-11-24T00:00:00Z","timestamp":1511481600000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100004543","name":"China Scholarship Council","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004543","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Cogn Comput"],"published-print":{"date-parts":[[2018,4]]},"DOI":"10.1007\/s12559-017-9526-9","type":"journal-article","created":{"date-parts":[[2017,11,24]],"date-time":"2017-11-24T22:55:00Z","timestamp":1511564100000},"page":"260-271","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":22,"title":["Semantic Scene Mapping with Spatio-temporal Deep Neural Network for Robotic Applications"],"prefix":"10.1007","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9839-1489","authenticated-orcid":false,"given":"Ruihao","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dongbing","family":"Gu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiqiang","family":"Long","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Huosheng","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,11,24]]},"reference":[{"key":"9526_CR1","doi-asserted-by":"crossref","unstructured":"Szegedy C, Liu W, Jia Y, Sermanet P, Reed S, Anguelov D, Erhan D, Vanhoucke V, Rabinovich A. Going deeper with convolutions. Proceedings of the IEEE conference on computer vision and pattern recognition; 2015. p. 1\u20139.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"9526_CR2","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J. Deep residual learning for image recognition. Proceedings of the IEEE conference on computer vision and pattern recognition; 2016. p. 770\u20138.","DOI":"10.1109\/CVPR.2016.90"},{"key":"9526_CR3","doi-asserted-by":"crossref","unstructured":"Long J, Shelhamer E, Darrell T. Fully convolutional networks for semantic segmentation. Proceedings of the IEEE conference on computer vision and pattern recognition; 2015. p. 3431\u201340.","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"9526_CR4","doi-asserted-by":"crossref","unstructured":"Zhao H, Shi J, Qi X, Wang X, Jia J. 2016. Pyramid scene parsing network. arXiv: 1612.01105 .","DOI":"10.1109\/CVPR.2017.660"},{"issue":"2","key":"9526_CR5","doi-asserted-by":"crossref","first-page":"99","DOI":"10.1109\/MRA.2006.1638022","volume":"13","author":"H Durrant-Whyte","year":"2006","unstructured":"Durrant-Whyte H, Bailey T. Simultaneous localization and mapping: part I. IEEE Robot Autom Mag 2006; 13(2):99\u2013110.","journal-title":"IEEE Robot Autom Mag"},{"issue":"3","key":"9526_CR6","doi-asserted-by":"crossref","first-page":"108","DOI":"10.1109\/MRA.2006.1678144","volume":"13","author":"T Bailey","year":"2006","unstructured":"Bailey T, Durrant-Whyte H. Simultaneous localization and mapping: part II. IEEE Robot Autom Mag 2006; 13(3):108\u201317.","journal-title":"IEEE Robot Autom Mag"},{"issue":"2","key":"9526_CR7","doi-asserted-by":"crossref","first-page":"168","DOI":"10.1007\/s12559-016-9441-5","volume":"9","author":"J Xie","year":"2017","unstructured":"Xie J, Yu L, Zhu L, Chen X. Semantic image segmentation method with multiple adjacency trees and multiscale features. Cogn Comput 2017;9(2):168\u201379.","journal-title":"Cogn Comput"},{"key":"9526_CR8","unstructured":"Simonyan K, Zisserman A. Very deep convolutional networks for large-scale image recognition. Proceedings of the 3rd international conference on learning representations; 2015. p. 1\u201314."},{"key":"9526_CR9","unstructured":"Liu W, Rabinovich A, Berg AC. 2015. Parsenet: looking wider to see better. arXiv: 1506.04579 ."},{"key":"9526_CR10","unstructured":"Badrinarayanan V, Kendall A, Cipolla R. 2015. Segnet: a deep convolutional encoder-decoder architecture for image segmentation. arXiv: 1511.00561 ."},{"key":"9526_CR11","unstructured":"Kendall A, Badrinarayanan V, Cipolla R. 2015. Bayesian segnet: model uncertainty in deep convolutional encoder-decoder architectures for scene understanding. arXiv: 1511.02680 ."},{"key":"9526_CR12","doi-asserted-by":"crossref","unstructured":"Zheng S, Jayasumana S, Romera-Paredes B, Vineet V, Su Z, Du D, Huang C, Torr PH. Conditional random fields as recurrent neural networks. Proceedings of the IEEE international conference on computer vision; 2015. p. 1529\u201337.","DOI":"10.1109\/ICCV.2015.179"},{"key":"9526_CR13","doi-asserted-by":"crossref","unstructured":"Arnab A, Jayasumana S, Zheng S, Torr PH. Higher order conditional random fields in deep neural networks. European conference on computer vision. Springer; 2016. p. 524\u201340.","DOI":"10.1007\/978-3-319-46475-6_33"},{"key":"9526_CR14","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li L-J, Li K, Fei-Fei L. Imagenet: a large-scale hierarchical image database. IEEE conference on computer vision and pattern recognition, 2009. CVPR 2009. IEEE; 2009. p. 248\u201355.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"9526_CR15","unstructured":"Chen L-C, Papandreou G, Kokkinos I, Murphy K, Yuille AL. 2014. Semantic image segmentation with deep convolutional nets and fully connected CRFs. arXiv: 1412.7062 ."},{"key":"9526_CR16","unstructured":"Chen L-C, Papandreou G, Kokkinos I, Murphy K, Yuille AL. 2016. Deeplab: semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs. arXiv: 1606.00915 ."},{"key":"9526_CR17","doi-asserted-by":"crossref","unstructured":"Chen L-C, Yang Y, Wang J, Xu W, Yuille AL. Attention to scale: scale-aware semantic image segmentation. Proceedings of the IEEE conference on computer vision and pattern recognition; 2016. p. 3640\u20139.","DOI":"10.1109\/CVPR.2016.396"},{"issue":"1","key":"9526_CR18","doi-asserted-by":"crossref","first-page":"98","DOI":"10.1007\/s11263-014-0733-5","volume":"111","author":"M Everingham","year":"2015","unstructured":"Everingham M, Eslami SA, Van Gool L, Williams CK, Winn J, Zisserman A. The pascal visual object classes challenge: a retrospective. Int J Comput Vis 2015;111(1):98\u2013136.","journal-title":"Int J Comput Vis"},{"key":"9526_CR19","unstructured":"Wu Z, Shen C, Hengel AVD. 2016. High-performance semantic segmentation using very deep fully convolutional networks. arXiv: 1604.04339 ."},{"key":"9526_CR20","doi-asserted-by":"crossref","unstructured":"Cordts M, Omran M, Ramos S, Rehfeld T, Enzweiler M, Benenson R, Franke U, Roth S, Schiele B. The cityscapes dataset for semantic urban scene understanding. Proceedings of the IEEE conference on computer vision and pattern recognition; 2016. p. 3213\u201323.","DOI":"10.1109\/CVPR.2016.350"},{"key":"9526_CR21","unstructured":"Wu Z, Shen C, Hengel AVD. 2016. Wider or deeper: revisiting the resnet model for visual recognition. arXiv: 1611.10080 ."},{"key":"9526_CR22","doi-asserted-by":"crossref","unstructured":"Zhou B, Zhao H, Puig X, Fidler S, Barriuso A, Torralba A. 2016. Semantic understanding of scenes through the ade20k dataset. arXiv: 1608.05442 .","DOI":"10.1109\/CVPR.2017.544"},{"issue":"4","key":"9526_CR23","doi-asserted-by":"crossref","first-page":"629","DOI":"10.1007\/s12559-016-9387-7","volume":"8","author":"Z Tu","year":"2016","unstructured":"Tu Z, Abel A, Zhang L, Luo B, Hussain A. A new spatio-temporal saliency-based video object segmentation. Cogn Comput 2016;8(4):629\u2013647.","journal-title":"Cogn Comput"},{"key":"9526_CR24","doi-asserted-by":"crossref","unstructured":"Doborjeh ZG, Doborjeh MG, Kasabov N. Attentional bias pattern recognition in spiking neural networks from spatio-temporal EEG data. Cogn Comput, 2017:1\u201314.","DOI":"10.1109\/IJCNN.2018.8489748"},{"key":"9526_CR25","doi-asserted-by":"crossref","unstructured":"Wang S, Clark R, Wen H, Trigoni N. DeepVO: towards end-to-end visual odometry with deep recurrent convolutional neural networks. 2017 IEEE international conference on robotics and automation (ICRA). IEEE; 2017. p. 2043\u201350.","DOI":"10.1109\/ICRA.2017.7989236"},{"key":"9526_CR26","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y. 2015. Towards good practices for very deep two-stream convnets. arXiv: 1507.02159 ."},{"key":"9526_CR27","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y, Lin D, Tang X, Van Gool L. Temporal segment networks: towards good practices for deep action recognition. European conference on computer vision. Springer; 2016. p. 20\u201336.","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"9526_CR28","doi-asserted-by":"crossref","unstructured":"Li R, Liu Q, Gui J, Gu D, Hu H. 2017. Indoor relocalization in challenging environments with dual-stream convolutional neural networks. IEEE Trans Autom Sci Eng.","DOI":"10.1109\/TASE.2017.2664920"},{"key":"9526_CR29","doi-asserted-by":"crossref","unstructured":"Eitel A, Springenberg JT, Spinello L, Riedmiller M, Burgard W. Multimodal deep learning for robust RGB-d object recognition. 2015 IEEE\/RSJ international conference on intelligent robots and systems (IROS). IEEE; 2015. p. 681\u20137.","DOI":"10.1109\/IROS.2015.7353446"},{"key":"9526_CR30","doi-asserted-by":"crossref","unstructured":"Schwarz M, Schulz H, Behnke S. RGB-D object recognition and pose estimation based on pre-trained convolutional neural network features. 2015 IEEE international conference on robotics and automation (ICRA). IEEE; 2015. p. 1329\u201335.","DOI":"10.1109\/ICRA.2015.7139363"},{"key":"9526_CR31","doi-asserted-by":"crossref","unstructured":"Hazirbas C, Ma L, Domokos C, Cremers D. Fusenet: incorporating depth into semantic segmentation via fusion-based CNN architecture. Proceedings of ACCV; 2016.","DOI":"10.1007\/978-3-319-54181-5_14"},{"key":"9526_CR32","unstructured":"Valada A, Oliveira G, Brox T, Burgard W. Towards robust semantic segmentation using deep fusion. Robotics: science and systems (RSS 2016) workshop, are the sceptics right? Limits and potentials of deep learning in robotics; 2016."},{"key":"9526_CR33","doi-asserted-by":"crossref","unstructured":"Valada A, Vertens J, Dhall A, Burgard W. Adapnet: adaptive semantic segmentation in adverse environmental conditions. 2017 IEEE international conference on robotics and automation (ICRA). IEEE; 2017.","DOI":"10.1109\/ICRA.2017.7989540"},{"issue":"1","key":"9526_CR34","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/s12559-009-9030-y","volume":"2","author":"M H\u00fclse","year":"2010","unstructured":"H\u00fclse M, McBride S, Lee M. Fast learning mapping schemes for robotic hand\u2013eye coordination. Cogn Comput 2010;2(1):1\u201316.","journal-title":"Cogn Comput"},{"key":"9526_CR35","doi-asserted-by":"crossref","unstructured":"Salas-Moreno RF, Glocken B, Kelly PH, Davison AJ. Dense planar slam. 2014 IEEE international symposium on mixed and augmented reality (ISMAR). IEEE; 2014. p. 157\u201364.","DOI":"10.1109\/ISMAR.2014.6948422"},{"key":"9526_CR36","doi-asserted-by":"crossref","unstructured":"Salas-Moreno RF, Newcombe RA, Strasdat H, Kelly PH, Davison AJ. Slam++: simultaneous localisation and mapping at the level of objects. Proceedings of the IEEE conference on computer vision and pattern recognition; 2013. p. 1352\u20139.","DOI":"10.1109\/CVPR.2013.178"},{"key":"9526_CR37","doi-asserted-by":"crossref","unstructured":"Jia Y, Shelhamer E, Donahue J, Karayev S, Long J, Girshick R, Guadarrama S, Darrell T. Caffe: convolutional architecture for fast feature embedding. Proceedings of the ACM international conference on multimedia. ACM; 2014. p. 675\u20138.","DOI":"10.1145\/2647868.2654889"},{"key":"9526_CR38","doi-asserted-by":"crossref","unstructured":"Mur-Artal R, Tard\u00f3s JD. Fast relocalisation and loop closing in keyframe-based SLAM. 2014 IEEE international conference on robotics and automation (ICRA). IEEE; 2014. p. 846\u201353.","DOI":"10.1109\/ICRA.2014.6906953"},{"issue":"5","key":"9526_CR39","doi-asserted-by":"crossref","first-page":"1147","DOI":"10.1109\/TRO.2015.2463671","volume":"31","author":"R Mur-Artal","year":"2015","unstructured":"Mur-Artal R, Montiel J, Tardos JD. ORB-SLAM: a versatile and accurate monocular SLAM system. IEEE Trans Robot 2015;31(5):1147\u201363.","journal-title":"IEEE Trans Robot"}],"container-title":["Cognitive Computation"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s12559-017-9526-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s12559-017-9526-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s12559-017-9526-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,27]],"date-time":"2025-06-27T14:10:38Z","timestamp":1751033438000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s12559-017-9526-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,11,24]]},"references-count":39,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2018,4]]}},"alternative-id":["9526"],"URL":"https:\/\/doi.org\/10.1007\/s12559-017-9526-9","relation":{},"ISSN":["1866-9956","1866-9964"],"issn-type":[{"type":"print","value":"1866-9956"},{"type":"electronic","value":"1866-9964"}],"subject":[],"published":{"date-parts":[[2017,11,24]]}}}