{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,31]],"date-time":"2025-12-31T00:58:41Z","timestamp":1767142721693,"version":"build-2238731810"},"reference-count":50,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2024,4,15]],"date-time":"2024-04-15T00:00:00Z","timestamp":1713139200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,4,15]],"date-time":"2024-04-15T00:00:00Z","timestamp":1713139200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-024-19110-1","type":"journal-article","created":{"date-parts":[[2024,4,15]],"date-time":"2024-04-15T01:01:55Z","timestamp":1713142915000},"page":"5985-6003","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Cascading context enhancement network for RGB-D semantic segmentation"],"prefix":"10.1007","volume":"84","author":[{"given":"Xu","family":"Tang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-7427-6710","authenticated-orcid":false,"given":"Zejun","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yan","family":"Meng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianxiao","family":"Xie","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Changbing","family":"Tang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weichuan","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,4,15]]},"reference":[{"issue":"2","key":"19110_CR1","doi-asserted-by":"crossref","first-page":"4","DOI":"10.1109\/MMUL.2012.24","volume":"19","author":"Z Zhang","year":"2012","unstructured":"Zhang Z (2012) Microsoft kinect sensor and its effect. IEEE Multimed 19(2):4\u201310","journal-title":"IEEE Multimed"},{"key":"19110_CR2","unstructured":"Park SJ, Hong KS, Lee S (2017) Rdfnet: Rgb-d multi-level residual feature fusion for indoor semantic segmentation. In: Proceedings of the IEEE international conference on computer vision, pp 4980\u20134989"},{"key":"19110_CR3","doi-asserted-by":"crossref","first-page":"2313","DOI":"10.1109\/TIP.2021.3049332","volume":"30","author":"LZ Chen","year":"2021","unstructured":"Chen LZ, Lin Z, Wang Z et al (2021) Spatial information guided convolution for real-time rgbd semantic segmentation. IEEE Trans Image Process 30:2313\u20132324","journal-title":"IEEE Trans Image Process"},{"key":"19110_CR4","doi-asserted-by":"crossref","unstructured":"Cao J, Leng H, Lischinski D et\u00a0al (2021) Shapeconv: Shape-aware convolutional layer for indoor rgb-d semantic segmentation. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 7088\u20137097","DOI":"10.1109\/ICCV48922.2021.00700"},{"issue":"24","key":"19110_CR5","doi-asserted-by":"crossref","first-page":"24161","DOI":"10.1109\/JSEN.2022.3218601","volume":"22","author":"P Wu","year":"2022","unstructured":"Wu P, Guo R, Tong X et al (2022) Link-rgbd: Cross-guided feature fusion network for rgbd semantic segmentation. IEEE Sens J 22(24):24161\u201324175","journal-title":"IEEE Sens J"},{"key":"19110_CR6","doi-asserted-by":"crossref","first-page":"102082","DOI":"10.1016\/j.displa.2021.102082","volume":"70","author":"X Yan","year":"2021","unstructured":"Yan X, Hou S, Karim A et al (2021) Rafnet: Rgb-d attention feature fusion network for indoor semantic segmentation. Displays 70:102082","journal-title":"Displays"},{"key":"19110_CR7","doi-asserted-by":"publisher","unstructured":"Yang Y, Xu Y, Zhang C et\u00a0al (2022) Hierarchical vision transformer with channel attention for rgb-d image segmentation. In: Proceedings of the 4th international symposium on signal processing systems. Association for Computing Machinery, New York, NY, USA, SSPS \u201922, p 68-73. https:\/\/doi.org\/10.1145\/3532342.3532352","DOI":"10.1145\/3532342.3532352"},{"key":"19110_CR8","doi-asserted-by":"crossref","unstructured":"Fischedick SB, Seichter D, Schmidt R et\u00a0al (2023) Efficient multi-task scene analysis with rgb-d transformers. arXiv:2306.05242","DOI":"10.1109\/IJCNN54540.2023.10191977"},{"key":"19110_CR9","doi-asserted-by":"crossref","unstructured":"Girdhar R, Singh M, Ravi N et\u00a0al (2022) Omnivore: A single model for many visual modalities. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 16102\u201316112","DOI":"10.1109\/CVPR52688.2022.01563"},{"issue":"25","key":"19110_CR10","doi-asserted-by":"crossref","first-page":"35831","DOI":"10.1007\/s11042-021-11555-y","volume":"81","author":"N Yang","year":"2022","unstructured":"Yang N, Zhang C, Zhang Y et al (2022) A benchmark dataset and baseline model for co-salient object detection within rgb-d images. Multimed Tools Appl 81(25):35831\u201335842","journal-title":"Multimed Tools Appl"},{"key":"19110_CR11","doi-asserted-by":"crossref","unstructured":"Chen Y, Ni J, Tang G et\u00a0al (2023) An improved dense-to-sparse cross-modal fusion network for 3d object detection in rgb-d images. Multimedia Tools and Applications, pp 1\u201326","DOI":"10.1007\/s11042-023-15845-5"},{"key":"19110_CR12","doi-asserted-by":"crossref","unstructured":"Chen X, Lin KY, Wang J et\u00a0al (2020) Bi-directional cross-modality feature propagation with separation-and-aggregation gate for rgb-d semantic segmentation","DOI":"10.1007\/978-3-030-58621-8_33"},{"key":"19110_CR13","doi-asserted-by":"crossref","unstructured":"Hazirbas C, Ma L, Domokos C et\u00a0al (2017) Fusenet: Incorporating depth into semantic segmentation via fusion-based cnn architecture. In: Computer vision\u2013ACCV 2016: 13th Asian Conference on Computer Vision, Taipei, Taiwan, November 20-24, 2016, Revised Selected Papers, Part I 13, Springer, pp 213\u2013228","DOI":"10.1007\/978-3-319-54181-5_14"},{"key":"19110_CR14","unstructured":"Jiang J, Zheng L, Luo F et\u00a0al (2018) Rednet: Residual encoder-decoder network for indoor rgb-d semantic segmentation. arXiv:1806.01054"},{"issue":"21","key":"19110_CR15","doi-asserted-by":"crossref","first-page":"8520","DOI":"10.3390\/s22218520","volume":"22","author":"L Zhu","year":"2022","unstructured":"Zhu L, Kang Z, Zhou M et al (2022) Cmanet: Cross-modality attention network for indoor-scene semantic segmentation. Sensors 22(21):8520","journal-title":"Sensors"},{"key":"19110_CR16","doi-asserted-by":"crossref","first-page":"658","DOI":"10.1109\/LSP.2021.3066071","volume":"28","author":"G Zhang","year":"2021","unstructured":"Zhang G, Xue JH, Xie P et al (2021) Non-local aggregation for rgb-d semantic segmentation. IEEE Signal Process Lett 28:658\u2013662","journal-title":"IEEE Signal Process Lett"},{"key":"19110_CR17","doi-asserted-by":"crossref","unstructured":"Hu X, Yang K, Fei L, et\u00a0al (2019) Acnet: Attention based network to exploit complementary features for rgbd semantic segmentation. In: 2019 IEEE International conference on image processing (ICIP). IEEE, pp 1440\u20131444","DOI":"10.1109\/ICIP.2019.8803025"},{"key":"19110_CR18","doi-asserted-by":"publisher","unstructured":"Zhou H, Qi L, Huang H et\u00a0al (2022) Canet: Co-attention network for rgb-d semantic segmentation. Pattern Recognition 124:108468. https:\/\/doi.org\/10.1016\/j.patcog.2021.108468. https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0031320321006440","DOI":"10.1016\/j.patcog.2021.108468"},{"key":"19110_CR19","doi-asserted-by":"crossref","first-page":"126389","DOI":"10.1016\/j.neucom.2023.126389","volume":"548","author":"Q Zhao","year":"2023","unstructured":"Zhao Q, Wan Y, Xu J et al (2023) Cross-modal attention fusion network for rgb-d semantic segmentation. Neurocomputing 548:126389","journal-title":"Neurocomputing"},{"issue":"1","key":"19110_CR20","doi-asserted-by":"crossref","first-page":"263","DOI":"10.1109\/TITS.2017.2750080","volume":"19","author":"E Romera","year":"2017","unstructured":"Romera E, Alvarez JM, Bergasa LM et al (2017) Erfnet: Efficient residual factorized convnet for real-time semantic segmentation. IEEE Trans IntellTrans Syst 19(1):263\u2013272","journal-title":"IEEE Trans IntellTrans Syst"},{"key":"19110_CR21","doi-asserted-by":"crossref","unstructured":"Shetty R, Schiele B, Fritz M (2019) Not using the car to see the sidewalk\u2013quantifying and controlling the effects of context in classification and segmentation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 8218\u20138226","DOI":"10.1109\/CVPR.2019.00841"},{"key":"19110_CR22","unstructured":"Liu W, Rabinovich A, Berg AC (2015) Parsenet: Looking wider to see better. arXiv:1506.04579"},{"key":"19110_CR23","doi-asserted-by":"crossref","unstructured":"Zhao H, Shi J, Qi X et\u00a0al (2017) Pyramid scene parsing network. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2881\u20132890","DOI":"10.1109\/CVPR.2017.660"},{"issue":"4","key":"19110_CR24","doi-asserted-by":"crossref","first-page":"834","DOI":"10.1109\/TPAMI.2017.2699184","volume":"40","author":"LC Chen","year":"2017","unstructured":"Chen LC, Papandreou G, Kokkinos I et al (2017) Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs. IEEE Trans Pattern Anal Mach Intell 40(4):834\u2013848","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"8","key":"19110_CR25","doi-asserted-by":"crossref","first-page":"2375","DOI":"10.1007\/s11263-021-01465-9","volume":"129","author":"Y Yuan","year":"2021","unstructured":"Yuan Y, Huang L, Guo J et al (2021) Ocnet: Object context for semantic segmentation. Int J Comput Vis 129(8):2375\u20132398","journal-title":"Int J Comput Vis"},{"key":"19110_CR26","doi-asserted-by":"crossref","unstructured":"Fu J, Liu J, Tian H et\u00a0al (2019) Dual attention network for scene segmentation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 3146\u20133154","DOI":"10.1109\/CVPR.2019.00326"},{"key":"19110_CR27","doi-asserted-by":"crossref","unstructured":"Chen LC, Zhu Y, Papandreou G et\u00a0al (2018) Encoder-decoder with atrous separable convolution for semantic image segmentation. In: Proceedings of the European conference on computer vision (ECCV), pp 801\u2013818","DOI":"10.1007\/978-3-030-01234-2_49"},{"key":"19110_CR28","doi-asserted-by":"crossref","unstructured":"Lin D, Shen D, Shen S et\u00a0al (2019) Zigzagnet: Fusing top-down and bottom-up context for object segmentation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 7490\u20137499","DOI":"10.1109\/CVPR.2019.00767"},{"key":"19110_CR29","doi-asserted-by":"crossref","unstructured":"Zhang H, Zhang H, Wang C et\u00a0al (2019) Co-occurrent features in semantic segmentation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 548\u2013557","DOI":"10.1109\/CVPR.2019.00064"},{"key":"19110_CR30","doi-asserted-by":"crossref","unstructured":"Li K, Hariharan B, Malik J (2016) Iterative instance segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3659\u20133667","DOI":"10.1109\/CVPR.2016.398"},{"key":"19110_CR31","doi-asserted-by":"crossref","unstructured":"Yuan Y, Chen X, Wang J (2020) Object-contextual representations for semantic segmentation. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part VI 16, Springer, pp 173\u2013190","DOI":"10.1007\/978-3-030-58539-6_11"},{"key":"19110_CR32","unstructured":"Vaswani A, Shazeer N, Parmar N et\u00a0al (2017) Attention is all you need. Advances in neural information processing systems 30"},{"key":"19110_CR33","doi-asserted-by":"crossref","unstructured":"Wang X, Girshick R, Gupta A et\u00a0al (2018) Non-local neural networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 7794\u20137803","DOI":"10.1109\/CVPR.2018.00813"},{"key":"19110_CR34","doi-asserted-by":"crossref","unstructured":"Woo S, Park J, Lee JY, et\u00a0al (2018) Cbam: Convolutional block attention module. In: Proceedings of the European conference on computer vision (ECCV), pp 3\u201319","DOI":"10.1007\/978-3-030-01234-2_1"},{"key":"19110_CR35","doi-asserted-by":"crossref","unstructured":"Hu J, Shen L, Sun G (2018) Squeeze-and-excitation networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 7132\u20137141","DOI":"10.1109\/CVPR.2018.00745"},{"key":"19110_CR36","doi-asserted-by":"crossref","unstructured":"Qin Z, Zhang P, Wu F et\u00a0al (2021) Fcanet: Frequency channel attention networks. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 783\u2013792","DOI":"10.1109\/ICCV48922.2021.00082"},{"key":"19110_CR37","doi-asserted-by":"crossref","first-page":"108785","DOI":"10.1016\/j.patcog.2022.108785","volume":"129","author":"G Li","year":"2022","unstructured":"Li G, Fang Q, Zha L et al (2022) Ham: Hybrid attention module in deep convolutional neural networks for image classification. Pattern Recog 129:108785","journal-title":"Pattern Recog"},{"key":"19110_CR38","doi-asserted-by":"crossref","unstructured":"Silberman N, Hoiem D, Kohli P et\u00a0al (2012) Indoor segmentation and support inference from rgbd images. In: Computer Vision\u2013ECCV 2012: 12th European Conference on Computer Vision, Florence, Italy, October 7-13, 2012, Proceedings, Part V 12, Springer, pp 746\u2013760","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"19110_CR39","doi-asserted-by":"crossref","unstructured":"Song S, Lichtenberg SP, Xiao J (2015) Sun rgb-d: A rgb-d scene understanding benchmark suite. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 567\u2013576","DOI":"10.1109\/CVPR.2015.7298655"},{"key":"19110_CR40","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, et\u00a0al (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"19110_CR41","doi-asserted-by":"crossref","unstructured":"Long J, Shelhamer E, Darrell T (2015) Fully convolutional networks for semantic segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3431\u20133440","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"19110_CR42","doi-asserted-by":"crossref","unstructured":"He Y, Chiu WC, Keuper M et\u00a0al (2017) Std2p: Rgbd semantic segmentation using spatio-temporal data-driven pooling. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4837\u20134846","DOI":"10.1109\/CVPR.2017.757"},{"key":"19110_CR43","doi-asserted-by":"crossref","unstructured":"Lin D, Chen G, Cohen-Or D, et\u00a0al (2017) Cascaded feature network for semantic segmentation of rgb-d images. In: Proceedings of the IEEE international conference on computer vision, pp 1311\u20131319","DOI":"10.1109\/ICCV.2017.147"},{"issue":"25","key":"19110_CR44","doi-asserted-by":"crossref","first-page":"35815","DOI":"10.1007\/s11042-021-11395-w","volume":"81","author":"W Zou","year":"2022","unstructured":"Zou W, Peng Y, Zhang Z et al (2022) Rgb-d gate-guided edge distillation for indoor semantic segmentation. Multimed Tools Appl 81(25):35815\u201335830","journal-title":"Multimed Tools Appl"},{"key":"19110_CR45","doi-asserted-by":"crossref","unstructured":"Xu D, Ouyang W, Wang X et\u00a0al (2018) Pad-net: Multi-tasks guided prediction-and-distillation network for simultaneous depth estimation and scene parsing. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 675\u2013684","DOI":"10.1109\/CVPR.2018.00077"},{"key":"19110_CR46","doi-asserted-by":"crossref","unstructured":"Cheng Y, Cai R, Li Z, et\u00a0al (2017) Locality-sensitive deconvolution networks with gated fusion for rgb-d indoor semantic segmentation. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3029\u20133037","DOI":"10.1109\/CVPR.2017.161"},{"key":"19110_CR47","doi-asserted-by":"crossref","first-page":"568","DOI":"10.1016\/j.neucom.2021.08.009","volume":"462","author":"J Cao","year":"2021","unstructured":"Cao J, Leng H, Cohen-Or D et al (2021) Rgb$$\\times $$ d: Learning depth-weighted rgb patches for rgb-d indoor semantic segmentation. Neurocomputing 462:568\u2013580","journal-title":"Neurocomputing"},{"key":"19110_CR48","doi-asserted-by":"crossref","first-page":"102949","DOI":"10.1016\/j.cviu.2020.102949","volume":"195","author":"E Saraee","year":"2020","unstructured":"Saraee E, Jalal M, Betke M (2020) Visual complexity analysis using deep intermediate-layer features. Comp Vision Image Underst 195:102949","journal-title":"Comp Vision Image Underst"},{"key":"19110_CR49","doi-asserted-by":"crossref","unstructured":"Feng T, Zhai Y, Yang J, et\u00a0al (2022) Ic9600: A benchmark dataset for automatic image complexity assessment. IEEE Transactions on Pattern Analysis and Machine Intelligence","DOI":"10.1109\/TPAMI.2022.3232328"},{"key":"19110_CR50","doi-asserted-by":"publisher","unstructured":"Zhu L, Kang Z, Zhou M et\u00a0al (2022) Cmanet: Cross-modality attention network for indoor-scene semantic segmentation. Sensors 22(21). https:\/\/doi.org\/10.3390\/s22218520. https:\/\/www.mdpi.com\/1424-8220\/22\/21\/8520","DOI":"10.3390\/s22218520"}],"updated-by":[{"DOI":"10.1007\/s11042-024-19608-8","type":"correction","label":"Correction","source":"publisher","updated":{"date-parts":[[2024,6,13]],"date-time":"2024-06-13T00:00:00Z","timestamp":1718236800000}}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-024-19110-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-024-19110-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-024-19110-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,22]],"date-time":"2025-03-22T20:25:14Z","timestamp":1742675114000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-024-19110-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,4,15]]},"references-count":50,"journal-issue":{"issue":"9","published-online":{"date-parts":[[2025,3]]}},"alternative-id":["19110"],"URL":"https:\/\/doi.org\/10.1007\/s11042-024-19110-1","relation":{},"ISSN":["1573-7721"],"issn-type":[{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,4,15]]},"assertion":[{"value":"16 October 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 February 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 March 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 April 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 June 2024","order":5,"name":"change_date","label":"Change Date","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"Correction","order":6,"name":"change_type","label":"Change Type","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"A Correction to this paper has been published:","order":7,"name":"change_details","label":"Change Details","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"https:\/\/doi.org\/10.1007\/s11042-024-19608-8","URL":"https:\/\/doi.org\/10.1007\/s11042-024-19608-8","order":8,"name":"change_details","label":"Change Details","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflicts of interest"}}]}}