{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T17:12:06Z","timestamp":1783012326587,"version":"3.54.6"},"reference-count":106,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2023,9,7]],"date-time":"2023-09-07T00:00:00Z","timestamp":1694044800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2023,9,7]],"date-time":"2023-09-07T00:00:00Z","timestamp":1694044800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["No.2020YFB2103402"],"award-info":[{"award-number":["No.2020YFB2103402"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,2]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>In this paper, we focus on exploring effective methods for faster and accurate semantic segmentation. A common practice to improve the performance is to attain high-resolution feature maps with strong semantic representation. Two strategies are widely used: atrous convolutions and feature pyramid fusion, while both are either computationally intensive or ineffective. Inspired by the Optical Flow for motion alignment between adjacent video frames, we propose a Flow Alignment Module (FAM) to learn <jats:italic>Semantic Flow<\/jats:italic> between feature maps of adjacent levels and broadcast high-level features to high-resolution features effectively and efficiently. Furthermore, integrating our FAM to a standard feature pyramid structure exhibits superior performance over other real-time methods, even on lightweight backbone networks, such as ResNet-18 and DFNet. Then to further speed up the inference procedure, we also present a novel Gated Dual Flow Alignment Module to directly align high-resolution feature maps and low-resolution feature maps where we term the improved version network as SFNet-Lite. Extensive experiments are conducted on several challenging datasets, where results show the effectiveness of both SFNet and SFNet-Lite. In particular, when using Cityscapes test set, the SFNet-Lite series achieve 80.1 mIoU while running at 60 FPS using ResNet-18 backbone and 78.8 mIoU while running at 120 FPS using STDC backbone on RTX-3090. Moreover, we unify four challenging driving datasets (i.e., Cityscapes, Mapillary, IDD, and BDD) into one large dataset, which we named Unified Driving Segmentation (UDS) dataset. It contains diverse domain and style information. We benchmark several representative works on UDS. Both SFNet and SFNet-Lite still achieve the best speed and accuracy trade-off on UDS, which serves as a strong baseline in such a challenging setting. The code and models are publicly available at <jats:ext-link xmlns:xlink=\"http:\/\/www.w3.org\/1999\/xlink\" ext-link-type=\"uri\" xlink:href=\"https:\/\/github.com\/lxtGH\/SFSegNets\">https:\/\/github.com\/lxtGH\/SFSegNets<\/jats:ext-link>.<\/jats:p>","DOI":"10.1007\/s11263-023-01875-x","type":"journal-article","created":{"date-parts":[[2023,9,7]],"date-time":"2023-09-07T12:04:58Z","timestamp":1694088298000},"page":"466-489","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":65,"title":["Sfnet: Faster and Accurate Semantic Segmentation Via Semantic Flow"],"prefix":"10.1007","volume":"132","author":[{"given":"Xiangtai","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiangning","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yibo","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangliang","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kuiyuan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8735-2516","authenticated-orcid":false,"given":"Yunhai","family":"Tong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2023,9,7]]},"reference":[{"key":"1875_CR1","doi-asserted-by":"crossref","unstructured":"Badrinarayanan, V., Kendall, A. & Cipolla, R. (2017). Segnet: A deep convolutional encoder-decoder architecture for image segmentation. In TPAMI.","DOI":"10.1109\/TPAMI.2016.2644615"},{"key":"1875_CR2","doi-asserted-by":"crossref","unstructured":"Baker, S., Daniel Scharstein, J. P., Lewis, S. R., Black, M. J., & Szeliski, R. (2011). A database and evaluation methodology for optical flow. In IJCV.","DOI":"10.1007\/s11263-010-0390-2"},{"key":"1875_CR3","doi-asserted-by":"crossref","unstructured":"Brostow, G. J., Fauqueur, J., & Cipolla, R. (2008). Semantic object classes in video: A high-definition ground truth database. Pattern Recognition Letters.","DOI":"10.1016\/j.patrec.2008.04.005"},{"key":"1875_CR4","doi-asserted-by":"crossref","unstructured":"Brox, T., Bruhn, A., Papenberg, N., & Weickert, J. (2004). High accuracy optical flow estimation based on a theory for warping. In ECCV.","DOI":"10.1007\/978-3-540-24673-2_3"},{"key":"1875_CR5","doi-asserted-by":"crossref","unstructured":"Caesar, H., & Uijlings, J. & Ferrari, V. (2018). Coco-stuff: Thing and stuff classes in context. In CVPR.","DOI":"10.1109\/CVPR.2018.00132"},{"key":"1875_CR6","doi-asserted-by":"crossref","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., & Zagoruyko, S. (2020). End-to-end object detection with transformers. In ECCV.","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"1875_CR7","doi-asserted-by":"crossref","unstructured":"Chen, Y., Lin, G., Li, S., Bourahla, O., Yiming, W., Wang, F., Feng, J., Xu, M., & Li, X. (2020). Banet: Bidirectional aggregation network with occlusion handling for panoptic segmentation. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00385"},{"key":"1875_CR8","unstructured":"Chen, L.-C., Papandreou, G., Kokkinos, I., Murphy, K., & Yuille, A. L. (2015). Semantic image segmentation with deep convolutional nets and fully connected CRFs. In ICLR."},{"key":"1875_CR9","doi-asserted-by":"crossref","unstructured":"Chen, L.-C., Papandreou, G., Kokkinos, I., Murphy, K., & Yuille, A. L. (2018). Deeplab: Semantic image segmentation with deep convolutional nets, atrous convolution, and fully connected crfs. In TPAMI.","DOI":"10.1109\/TPAMI.2017.2699184"},{"key":"1875_CR10","unstructured":"Chen, L.-C., Papandreou, G., Schroff, F., & Adam, H. (2017). Rethinking atrous convolution for semantic image segmentation. ArXiv preprint, arXiv:1706.05587."},{"key":"1875_CR11","doi-asserted-by":"crossref","unstructured":"Chen, L.-C., Zhu, Y., Papandreou, G., Schroff, F., & Adam, H. (2018). Encoder-decoder with atrous separable convolution for semantic image segmentation. In ECCV.","DOI":"10.1007\/978-3-030-01234-2_49"},{"key":"1875_CR12","doi-asserted-by":"crossref","unstructured":"Cheng, B., Collins, M. D., Zhu, Y., Liu, T., Huang, T. S., Adam, H., & Chen, L.-C. (2020). Panoptic-deeplab: A simple, strong, and fast baseline for bottom-up panoptic segmentation. In CVPR.","DOI":"10.1109\/CVPR42600.2020.01249"},{"key":"1875_CR13","unstructured":"Cheng, B., Schwing, A. G., & Kirillov, A. (2021). Per-pixel classification is not all you need for semantic segmentation. In NeurIPS."},{"key":"1875_CR14","doi-asserted-by":"crossref","unstructured":"Choi, S., Jung, S., Yun, H., Kim, J. T., Kim, S., & Choo, J. (2021). Robustnet: Improving domain generalization in urban-scene segmentation via instance selective whitening. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01141"},{"key":"1875_CR15","doi-asserted-by":"crossref","unstructured":"Cordts, M., Omran, M., Ramos, S., Rehfeld, T., Enzweiler, M., Benenson, R., Franke, U., Roth, S., & Schiele, B. (2016). The cityscapes dataset for semantic urban scene understanding. In CVPR.","DOI":"10.1109\/CVPR.2016.350"},{"key":"1875_CR16","doi-asserted-by":"crossref","unstructured":"Dai, J., Qi, H., Xiong, Y., Li, Y., Zhang, G., Hu, H., & Wei, Y. (2017). Deformable convolutional networks. In ICCV.","DOI":"10.1109\/ICCV.2017.89"},{"key":"1875_CR17","doi-asserted-by":"crossref","unstructured":"Ding, H., Jiang, X., Shuai, B., Liu, A. Q., & Wang, G. (2018). Context contrasted feature and gated multi-scale aggregation for scene segmentation. In CVPR.","DOI":"10.1109\/CVPR.2018.00254"},{"key":"1875_CR18","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., Uszkoreit, J., & Houlsby, N. (2021). An image is worth $$16\\times 16$$ words: Transformers for image recognition at scale. In ICLR."},{"key":"1875_CR19","doi-asserted-by":"crossref","unstructured":"Dosovitskiy, A., Fischer, P., Ilg, E., Hausser, P., Hazirbas, C., Golkov, V., Van Der Smagt, P., Cremers, D., & Brox, T. (2015). Flownet: Learning optical flow with convolutional networks. In CVPR.","DOI":"10.1109\/ICCV.2015.316"},{"key":"1875_CR20","doi-asserted-by":"crossref","unstructured":"Fan, M., Lai, S., Huang, J., Wei, X., Chai, Z., Luo, J., & Wei, X. (2021). Rethinking bisenet for real-time semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00959"},{"key":"1875_CR21","unstructured":"Fisher, Yu., Chen, H., Wang, X., Xian, W., Chen, Y., Liu, F., Madhavan, V., & Darrell, T. (2020). Bdd100k: A diverse driving dataset for heterogeneous multitask learning. In CVPR."},{"key":"1875_CR22","unstructured":"Hanzhe, H., Chen, Y., Jiarui, X., Borse, S., Cai, H., Porikli, F., & Wang, X. (2022). Learning implicit feature alignment function for semantic segmentation. In ECCV."},{"key":"1875_CR23","doi-asserted-by":"crossref","unstructured":"He, H., Li, X., Cheng, G., Shi, J., Tong, Y., Meng, G., Prinet, V., & Weng, L. B. (2021). Enhanced boundary learning for glass-like object segmentation. In ICCV.","DOI":"10.1109\/ICCV48922.2021.01556"},{"key":"1875_CR24","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In CVPR.","DOI":"10.1109\/CVPR.2016.90"},{"key":"1875_CR25","unstructured":"Hong, Y., Pan, H., Sun, W., & Jia, Y. (2022). Deep dual-resolution networks for real-time and accurate semantic segmentation of road scenes. In IEEE TITS."},{"key":"1875_CR26","doi-asserted-by":"crossref","unstructured":"Hou, R., Li, J., Bhargava, A., Raventos, A., Guizilini, V., Fang, C., Lynch, J., & Gaidon, A. (2020). Real-time panoptic segmentation from dense detections. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00855"},{"key":"1875_CR27","unstructured":"Howard, A. G., Zhu, M., Chen, B., Kalenichenko, D., Wang, W., Weyand, T., Andreetto, M., & Adam, H. (2017) Efficient convolutional neural networks for mobile vision applications. Mobilenets. arXiv preprint, arXiv:1704.04861."},{"key":"1875_CR28","doi-asserted-by":"crossref","unstructured":"Huang, Z., Wang, X., Huang, L., Huang, C., Wei, Y. & Liu, W. (2019). CCNET: Criss-cross attention for semantic segmentation. In ICCV.","DOI":"10.1109\/ICCV.2019.00069"},{"key":"1875_CR29","doi-asserted-by":"crossref","unstructured":"Huang, Z., Wei, Y., Wang, X., Shi, H., Liu, W. & Huang, T. S. (2021). Alignseg: Feature-aligned segmentation networks. In TPAMI.","DOI":"10.1109\/TPAMI.2021.3062772"},{"key":"1875_CR30","doi-asserted-by":"crossref","unstructured":"Huang, S., Zhichao, L., Cheng, R. & He, C. (2021). FAPN: Feature-aligned pyramid network for dense image prediction. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00090"},{"key":"1875_CR31","unstructured":"Jaderberg, M., Simonyan, K., Zisserman, A., & Kavukcuoglu, K. (2015). Spatial transformer networks. In NeurIPS."},{"key":"1875_CR32","unstructured":"Jun, F., Liu, J., Tian, H., Fang, Z., & Hanqing, L. (2019). Dual attention network for scene segmentation. In CVPR."},{"key":"1875_CR33","doi-asserted-by":"crossref","unstructured":"Kim, J., Lee, J., Park, J., Min, D., & Sohn, K. (2022). Pin the memory: Learning to generalize semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00431"},{"key":"1875_CR34","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Girshick, R., He, K., & Dollar, P. (2019). Panoptic feature pyramid networks. In CVPR.","DOI":"10.1109\/CVPR.2019.00656"},{"key":"1875_CR35","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Girshick, R., He, K., & Doll\u00e1r, P. (2019). Panoptic feature pyramid networks. In CVPR.","DOI":"10.1109\/CVPR.2019.00656"},{"key":"1875_CR36","doi-asserted-by":"crossref","unstructured":"Lambert, J., Liu, Z., Sener, O., & Hays, J., Koltun, V. (2020). MSeg: A composite dataset for multi-domain semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR42600.2020.00295"},{"key":"1875_CR37","doi-asserted-by":"crossref","unstructured":"Li, Y., Chen, X., Zhu, Z., Xie, L., Huang, G., Dalong, D., & Wang, X. (2019). Attention-guided unified network for panoptic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2019.00719"},{"key":"1875_CR38","doi-asserted-by":"crossref","unstructured":"Li, X., He, H., Li, X., Li, D., Cheng, G., Shi, J., Weng, L., Tong, Y., & Lin, Z. (2021). Pointflow: Flowing semantics through points for aerial image segmentation. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00420"},{"key":"1875_CR39","doi-asserted-by":"crossref","unstructured":"Li, X., Houlong, Z., Lei, H., Yunhai, T., Kuiyuan, Y. (2020). GFF: Gated fully fusion for semantic segmentation. In AAAI.","DOI":"10.1609\/aaai.v34i07.6805"},{"key":"1875_CR40","doi-asserted-by":"crossref","unstructured":"Li, Q., Qi, X., & Torr, P. H. S. (2020). Unifying training and inference for panoptic segmentation. In CVPR.","DOI":"10.1109\/CVPR42600.2020.01333"},{"key":"1875_CR41","unstructured":"Li, B., Weinberger, K. Q., Belongie, S., Koltun, V., & Ranftl, R. (2022). ICLR: Language-driven semantic segmentation."},{"key":"1875_CR42","doi-asserted-by":"crossref","unstructured":"Li, H., Xiong, P., & Fan, H. (2019). and Jian Sun. Dfanet: Deep feature aggregation for real-time semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2019.00975"},{"key":"1875_CR43","doi-asserted-by":"crossref","unstructured":"Li, X., You, A., Zhu, Z., Zhao, H., Yang, M., Yang, K., & Tong, Y. (2020). Semantic flow for fast and accurate scene parsing. In ECCV.","DOI":"10.1007\/978-3-030-58452-8_45"},{"key":"1875_CR44","doi-asserted-by":"crossref","unstructured":"Li, Y., Zhao, H., Qi, X., Wang, L., Li, Z., Sun, J., & Jia, J. (2021). Fully convolutional networks for panoptic segmentation. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00028"},{"key":"1875_CR45","doi-asserted-by":"crossref","unstructured":"Li, X., Zhong, Z., Jianlong, W., Yang, Y., Lin, Z., & Liu, H. (2019). Expectation-maximization attention networks for semantic segmentation. In ICCV.","DOI":"10.1109\/ICCV.2019.00926"},{"key":"1875_CR46","doi-asserted-by":"crossref","unstructured":"Li, X., Zhou, Y., Pan, Z., & Feng, J. (2019). Partial order pruning: for best speed\/accuracy trade-off in neural architecture search. In CVPR.","DOI":"10.1109\/CVPR.2019.00936"},{"key":"1875_CR47","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., Doll\u00e1r, P., Girshick, R. B., He, K., Hariharan, B., & Belongie, S. J. (2017). Feature pyramid networks for object detection. In CVPR.","DOI":"10.1109\/CVPR.2017.106"},{"key":"1875_CR48","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C. L. (2014). Microsoft coco: Common objects in context. In ECCV.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1875_CR49","doi-asserted-by":"crossref","unstructured":"Lin, G., Milan, A., Shen, C., & Reid, I. D. (2017). Refinenet: Multi-path refinement networks for high-resolution semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2017.549"},{"key":"1875_CR50","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Han, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin transformer: Hierarchical vision transformer using shifted windows. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"1875_CR51","unstructured":"Liu, W., Rabinovich, A., & Berg, A. C. (2015). Parsenet: Looking wider to see better. arXiv preprint arXiv:1506.04579."},{"key":"1875_CR52","doi-asserted-by":"crossref","unstructured":"Long, J., Shelhamer, E., & Darrell, T. (2015). Fully convolutional networks for semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"1875_CR53","doi-asserted-by":"crossref","unstructured":"Ma, N., Zhang, X., Zheng, H.-T., & Sun, J. (2018). Shufflenet v2: Practical guidelines for efficient CNN architecture design. In ECCV.","DOI":"10.1007\/978-3-030-01264-9_8"},{"key":"1875_CR54","doi-asserted-by":"crossref","unstructured":"Mehta, S., Rastegari, M., Caspi, A., Shapiro, L., Hajishirzi, H. (2018). Espnet: Efficient spatial pyramid of dilated convolutions for semantic segmentation. In ECCV.","DOI":"10.1007\/978-3-030-01249-6_34"},{"key":"1875_CR55","doi-asserted-by":"crossref","unstructured":"Mehta, S., Rastegari, M., Shapiro, L., & Hajishirzi, H. (2019). Espnetv2: A light-weight, power efficient, and general purpose convolutional neural network. In CVPR.","DOI":"10.1109\/CVPR.2019.00941"},{"key":"1875_CR56","doi-asserted-by":"crossref","unstructured":"Nekrasov, V., Chen, H., Shen, C., & Reid, I. (2019). Fast neural architecture search of compact semantic segmentation models via auxiliary cells. In CVPR.","DOI":"10.1109\/CVPR.2019.00934"},{"key":"1875_CR57","doi-asserted-by":"crossref","unstructured":"Neuhold, G., Ollmann, T., Bulo, S. R., & Kontschieder, P. (2017). The mapillary vistas dataset for semantic understanding of street scenes. In ICCV.","DOI":"10.1109\/ICCV.2017.534"},{"key":"1875_CR58","doi-asserted-by":"crossref","unstructured":"Nirkin, Y., Wolf, L., & Hassner, T. (2021). Hyperseg: Patch-wise hypernetwork for real-time semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00405"},{"key":"1875_CR59","doi-asserted-by":"crossref","unstructured":"Orsic, M., Kreso, I., Bevandic, P., & Segvic, S. (2019). In defense of pre-trained imagenet architectures for real-time semantic segmentation of road-driving images. In CVPR.","DOI":"10.1109\/CVPR.2019.01289"},{"key":"1875_CR60","doi-asserted-by":"crossref","unstructured":"Pan, X., Luo, P., Shi, J., & Tang, X. (2018). Two at once: Enhancing learning and generalization capacities via ibn-net. In ECCV.","DOI":"10.1007\/978-3-030-01225-0_29"},{"key":"1875_CR61","unstructured":"Paszke, A., Gross, S., Chintala, S., Chanan, G., Yang, E., DeVito, Z., Lin, Z., Desmaison, A., Antiga, L., & Lerer, A. (2017). Automatic differentiation in pytorch. In NeurIPS."},{"key":"1875_CR62","unstructured":"Peng, J., Liu, Y., Tang, S., Hao, Y., Chu, L., Chen, G., Zewu, W., Chen, Z., Yu, Z., Yuning, D., Dang, Q., Lai, B., Liu, Q., Hu, X., Yu, D., & Ma, Y. (2022). Pp-liteseg: A superior real-time semantic segmentation model. arXiv preprint. arXiv:2204.02681."},{"key":"1875_CR63","doi-asserted-by":"crossref","unstructured":"Porzi, L., Bulo, S. R., Colovic, A., & Kontschieder, P. (2019). Seamless scene segmentation. In CVPR.","DOI":"10.1109\/CVPR.2019.00847"},{"key":"1875_CR64","doi-asserted-by":"crossref","unstructured":"Qiao, S., Chen, L.-C., & Yuille, A. (2021). Detectors: Detecting objects with recursive feature pyramid and switchable atrous convolution. In CVPR.","DOI":"10.1109\/CVPR46437.2021.01008"},{"key":"1875_CR65","doi-asserted-by":"crossref","unstructured":"Romera, E., Alvarez, J. M., Bergasa, L. M., & Arroyo, R. (2018). Erfnet: Efficient residual factorized convnet for real-time semantic segmentation. In IEEE-TITS.","DOI":"10.1109\/IVS.2017.7995966"},{"key":"1875_CR66","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., & Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation. In MICCAI.","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"1875_CR67","doi-asserted-by":"crossref","unstructured":"Russakovsky, O., Deng, J., Hao, S., Krause, J., Satheesh, S., Ma, S., Huang, Z., Karpathy, A., Khosla, A., Bernstein, M., Berg, A. C., & Fei-Fei, L. (2015). Imagenet large scale visual recognition challenge. In IJCV.","DOI":"10.1007\/s11263-015-0816-y"},{"key":"1875_CR68","doi-asserted-by":"crossref","unstructured":"Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., & Chen, L.-C. (2018). Mobilenetv 2: Inverted residuals and linear bottlenecks. In CVPR.","DOI":"10.1109\/CVPR.2018.00474"},{"key":"1875_CR69","doi-asserted-by":"crossref","unstructured":"Shrivastava, A., Gupta, A., & Girshick, R. (2016). Training region-based object detectors with online hard example mining. In CVPR.","DOI":"10.1109\/CVPR.2016.89"},{"key":"1875_CR70","unstructured":"Si, H., Zhang, Z., Lv, F., Yu, G., & Lu, F. (2019). Real-time semantic segmentation via multiply spatial fusion network. arXiv preprint arXiv:1911.07217."},{"key":"1875_CR71","doi-asserted-by":"crossref","unstructured":"Strudel, R., Garcia, R., Laptev, I., & Schmid, C. (2021). Segmenter: Transformer for semantic segmentation. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00717"},{"key":"1875_CR72","doi-asserted-by":"crossref","unstructured":"Takikawa, T., Acuna, D., Jampani, V., Fidler, S. (2019). Gated-scnn: Gated shape cnns for semantic segmentation. In ICCV.","DOI":"10.1109\/ICCV.2019.00533"},{"key":"1875_CR73","doi-asserted-by":"crossref","unstructured":"Varma, G., Subramanian, A., Namboodiri, A., Chandraker, M., & Jawahar, C. V. (2019). IDD: A dataset for exploring problems of autonomous navigation in unconstrained environments. In WACV.","DOI":"10.1109\/WACV.2019.00190"},{"key":"1875_CR74","doi-asserted-by":"crossref","unstructured":"Wang, X., Girshick, R., Gupta, A., & He, K. (2018). Non-local neural networks. In CVPR.","DOI":"10.1109\/CVPR.2018.00813"},{"key":"1875_CR75","doi-asserted-by":"crossref","unstructured":"Wang, J., Lan, C., Liu, C., Ouyang, Y., Qin, T., Wang, L., Chen, Y., Zeng, W. & Yu, P. (2022). Generalizing to unseen domains: A survey on domain generalization. In IEEE TKDE.","DOI":"10.24963\/ijcai.2021\/628"},{"key":"1875_CR76","doi-asserted-by":"crossref","unstructured":"Wang, H., Zhu, Y., Adam, H., Yuille, A., & Chen, L.-C. (2021). Max-deeplab: End-to-end panoptic segmentation with mask transformers. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00542"},{"key":"1875_CR77","doi-asserted-by":"crossref","unstructured":"Wang, H., Zhu, Y., Green, B., Adam, H., Yuille, A., & Chen, L.-C. (2020). Axial-deeplab: Stand-alone axial-attention for panoptic segmentation. In ECCV.","DOI":"10.1007\/978-3-030-58548-8_7"},{"key":"1875_CR78","doi-asserted-by":"crossref","unstructured":"Woo, S., Park, J., Lee, J.-Y., & Kweon, S. (2018). CBAM: Convolutional block attention module. In ECCV.","DOI":"10.1007\/978-3-030-01234-2_1"},{"key":"1875_CR79","unstructured":"Wu, Y., Kirillov, A., Massa, F., Lo, W.-Y., & Girshick, R. (2019).Detectron2. https:\/\/github.com\/facebookresearch\/detectron2."},{"key":"1875_CR80","doi-asserted-by":"crossref","unstructured":"Xiao, T., Liu, Y., Zhou, B., Jiang, Y., & Sun, J. (2018). Unified perceptual parsing for scene understanding. In ECCV.","DOI":"10.1007\/978-3-030-01228-1_26"},{"key":"1875_CR81","unstructured":"Xie, E., Wang, W., Yu, Z., Anandkumar, A., Alvarez, J. M., & Luo, P. (2021). Segformer: Simple and efficient design for semantic segmentation with transformers. In NeurIPS."},{"key":"1875_CR82","doi-asserted-by":"crossref","unstructured":"Xiong, Y., Liao, R., Zhao, H., Rui, H., Bai, M., Yumer, E. & Urtasun, R. (2019). UPSNET: A unified panoptic segmentation network. In CVPR.","DOI":"10.1109\/CVPR.2019.00902"},{"key":"1875_CR83","doi-asserted-by":"crossref","unstructured":"Yang, M., Kun, Yu., Zhang, C., Li, Z., & Yang, K. (2018). Denseaspp for semantic segmentation in street scenes. In CVPR.","DOI":"10.1109\/CVPR.2018.00388"},{"key":"1875_CR84","doi-asserted-by":"crossref","unstructured":"Yang, Y., Li, H., Li, X., Zhao, Q., & Wu, J., &, Lin, Z. (2020). SOGNET: Scene overlap graph network for panoptic segmentation. In AAAI.","DOI":"10.1609\/aaai.v34i07.6955"},{"key":"1875_CR85","unstructured":"Yanran, W., Li, X., Shi, C., Tong, Y., Hua, Y., Song, T., Ma, R., & Guan, H. (2021). Fast and accurate scene parsing via bi-direction alignment networks. In ICIP."},{"key":"1875_CR86","unstructured":"Yu, F., & Koltun, V. (2016). Multi-scale context aggregation by dilated convolutions. In ICLR."},{"key":"1875_CR87","doi-asserted-by":"crossref","unstructured":"Yu, C., Gao, C., Wang, J., Yu, G., Shen, C., & Sang, N. (2021). Bisenet v2: Bilateral network with guided aggregation for real-time semantic segmentation. In IJCV.","DOI":"10.1007\/s11263-021-01515-2"},{"key":"1875_CR88","doi-asserted-by":"crossref","unstructured":"Yu, C., Wang, J., Peng, C., Gao, C., Yu, G., & Sang, N. (2018). Bisenet: Bilateral segmentation network for real-time semantic segmentation. In ECCV.","DOI":"10.1007\/978-3-030-01261-8_20"},{"key":"1875_CR89","doi-asserted-by":"crossref","unstructured":"Yu, C., Wang, J., Peng, C., Gao, C., Yu, G., & Sang, N. (2018). Learning a discriminative feature network for semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2018.00199"},{"key":"1875_CR90","unstructured":"Yuan, Y., & Wang, J. (2021). OCNET: Object context network for scene parsing. In IJCV."},{"key":"1875_CR91","doi-asserted-by":"crossref","unstructured":"Yuan, Y., Chen, X., & Wang, J. (2020). Object-contextual representations for semantic segmentation. In ECCV.","DOI":"10.1007\/978-3-030-58539-6_11"},{"key":"1875_CR92","doi-asserted-by":"crossref","unstructured":"Yuan, H., Li, X., Yang, Y., Cheng, G., Zhang, J., Tong, Y., Zhang, L. & Tao, D. (2022). Polyphonicformer: Unified query learning for depth-aware video panoptic segmentation. In ECCV.","DOI":"10.1007\/978-3-031-19812-0_34"},{"key":"1875_CR93","unstructured":"Yue, K., Sun, M., Yuan, Y., Zhou, F., Ding, E., & Xu, F., (2018). Compact generalized non-local network. In NeurIPS."},{"key":"1875_CR94","doi-asserted-by":"crossref","unstructured":"Yue, X., Zhang, Y., Zhao, S., Sangiovanni-Vincentelli, A., Keutzer, K. & Gong, B. (2019). Domain randomization and pyramid consistency: Simulation-to-real generalization without accessing target domain data. In ICCV.","DOI":"10.1109\/ICCV.2019.00219"},{"key":"1875_CR95","doi-asserted-by":"crossref","unstructured":"Zhang, H., Dana, K., Shi, J., Zhang, Z., Wang, X., Tyagi, A., & Agrawal, A. (2018). Context encoding for semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2018.00747"},{"key":"1875_CR96","unstructured":"Zhang, W., Pang, J., Chen, K. & Loy, C.C. (2021). K-net: Towards unified image segmentation. In NeurIPS."},{"key":"1875_CR97","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Qiu, Z., Liu, J., Yao, T., Liu, D., & Mei, T. (2019). Customizable architecture search for semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2019.01191"},{"key":"1875_CR98","doi-asserted-by":"crossref","unstructured":"Zhang, H., Zhang, H., Wang, C., & Xie, J. (2019). Co-occurrent features in semantic segmentation. In CVPR.","DOI":"10.1109\/CVPR.2019.00064"},{"key":"1875_CR99","doi-asserted-by":"crossref","unstructured":"Zhao, H., Qi, X., Shen, X., Shi, J., & Jia, J. (2018). ICNET for real-time semantic segmentation on high-resolution images. In ECCV.","DOI":"10.1007\/978-3-030-01219-9_25"},{"key":"1875_CR100","doi-asserted-by":"crossref","unstructured":"Zhao, H., Shi, J., Qi, X., Wang, X., & Jia, J. (2017). Pyramid scene parsing network. In CVPR.","DOI":"10.1109\/CVPR.2017.660"},{"key":"1875_CR101","doi-asserted-by":"crossref","unstructured":"Zhao, H., Zhang, Y., Liu, S., Shi, J., Loy, C. C., Lin, D., & Jia, J. (2018). PSANET: Point-wise spatial attention network for scene parsing. In ECCV.","DOI":"10.1007\/978-3-030-01240-3_17"},{"key":"1875_CR102","doi-asserted-by":"crossref","unstructured":"Zheng, S., Jiachen, L., Zhao, H., Zhu, X., Luo, Z., Wang, Y., Yanwei, F., Feng, J., Xiang, T., Torr, P. H. S., & Zhang, L. (2021). Rethinking semantic segmentation from a sequence-to-sequence perspective with transformers. In CVPR.","DOI":"10.1109\/CVPR46437.2021.00681"},{"key":"1875_CR103","doi-asserted-by":"crossref","unstructured":"Zhou, X., Koltun, V., & Kr\u00e4henb\u00fchl, P. (2022). Simple multi-dataset detection. In CVPR.","DOI":"10.1109\/CVPR52688.2022.00742"},{"key":"1875_CR104","doi-asserted-by":"crossref","unstructured":"Zhou, B., Zhao, H., Puig, X., Fidler, S., Barriuso, A., & Torralba, A. (2016). Semantic understanding of scenes through the ADE20K dataset. arXiv preprint arXiv:1608.05442.","DOI":"10.1109\/CVPR.2017.544"},{"key":"1875_CR105","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Sapra, K., Reda, F. A., Shih, K. J., Newsam, S., Tao, A., & Catanzaro, B. (2019). Improving semantic segmentation via video propagation and label relaxation. In CVPR.","DOI":"10.1109\/CVPR.2019.00906"},{"key":"1875_CR106","doi-asserted-by":"crossref","unstructured":"Zhu, X., Xiong, Y., Dai, J., Lu., Yuan, L., & Wei, Y. (2017). Deep feature flow for video recognition. In CVPR.","DOI":"10.1109\/CVPR.2017.441"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01875-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01875-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01875-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,30]],"date-time":"2024-01-30T07:17:39Z","timestamp":1706599059000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01875-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,9,7]]},"references-count":106,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2024,2]]}},"alternative-id":["1875"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01875-x","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,9,7]]},"assertion":[{"value":"11 July 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 July 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 September 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}