{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,24]],"date-time":"2025-07-24T12:01:58Z","timestamp":1753358518753,"version":"3.37.3"},"reference-count":73,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2024,5,1]],"date-time":"2024-05-01T00:00:00Z","timestamp":1714521600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,5,1]],"date-time":"2024-05-01T00:00:00Z","timestamp":1714521600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,9]]},"DOI":"10.1007\/s11263-024-02060-4","type":"journal-article","created":{"date-parts":[[2024,5,1]],"date-time":"2024-05-01T13:15:13Z","timestamp":1714569313000},"page":"4036-4051","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Scaling Up Multi-domain Semantic Segmentation with Sentence Embeddings"],"prefix":"10.1007","volume":"132","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4349-8297","authenticated-orcid":false,"given":"Wei","family":"Yin","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yifan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chunhua","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Baichuan","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anton","family":"van den Hengel","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,5,1]]},"reference":[{"key":"2060_CR1","doi-asserted-by":"crossref","unstructured":"Baek, D.,\u00a0Oh, Y., &\u00a0Ham, B. (2021). Exploiting a joint embedding space for generalized zero-shot semantic segmentation. In International conference on computer vision (pp. 9536\u20139545).","DOI":"10.1109\/ICCV48922.2021.00940"},{"key":"2060_CR2","doi-asserted-by":"crossref","unstructured":"Benenson, R.,\u00a0Popov, S., &\u00a0Ferrari, V. (2019). Large-scale interactive object segmentation with human annotators. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2019.01197"},{"key":"2060_CR3","doi-asserted-by":"crossref","unstructured":"Bevandi\u0107, P.,\u00a0Kre\u0161o, I.,\u00a0Or\u0161i\u0107, M., &\u00a0\u0160egvi\u0107, S. (2019). Simultaneous semantic segmentation and outlier detection in presence of domain shift. In German Conference on Pattern Recognition (pp. 33\u201347). Springer.","DOI":"10.1007\/978-3-030-33676-9_3"},{"key":"2060_CR4","doi-asserted-by":"crossref","unstructured":"Brostow, G.,\u00a0Shotton, J.,\u00a0Fauqueur, J., & Cipolla, R. (2008). Segmentation and recognition using structure from motion point clouds. In European conference on computer vision (pp. 44\u201357). Springer.","DOI":"10.1007\/978-3-540-88682-2_5"},{"key":"2060_CR5","first-page":"468","volume":"32","author":"M Bucher","year":"2019","unstructured":"Bucher, M., Vu, T.-H., Cord, M., & P\u00e9rez, P. (2019). Zero-shot semantic segmentation. Advances in Neural Information Processing Systems, 32, 468\u2013479.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2060_CR6","unstructured":"Bujwid, S., & Sullivan, J. (2021). Large-scale zero-shot image classification from rich and diverse textual descriptions. arXiv Computing Research Repository."},{"key":"2060_CR7","doi-asserted-by":"crossref","unstructured":"Butler, D.\u00a0J.,\u00a0Wulff, J., Stanley, G.\u00a0B., & Black, M.\u00a0J. (2012). A naturalistic open source movie for optical flow evaluation. In European conference on computer vision (pp. 611\u2013625).","DOI":"10.1007\/978-3-642-33783-3_44"},{"key":"2060_CR8","doi-asserted-by":"crossref","unstructured":"Cao, J.,\u00a0Leng, H.,\u00a0Lischinski,D.,\u00a0Cohen-Or, D.,\u00a0Tu, C., & Li, Y. (2021). Shapeconv: Shape-aware convolutional layer for indoor RGB-D semantic segmentation. arXiv Computing Research Repository. arXiv:2108.10528","DOI":"10.1109\/ICCV48922.2021.00700"},{"key":"2060_CR9","doi-asserted-by":"crossref","unstructured":"Chen, W.,\u00a0Qian, S.,\u00a0Fan, D., Kojima, N.,\u00a0Hamilton, M., & Deng, J. (2020). Oasis: A large-scale dataset for single image 3D in the wild. In IEEE conference on computer vision and pattern recognition (pp. 679\u2013688).","DOI":"10.1109\/CVPR42600.2020.00076"},{"key":"2060_CR10","doi-asserted-by":"crossref","unstructured":"Chen, X.,\u00a0Girshick, R.,\u00a0He, K., & Doll\u00e1r, P. (2019). Tensormask: A foundation for dense object segmentation. In International conference on computer vision (pp. 2061\u20132069).","DOI":"10.1109\/ICCV.2019.00215"},{"key":"2060_CR11","doi-asserted-by":"crossref","unstructured":"Chen, H.,\u00a0Sun, K.,\u00a0Tian, Z.,\u00a0Shen, C.,\u00a0Huang, Y., & Yan, Y. (2020). BlendMask: Top-down meets bottom-up for instance segmentation. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR42600.2020.00860"},{"key":"2060_CR12","doi-asserted-by":"crossref","unstructured":"Chen, L.-C.,\u00a0Zhu, Y.,\u00a0Papandreou, G.,\u00a0Schroff, F., & Adam, H. (2018). Encoder\u2013decoder with atrous separable convolution for semantic image segmentation. In European conference on computer vision (pp. 801\u2013818). Springer.","DOI":"10.1007\/978-3-030-01234-2_49"},{"key":"2060_CR13","first-page":"730","volume":"29","author":"W Chen","year":"2016","unstructured":"Chen, W., Fu, Z., Yang, D., & Deng, J. (2016). Single-image depth perception in the wild. Advances in Neural Information Processing Systems, 29, 730\u2013738.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2060_CR14","doi-asserted-by":"crossref","unstructured":"Cheng, B.,\u00a0Misra, I., Schwing, A.\u00a0G.,\u00a0Kirillov, A., &\u00a0Girdhar, R. (2022). Masked-attention mask transformer for universal image segmentation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 1290\u20131299).","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"2060_CR15","unstructured":"Cheng, B., Schwing, A., & Kirillov, A. (2021). Per-pixel classification is not all you need for semantic segmentation. Advances in Neural Information Processing Systems, 34(2021), 17864\u201317875."},{"key":"2060_CR16","doi-asserted-by":"crossref","unstructured":"Cordts, M.,\u00a0Omran, M.,\u00a0Ramos, S.,\u00a0Rehfeld, T.,\u00a0Enzweiler, M.,\u00a0Benenson, R.,\u00a0Franke, U.,\u00a0Roth, S., & Schiele, B. (2016). The cityscapes dataset for semantic urban scene understanding. In IEEE conference on computer vision and pattern recognition (pp. 3213\u20133223).","DOI":"10.1109\/CVPR.2016.350"},{"key":"2060_CR17","doi-asserted-by":"crossref","unstructured":"Dai, A., Chang, A.\u00a0X.,\u00a0Savva, M.,\u00a0Halber, M.,\u00a0Funkhouser, T., & Nie\u00dfner, M. (2017). Scannet: Richly-annotated 3D reconstructions of indoor scenes. In IEEE conference on computer vision and pattern recognition (pp. 5828\u20135839).","DOI":"10.1109\/CVPR.2017.261"},{"key":"2060_CR18","doi-asserted-by":"crossref","unstructured":"Ding, J.,\u00a0Xue, N., Xia, G.-S., &\u00a0Dai, D. (2022). Decoupling zero-shot semantic segmentation. In Proceedingsof the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (pp. 11583\u201311592).","DOI":"10.1109\/CVPR52688.2022.01129"},{"issue":"2","key":"2060_CR19","doi-asserted-by":"publisher","first-page":"3580","DOI":"10.1109\/LRA.2020.2978666","volume":"5","author":"\u00d6 Erkent","year":"2020","unstructured":"Erkent, \u00d6., & Laugier, C. (2020). Semantic segmentation with unsupervised domain adaptation under varying weather conditions for autonomous vehicles. IEEE Robotics and Automation Letters, 5(2), 3580\u20133587.","journal-title":"IEEE Robotics and Automation Letters"},{"issue":"1","key":"2060_CR20","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1007\/s11263-014-0733-5","volume":"111","author":"M Everingham","year":"2015","unstructured":"Everingham, M., Eslami, S. A., Van Gool, L., Williams, C. K., Winn, J., & Zisserman, A. (2015). The pascal visual object classes challenge: A retrospective. International Journal of Computer Vision, 111(1), 98\u2013136.","journal-title":"International Journal of Computer Vision"},{"key":"2060_CR21","doi-asserted-by":"publisher","first-page":"1231","DOI":"10.1177\/0278364913491297","volume":"32","author":"A Geiger","year":"2013","unstructured":"Geiger, A., Lenz, P., Stiller, C., & Urtasun, R. (2013). Vision meets robotics: The kitti dataset. The International Journal of Robotics Research, 32, 1231\u20131237.","journal-title":"The International Journal of Robotics Research"},{"key":"2060_CR22","doi-asserted-by":"crossref","unstructured":"Gu, Z.,\u00a0Zhou, S.,\u00a0Niu, L.,\u00a0Zhao, Z., & Zhang, L. (2020). Context-aware feature generation for zero-shot semantic segmentation,\u201d in ACM international conference on multimedia (pp. 1921\u20131929).","DOI":"10.1145\/3394171.3413593"},{"key":"2060_CR23","doi-asserted-by":"crossref","unstructured":"He, K.,\u00a0Gkioxari, G.,\u00a0Doll\u00e1r, P., & Girshick, R. (2017). Mask R-CNN. In International conference on computer vision (pp. 2961\u20132969).","DOI":"10.1109\/ICCV.2017.322"},{"key":"2060_CR24","unstructured":"Hua, Y.,\u00a0Kohli, P.,\u00a0Uplavikar, P.,\u00a0Ravi, A.,\u00a0Gunaseelan, S.,\u00a0Orozco, J., & Li, E. (2020). Holopix50k: A large-scale in-the-wild stereo image dataset. In IEEE conference on computer vision and pattern recognition workshop."},{"key":"2060_CR25","unstructured":"Huang, Y.,\u00a0Jia, W.,\u00a0He, X.,\u00a0Liu, L.,\u00a0Li,Y., & Tao, D. (2021). Channelized axial attention for semantic segmentation. arXiv Computing Research Repository, 2101.07434."},{"key":"2060_CR26","first-page":"5","volume":"3","author":"P Hu","year":"2020","unstructured":"Hu, P., Sclaroff, S., & Saenko, K. (2020). Uncertainty-aware learning for zero-shot semantic segmentation. Advances in Neural Information Processing Systems, 3, 5.","journal-title":"Advances in Neural Information Processing Systems"},{"issue":"8","key":"2060_CR27","doi-asserted-by":"publisher","first-page":"4131","DOI":"10.1109\/TIP.2018.2836318","volume":"27","author":"Y Kim","year":"2018","unstructured":"Kim, Y., Jung, H., Min, D., & Sohn, K. (2018). Deep monocular depth estimation via integration of global and local predictions. IEEE Transactions on Image Processing, 27(8), 4131\u20134144.","journal-title":"IEEE Transactions on Image Processing"},{"key":"2060_CR28","doi-asserted-by":"crossref","unstructured":"Lambert, J.,\u00a0Liu, Z.,\u00a0Sener, O.,\u00a0Hays, J., &\u00a0Koltun, V. (2020). MSeg: A composite dataset for multi-domain semantic segmentation. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR42600.2020.00295"},{"key":"2060_CR29","unstructured":"Li, B., Weinberger, K.\u00a0Q.,\u00a0Belongie, S.,\u00a0Koltun, V., &\u00a0Ranftl, R. (2022). Language-driven semantic segmentation. In International conference on learning representations."},{"key":"2060_CR30","doi-asserted-by":"crossref","unstructured":"Li, Z., & Snavely, N. (2018). Megadepth: Learning single-view depth prediction from internet photos. In IEEE conference on computer vision and pattern recognition (pp. 2041\u20132050).","DOI":"10.1109\/CVPR.2018.00218"},{"key":"2060_CR31","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y.,\u00a0Maire, M.,\u00a0Belongie, S.,\u00a0Hays, J.,\u00a0Perona, P.,\u00a0Ramanan, D.,\u00a0Doll\u00e1r, P., & Zitnick, C.\u00a0L. (2014). Microsoft Coco: Common Objects in Context. In European conference on computer vision (pp. 740\u2013755). Springer.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"2060_CR32","doi-asserted-by":"crossref","unstructured":"Liu, C., Chen, L.-C.,\u00a0Schroff, F.,\u00a0Adam, H.,\u00a0Hua, W., Yuille, A.\u00a0L., & Fei-Fei, L. (2019). Auto-deeplab: Hierarchical neural architecture search for semantic image segmentation. In IEEE conference on computer vision and pattern recognition (pp. 82\u201392).","DOI":"10.1109\/CVPR.2019.00017"},{"key":"2060_CR33","doi-asserted-by":"crossref","unstructured":"Liu, Z.,\u00a0Lin, Y.,\u00a0Cao, Y.,\u00a0Hu, H.,\u00a0Wei, Y.,\u00a0Zhang, Z.,\u00a0Lin, S., &\u00a0Guo, B. (2021). Swin transformer: Hierarchical vision transformer using shifted windows. In International conference on computer vision.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"2060_CR34","doi-asserted-by":"crossref","unstructured":"Long, J.,\u00a0Shelhamer, E., &\u00a0Darrell, T. (2015). Fully convolutional networks for semantic segmentation. In IEEE conference on computer vision and pattern recognition (pp. 3431\u20133440).","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"2060_CR35","first-page":"3111","volume":"26","author":"T Mikolov","year":"2013","unstructured":"Mikolov, T., Sutskever, I., Chen, K., Corrado, G. S., & Dean, J. (2013). Distributed representations of words and phrases and their compositionality. Advances in Neural Information Processing Systems, 26, 3111\u20133119.","journal-title":"Advances in Neural Information Processing Systems"},{"issue":"11","key":"2060_CR36","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1145\/219717.219748","volume":"38","author":"GA Miller","year":"1995","unstructured":"Miller, G. A. (1995). Wordnet: A lexical database for English. Communications of the ACM, 38(11), 39\u201341.","journal-title":"Communications of the ACM"},{"key":"2060_CR37","doi-asserted-by":"crossref","unstructured":"Mottaghi,R.,\u00a0Chen, X.,\u00a0Liu, X., Cho, N.-G., Lee, S.-W.,\u00a0Fidler, S.,\u00a0Urtasun, R., & Yuille, A. (2014). The role of context for object detection and semantic segmentation in the wild. In IEEE conference on computer vision and pattern recognition (pp. 891\u2013898).","DOI":"10.1109\/CVPR.2014.119"},{"key":"2060_CR38","doi-asserted-by":"crossref","unstructured":"Neuhold, G.,\u00a0Ollmann, T.,\u00a0Rota\u00a0Bulo, S., & Kontschieder, P. (2017). The mapillary vistas dataset for semantic understanding of street scenes. In International conference on computer vision (pp. 4990\u20134999).","DOI":"10.1109\/ICCV.2017.534"},{"key":"2060_CR39","doi-asserted-by":"crossref","unstructured":"Porzi, L.,\u00a0Rota\u00a0Bul\u00f2, S.,\u00a0Colovic, A., & Kontschieder, P. (2019). Seamless scene segmentation. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2019.00847"},{"key":"2060_CR40","unstructured":"Radford, A., Kim, J.\u00a0W.,\u00a0Hallacy, C.,\u00a0Ramesh, A.,\u00a0Goh,G.,\u00a0Agarwal, S.,\u00a0Sastry, G.,\u00a0Askell, A.,\u00a0Mishkin, P.,\u00a0Clark, J., & Krueger, G. (2021). Learning transferable visual models from natural language supervision. arXiv Computing Research Repository, 2103.00020."},{"key":"2060_CR41","doi-asserted-by":"crossref","unstructured":"Ranftl, R.,\u00a0Bochkovskiy, A., & Koltun, V. (2021). Vision transformers for dense prediction. In International conference on computer vision (pp. 12179\u201312188).","DOI":"10.1109\/ICCV48922.2021.01196"},{"key":"2060_CR42","doi-asserted-by":"publisher","first-page":"1623","DOI":"10.1109\/TPAMI.2020.3019967","volume":"44","author":"R Ranftl","year":"2020","unstructured":"Ranftl, R., Lasinger, K., Hafner, D., Schindler, K., & Koltun, V. (2020). Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44, 1623\u20131637.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2060_CR43","unstructured":"Ros, G.,\u00a0Stent, S., Alcantarilla, P.\u00a0F., &\u00a0Watanabe, T. (2016). Training constrained deconvolutional networks for road scene semantic segmentation. arXiv Computing Research Repository, 1604.01545."},{"key":"2060_CR44","doi-asserted-by":"crossref","unstructured":"Shao, S.,\u00a0Li, Z.,\u00a0Zhang, T.,\u00a0Peng, C.,\u00a0Yu, G.,\u00a0Zhang, X.,\u00a0Li, J., &\u00a0Sun, J. (2019). Objects365: A large-scale, high-quality dataset for object detection. In International conference on computer vision (pp. 8430\u20138439).","DOI":"10.1109\/ICCV.2019.00852"},{"key":"2060_CR45","doi-asserted-by":"crossref","unstructured":"Shi, H.,\u00a0Li, H.,\u00a0Wu, Q., & Song, Z. (2019). Scene parsing via integrated classification model and variance-based regularization. In IEEE conference on computer vision and pattern recognition (pp. 5307\u20135316).","DOI":"10.1109\/CVPR.2019.00545"},{"key":"2060_CR46","doi-asserted-by":"crossref","unstructured":"Silberman, N.,\u00a0Hoiem, D.,\u00a0Kohli, P., & Fergus, R. (2012). Indoor segmentation and support inference from RGBD images. In European conference on computer vision (pp. 746\u2013760). Springer.","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"2060_CR47","doi-asserted-by":"crossref","unstructured":"Song, S., Lichtenberg, S.\u00a0P., & Xiao, J. (2015). Sun RGB-D: A RGB-D scene understanding benchmark suite. In IEEE conference on computer vision and pattern recognition, pp. 567\u2013576.","DOI":"10.1109\/CVPR.2015.7298655"},{"key":"2060_CR48","doi-asserted-by":"crossref","unstructured":"Sun, K.,\u00a0Xiao, B.,\u00a0Liu, D., & Wang, J. (2019). Deep high-resolution representation learning for human pose estimation. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2019.00584"},{"key":"2060_CR49","doi-asserted-by":"crossref","unstructured":"Tian, Z., Shen, C., & Chen, H. (2020). Conditional convolutions for instance segmentation. In European conference on computer vision. Springer.","DOI":"10.1007\/978-3-030-58452-8_17"},{"issue":"5","key":"2060_CR50","doi-asserted-by":"publisher","first-page":"1239","DOI":"10.1007\/s11263-019-01188-y","volume":"128","author":"A Valada","year":"2020","unstructured":"Valada, A., Mohan, R., & Burgard, W. (2020). Self-supervised model adaptation for multimodal semantic segmentation. International Journal of Computer Vision, 128(5), 1239\u20131285.","journal-title":"International Journal of Computer Vision"},{"key":"2060_CR51","doi-asserted-by":"crossref","unstructured":"Vandenhende, S.,\u00a0Georgoulis, S., & Van\u00a0Gool, L. (2020). MTI-net: Multi-scale task interaction networks for multi-task learning. In European conference on computer vision (pp. 527\u2013543). Springer.","DOI":"10.1007\/978-3-030-58548-8_31"},{"key":"2060_CR52","doi-asserted-by":"crossref","unstructured":"Varma, G.,\u00a0Subramanian, A.,\u00a0Namboodiri, A.,\u00a0Chandraker, M., & Jawahar, C. (2019). IDD: A dataset for exploring problems of autonomous navigation in unconstrained environments. In IEEE Winter Conference on Applications of Computer Vision (pp. 1743\u20131751). IEEE.","DOI":"10.1109\/WACV.2019.00190"},{"key":"2060_CR53","unstructured":"Vasiljevic, I.,\u00a0Kolkin, N.,\u00a0Zhang, S.,\u00a0Luo, R.,\u00a0Wang, H., Dai, F.\u00a0Z., Daniele, A.\u00a0F.,\u00a0Mostajabi, M.,\u00a0Basart, S., Walter, M.\u00a0R., & Shakhnarovich, G. (2019). DIODE: A Dense Indoor and Outdoor DEpth Dataset. arXiv Computing Research Repository [Online]. Available: arXiv: 1908.00463"},{"key":"2060_CR54","first-page":"17721","volume":"33","author":"X Wang","year":"2020","unstructured":"Wang, X., Zhang, R., Kong, T., Li, L., & Shen, C. (2020). SOLOv2: Dynamic and fast instance segmentation. Advances in Neural Information Processing Systems, 33, 17721\u201317732.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2060_CR55","doi-asserted-by":"crossref","unstructured":"Xian, K.,\u00a0Shen, C.,\u00a0Cao, Z.,\u00a0Lu, H.,\u00a0Xiao, Y.,\u00a0Li, R., &\u00a0Luo, Z. (2018). Monocular relative depth perception with web stereo data supervision. In IEEE conference on computer vision and pattern recognition (pp. 311\u2013320).","DOI":"10.1109\/CVPR.2018.00040"},{"key":"2060_CR56","doi-asserted-by":"crossref","unstructured":"Xian, K.,\u00a0Zhang, J.,\u00a0Wang, O.,\u00a0Mai, L.,\u00a0Lin, Z., & Cao, Z. (2020). Structure-guided ranking loss for single image depth prediction. In IEEE conference on computer vision and pattern recognition (pp. 611\u2013620).","DOI":"10.1109\/CVPR42600.2020.00069"},{"key":"2060_CR57","doi-asserted-by":"crossref","unstructured":"Xian, Y.,\u00a0Choudhury, S.,\u00a0He, Y.,\u00a0Schiele, B., & Akata, Z. (2019). Semantic projection network for zero-and few-label semantic segmentation. In IEEE conference on computer vision and pattern recognition (pp. 8256\u20138265).","DOI":"10.1109\/CVPR.2019.00845"},{"key":"2060_CR58","doi-asserted-by":"crossref","unstructured":"Xie, E.,\u00a0Sun, P.,\u00a0Song, X.,\u00a0Wang, W.,\u00a0Liu, X.,\u00a0Liang, D.,\u00a0Shen, C., & Luo, P. (2020). Polarmask: Single shot instance segmentation with polar representation. In IEEE conference on computer vision and pattern recognition (pp. 12193\u201312202).","DOI":"10.1109\/CVPR42600.2020.01221"},{"key":"2060_CR59","unstructured":"Xie, E.,\u00a0Wang, W.,\u00a0Yu, Z.,\u00a0Anandkumar, A., Alvarez, J.\u00a0M., &\u00a0Luo, P. (2021). SegFormer: Simple and efficient design for semantic segmentation with transformers. Advances in Neural Information Processing Systems."},{"key":"2060_CR60","unstructured":"Yang, L.,\u00a0Fan, Y., & Xu, N. (2019a). Video instance segmentation. arXiv Computing Research Repository [Online]. Available: arXiv:1905.04804"},{"key":"2060_CR61","doi-asserted-by":"crossref","unstructured":"Yang, L.,\u00a0Fan, Y., & Xu, N. (2019b). Video instance segmentation. In International conference on computer vision (pp. 5188\u20135197).","DOI":"10.1109\/ICCV.2019.00529"},{"key":"2060_CR62","doi-asserted-by":"publisher","first-page":"7282","DOI":"10.1109\/TPAMI.2021.3097396","volume":"44","author":"W Yin","year":"2021","unstructured":"Yin, W., Liu, Y., & Shen, C. (2021). Virtual normal: Enforcing geometric constraints for accurate and robust depth prediction. IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 44, 7282\u20137295.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)"},{"key":"2060_CR63","unstructured":"Yin, W.,\u00a0Wang, X.,\u00a0Shen, C.,\u00a0Liu, Y.,\u00a0Tian, Z.,\u00a0Xu, S.,\u00a0Sun, C., & Renyin, D. (2020). Diversedepth: Affine-invariant depth prediction using diverse data. arXiv Computing Research Repository, 2002.00569."},{"key":"2060_CR64","doi-asserted-by":"crossref","unstructured":"Yin, W.,\u00a0Zhang, C.,\u00a0Chen, H.,\u00a0Cai, Z.,\u00a0Yu, G.,\u00a0Wang, K.,\u00a0Chen, X., & Shen, C. (2023). Metric3d: Towards zero-shot metric 3d prediction from a single image. In International conference on computer vision.","DOI":"10.1109\/ICCV51070.2023.00830"},{"key":"2060_CR65","doi-asserted-by":"crossref","unstructured":"Yin, W.,\u00a0Zhang, J.,\u00a0Wang, O.,\u00a0Niklaus, S.,\u00a0Mai, L.,\u00a0Chen, S., &\u00a0Shen, C. (2021). Learning to recover 3d scene shape from a single image. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR46437.2021.00027"},{"key":"2060_CR66","doi-asserted-by":"publisher","first-page":"6480","DOI":"10.1109\/TPAMI.2022.3209968","volume":"45","author":"W Yin","year":"2022","unstructured":"Yin, W., Zhang, J., Wang, O., Niklaus, S., Chen, S., Liu, Y., & Shen, C. (2022). Towards accurate reconstruction of 3D scene shape from a single monocular image. IEEE Transactions on Pattern Analysis and Machine Intelligence, 45, 6480\u20136494.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2060_CR67","doi-asserted-by":"crossref","unstructured":"Yu, F.,\u00a0Chen, H.,\u00a0Wang, X.,\u00a0Xian, W.,\u00a0Chen, Y.,\u00a0Liu, F.,\u00a0Madhavan, V., & Darrell, T. (2020). Bdd100k: A diverse driving dataset for heterogeneous multitask learning. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR42600.2020.00271"},{"key":"2060_CR68","doi-asserted-by":"crossref","unstructured":"Yuan, Y.,\u00a0Chen, X., & Wang, J. (2020). Object-contextual representations for semantic segmentation. In European conference on computer vision (pp. 173\u2013190). Springer.","DOI":"10.1007\/978-3-030-58539-6_11"},{"key":"2060_CR69","doi-asserted-by":"crossref","unstructured":"Zamir, A., Sax, A., Shen, W., Guibas, L., Malik, J., & Savarese, S. (2018). Taskonomy: Disentangling task transfer learning. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2018.00391"},{"key":"2060_CR70","doi-asserted-by":"crossref","unstructured":"Zendel, O.,\u00a0Honauer, K.,\u00a0Murschitz, M.,\u00a0Steininger, D., & Dominguez, G.\u00a0F. (2018). Wilddash-creating hazard-aware benchmarks. In European conference on computer vision (pp. 402\u2013416). Springer.","DOI":"10.1007\/978-3-030-01231-1_25"},{"key":"2060_CR71","doi-asserted-by":"crossref","unstructured":"Zhao, H.,\u00a0Puig, X.,\u00a0Zhou, B.,\u00a0Fidler, S., &\u00a0Torralba, A. (2017). Open vocabulary scene parsing. In International conference on computer vision (pp. 2002\u20132010).","DOI":"10.1109\/ICCV.2017.221"},{"key":"2060_CR72","doi-asserted-by":"crossref","unstructured":"Zhou, B.,\u00a0Zhao, H.,\u00a0Puig, X.,\u00a0Fidler, S.,\u00a0Barriuso, A., & Torralba, A. (2017). Scene parsing through ade20k dataset. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2017.544"},{"key":"2060_CR73","doi-asserted-by":"crossref","unstructured":"Zhu, Y.,\u00a0Sapra, K., Reda, F.\u00a0A., Shih, K.\u00a0J.,\u00a0Newsam, S.,\u00a0Tao, A., & Catanzaro, B. (2019). Improving semantic segmentation via video propagation and label relaxation. In IEEE conference on computer vision and pattern recognition (pp. 8856\u20138865).","DOI":"10.1109\/CVPR.2019.00906"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02060-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-024-02060-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02060-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,27]],"date-time":"2024-08-27T07:42:19Z","timestamp":1724744539000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-024-02060-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,5,1]]},"references-count":73,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2024,9]]}},"alternative-id":["2060"],"URL":"https:\/\/doi.org\/10.1007\/s11263-024-02060-4","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"type":"print","value":"0920-5691"},{"type":"electronic","value":"1573-1405"}],"subject":[],"published":{"date-parts":[[2024,5,1]]},"assertion":[{"value":"31 October 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 March 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 May 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}