{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:05:02Z","timestamp":1777655102401,"version":"3.51.4"},"publisher-location":"Cham","reference-count":94,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031733963","type":"print"},{"value":"9783031733970","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,3]],"date-time":"2024-11-03T00:00:00Z","timestamp":1730592000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-73397-0_21","type":"book-chapter","created":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T19:05:59Z","timestamp":1730574359000},"page":"357-375","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Open-Vocabulary 3D Semantic Segmentation with\u00a0Text-to-Image Diffusion Models"],"prefix":"10.1007","author":[{"given":"Xiaoyu","family":"Zhu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pengfei","family":"Xing","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Long","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junwei","family":"Liang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alexander","family":"Hauptmann","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ting","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Andrew","family":"Gallagher","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,3]]},"reference":[{"key":"21_CR1","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"422","DOI":"10.1007\/978-3-030-58452-8_25","volume-title":"Computer Vision \u2013 ECCV 2020","author":"P Achlioptas","year":"2020","unstructured":"Achlioptas, P., Abdelreheem, A., Xia, F., Elhoseiny, M., Guibas, L.: ReferIt3D: neural listeners for fine-grained 3D object identification in real-world scenes. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12346, pp. 422\u2013440. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58452-8_25"},{"key":"21_CR2","unstructured":"Alayrac, J.B., et al.: Flamingo: a visual language model for few-shot learning. In: NeurIPS (2022)"},{"key":"21_CR3","unstructured":"Anand, A., Koppula, H.S., Joachims, T., Saxena, A.: Contextually guided semantic labeling and search for 3D point clouds. In: IJRR (2011)"},{"key":"21_CR4","doi-asserted-by":"crossref","unstructured":"Armeni, I., et al.: 3D semantic parsing of large-scale indoor spaces. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.170"},{"key":"21_CR5","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3197517.3201301","volume":"37","author":"M Atzmon","year":"2018","unstructured":"Atzmon, M., Maron, H., Lipman, Y.: Point convolutional neural networks by extension operators. ACM Trans. Graph. 37, 1\u201312 (2018)","journal-title":"ACM Trans. Graph."},{"key":"21_CR6","unstructured":"Baranchuk, D., Voynov, A., Rubachev, I., Khrulkov, V., Babenko, A.: Label-efficient semantic segmentation with diffusion models. In: ICLR (2022)"},{"key":"21_CR7","doi-asserted-by":"crossref","unstructured":"Chang, A., et al.: Matterport3D: learning from RGB-D data in indoor environments. In: 3DV (2017)","DOI":"10.1109\/3DV.2017.00081"},{"key":"21_CR8","doi-asserted-by":"crossref","unstructured":"Chen, B., et al.: Open-vocabulary queryable scene representations for real world planning. arXiv prepreint arXiv:2209.09874 (2022)","DOI":"10.1109\/ICRA48891.2023.10161534"},{"key":"21_CR9","doi-asserted-by":"crossref","unstructured":"Chen, S., Sun, P., Song, Y., Luo, P.: DiffusionDet: diffusion model for object detection. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01816"},{"key":"21_CR10","doi-asserted-by":"crossref","unstructured":"Cheng, B., Misra, I., Schwing, A.G., Kirillov, A., Girdhar, R.: Masked-attention mask transformer for universal image segmentation. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00135"},{"key":"21_CR11","unstructured":"Cheng, B., Schwing, A.G., Kirillov, A.: Per-pixel classification is not all you need for semantic segmentation. In: NeurIPS (2021)"},{"key":"21_CR12","doi-asserted-by":"crossref","unstructured":"Cheraghian, A., Rahman, S., Campbell, D., Petersson, L.: Transductive zero-shot learning for 3D point cloud classification. In: WACV (2020)","DOI":"10.1109\/WACV45572.2020.9093545"},{"key":"21_CR13","doi-asserted-by":"crossref","unstructured":"Cheraghian, A., Rahman, S., Campbell, D., Petersson, L.: Mitigating the hubness problem for zero-shot learning of 3D objects. In: BMVC (2019)","DOI":"10.23919\/MVA.2019.8758063"},{"key":"21_CR14","doi-asserted-by":"publisher","unstructured":"Cheraghian, A., Rahman, S., Chowdhury, T.F., et al.: Zero-shot learning on 3d point cloud objects and beyond. Int. J. Comput. Vis. 130, 2364\u20132384 (2022). https:\/\/doi.org\/10.1007\/s11263-022-01650-4","DOI":"10.1007\/s11263-022-01650-4"},{"key":"21_CR15","doi-asserted-by":"crossref","unstructured":"Cheraghian, A., Rahman, S., Petersson, L.: Zero-shot learning of 3D point cloud objects. In: MVA (2019)","DOI":"10.23919\/MVA.2019.8758063"},{"key":"21_CR16","doi-asserted-by":"crossref","unstructured":"Choy, C., Gwak, J., Savarese, S.: 4D spatio-temporal ConvNets: Minkowski convolutional neural networks. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00319"},{"key":"21_CR17","doi-asserted-by":"crossref","unstructured":"Dai, A., Chang, A.X., Savva, M., Halber, M., Funkhouser, T., Nie\u00dfner, M.: ScanNet: richly-annotated 3d reconstructions of indoor scenes. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.261"},{"key":"21_CR18","doi-asserted-by":"crossref","unstructured":"Ding, R., Yang, J., Xue, C., Zhang, W., Bai, S., Qi, X.: Lowis3D: language-driven open-world instance-level 3D scene understanding. arXiv preprint arXiv:2308.00353 (2023)","DOI":"10.1109\/TPAMI.2024.3410324"},{"key":"21_CR19","doi-asserted-by":"crossref","unstructured":"Ding, R., Yang, J., Xue, C., Zhang, W., Bai, S., Qi, X.: PLA: language-driven open-vocabulary 3D scene understanding. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00677"},{"key":"21_CR20","doi-asserted-by":"crossref","unstructured":"Engelmann, F., Kontogianni, T., Hermans, A., Leibe, B.: Exploring spatial context for 3D semantic segmentation of point clouds. In: ICCV workshop (2017)","DOI":"10.1109\/ICCVW.2017.90"},{"key":"21_CR21","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"395","DOI":"10.1007\/978-3-030-11015-4_29","volume-title":"Computer Vision \u2013 ECCV 2018 Workshops","author":"F Engelmann","year":"2019","unstructured":"Engelmann, F., Kontogianni, T., Schult, J., Leibe, B.: Know what your neighbors do: 3D semantic segmentation of point clouds. In: Leal-Taix\u00e9, L., Roth, S. (eds.) ECCV 2018. LNCS, vol. 11131, pp. 395\u2013409. Springer, Cham (2019). https:\/\/doi.org\/10.1007\/978-3-030-11015-4_29"},{"key":"21_CR22","doi-asserted-by":"publisher","first-page":"102304","DOI":"10.1016\/j.rcim.2021.102304","volume":"75","author":"J Fan","year":"2022","unstructured":"Fan, J., Zheng, P., Li, S.: Vision-based holistic scene understanding towards proactive human-robot collaboration. Robot. Comput. Integr. Manuf. 75, 102304 (2022)","journal-title":"Robot. Comput. Integr. Manuf."},{"key":"21_CR23","doi-asserted-by":"crossref","unstructured":"Feng, R., Gao, Y., Tse, T.H.E., Ma, X., Chang, H.J.: DiffPose: spatiotemporal diffusion model for video-based human pose estimation. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01365"},{"key":"21_CR24","doi-asserted-by":"crossref","unstructured":"Gadre, S.Y., Wortsman, M., Ilharco, G., Schmidt, L., Song, S.: Cows on pasture: baselines and benchmarks for language-driven zero-shot object navigation. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.02219"},{"key":"21_CR25","doi-asserted-by":"publisher","unstructured":"Ghiasi, G., Gu, X., Cui, Y., Lin, T.-Y.: Scaling open-vocabulary image segmentation with\u00a0image-level labels. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Proceedings of the 17th European Conference on Computer Vision, ECCV 2022, Part XXXVI, Tel Aviv, Israel, 23\u201327 October 2022, pp. 540\u2013557. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-20059-5_31","DOI":"10.1007\/978-3-031-20059-5_31"},{"key":"21_CR26","doi-asserted-by":"crossref","unstructured":"Graham, B., Engelcke, M., Maaten, L.: 3D semantic segmentation with submanifold sparse convolutional networks. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00961"},{"issue":"5","key":"21_CR27","doi-asserted-by":"publisher","first-page":"2012","DOI":"10.1109\/TVCG.2020.2973477","volume":"26","author":"L Han","year":"2020","unstructured":"Han, L., Zheng, T., Zhu, Y., Xu, L., Fang, L.: Live semantic 3d perception for immersive augmented reality. IEEE Trans. Vis. Comput. Graph. 26(5), 2012\u20132022 (2020)","journal-title":"IEEE Trans. Vis. Comput. Graph."},{"key":"21_CR28","doi-asserted-by":"crossref","unstructured":"He, Q., et al.: UniM-OV3D: uni-modality open-vocabulary 3D scene understanding with fine-grained feature representation. In: IJCAI (2024)","DOI":"10.24963\/ijcai.2024\/90"},{"key":"21_CR29","doi-asserted-by":"crossref","unstructured":"Holmquist, K., Wandt, B.: DiffPose: multi-hypothesis human pose estimation using diffusion models. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01464"},{"key":"21_CR30","doi-asserted-by":"crossref","unstructured":"Hou, J., Graham, B., Nie\u00dfner, M., Xie, S.: Exploring data-efficient 3D scene understanding with contrastive scene contexts. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.01533"},{"key":"21_CR31","doi-asserted-by":"crossref","unstructured":"Hu, Z., et al.: VMNet: voxel-mesh network for geodesic-aware 3D semantic segmentation. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.01520"},{"key":"21_CR32","doi-asserted-by":"crossref","unstructured":"Hua, B.S., Tran, M.K., Yeung, S.K.: Pointwise convolutional neural networks. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00109"},{"key":"21_CR33","doi-asserted-by":"crossref","unstructured":"Huang, C., Mees, O., Zeng, A., Burgard, W.: Visual language maps for robot navigation. In: ICRA (2023)","DOI":"10.1109\/ICRA48891.2023.10160969"},{"key":"21_CR34","doi-asserted-by":"crossref","unstructured":"Huang, J., Zhang, H., Yi, L., Funkhouser, T., Nie\u00dfner, M., Guibas, L.J.: TextureNet: consistent local parametrizations for learning from high-resolution signals on meshes. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.00457"},{"key":"21_CR35","doi-asserted-by":"crossref","unstructured":"Huang, S., Chen, Y., Jia, J., Wang, L.: Multi-view transformer for 3D visual grounding. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01508"},{"issue":"10","key":"21_CR36","doi-asserted-by":"publisher","first-page":"11781","DOI":"10.1109\/JSEN.2020.3003121","volume":"21","author":"Z Huang","year":"2020","unstructured":"Huang, Z., Lv, C., Xing, Y., Wu, J.: Multi-modal sensor fusion-based deep neural network for end-to-end autonomous driving with scene understanding. IEEE Sens. J. 21(10), 11781\u201311790 (2020)","journal-title":"IEEE Sens. J."},{"key":"21_CR37","doi-asserted-by":"crossref","unstructured":"Jatavallabhula, K., et al.: ConceptFusion: open-set multimodal 3D mapping. In: Robotics Science and Systems (2023)","DOI":"10.15607\/RSS.2023.XIX.066"},{"key":"21_CR38","doi-asserted-by":"crossref","unstructured":"Ji, Y., et al.: DDP: diffusion model for dense visual prediction. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01987"},{"key":"21_CR39","unstructured":"Jia, C., et al.: Scaling up visual and vision-language representation learning with noisy text supervision. In: ICML (2021)"},{"key":"21_CR40","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)"},{"key":"21_CR41","unstructured":"Koppula, H., Anand, A., Joachims, T., Saxena, A.: Semantic labeling of 3D point clouds for indoor scenes. In: NeurIPS (2011)"},{"key":"21_CR42","unstructured":"Kwon, M., Jeong, J., Uh, Y.: Diffusion models already have a semantic latent space. In: ICLR (2023)"},{"key":"21_CR43","doi-asserted-by":"crossref","unstructured":"Lambert, J., Liu, Z., Sener, O., Hays, J., Koltun, V.: MSeg: a composite dataset for multi-domain semantic segmentation. In: CVPR (2020)","DOI":"10.1109\/CVPR42600.2020.00295"},{"key":"21_CR44","doi-asserted-by":"crossref","unstructured":"Landrieu, L., Simonovsky, M.: Large-scale point cloud semantic segmentation with superpoint graphs. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00479"},{"key":"21_CR45","doi-asserted-by":"crossref","unstructured":"Li, A.C., Prabhudesai, M., Duggal, S., Brown, E., Pathak, D.: Your diffusion model is secretly a zero-shot classifier. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00210"},{"key":"21_CR46","unstructured":"Li, B., Weinberger, K.Q., Belongie, S., Koltun, V., Ranftl, R.: Language-driven semantic segmentation. In: ICLR (2022)"},{"key":"21_CR47","unstructured":"Li, J., Selvaraju, R.R., Gotmare, A.D., Joty, S.R., Xiong, C., Hoi, S.C.H.: Align before fuse: vision and language representation learning with momentum distillation. In: NeurIPS (2021)"},{"key":"21_CR48","unstructured":"Li, Y., Bu, R., Sun, M., Wu, W., Di, X., Chen, B.: PointCNN: convolution on X-transformed points. In: NeurIPS (2018)"},{"key":"21_CR49","doi-asserted-by":"crossref","unstructured":"Li, Z., Zhou, Q., Zhang, X., Zhang, Y., Wang, Y., Xie, W.: Open-vocabulary object segmentation with diffusion models. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00705"},{"key":"21_CR50","doi-asserted-by":"crossref","unstructured":"Liang, F., et al.: Open-vocabulary semantic segmentation with mask-adapted clip. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00682"},{"key":"21_CR51","unstructured":"Liu, B., Deng, S., Dong, Q., Hu, Z.: Language-level semantics conditioned 3D point cloud segmentation. arXiv prepreint arXiv:2107.00430 (2022)"},{"key":"21_CR52","doi-asserted-by":"crossref","unstructured":"Liu, D., Li, Q., Dinh, A.D., Jiang, T., Shah, M., Xu, C.: Diffusion action segmentation. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00930"},{"key":"21_CR53","unstructured":"Liu, K., et al.: Weakly supervised 3d open-vocabulary segmentation. In: NeurIPS (2023)"},{"key":"21_CR54","doi-asserted-by":"publisher","unstructured":"Liu, N., Li, S., Du, Y., Torralba, A., Tenenbaum, J.B.: Compositional visual generation with composable diffusion models. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision, ECCV 2022. LNCS, vol. 13677. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19790-1_26","DOI":"10.1007\/978-3-031-19790-1_26"},{"key":"21_CR55","doi-asserted-by":"crossref","unstructured":"Liu, Z., Qi, X., Fu, C.W.: 3D-to-2D distillation for indoor scene parsing. In: CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00444"},{"key":"21_CR56","doi-asserted-by":"crossref","unstructured":"Lu, Y., Rasmussen, C.: Simplified Markov random fields for efficient semantic labeling of 3D point clouds. In: ICIRS (2012)","DOI":"10.1109\/IROS.2012.6386039"},{"key":"21_CR57","doi-asserted-by":"crossref","unstructured":"Ma, Z., Hong, J., Gul, M.O., Gandhi, M., Gao, I., Krishna, R.: CREPE: can vision-language foundation models reason compositionally? arXiv preprint arXiv:2212.07796 (2023)","DOI":"10.1109\/CVPR52729.2023.01050"},{"key":"21_CR58","doi-asserted-by":"crossref","unstructured":"Mazur, K., Sucar, E., Davison, A.: Feature-realistic neural fusion for real-time, open set scene understanding. In: ICRA (2023)","DOI":"10.1109\/ICRA48891.2023.10160800"},{"key":"21_CR59","doi-asserted-by":"crossref","unstructured":"Michele, B., Boulch, A., Puy, G., Bucher, M., Marlet, R.: Generative zero-shot learning for semantic segmentation of 3D point cloud. In: 3DV (2021)","DOI":"10.1109\/3DV53792.2021.00107"},{"key":"21_CR60","unstructured":"Mittal, S., Abstreiter, K., Bauer, S., Sch\u00f6lkopf, B., Mehrjou, A.: Diffusion based representation learning. In: ICML (2023)"},{"key":"21_CR61","doi-asserted-by":"crossref","unstructured":"Peng, S., Genova, K., Jiang, C.M., Tagliasacchi, A., Pollefeys, M., Funkhouser, T.: OpenScene: 3D scene understanding with open vocabularies. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00085"},{"key":"21_CR62","unstructured":"Qi, C.R., Su, H., Mo, K., Guibas, L.J.: PointNet: deep learning on point sets for 3D classification and segmentation. In: CVPR (2017)"},{"key":"21_CR63","unstructured":"Qi, C.R., Yi, L., Su, H., Guibas, L.J.: PointNet++: deep hierarchical feature learning on point sets in a metric space. In: NeurIPS (2017)"},{"key":"21_CR64","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision. In: ICML (2021)"},{"key":"21_CR65","unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: ICML (2021)"},{"key":"21_CR66","unstructured":"Roh, J., Desingh, K., Farhadi, A., Fox, D.: LanguageRefer: spatial-language model for 3D visual grounding. In: Conference on Robot Learning, pp. 1046\u20131056. PMLR (2022)"},{"key":"21_CR67","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"21_CR68","doi-asserted-by":"publisher","unstructured":"Rozenberszki, D., Litany, O., Dai, A.: Language-grounded indoor 3D semantic segmentation in\u00a0the\u00a0wild. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Proceedings of the 17th European Conference on Computer Vision. LNCS, Part XXXIII, Tel Aviv, Israel, 23\u201327 October 2022, pp. 125\u2013141. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19827-4_8","DOI":"10.1007\/978-3-031-19827-4_8"},{"key":"21_CR69","doi-asserted-by":"crossref","unstructured":"Saharia, C., et al.: Photorealistic text-to-image diffusion models with deep language understanding. In: NeurIPS (2022)","DOI":"10.1145\/3528233.3530757"},{"key":"21_CR70","doi-asserted-by":"crossref","unstructured":"Saharia, C., et\u00a0al.: Photorealistic text-to-image diffusion models with deep language understanding. In: NeurIPS (2022)","DOI":"10.1145\/3528233.3530757"},{"key":"21_CR71","unstructured":"Schuhmann, C., et\u00a0al.: LAION-5B: an open large-scale dataset for training next generation image-text models. In: NeurIPS (2022)"},{"key":"21_CR72","doi-asserted-by":"crossref","unstructured":"Schult, J., Engelmann, F., Hermans, A., Litany, O., Tang, S., Leibe, B.: Mask3D: mask transformer for 3D semantic instance segmentation. In: ICRA (2023)","DOI":"10.1109\/ICRA48891.2023.10160590"},{"key":"21_CR73","unstructured":"Shafiullah, N.M.M., Paxton, C., Pinto, L., Chintala, S., Szlam, A.: CLIP-fields: weakly supervised semantic fields for robotic memory. In: CoRL Workshop on Language and Robotics (2022)"},{"key":"21_CR74","unstructured":"Shah, D., Osinski, B., Ichter, B., Levine, S.: LM-Nav: robotic navigation with large pre-trained models of language, vision, and action. In: CoRL (2022)"},{"key":"21_CR75","doi-asserted-by":"crossref","unstructured":"Shan, W., et al.: Diffusion-based 3d human pose estimation with multi-hypothesis aggregation. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01356"},{"key":"21_CR76","unstructured":"Straub, J., et\u00a0al.: The replica dataset: a digital replica of indoor spaces. arXiv preprint arXiv:1906.05797 (2019)"},{"key":"21_CR77","unstructured":"Takmaz, A., et al.: OpenMask3D: open-vocabulary 3D instance segmentation. In: NeurIPS (2023)"},{"key":"21_CR78","unstructured":"Takmaz, A., et al.: OpenMask3D: open-vocabulary 3D instance segmentation. arXiv preprint arXiv:2306.13631 (2023)"},{"key":"21_CR79","unstructured":"Tang, L., Jia, M., Wang, Q., Phoo, C.P., Hariharan, B.: Emergent correspondence from image diffusion. arXiv preprint arXiv:2306.03881 (2023)"},{"key":"21_CR80","doi-asserted-by":"crossref","unstructured":"Tatarchenko, M., Park, J., Koltun, V., Zhou., Q.Y.: Tangent convolutions for dense prediction in 3D. In: CVPR (2018)","DOI":"10.1109\/CVPR.2018.00409"},{"key":"21_CR81","doi-asserted-by":"crossref","unstructured":"Tchapmi, L.P., Choy, C.B., Armeni, I., Gwak, J., Savarese, S.: SEGCloud: semantic segmentation of 3d point clouds. In: 3DV (2017)","DOI":"10.1109\/3DV.2017.00067"},{"key":"21_CR82","doi-asserted-by":"crossref","unstructured":"Thomas, H., et al.: KPConv: flexible and deformable convolution for point clouds. In: ICCV (2019)","DOI":"10.1109\/ICCV.2019.00651"},{"key":"21_CR83","doi-asserted-by":"crossref","unstructured":"Wang, J., Rupprecht, C., Novotny, D.: PoseDiffusion: solving pose estimation via diffusion-aided bundle adjustment. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00896"},{"key":"21_CR84","unstructured":"Wang, J., et al.: Diffusion model is secretly a training-free open vocabulary semantic segmenter. arXiv preprint arXiv:2309.02773 (2023)"},{"key":"21_CR85","doi-asserted-by":"crossref","unstructured":"Wang, T., Li, J., An, X.: An efficient scene semantic labeling approach for 3D point cloud. In: ITSC (2015)","DOI":"10.1109\/ITSC.2015.342"},{"key":"21_CR86","doi-asserted-by":"crossref","unstructured":"Xu, J., Liu, S., Vahdat, A., Byeon, W., Wang, X., De\u00a0Mello, S.: Open-vocabulary panoptic segmentation with text-to-image diffusion models. In: CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00289"},{"key":"21_CR87","unstructured":"Xu, Z., He, Z., Wu, J., Song, S.: Learning 3D dynamic scene representations for robot manipulation. arXiv preprint arXiv:2011.01968 (2020)"},{"key":"21_CR88","doi-asserted-by":"crossref","unstructured":"Yang, X., Wang, X.: Diffusion model as representation learner. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01736"},{"key":"21_CR89","doi-asserted-by":"crossref","unstructured":"Zhang, J., Dong, R., Ma, K.: CLIP-FO3D: learning free open-world 3D scene representations from 2D dense clip. arXiv preprint arXiv:2303.04748 (2023)","DOI":"10.1109\/ICCVW60793.2023.00219"},{"key":"21_CR90","doi-asserted-by":"crossref","unstructured":"Zhang, R., et al.: PointCLIP: point cloud understanding by clip. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00836"},{"key":"21_CR91","doi-asserted-by":"crossref","unstructured":"Zhao, W., Rao, Y., Liu, Z., Liu, B., Zhou, J., Lu, J.: Unleashing text-to-image diffusion models for visual perception. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.00527"},{"key":"21_CR92","doi-asserted-by":"crossref","unstructured":"Zheng, M., et al.: Weakly supervised contrastive learning. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00989"},{"key":"21_CR93","doi-asserted-by":"publisher","unstructured":"Zhou, C., Loy, C.C., Dai, B.: Extract free dense labels from CLIP. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) Computer Vision, ECCV 2022. LNCS, vol. 13688. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19815-1_40","DOI":"10.1007\/978-3-031-19815-1_40"},{"key":"21_CR94","doi-asserted-by":"crossref","unstructured":"Zhu, X., et al.: Weakly supervised 3d semantic segmentation using cross-image consensus and inter-voxel affinity relations. In: ICCV (2021)","DOI":"10.1109\/ICCV48922.2021.00283"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-73397-0_21","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,2]],"date-time":"2024-11-02T19:20:46Z","timestamp":1730575246000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-73397-0_21"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,3]]},"ISBN":["9783031733963","9783031733970"],"references-count":94,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-73397-0_21","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,3]]},"assertion":[{"value":"3 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}