{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T18:03:36Z","timestamp":1784311416992,"version":"3.55.0"},"reference-count":39,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T00:00:00Z","timestamp":1784246400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T00:00:00Z","timestamp":1784246400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Humanities and Social Science Fund of Ministry of Education","award":["24YJCZH458"],"award-info":[{"award-number":["24YJCZH458"]}]},{"name":"R&D Program of Beijing Municipal Education Commission","award":["KM202310009002"],"award-info":[{"award-number":["KM202310009002"]}]},{"name":"Yuxiu Innovation Project of NCUT","award":["2024NCUTYXCX202"],"award-info":[{"award-number":["2024NCUTYXCX202"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1007\/s00371-026-04626-4","type":"journal-article","created":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T17:25:50Z","timestamp":1784309150000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Mask-aware tri-modal learning for indoor 3D object detection"],"prefix":"10.1007","volume":"42","author":[{"given":"Feng","family":"Zhou","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hui","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kaida","family":"Ning","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Junjun","family":"Pan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jin","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9397-8539","authenticated-orcid":false,"given":"Ju","family":"Dai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,7,17]]},"reference":[{"key":"4626_CR1","doi-asserted-by":"crossref","unstructured":"Armeni, I., Sener, O., Zamir, A.R., Jiang, H., Brilakis, I., Fischer, M., Savarese, S.: 3d semantic parsing of large-scale indoor spaces, CVPR (2016)","DOI":"10.1109\/CVPR.2016.170"},{"key":"4626_CR2","doi-asserted-by":"crossref","unstructured":"Cheng, B., Sheng, L., Shi, S., Yang, M., Xu, D.: Back-tracing representative points for voting-based 3d object detection in point clouds, pp. 8959\u20138968. CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00885"},{"key":"4626_CR3","doi-asserted-by":"crossref","unstructured":"Cheng, Z., Wu, F., Qian, P., Zhao, Z., Yang, X.: Aic3dod: Advancing indoor class-incremental 3d object detection with point transformer architecture and room layout constraints, pp. 7501\u20137510. WACV (2025)","DOI":"10.1109\/WACV61041.2025.00730"},{"key":"4626_CR4","doi-asserted-by":"crossref","unstructured":"Dai, A., Chang, A.X., Savva, M., Halber, M., Funkhouser, T., Nie\u00dfner, M.: Scannet: Richly-annotated 3d reconstructions of indoor scenes. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.261"},{"key":"4626_CR5","doi-asserted-by":"crossref","unstructured":"Kolodiazhnyi, M., Vorontsova, A., Konushin, A., Rukhovich, D.: Oneformer3d: One transformer for unified point cloud segmentation, pp. 20943\u201320953. CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.01979"},{"key":"4626_CR6","doi-asserted-by":"publisher","first-page":"4365","DOI":"10.1609\/aaai.v39i4.32459","volume":"39","author":"M Kolodiazhnyi","year":"2025","unstructured":"Kolodiazhnyi, M., Vorontsova, A., Skripkin, M., Rukhovich, D., Konushin, A.: Unidet3d: Multi-dataset indoor 3d object detection. AAAI 39, 4365\u20134373 (2025)","journal-title":"AAAI"},{"key":"4626_CR7","doi-asserted-by":"crossref","unstructured":"Li, L.H., Zhang, P., Zhang, H., Yang, J., Li, C., Zhong, W., Wang, L., Gao, J.: Grounded language-image pre-training. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.01069"},{"key":"4626_CR8","doi-asserted-by":"crossref","unstructured":"Li, X., Wang, W., Hu, X., Li, J., Tang, J., Yang, J.: Generalized focal loss v2: Learning reliable localization quality estimation for dense object detection. In: CVPR, pp. 11,632\u201311,641 (2021)","DOI":"10.1109\/CVPR46437.2021.01146"},{"key":"4626_CR9","doi-asserted-by":"crossref","unstructured":"Li, Z., Yu, H., Ding, Y., Qiao, J., Azam, B., Akhtar, N.: Go-n3rdet: Geometry optimized nerf-enhanced 3d object detector, pp. 27211\u201327221. CVPR (2025)","DOI":"10.1109\/CVPR52734.2025.02534"},{"key":"4626_CR10","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, C., Li, Y., Lee, Y.J.: Improved baselines with visual instruction tuning. In: CVPR (2024). 10.48550\/arXiv.2310.03744","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"4626_CR11","doi-asserted-by":"crossref","unstructured":"Liu, M., Shi, R., Kuang, K., Zhu, Y., Li, X., Han, S., Cai, H., Porikli, F., Su, H.: Openshape: Scaling up 3d shape representation towards open-world understanding, NeurIPS (2023)","DOI":"10.52202\/075280-1944"},{"key":"4626_CR12","doi-asserted-by":"crossref","unstructured":"Liu, S., Zeng, Z., Ren, T., Li, F., Zhang, H., Yang, J., Jiang, Q., Li, C., Yang, J., Su, H., Zhu, J., Zhang, L.: Grounding dino: Marrying dino with grounded pre-training for open-set object detection. In: ECCV, pp. 38\u201355 (2024)","DOI":"10.1007\/978-3-031-72970-6_3"},{"key":"4626_CR13","doi-asserted-by":"crossref","unstructured":"Liu, Z., Zhang, Z., Cao, Y., Hu, H., Tong, X.: Group-free 3d object detection via transformers. In: ICCV, pp. 2949\u20132958. (2021)","DOI":"10.1109\/ICCV48922.2021.00294"},{"key":"4626_CR14","doi-asserted-by":"crossref","unstructured":"Minderer, M., Gritsenko, A., Stone, A., Neumann, M., Weissenborn, D., Dosovitskiy, A., Mahendran, A., Arnab, A., Dehghani, M., Shen, Z., Wang, X., Zhai, X., Kipf, T., Houlsby, N.: Simple open-vocabulary object detection with vision transformers, ECCV (2022)","DOI":"10.1007\/978-3-031-20080-9_42"},{"key":"4626_CR15","doi-asserted-by":"crossref","unstructured":"Misra, I., Girdhar, R., Joulin, A.: An end-to-end transformer model for 3d object detection. In: ICCV, pp. 2906\u20132917. (2021)","DOI":"10.1109\/ICCV48922.2021.00290"},{"key":"4626_CR16","doi-asserted-by":"crossref","unstructured":"Ngo, T.D., Hua, B.S., Nguyen, K.: Isbnet: A 3d point cloud instance segmentation network with instance-aware sampling and box-aware dynamic convolution, pp. 13550\u201313559. CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.01302"},{"key":"4626_CR17","doi-asserted-by":"crossref","unstructured":"Nguyen, P.D.A., Ngo, T.D., Kalogerakis, E., Gan, C., Tran, A., Pham, C., Nguyen, K.: Open3dis: Open-vocabulary 3d instance segmentation with 2d mask guidance. In: CVPR, pp. 4018\u20134028 (2024)","DOI":"10.1109\/CVPR52733.2024.00385"},{"key":"4626_CR18","doi-asserted-by":"crossref","unstructured":"Peng, S., Genova, K., Jiang, C.M., Tagliasacchi, A., Pollefeys, M., Funkhouser, T.: Openscene: 3d scene understanding with open vocabularies, pp. 815\u2013824. CVPR (2023)","DOI":"10.1109\/CVPR52729.2023.00085"},{"key":"4626_CR19","doi-asserted-by":"crossref","unstructured":"Qi, C.R., Litany, O., He, K., Guibas, L.J.: Deep hough voting for 3d object detection in point clouds. In: ICCV, pp. 9277\u20139286. (2019)","DOI":"10.1109\/ICCV.2019.00937"},{"key":"4626_CR20","unstructured":"Qi, C.R., Yi, L., Su, H., Guibas, L.J.: Pointnet++: Deep hierarchical feature learning on point sets in a metric space. In: NeurIPS (2017)"},{"key":"4626_CR21","doi-asserted-by":"crossref","unstructured":"Qian, G., Li, Y., Peng, H., Mai, J., Hammoud, H., Elhoseiny, M., Ghanem, B.: Pointnext: Revisiting pointnet++ with improved training and scaling strategies. In: NeurIPS (2022)","DOI":"10.52202\/068431-1685"},{"key":"4626_CR22","doi-asserted-by":"crossref","unstructured":"Rukhovich, D., Vorontsova, A., Konushin, A.: Fcaf3d: Fully convolutional anchor-free 3d object detection, pp. 477\u2013493. ECCV (2022)","DOI":"10.1007\/978-3-031-20080-9_28"},{"key":"4626_CR23","doi-asserted-by":"crossref","unstructured":"Schult, J., Engelmann, F., Hermans, A., Litany, O., Tang, S., Leibe, B.: Mask3d: Mask transformer for 3d semantic instance segmentation. In: ICRA, pp. 8216\u20138223 (2023)","DOI":"10.1109\/ICRA48891.2023.10160590"},{"key":"4626_CR24","unstructured":"Shen, Y., Geng, Z., Yuan, Y., Lin, Y., Liu, Z., Wang, C., Hu, H., Zheng, N., Guo, B.: V-detr: Detr with vertex relative position encoding for 3d object detection, p. ICLR. (2024)"},{"key":"4626_CR25","doi-asserted-by":"crossref","unstructured":"Tai, H., He, Q., Qian, Y., Hu, X., Li, X., Liu, Y., Zhang, J.: Open-vocabulary sam3d: Towards training-free open-vocabulary 3d scene understanding. IEEE TCSVT (2026)","DOI":"10.1109\/TCSVT.2026.3680794"},{"key":"4626_CR26","doi-asserted-by":"crossref","unstructured":"Takmaz, A., Fedele, E., Sumner, R.W., Pollefeys, M., Tombari, F., Engelmann, F.: Openmask3d: Open-vocabulary 3d instance segmentation. NeurIPS , (2023)","DOI":"10.52202\/075280-2989"},{"key":"4626_CR27","doi-asserted-by":"crossref","unstructured":"Vu, T., Kim, K., Luu, T.M., Nguyen, T., Yoo, C.D.: Softgroup for 3d instance segmentation on point clouds, pp. 2708\u20132717. CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00273"},{"issue":"10","key":"4626_CR28","doi-asserted-by":"publisher","first-page":"6303","DOI":"10.1109\/TCSVT.2023.3272734","volume":"33","author":"C Wang","year":"2023","unstructured":"Wang, C., Deng, J., He, J., Zhang, T., Zhang, Z., Zhang, Y.: Long-short range adaptive transformer with dynamic sampling for 3d object detection. IEEE TCSVT 33(10), 6303\u20136318 (2023). https:\/\/doi.org\/10.1109\/TCSVT.2023.3272734","journal-title":"IEEE TCSVT"},{"key":"4626_CR29","doi-asserted-by":"crossref","unstructured":"Wang, H., Ding, L., Dong, S., Shi, S., Li, A., Li, J., Li, Z., Wang, L.: Cagroup3d: Class-aware grouping for 3d object detection on point clouds. NeurIPS 35, 29975\u201329988 (2022)","DOI":"10.52202\/068431-2173"},{"key":"4626_CR30","doi-asserted-by":"crossref","unstructured":"Wang, Z., Li, Y.L., Chen, X., Zhao, H., Wang, S.: Uni3detr: Unified 3d detection transformer. In: NeurIPS (2023)","DOI":"10.52202\/075280-1733"},{"key":"4626_CR31","doi-asserted-by":"crossref","unstructured":"Wu, X., Jiang, L., Wang, P.S., Liu, Z., Liu, X., Qiao, Y., Ouyang, W., He, T., Zhao, H.: Point transformer v3: Simpler, faster, stronger. In: CVPR (2024)","DOI":"10.1109\/CVPR52733.2024.00463"},{"key":"4626_CR32","doi-asserted-by":"crossref","unstructured":"Xue, L., Gao, M., Xing, C., Mart\u00edn-Mart\u00edn, R., Wu, J., Xiong, C., Xu, R., Niebles, J.C., Savarese, S.: Ulip: Learning a unified representation of language, images, and point clouds for 3d understanding. In: CVPR (2023). 10.48550\/arXiv.2212.05171","DOI":"10.1109\/CVPR52729.2023.00120"},{"key":"4626_CR33","doi-asserted-by":"crossref","unstructured":"Zhang, H., Wang, Y., Dayoub, F., S\u00fcnderhauf, N.: Varifocalnet: An iou-aware dense object detector, pp. 8514\u20138523. CVPR (2021)","DOI":"10.1109\/CVPR46437.2021.00841"},{"key":"4626_CR34","doi-asserted-by":"crossref","unstructured":"Zhang, R., Guo, Z., Zhang, W., Li, K., Miao, X., Cui, B., Qiao, Y., Gao, P., Li, H.: Pointclip: Point cloud understanding by clip. In: CVPR (2022)","DOI":"10.1109\/CVPR52688.2022.00836"},{"key":"4626_CR35","doi-asserted-by":"publisher","unstructured":"Zhang, Z., Sun, B., Yang, H., Huang, Q.: H3dnet: 3d object detection using hybrid geometric primitives. In: ECCV (2020). https:\/\/doi.org\/10.1007\/978-3-030-58539-6_27","DOI":"10.1007\/978-3-030-58539-6_27"},{"key":"4626_CR36","doi-asserted-by":"crossref","unstructured":"Zhao, H., Jiang, L., Jia, J., Torr, P.H.S., Koltun, V.: Point transformer. In: ICCV, pp. 16239\u201316248. (2021)","DOI":"10.1109\/ICCV48922.2021.01595"},{"key":"4626_CR37","doi-asserted-by":"publisher","first-page":"10734","DOI":"10.1609\/aaai.v39i10.33166","volume":"39","author":"F Zhou","year":"2025","unstructured":"Zhou, F., Zhang, Q., Dai, J., Li, L., Fan, Q., Xing, J.: Position-aware guided point cloud completion with clip model. AAAI 39, 10734\u201310742 (2025). https:\/\/doi.org\/10.1609\/aaai.v39i10.33166","journal-title":"AAAI"},{"key":"4626_CR38","unstructured":"Zhou, Y., Gu, J., Chiang, T.Y., Xiang, F., Su, H.: Point-sam: Promptable 3d segmentation model for point clouds, p. ICLR. (2025)"},{"key":"4626_CR39","doi-asserted-by":"publisher","first-page":"7811","DOI":"10.1609\/aaai.v38i7.28616","volume":"38","author":"Y Zhu","year":"2024","unstructured":"Zhu, Y., Hui, L., Shen, Y., Xie, J.: Spgroup3d: Superpoint grouping network for indoor 3d object detection. AAAI 38, 7811\u20137819 (2024)","journal-title":"AAAI"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-026-04626-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-026-04626-4","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-026-04626-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T17:25:55Z","timestamp":1784309155000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-026-04626-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,17]]},"references-count":39,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2026,8]]}},"alternative-id":["4626"],"URL":"https:\/\/doi.org\/10.1007\/s00371-026-04626-4","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7,17]]},"assertion":[{"value":"30 April 2026","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 June 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 July 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare no conflict of interest.","order":1,"name":"Ethics","label":"Conflict of interest","group":{"name":"EthicsHeading","label":"Declarations"}}],"article-number":"419"}}