{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T20:17:53Z","timestamp":1783109873244,"version":"3.54.6"},"reference-count":45,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2025YFE0113500"],"award-info":[{"award-number":["2025YFE0113500"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100014219","name":"National Science Fund for Distinguished Young Scholars","doi-asserted-by":"publisher","award":["62525605"],"award-info":[{"award-number":["62525605"]}],"id":[{"id":"10.13039\/501100014219","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U22B2051"],"award-info":[{"award-number":["U22B2051"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62302411"],"award-info":[{"award-number":["62302411"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U25B2066"],"award-info":[{"award-number":["U25B2066"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113854","type":"journal-article","created":{"date-parts":[[2026,4,27]],"date-time":"2026-04-27T23:31:47Z","timestamp":1777332707000},"page":"113854","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PD","title":["3D-STMN++: Leveraging semantic proxies to enhance superpoint-text matching for 3D Referring Expression Segmentation"],"prefix":"10.1016","volume":"179","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-3593-5142","authenticated-orcid":false,"given":"Changli","family":"Wu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qi","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiayi","family":"Ji","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-1235-5016","authenticated-orcid":false,"given":"Yihang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yiwei","family":"Ma","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3912-9306","authenticated-orcid":false,"given":"Xiaoshuai","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7645-9606","authenticated-orcid":false,"given":"Liujuan","family":"Cao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113854_b1","series-title":"ECCV","first-page":"202","article-title":"Scanrefer: 3d object localization in rgb-d scans using natural language","author":"Chen","year":"2020"},{"key":"10.1016\/j.patcog.2026.113854_b2","series-title":"ECCV","first-page":"422","article-title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","author":"Achlioptas","year":"2020"},{"key":"10.1016\/j.patcog.2026.113854_b3","series-title":"ICCV","first-page":"2928","article-title":"3DVG-transformer: Relation modeling for visual grounding on point clouds","author":"Zhao","year":"2021"},{"key":"10.1016\/j.patcog.2026.113854_b4","article-title":"R2G: Reasoning to ground in 3D scenes","author":"Li","year":"2025","journal-title":"PR"},{"key":"10.1016\/j.patcog.2026.113854_b5","article-title":"Adaptive depth position encoding for sparse query-based 3D object detection from multi-camera images","author":"Linghu","year":"2025","journal-title":"PR"},{"key":"10.1016\/j.patcog.2026.113854_b6","article-title":"Multimodal fusion via voting network for 3D object detection in indoors","volume":"164","author":"Li","year":"2025","journal-title":"PR"},{"key":"10.1016\/j.patcog.2026.113854_b7","article-title":"PVConvNet: Pixel-voxel sparse convolution for multimodal 3D object detection","volume":"149","author":"Liu","year":"2024","journal-title":"PR"},{"key":"10.1016\/j.patcog.2026.113854_b8","first-page":"1610","article-title":"Text-guided graph neural networks for referring 3d instance segmentation","volume":"vol. 35","author":"Huang","year":"2021"},{"key":"10.1016\/j.patcog.2026.113854_b9","series-title":"ICCV","first-page":"1791","article-title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","author":"Yuan","year":"2021"},{"key":"10.1016\/j.patcog.2026.113854_b10","first-page":"4551","article-title":"X-RefSeg3D: Enhancing referring 3D instance segmentation via structured cross-modal graph neural networks","volume":"vol. 38","author":"Qian","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b11","series-title":"ICCV","first-page":"4673","article-title":"Learning to assemble neural module tree networks for visual grounding","author":"Liu","year":"2019"},{"key":"10.1016\/j.patcog.2026.113854_b12","series-title":"CVPR","first-page":"16454","article-title":"3D-sps: Single-stage 3d visual grounding via referred point progressive selection","author":"Luo","year":"2022"},{"key":"10.1016\/j.patcog.2026.113854_b13","series-title":"CVPR","first-page":"4558","article-title":"Large-scale point cloud semantic segmentation with superpoint graphs","author":"Landrieu","year":"2018"},{"key":"10.1016\/j.patcog.2026.113854_b14","first-page":"5940","article-title":"3D-stmn: Dependency-driven superpoint-text matching network for end-to-end 3d referring expression segmentation","volume":"vol. 38","author":"Wu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b15","series-title":"ECCV","first-page":"69","article-title":"Modeling context in referring expressions","author":"Yu","year":"2016"},{"key":"10.1016\/j.patcog.2026.113854_b16","series-title":"CVPR","first-page":"10488","article-title":"Referring image segmentation via cross-modal progressive comprehension","author":"Huang","year":"2020"},{"issue":"5","key":"10.1016\/j.patcog.2026.113854_b17","first-page":"1333","article-title":"Referring image segmentation by generative adversarial learning","volume":"22","author":"Qiu","year":"2019","journal-title":"TMM"},{"key":"10.1016\/j.patcog.2026.113854_b18","series-title":"CVPR","first-page":"5828","article-title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","author":"Dai","year":"2017"},{"key":"10.1016\/j.patcog.2026.113854_b19","series-title":"ICCV","first-page":"1856","article-title":"Sat: 2d semantics assisted training for 3d visual grounding","author":"Yang","year":"2021"},{"key":"10.1016\/j.patcog.2026.113854_b20","series-title":"ICCV","first-page":"3722","article-title":"Free-form description guided 3d visual graph network for object grounding in point cloud","author":"Feng","year":"2021"},{"key":"10.1016\/j.patcog.2026.113854_b21","series-title":"ECCV","first-page":"417","article-title":"Bottom up top down detection transformers for language grounding in images and point clouds","author":"Jain","year":"2022"},{"key":"10.1016\/j.patcog.2026.113854_b22","series-title":"CVPR","first-page":"19231","article-title":"EDA: Explicit text-decoupling and dense alignment for 3D visual grounding","author":"Wu","year":"2023"},{"key":"10.1016\/j.patcog.2026.113854_b23","series-title":"A unified framework for 3d point cloud visual grounding","author":"Lin","year":"2023"},{"key":"10.1016\/j.patcog.2026.113854_b24","first-page":"59468","article-title":"A unified framework for 3d scene understanding","volume":"37","author":"Xu","year":"2024","journal-title":"NeurIPS"},{"key":"10.1016\/j.patcog.2026.113854_b25","series-title":"Empowering 3D visual grounding with reasoning capabilities","author":"Zhu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b26","series-title":"CVPR","first-page":"9031","article-title":"3D-mpa: Multi-proposal aggregation for 3d semantic instance segmentation","author":"Engelmann","year":"2020"},{"key":"10.1016\/j.patcog.2026.113854_b27","series-title":"ICCV","first-page":"2783","article-title":"Instance segmentation in 3D scenes using semantic superpoint tree networks","author":"Liang","year":"2021"},{"key":"10.1016\/j.patcog.2026.113854_b28","first-page":"2393","article-title":"Superpoint transformer for 3d scene instance segmentation","volume":"vol. 37","author":"Sun","year":"2023"},{"key":"10.1016\/j.patcog.2026.113854_b29","series-title":"CVPR","first-page":"17619","article-title":"Growsp: Unsupervised semantic segmentation of 3d point clouds","author":"Zhang","year":"2023"},{"key":"10.1016\/j.patcog.2026.113854_b30","series-title":"CVPR","first-page":"3292","article-title":"Sai3d: Segment any instance in 3d scenes","author":"Yin","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b31","series-title":"CVPR","first-page":"28274","article-title":"Maskclustering: View consensus based mask graph clustering for open-vocabulary 3d instance segmentation","author":"Yan","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b32","series-title":"CVPR","first-page":"20019","article-title":"Geoauxnet: Towards universal 3d representation learning for multi-sensor point clouds","author":"Zhang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b33","series-title":"CVPR","first-page":"20943","article-title":"Oneformer3d: One transformer for unified point cloud segmentation","author":"Kolodiazhnyi","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b34","series-title":"ICME","first-page":"1","article-title":"MPVNN: multi-resolution point-voxel non-parametric network for 3d point cloud processing","author":"Wen","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b35","first-page":"8052","article-title":"Pointgt: A method for point-cloud classification and segmentation based on local geometric transformation","volume":"26","author":"Zhang","year":"2024","journal-title":"TMM"},{"key":"10.1016\/j.patcog.2026.113854_b36","series-title":"CVPR","first-page":"4840","article-title":"Point transformer v3: Simpler faster stronger","author":"Wu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b37","series-title":"CVPR","first-page":"652","article-title":"Pointnet: Deep learning on point sets for 3d classification and segmentation","author":"Qi","year":"2017"},{"key":"10.1016\/j.patcog.2026.113854_b38","series-title":"ECCV","first-page":"349","article-title":"Segpoint: Segment any point cloud via large language model","author":"He","year":"2024"},{"key":"10.1016\/j.patcog.2026.113854_b39","series-title":"CVPR","first-page":"7097","article-title":"Pcl: Proxy-based contrastive learning for domain generalization","author":"Yao","year":"2022"},{"key":"10.1016\/j.patcog.2026.113854_b40","series-title":"CVPR","first-page":"7420","article-title":"Non-isotropy regularization for proxy-based deep metric learning","author":"Roth","year":"2022"},{"key":"10.1016\/j.patcog.2026.113854_b41","article-title":"Intra-modal proxy learning for zero-shot visual categorization with clip","volume":"36","author":"Qian","year":"2024","journal-title":"NeurIPS"},{"key":"10.1016\/j.patcog.2026.113854_b42","series-title":"A generalization of transformer networks to graphs","author":"Dwivedi","year":"2020"},{"key":"10.1016\/j.patcog.2026.113854_b43","first-page":"11164","article-title":"LESS: Label-efficient and single-stage referring 3D segmentation","volume":"37","author":"Liu","year":"2024","journal-title":"NeurIPS"},{"key":"10.1016\/j.patcog.2026.113854_b44","series-title":"CVPR","first-page":"3772","article-title":"3D-llava: Towards generalist 3d lmms with omni superpoint transformer","author":"Deng","year":"2025"},{"key":"10.1016\/j.patcog.2026.113854_b45","series-title":"3DV","article-title":"Reason3d: Searching and reasoning 3d segmentation via large language model","author":"Huang","year":"2025"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008198?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008198?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T19:24:52Z","timestamp":1783106692000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326008198"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":45,"alternative-id":["S0031320326008198"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113854","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"3D-STMN++: Leveraging semantic proxies to enhance superpoint-text matching for 3D Referring Expression Segmentation","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113854","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier Ltd.","name":"copyright","label":"Copyright"}],"article-number":"113854"}}