{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,20]],"date-time":"2025-08-20T12:21:34Z","timestamp":1755692494536,"version":"3.37.3"},"reference-count":56,"publisher":"Springer Science and Business Media LLC","issue":"21","license":[{"start":{"date-parts":[[2024,4,23]],"date-time":"2024-04-23T00:00:00Z","timestamp":1713830400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,4,23]],"date-time":"2024-04-23T00:00:00Z","timestamp":1713830400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62173045","6167319"],"award-info":[{"award-number":["62173045","6167319"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["Fundamental Research Funds for the Central Universities"],"award-info":[{"award-number":["Fundamental Research Funds for the Central Universities"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100010229","name":"Natural Science Foundation of Tianjin Municipal Science and Technology Commission","doi-asserted-by":"publisher","award":["622RC675"],"award-info":[{"award-number":["622RC675"]}],"id":[{"id":"10.13039\/501100010229","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Comput &amp; Applic"],"published-print":{"date-parts":[[2024,7]]},"DOI":"10.1007\/s00521-024-09764-1","type":"journal-article","created":{"date-parts":[[2024,4,23]],"date-time":"2024-04-23T13:01:48Z","timestamp":1713877308000},"page":"12977-12990","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Lgvc: language-guided visual context modeling for 3D visual grounding"],"prefix":"10.1007","volume":"36","author":[{"given":"Liang","family":"Geng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianqin","family":"Yin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yingchun","family":"Niu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,4,23]]},"reference":[{"issue":"1","key":"9764_CR1","doi-asserted-by":"publisher","first-page":"74","DOI":"10.1007\/s11263-016-0965-7","volume":"123","author":"BA Plummer","year":"2017","unstructured":"Plummer BA, Wang L, Cervantes CM, Caicedo JC, Hockenmaier J, Lazebnik S (2017) Flickr30k entities: collecting region-to-phrase correspondences for richer image-to-sentence models. Int J Comput Vis 123(1):74\u201393","journal-title":"Int J Comput Vis"},{"key":"9764_CR2","doi-asserted-by":"crossref","unstructured":"Kazemzadeh S, Ordonez V, Matten M, Berg T (2014) Referitgame: referring to objects in photographs of natural scenes. In: Proceedings of the 2014 conference on empirical methods in natural language processing (EMNLP), pp 787\u2013798","DOI":"10.3115\/v1\/D14-1086"},{"key":"9764_CR3","doi-asserted-by":"crossref","unstructured":"Yu L, Poirson P, Yang S, Berg AC, Berg TL (2016) Modeling context in referring expressions. In: European conference on computer vision, pp 69\u201385. Springer","DOI":"10.1007\/978-3-319-46475-6_5"},{"key":"9764_CR4","doi-asserted-by":"crossref","unstructured":"Yang Z, Gong B, Wang L, Huang W, Yu D, Luo J (2019) A fast and accurate one-stage approach to visual grounding. In: ICCV, pp 4683\u20134693","DOI":"10.1109\/ICCV.2019.00478"},{"key":"9764_CR5","doi-asserted-by":"crossref","unstructured":"Wang P, Wu Q, Cao J, Shen C, Gao L, Hengel van den A (2019) Neighbourhood watch: referring expression comprehension via language-guided graph attention networks. In: CVPR, pp 1960\u20131968","DOI":"10.1109\/CVPR.2019.00206"},{"key":"9764_CR6","doi-asserted-by":"crossref","unstructured":"Yu L, Lin Z, Shen X, Yang J, Lu X, Bansal M, Berg TL (2018) Mattnet: modular attention network for referring expression comprehension. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1307\u20131315","DOI":"10.1109\/CVPR.2018.00142"},{"key":"9764_CR7","doi-asserted-by":"crossref","unstructured":"Chen DZ, Chang AX, Nie\u00dfner M (2020) Scanrefer: 3d object localization in rgb-d scans using natural language. In: ECCV","DOI":"10.1007\/978-3-030-58565-5_13"},{"key":"9764_CR8","doi-asserted-by":"crossref","unstructured":"Achlioptas P, Abdelreheem A, Xia F, Elhoseiny M, Guibas L (2020) Referit3d: neural listeners for fine-grained 3d object identification in real-world scenes. In: ECCV, pp 422\u2013440. Springer","DOI":"10.1007\/978-3-030-58452-8_25"},{"key":"9764_CR9","doi-asserted-by":"crossref","unstructured":"Xia F, Zamir AR, He Z, Sax A, Malik J, Savarese S (2018) Gibson env: real-world perception for embodied agents. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 9068\u20139079","DOI":"10.1109\/CVPR.2018.00945"},{"key":"9764_CR10","doi-asserted-by":"crossref","unstructured":"Savva M, Kadian A, Maksymets O, Zhao Y, Wijmans E, Jain B, Straub J, Liu J, Koltun V, Malik J et al (2019) Habitat: a platform for embodied ai research. In: ICCV, pp 9339\u20139347","DOI":"10.1109\/ICCV.2019.00943"},{"issue":"11","key":"9764_CR11","doi-asserted-by":"publisher","first-page":"2947","DOI":"10.1109\/TVCG.2018.2868591","volume":"24","author":"K Kim","year":"2018","unstructured":"Kim K, Billinghurst M, Bruder G, Duh HBL, Welch GF (2018) Revisiting trends in augmented reality research: a review of the 2nd decade of ismar (2008\u20132017). IEEE Trans Visual Comput Graphics 24(11):2947\u20132962","journal-title":"IEEE Trans Visual Comput Graphics"},{"key":"9764_CR12","doi-asserted-by":"crossref","unstructured":"Kress Bernard C, Cummings William J (2017) 11-1: Invited paper: Towards the ultimate mixed reality experience: Hololens display architecture choices. In SID symposium digest of technical papers, volume 48, pages 127-131. Wiley Online Library","DOI":"10.1002\/sdtp.11586"},{"key":"9764_CR13","doi-asserted-by":"crossref","unstructured":"He D, Zhao Y, Luo J, Hui T, Huang S, Zhang A, Liu S (2021) Transrefer3d: Entity-and-relation aware transformer for fine-grained 3d visual grounding. In: Proceedings of the 29th ACM international conference on multimedia","DOI":"10.1145\/3474085.3475397"},{"key":"9764_CR14","unstructured":"Roh J, Desingh K, Farhadi A, Fox D (2021) Languagerefer: spatial-language model for 3d visual grounding. In: CoRL"},{"key":"9764_CR15","doi-asserted-by":"crossref","unstructured":"Yang Z, Zhang S, Wang L, Luo J (2021) Sat: 2d semantics assisted training for 3d visual grounding. In: ICCV","DOI":"10.1109\/ICCV48922.2021.00187"},{"key":"9764_CR16","doi-asserted-by":"crossref","unstructured":"Yuan Z, Yan X, Liao Y, Zhang R, Wang S, Li Z, Cui S (2021) Instancerefer: cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring. In: ICCV","DOI":"10.1109\/ICCV48922.2021.00181"},{"key":"9764_CR17","doi-asserted-by":"crossref","unstructured":"Phan AV, Nguyen ML, Nguyen YLH, Bui LT (2018) Dgcnn: a convolutional neural network over large-scale labeled graphs. Neural Networks","DOI":"10.1016\/j.neunet.2018.09.001"},{"key":"9764_CR18","doi-asserted-by":"crossref","unstructured":"Huang PH, Lee HH, Chen HT, Liu TL (2021) Text-guided graph neural networks for referring 3D instance segmentation. In: Proceedings of the AAAI conference on artificial intelligence 35, pp 1610\u20131618","DOI":"10.1609\/aaai.v35i2.16253"},{"key":"9764_CR19","doi-asserted-by":"crossref","unstructured":"Zhao L, Daigang CL, Sheng, Dong X, (2021) 3DVGTransformer: relation modeling for visual grounding on point clouds. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 2928\u20132937","DOI":"10.1109\/ICCV48922.2021.00292"},{"key":"9764_CR20","doi-asserted-by":"crossref","unstructured":"Sadhu A, Chen K, Nevatia R (2019) Zero-shot grounding of objects from natural language queries. In: ICCV, pp 4694\u20134703","DOI":"10.1109\/ICCV.2019.00479"},{"key":"9764_CR21","doi-asserted-by":"crossref","unstructured":"Yang Z, Chen T, Wang L, Luo J (2020) Improving one-stage visual grounding by recursive subquery construction. In: ECCV","DOI":"10.1007\/978-3-030-58568-6_23"},{"key":"9764_CR22","doi-asserted-by":"crossref","unstructured":"Huang S, Chen Y, Jia J, Wang L (2022) Multi-view transformer for 3D visual grounding. In: CVPR","DOI":"10.1109\/CVPR52688.2022.01508"},{"key":"9764_CR23","unstructured":"Veli\u010dkovi\u0107 P, Cucurull G, Casanova A, Romero A, Li\u00f2 P, Bengio Y (2018) Graph attention networks. In: Proceedings of ICLR"},{"key":"9764_CR24","unstructured":"Hu W, Fey M, Zitnik M, Dong Y, Ren H, Liu B, Catasta M, Leskovec J (2020) Open graph benchmark: Datasets for machine learning on graphs. arXiv preprint arXiv:2005.00687"},{"key":"9764_CR25","unstructured":"Li G, Xiong C, Thabet A, Ghanem B (2020) Deepergcn: all you need to train deeper gcns. arXiv preprint arXiv:2006.07739"},{"key":"9764_CR26","unstructured":"Gilmer J, Schoenholz SS, Riley PF, Vinyals O, Dahl GE (2017) Neural message passing for quantum chemistry. In: International conference on machine learning, pp 1263\u20131272. PMLR"},{"key":"9764_CR27","doi-asserted-by":"crossref","unstructured":"Wang G, Ying R, Huang J, Leskovec J (2020) Direct multi-hop attention based graph neural network. arXiv preprint arXiv:2009.14332","DOI":"10.24963\/ijcai.2021\/425"},{"key":"9764_CR28","doi-asserted-by":"crossref","unstructured":"Yang S, Li G, Yu Y (2019) Dynamic graph attention for referring expression comprehension. In: CVPR","DOI":"10.1109\/ICCV.2019.00474"},{"key":"9764_CR29","doi-asserted-by":"crossref","unstructured":"Yang S, Li G, Yu Y (2019) Cross-modal relationship inference for grounding referring expressions. In: CVPR","DOI":"10.1109\/CVPR.2019.00427"},{"key":"9764_CR30","doi-asserted-by":"crossref","unstructured":"Jiang L, Zhao H, Shi S, Liu S, Fu CW, Jia J (2020) Pointgroup: dual-set point grouping for 3d instance segmentation. In: CVPR","DOI":"10.1109\/CVPR42600.2020.00492"},{"key":"9764_CR31","doi-asserted-by":"crossref","unstructured":"Liu Z, Zhang Z, Cao Y, Hu H, Tong X (2021) Group-free 3d object detection via transformers. In: ICCV","DOI":"10.1109\/ICCV48922.2021.00294"},{"key":"9764_CR32","doi-asserted-by":"crossref","unstructured":"Luo J, Fu1 J, Kong X, Gao C, Ren H, Shen H, Xia H, Liu S (2022) 3D-SPS: single-stage 3D visual grounding via referred point progressive selection. In: CVPR2022","DOI":"10.1109\/CVPR52688.2022.01596"},{"key":"9764_CR33","doi-asserted-by":"crossref","unstructured":"Liao Y, Liu S, Li G, Wang F, Chen Y, Qian C, Li B (2020) A real-time cross-modality correlation filtering method for referring expression comprehension. In: CVPR","DOI":"10.1109\/CVPR42600.2020.01089"},{"key":"9764_CR34","doi-asserted-by":"crossref","unstructured":"Mittal V (2020) Attngrounder: talking to cars with attention. In: European conference on computer vision, pp 62\u201373. Springer","DOI":"10.1007\/978-3-030-66096-3_6"},{"key":"9764_CR35","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning CD (2014) Glove: Global vectors for word representation. In: Proceedings of the 2014 conference","DOI":"10.3115\/v1\/D14-1162"},{"key":"9764_CR36","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Aidan NG, \u0141ukasz K, Illia P (2017) Attention is all you need. In: NeurIPS"},{"key":"9764_CR37","doi-asserted-by":"crossref","unstructured":"Shaw P, Uszkoreit J, Vaswani A (2018) Self-attention with relative position representations. ACL","DOI":"10.18653\/v1\/N18-2074"},{"key":"9764_CR38","doi-asserted-by":"crossref","unstructured":"Dai Z, Yang Z, Yang Y, Jaime GC, Quoc L, Ruslan S (2019) Attentive language models beyond a fixed-length context. In: ACL, Transformer-xl","DOI":"10.18653\/v1\/P19-1285"},{"key":"9764_CR39","doi-asserted-by":"crossref","unstructured":"Hui T, Liu S, Huang S, Linguistic structure guided context modeling for referring image segmentation[C], , Computer Vision-ECCV, et al (2020) 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part X 16. Springer International Publishing 2020:59\u201375","DOI":"10.1007\/978-3-030-58607-2_4"},{"key":"9764_CR40","doi-asserted-by":"crossref","unstructured":"Ding Z, Hui T, Huang J et al (2022) Language-bridged spatial-temporal interaction for referring video object segmentation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition. 4964\u20134973","DOI":"10.1109\/CVPR52688.2022.00491"},{"key":"9764_CR41","unstructured":"Tianrui H et al (2023) Language-aware spatial-temporal collaboration for referring video segmentation. IEEE Trans Pattern Anal Mach Intell"},{"key":"9764_CR42","doi-asserted-by":"crossref","unstructured":"Feng M, Li Z, Li Q, Zhang L, Zhang X, Zhu G, Zhang H, Wang Y, Mian A (2021) Free-form description guided 3d visual graph network for object grounding in point cloud. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 3722\u20133731","DOI":"10.1109\/ICCV48922.2021.00370"},{"key":"9764_CR43","doi-asserted-by":"crossref","unstructured":"Qi CR, Litany O, He K, Guibas LJ (2019) Deep hough voting for 3d object detection in point clouds. In: proceedings of the IEEE\/CVF international conference on computer vision, pp 9277\u20139286","DOI":"10.1109\/ICCV.2019.00937"},{"key":"9764_CR44","doi-asserted-by":"crossref","unstructured":"Cai D, Zhao L, Zhang J, Sheng L, Xu D (2022) 3djcg: A unified framework for joint dense captioning and visual grounding on 3d point clouds. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 16464\u201316473","DOI":"10.1109\/CVPR52688.2022.01597"},{"issue":"1","key":"9764_CR45","doi-asserted-by":"publisher","first-page":"852","DOI":"10.1109\/TPAMI.2022.3159003","volume":"45","author":"X Wen","year":"2022","unstructured":"Wen X, Xiang P, Han Z et al (2022) PMP-Net++: point cloud completion by transformer-enhanced multi-step point moving paths. IEEE Trans Pattern Anal Mach Intell 45(1):852\u2013867","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"9764_CR46","unstructured":"Qi C R, Yi L, Su H et al (2017) Pointnet++: deep hierarchical feature learning on point sets in a metric space. Adv Neural Inf Process Syst, 30"},{"key":"9764_CR47","doi-asserted-by":"crossref","unstructured":"Dey R, Salem FM (2017) Gate-variants of gated recurrent unit (GRU) neural networks. In: 2017 IEEE 60th international midwest symposium on circuits and systems (MWSCAS). IEEE, pp 1597-1600","DOI":"10.1109\/MWSCAS.2017.8053243"},{"key":"9764_CR48","unstructured":"Dave ZC et al (2022) D3Net: a unified speaker-listener architecture for 3D dense captioning and visual grounding. In: European conference on computer vision. Cham, Springer Nature Switzerland"},{"key":"9764_CR49","unstructured":"Chen J, Luo W, Wei X, Ma L, Zhang W (2022) Ham: hierarchical attention model with high performance for 3d visual grounding. arXiv preprint arXiv:2210.12513, 2"},{"key":"9764_CR50","unstructured":"Wansen W et al (2023) Vision-language navigation: a survey and taxonomy. Neural Comput Appl 1\u201326"},{"key":"9764_CR51","doi-asserted-by":"publisher","first-page":"9015","DOI":"10.1007\/s00521-022-06923-0","volume":"34.11","author":"J Zhao","year":"2022","unstructured":"Zhao J et al (2022) Overcoming language priors in VQA via adding visual module. Neural Comput Appl 34.11:9015\u20139023","journal-title":"Neural Comput Appl"},{"key":"9764_CR52","doi-asserted-by":"publisher","first-page":"10485","DOI":"10.1007\/s00521-021-05807-z","volume":"33","author":"C Chen","year":"2021","unstructured":"Chen C, Xiaodong G (2021) Context-aware network with foreground recalibration for grounding natural language in video. Neural Comput Appl 33:10485\u201310502","journal-title":"Neural Comput Appl"},{"key":"9764_CR53","doi-asserted-by":"crossref","unstructured":"Abdelreheem A, Upadhyay U, Skorokhodov I, Yahya RAl, Chen J, Elhoseiny M (2022) 3dreftransformer: Fine-grained object identification in realworld scenes using natural language. In: Proceedings of the IEEE\/CVF winter conference on applications of computer vision, pp 3941\u20133950","DOI":"10.1109\/WACV51458.2022.00068"},{"key":"9764_CR54","doi-asserted-by":"crossref","unstructured":"Jain A, Gkanatsios N, Mediratta I, Fragkiadaki K (2022) Bottom up top down detection transformers for language grounding in images and point clouds. In: Proceedings of the European Conference on Computer Vision, pp 417\u2013433. Springer","DOI":"10.1007\/978-3-031-20059-5_24"},{"key":"9764_CR55","doi-asserted-by":"crossref","unstructured":"Jain A, Gkanatsios N, Mediratta I, Fragkiadaki K (2022) Bottom up top down detection transformers for language grounding in images and point clouds. In: Proceedings of the European conference on computer vision, pp 417\u2013433. Springer","DOI":"10.1007\/978-3-031-20059-5_24"},{"key":"9764_CR56","unstructured":"Yanmin W et al (2023) EDA: Explicit Text-Decoupling and Dense Alignment for 3D Visual Grounding. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition"}],"container-title":["Neural Computing and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-024-09764-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00521-024-09764-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00521-024-09764-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,12]],"date-time":"2024-07-12T10:09:56Z","timestamp":1720778996000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00521-024-09764-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,4,23]]},"references-count":56,"journal-issue":{"issue":"21","published-print":{"date-parts":[[2024,7]]}},"alternative-id":["9764"],"URL":"https:\/\/doi.org\/10.1007\/s00521-024-09764-1","relation":{},"ISSN":["0941-0643","1433-3058"],"issn-type":[{"type":"print","value":"0941-0643"},{"type":"electronic","value":"1433-3058"}],"subject":[],"published":{"date-parts":[[2024,4,23]]},"assertion":[{"value":"31 May 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 March 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 April 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors have no relevant financial or nonfinancial interests to disclose.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}