{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T13:21:57Z","timestamp":1783084917372,"version":"3.54.6"},"reference-count":53,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100007128","name":"Shaanxi Province Natural Science Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100007128","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2041"],"award-info":[{"award-number":["U21B2041"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004543","name":"China Scholarship Council","doi-asserted-by":"publisher","award":["202506560029"],"award-info":[{"award-number":["202506560029"]}],"id":[{"id":"10.13039\/501100004543","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100008642","name":"Center for Health Design","doi-asserted-by":"publisher","award":["300102244202"],"award-info":[{"award-number":["300102244202"]}],"id":[{"id":"10.13039\/100008642","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2023YFB4301800"],"award-info":[{"award-number":["2023YFB4301800"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002837","name":"Chang&apos;an University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002837","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Fusion"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.inffus.2026.104515","type":"journal-article","created":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T07:31:44Z","timestamp":1780299104000},"page":"104515","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["U2ENet: Unified end-to-end network for monocular image-based single-object and multi-object 3D visual grounding"],"prefix":"10.1016","volume":"136","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-0699-3992","authenticated-orcid":false,"given":"Keyu","family":"Guo","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-1414-6181","authenticated-orcid":false,"given":"Hongkai","family":"Wei","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-6462-6087","authenticated-orcid":false,"given":"Yongle","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hongli","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiangyu","family":"Song","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shijie","family":"Sun","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yi","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huansheng","family":"Song","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7478-3509","authenticated-orcid":false,"given":"Nicola","family":"Strisciuglio","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.inffus.2026.104515_bib0001","article-title":"Visual grounding in 2D and 3D: a unified perspective and survey","author":"Guo","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104515_bib0002","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","first-page":"3751","article-title":"Beyond human perception: understanding multi-object world from monocular view","author":"Guo","year":"2025"},{"key":"10.1016\/j.inffus.2026.104515_bib0003","series-title":"2025 International Joint Conference on Neural Networks (IJCNN)","first-page":"1","article-title":"MSALNet: capturing contextual relationships for monocular 3D visual grounding","author":"Guo","year":"2025"},{"key":"10.1016\/j.inffus.2026.104515_sbref0004","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2026.132895","article-title":"ArgusNet: understanding 3D scenes more like humans","volume":"673","author":"Guo","year":"2026","journal-title":"Neurocomputing"},{"key":"10.1016\/j.inffus.2026.104515_bib0005","doi-asserted-by":"crossref","DOI":"10.1016\/j.compeleceng.2025.110116","article-title":"SmartTrack: sparse multiple objects association with selective re-identification tracking","volume":"123","author":"Guo","year":"2025","journal-title":"Comput. Electr. Eng."},{"key":"10.1016\/j.inffus.2026.104515_bib0006","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"4766","article-title":"GroundVLP: harnessing zero-shot visual grounding from vision-language pre-training and open-vocabulary object detection","volume":"38","author":"Shen","year":"2024"},{"key":"10.1016\/j.inffus.2026.104515_bib0007","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"1769","article-title":"TransVG: end-to-end visual grounding with transformers","author":"Deng","year":"2021"},{"key":"10.1016\/j.inffus.2026.104515_bib0008","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"1780","article-title":"MDETR-modulated detection for end-to-end multi-modal understanding","author":"Kamath","year":"2021"},{"key":"10.1016\/j.inffus.2026.104515_bib0009","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10965","article-title":"Grounded language-image pre-training","author":"Li","year":"2022"},{"key":"10.1016\/j.inffus.2026.104515_bib0010","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"11686","article-title":"CrIS: clip-driven referring image segmentation","author":"Wang","year":"2022"},{"issue":"4","key":"10.1016\/j.inffus.2026.104515_bib0011","doi-asserted-by":"crossref","first-page":"1644","DOI":"10.1007\/s11263-024-02261-x","article-title":"Audio-visual segmentation with semantics","volume":"133","author":"Zhou","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.inffus.2026.104515_bib0012","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"14633","article-title":"Referring multi-object tracking","author":"Wu","year":"2023"},{"issue":"11","key":"10.1016\/j.inffus.2026.104515_bib0013","doi-asserted-by":"crossref","first-page":"18964","DOI":"10.1109\/TITS.2024.3437645","article-title":"EchoTrack: auditory referring multi-object tracking for autonomous driving","volume":"25","author":"Lin","year":"2024","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.inffus.2026.104515_bib0014","series-title":"Proceedings of the 37th International Conference on Neural Information Processing Systems","first-page":"11703","article-title":"MonoUNI: a unified vehicle and infrastructure-side monocular 3D object detection network with sufficient depth clues","author":"Jia","year":"2023"},{"key":"10.1016\/j.inffus.2026.104515_bib0015","unstructured":"P. Liao, F. Yang, D. Wu, L. Bo, MonoDETRNext: next-generation accurate and efficient monocular 3D object detection method, \/arxiv: 2405.15176(2024)."},{"key":"10.1016\/j.inffus.2026.104515_bib0016","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"3111","article-title":"Geometry uncertainty projection network for monocular 3D object detection","author":"Lu","year":"2021"},{"key":"10.1016\/j.inffus.2026.104515_bib0017","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"4012","article-title":"MonoDTR: monocular 3D object detection with depth-aware transformer","author":"Huang","year":"2022"},{"key":"10.1016\/j.inffus.2026.104515_bib0018","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"2928","article-title":"3DVG-Transformer: relation modeling for visual grounding on point clouds","author":"Zhao","year":"2021"},{"key":"10.1016\/j.inffus.2026.104515_bib0019","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"17253","article-title":"Multi-attribute interactions matter for 3D visual grounding","author":"Xu","year":"2024"},{"key":"10.1016\/j.inffus.2026.104515_bib0020","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"15225","article-title":"Multi3DRefer: grounding text description to multiple 3D objects","author":"Zhang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104515_bib0021","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"6988","article-title":"Mono3DVG: 3D visual grounding in monocular images","volume":"38","author":"Zhan","year":"2024"},{"key":"10.1016\/j.inffus.2026.104515_bib0022","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part I 16","first-page":"422","article-title":"ReferIt3D: neural listeners for fine-grained 3d object identification in real-world scenes","author":"Achlioptas","year":"2020"},{"key":"10.1016\/j.inffus.2026.104515_bib0023","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"6032","article-title":"Refer-It-in-RGBD: a bottom-up approach for 3d visual grounding in RGBD images","author":"Liu","year":"2021"},{"key":"10.1016\/j.inffus.2026.104515_bib0024","series-title":"European Conference on Computer Vision","first-page":"456","article-title":"WildRefer: 3D object localization in large-scale dynamic scenes with multi-modal visual data and natural language","author":"Lin","year":"2024"},{"key":"10.1016\/j.inffus.2026.104515_bib0025","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"21341","article-title":"Rope3D: the roadside perception dataset for autonomous driving and monocular 3D object detection task","author":"Ye","year":"2022"},{"key":"10.1016\/j.inffus.2026.104515_bib0026","series-title":"European Conference on Computer Vision","first-page":"459","article-title":"MaxViT: multi-axis vision transformer","author":"Tu","year":"2022"},{"key":"10.1016\/j.inffus.2026.104515_bib0027","unstructured":"D. Guo, D. Yang, H. Zhang, J. Song, R. Zhang, R. Xu, Q. Zhu, S. Ma, P. Wang, X. Bi, et al., DeepSeek-R1: incentivizing reasoning capability in LLMs via reinforcement learning, arxiv: 2501.12948(2025)."},{"key":"10.1016\/j.inffus.2026.104515_bib0028","unstructured":"A. Gu, T. Dao, Mamba: linear-time sequence modeling with selective state spaces, arxiv: 2312.00752(2023)."},{"key":"10.1016\/j.inffus.2026.104515_bib0029","series-title":"European Conference on Computer Vision","first-page":"237","article-title":"VideoMamba: state space model for efficient video understanding","author":"Li","year":"2024"},{"key":"10.1016\/j.inffus.2026.104515_bib0030","series-title":"NIPS","article-title":"Attention is all you need","author":"Waswani","year":"2017"},{"key":"10.1016\/j.inffus.2026.104515_bib0031","unstructured":"T. Dao, A. Gu, Transformers are SSMs: generalized models and efficient algorithms through structured state space duality, arxiv: 2405.21060(2024)."},{"key":"10.1016\/j.inffus.2026.104515_bib0032","unstructured":"Y. Liu, M. Ott, N. Goyal, J. Du, M. Joshi, D. Chen, O. Levy, M. Lewis, L. Zettlemoyer, V. Stoyanov, RoBERTa: a robustly optimized bert pretraining approach, \/arxiv: 1907.11692(2019)."},{"key":"10.1016\/j.inffus.2026.104515_bib0033","unstructured":"X. Zhou, D. Wang, P. Kr\u00e4henb\u00fchl, Objects as points, arxiv: 1904.07850(2019)."},{"key":"10.1016\/j.inffus.2026.104515_bib0034","unstructured":"A. Dosovitskiy, An image is worth 16x16 words: transformers for image recognition at scale, arxiv: 2010.11929(2020)."},{"key":"10.1016\/j.inffus.2026.104515_bib0035","unstructured":"L. Zhu, B. Liao, Q. Zhang, X. Wang, W. Liu, X. Wang, Vision mamba: efficient visual representation learning with bidirectional state space model, arxiv: 2401.09417(2024)."},{"key":"10.1016\/j.inffus.2026.104515_bib0036","unstructured":"A. Ali, I. Zimerman, L. Wolf, The hidden attention of mamba models, arxiv: 2403.01590(2024)."},{"key":"10.1016\/j.inffus.2026.104515_bib0037","doi-asserted-by":"crossref","unstructured":"R. Zhang, H. Qiu, T. Wang, Z. Guo, X. Xu, Y. Qiao, P. Gao, H. Li, MonoDETR: depth-guided transformer for monocular 3D object detection, \/arxiv: 2203.13310(2022).","DOI":"10.1109\/ICCV51070.2023.00840"},{"key":"10.1016\/j.inffus.2026.104515_bib0038","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"2980","article-title":"Focal loss for dense object detection","author":"Lin","year":"2017"},{"issue":"11","key":"10.1016\/j.inffus.2026.104515_bib0039","doi-asserted-by":"crossref","first-page":"5034","DOI":"10.1109\/TNNLS.2020.3026669","article-title":"Laplacian pyramid neural network for dense continuous-value regression for complex scenes","volume":"32","author":"Chen","year":"2020","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.inffus.2026.104515_bib0040","series-title":"European Conference on Computer Vision","first-page":"202","article-title":"ScanRefer: 3D object localization in RGB-D scans using natural language","author":"Chen","year":"2020"},{"key":"10.1016\/j.inffus.2026.104515_bib0041","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"16464","article-title":"3DJCG: a unified framework for joint dense captioning and visual grounding on 3D point clouds","author":"Cai","year":"2022"},{"key":"10.1016\/j.inffus.2026.104515_bib0042","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"18109","article-title":"Unit3D: a unified transformer for 3D dense captioning and visual grounding","author":"Chen","year":"2023"},{"key":"10.1016\/j.inffus.2026.104515_bib0043","doi-asserted-by":"crossref","unstructured":"W. Guo, X. Xu, Z. Wang, J. Feng, J. Zhou, J. Lu, TSP3D: text-guided sparse voxel pruning for efficient 3D visual grounding, arxiv: 2502.10392(2025).","DOI":"10.1109\/CVPR52734.2025.00347"},{"issue":"1","key":"10.1016\/j.inffus.2026.104515_bib0044","doi-asserted-by":"crossref","DOI":"10.1049\/ipr2.13315","article-title":"Bootstrapping vision\u2013language transformer for monocular 3D visual grounding","volume":"19","author":"Lei","year":"2025","journal-title":"IET Image Process."},{"key":"10.1016\/j.inffus.2026.104515_bib0045","unstructured":"X. Chen, H. Fan, R. Girshick, K. He, Improved baselines with momentum contrastive learning, \/arxiv: 2003.04297(2020)."},{"key":"10.1016\/j.inffus.2026.104515_bib0046","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"13154","article-title":"Omni3D: a large benchmark and model for 3D object detection in the wild","author":"Brazil","year":"2023"},{"key":"10.1016\/j.inffus.2026.104515_bib0047","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"4694","article-title":"Zero-shot grounding of objects from natural language queries","author":"Sadhu","year":"2019"},{"key":"10.1016\/j.inffus.2026.104515_bib0048","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"4683","article-title":"A fast and accurate one-stage approach to visual grounding","author":"Yang","year":"2019"},{"key":"10.1016\/j.inffus.2026.104515_bib0049","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XIV 16","first-page":"387","article-title":"Improving one-stage visual grounding by recursive sub-query construction","author":"Yang","year":"2020"},{"key":"10.1016\/j.inffus.2026.104515_bib0050","unstructured":"Y. Sun, L. Dong, S. Huang, S. Ma, Y. Xia, J. Xue, J. Wang, F. Wei, Retentive network: a successor to transformer for large language models, arxiv: 2307.08621(2023)."},{"key":"10.1016\/j.inffus.2026.104515_bib0051","series-title":"Advances in Neural Information Processing Systems","first-page":"5998","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017"},{"key":"10.1016\/j.inffus.2026.104515_bib0052","doi-asserted-by":"crossref","unstructured":"B. Peng, E. Alcaide, Q. Anthony, A. Albalak, S. Arcadinho, S. Biderman, H. Cao, X. Cheng, M. Chung, M. Grella, et al., RWKV: reinventing RNNs for the transformer era, arxiv: 2305.13048(2023).","DOI":"10.18653\/v1\/2023.findings-emnlp.936"},{"key":"10.1016\/j.inffus.2026.104515_bib0053","series-title":"International Conference on Machine Learning","first-page":"28043","article-title":"Hyena hierarchy: towards larger convolutional language models","author":"Poli","year":"2023"}],"container-title":["Information Fusion"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526003945?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526003945?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T12:54:55Z","timestamp":1783083295000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1566253526003945"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":53,"alternative-id":["S1566253526003945"],"URL":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104515","relation":{},"ISSN":["1566-2535"],"issn-type":[{"value":"1566-2535","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"U2ENet: Unified end-to-end network for monocular image-based single-object and multi-object 3D visual grounding","name":"articletitle","label":"Article Title"},{"value":"Information Fusion","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104515","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104515"}}