{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T12:15:35Z","timestamp":1783080935649,"version":"3.54.6"},"reference-count":54,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["ZYGX2025XJ044"],"award-info":[{"award-number":["ZYGX2025XJ044"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["ZYGX2025XJ040"],"award-info":[{"award-number":["ZYGX2025XJ040"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100013804","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100013804","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62501116"],"award-info":[{"award-number":["62501116"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["92582204"],"award-info":[{"award-number":["92582204"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113833","type":"journal-article","created":{"date-parts":[[2026,4,23]],"date-time":"2026-04-23T22:59:12Z","timestamp":1776985152000},"page":"113833","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PD","title":["A novel multimodal semantic\u2013spatial representation method for embodied perception and spatial reasoning"],"prefix":"10.1016","volume":"179","author":[{"given":"Xinyu","family":"Zhou","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinru","family":"Tang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bin","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"1","key":"10.1016\/j.patcog.2026.113833_b1","doi-asserted-by":"crossref","DOI":"10.59717\/j.xinn-inform.2025.100008","article-title":"Embodied intelligence: Recent advances and future perspectives","volume":"1","author":"An","year":"2025","journal-title":"Innov. Informatics"},{"key":"10.1016\/j.patcog.2026.113833_b2","article-title":"Goal-oriented multi-robot collaborative source search with dynamic exploration-exploitation balance in large-scale constrained areas","author":"Yan","year":"2025","journal-title":"Inf. Fusion"},{"issue":"1","key":"10.1016\/j.patcog.2026.113833_b3","doi-asserted-by":"crossref","DOI":"10.59717\/j.xinn-inform.2025.100011","article-title":"Interpretable and robust multimodal data integration for precise treatment response and survival prediction in gastric cancer","volume":"1","author":"Zhou","year":"2025","journal-title":"Innov. Informatics"},{"key":"10.1016\/j.patcog.2026.113833_b4","first-page":"1","article-title":"Self-supervised pretraining with multimodality representation enhancement for salient object detection in RGB-D images","volume":"74","author":"Gao","year":"2025","journal-title":"IEEE Trans. Instrum. Meas."},{"key":"10.1016\/j.patcog.2026.113833_b5","first-page":"1","article-title":"HCFMaNet: A novel holistic cross-modal fusion mamba network for multi-modal medical image fusion","author":"Wei","year":"2026","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113833_b6","doi-asserted-by":"crossref","first-page":"5913","DOI":"10.1109\/TCCN.2026.3658820","article-title":"Cognitive underwater acoustic networking and target tracking: A comprehensive survey","volume":"12","author":"Yang","year":"2026","journal-title":"IEEE Trans. Cogn. Commun. Netw."},{"key":"10.1016\/j.patcog.2026.113833_b7","article-title":"Collaborative prior-enhanced RGB-D salient object detection network for intelligent IoT perception devices","author":"Gao","year":"2026","journal-title":"IEEE Internet Things J."},{"key":"10.1016\/j.patcog.2026.113833_b8","first-page":"18342","article-title":"Towards autonomous uav visual object search in city space: Benchmark and agentic methodology","volume":"vol. 40","author":"Ji","year":"2026"},{"issue":"3","key":"10.1016\/j.patcog.2026.113833_b9","doi-asserted-by":"crossref","first-page":"3417","DOI":"10.1109\/TMC.2025.3616027","article-title":"Heterogeneous graph reinforcement learning for dependency-aware multi-task allocation in spatial crowdsourcing","volume":"25","author":"Zhao","year":"2026","journal-title":"IEEE Trans. Mob. Comput."},{"key":"10.1016\/j.patcog.2026.113833_b10","doi-asserted-by":"crossref","unstructured":"R.Q. Charles, H. Su, M. Kaichun, L.J. Guibas, PointNet: Deep Learning on Point Sets for 3D Classification and Segmentation, in: 2017 IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 77\u201385.","DOI":"10.1109\/CVPR.2017.16"},{"key":"10.1016\/j.patcog.2026.113833_b11","doi-asserted-by":"crossref","unstructured":"S. Song, F. Yu, A. Zeng, A.X. Chang, M. Savva, T. Funkhouser, Semantic Scene Completion from a Single Depth Image, in: 2017 IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 190\u2013198.","DOI":"10.1109\/CVPR.2017.28"},{"key":"10.1016\/j.patcog.2026.113833_b12","unstructured":"A. Dai, A.X. Chang, M. Savva, M. Halber, T. Funkhouser, M. Nie\u00dfner, ScanNet: Richly-Annotated 3D Reconstructions of Indoor Scenes, in: 2017 IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 2432\u20132443."},{"issue":"1","key":"10.1016\/j.patcog.2026.113833_b13","doi-asserted-by":"crossref","first-page":"99","DOI":"10.1145\/3503250","article-title":"Nerf: Representing scenes as neural radiance fields for view synthesis","volume":"65","author":"Mildenhall","year":"2021","journal-title":"Commun. ACM"},{"issue":"1","key":"10.1016\/j.patcog.2026.113833_b14","doi-asserted-by":"crossref","first-page":"15109","DOI":"10.1038\/s41598-023-40343-x","article-title":"Deep residual-dense network based on bidirectional recurrent neural network for atrial fibrillation detection","volume":"13","author":"Laghari","year":"2023","journal-title":"Sci. Rep."},{"key":"10.1016\/j.patcog.2026.113833_b15","first-page":"1","article-title":"Self-supervised depth completion guided by 3D perception and geometry consistency","author":"Cai","year":"2026","journal-title":"IEEE Trans. Vis. Comput. Graphics"},{"issue":"10","key":"10.1016\/j.patcog.2026.113833_b16","doi-asserted-by":"crossref","first-page":"7211","DOI":"10.1109\/TVCG.2025.3542465","article-title":"Hierarchical point saliency for 3D keypoint detection","volume":"31","author":"Yang","year":"2025","journal-title":"IEEE Trans. Vis. Comput. Graphics"},{"key":"10.1016\/j.patcog.2026.113833_b17","first-page":"1","article-title":"Feature compression for cloud-edge multimodal 3D object detection","author":"Tian","year":"2026","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"1","key":"10.1016\/j.patcog.2026.113833_b18","doi-asserted-by":"crossref","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","article-title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","volume":"123","author":"Krishna","year":"2017","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.113833_b19","doi-asserted-by":"crossref","unstructured":"R. Zellers, M. Yatskar, S. Thomson, Y. Choi, Neural Motifs: Scene Graph Parsing with Global Context, in: 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2018, pp. 5831\u20135840.","DOI":"10.1109\/CVPR.2018.00611"},{"key":"10.1016\/j.patcog.2026.113833_b20","unstructured":"K. Tang, Y. Niu, J. Huang, J. Shi, H. Zhang, Unbiased Scene Graph Generation From Biased Training, in: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 3713\u20133722."},{"key":"10.1016\/j.patcog.2026.113833_b21","unstructured":"X. Lin, T. Lin, L. Huang, H. Xie, Z. Su, BIP3D: Bridging 2D Images and 3D Perception for Embodied Intelligence, in: 2025 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2025, pp. 9007\u20139016."},{"key":"10.1016\/j.patcog.2026.113833_b22","doi-asserted-by":"crossref","unstructured":"D. Marsili, R. Agrawal, Y. Yue, G. Gkioxari, Visual Agentic AI for Spatial Reasoning with a Dynamic API, in: 2025 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2025, pp. 19446\u201319455.","DOI":"10.1109\/CVPR52734.2025.01811"},{"key":"10.1016\/j.patcog.2026.113833_b23","doi-asserted-by":"crossref","unstructured":"C. Kim, K. Kim, M. Oh, H. Baek, J. Lee, D. Jung, S. Woo, Y. Woo, J. Tucker, R. Firoozi, S.-W. Seo, M. Schwager, S.-W. Kim, E2Map: Experience-and-Emotion Map for Self-Reflective Robot Navigation with Language Models, in: 2025 IEEE International Conference on Robotics and Automation, ICRA, 2025, pp. 12811\u201312817.","DOI":"10.1109\/ICRA55743.2025.11128669"},{"issue":"1","key":"10.1016\/j.patcog.2026.113833_b24","doi-asserted-by":"crossref","first-page":"602","DOI":"10.1109\/TVCG.2024.3456399","article-title":"Precise embodied data selection with haptic feedback while retaining room-scale visualisation context","volume":"31","author":"Dai","year":"2025","journal-title":"IEEE Trans. Vis. Comput. Graphics"},{"issue":"5","key":"10.1016\/j.patcog.2026.113833_b25","doi-asserted-by":"crossref","first-page":"1074","DOI":"10.1109\/TCDS.2024.3481457","article-title":"Multimodal perception for indoor mobile robotics navigation and safe manipulation","volume":"17","author":"Zhang","year":"2025","journal-title":"IEEE Trans. Cogn. Dev. Syst."},{"key":"10.1016\/j.patcog.2026.113833_b26","doi-asserted-by":"crossref","first-page":"24311","DOI":"10.1109\/TASE.2025.3631485","article-title":"MagicGripper: A mini-MagicTac integrated gripper enabling multimodal perception in contact-rich manipulation","volume":"22","author":"Fan","year":"2025","journal-title":"IEEE Trans. Autom. Sci. Eng."},{"key":"10.1016\/j.patcog.2026.113833_b27","doi-asserted-by":"crossref","unstructured":"J. Wald, H. Dhamo, N. Navab, F. Tombari, Learning 3D Semantic Scene Graphs From 3D Indoor Reconstructions, in: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2020, pp. 3960\u20133969.","DOI":"10.1109\/CVPR42600.2020.00402"},{"key":"10.1016\/j.patcog.2026.113833_b28","doi-asserted-by":"crossref","unstructured":"J. Johnson, R. Krishna, M. Stark, L.-J. Li, D.A. Shamma, M.S. Bernstein, L. Fei-Fei, Image retrieval using scene graphs, in: 2015 IEEE Conference on Computer Vision and Pattern Recognition, 2015, pp. 3668\u20133678.","DOI":"10.1109\/CVPR.2015.7298990"},{"key":"10.1016\/j.patcog.2026.113833_b29","doi-asserted-by":"crossref","unstructured":"K. Tang, H. Zhang, B. Wu, W. Luo, W. Liu, Learning to Compose Dynamic Tree Structures for Visual Contexts, in: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 6612\u20136621.","DOI":"10.1109\/CVPR.2019.00678"},{"issue":"1","key":"10.1016\/j.patcog.2026.113833_b30","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/TPAMI.2021.3137605","article-title":"A comprehensive survey of scene graphs: Generation and application","volume":"45","author":"Chang","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113833_b31","series-title":"European Conference on Computer Vision","first-page":"56","article-title":"Towards open-vocabulary scene graph generation with prompt-based finetuning","author":"He","year":"2022"},{"key":"10.1016\/j.patcog.2026.113833_b32","doi-asserted-by":"crossref","unstructured":"R. Li, S. Zhang, D. Lin, K. Chen, X. He, From pixels to graphs: Open-vocabulary scene graph generation with vision-language models, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 28076\u201328086.","DOI":"10.1109\/CVPR52733.2024.02652"},{"key":"10.1016\/j.patcog.2026.113833_b33","article-title":"Depth map prediction from a single image using a multi-scale deep network","volume":"27","author":"Eigen","year":"2014","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.patcog.2026.113833_b34","doi-asserted-by":"crossref","unstructured":"C. Godard, O.M. Aodha, G.J. Brostow, Unsupervised Monocular Depth Estimation with Left-Right Consistency, in: 2017 IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 6602\u20136611.","DOI":"10.1109\/CVPR.2017.699"},{"key":"10.1016\/j.patcog.2026.113833_b35","doi-asserted-by":"crossref","unstructured":"Z. Li, S. Niklaus, N. Snavely, O. Wang, Neural Scene Flow Fields for Space-Time View Synthesis of Dynamic Scenes, in: 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 6494\u20136504.","DOI":"10.1109\/CVPR46437.2021.00643"},{"key":"10.1016\/j.patcog.2026.113833_b36","doi-asserted-by":"crossref","unstructured":"S. Zhi, T. Laidlow, S. Leutenegger, A.J. Davison, In-place scene labelling and understanding with implicit scene representation, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2021, pp. 15838\u201315847.","DOI":"10.1109\/ICCV48922.2021.01554"},{"key":"10.1016\/j.patcog.2026.113833_b37","doi-asserted-by":"crossref","unstructured":"R. Zellers, M. Yatskar, S. Thomson, Y. Choi, Neural motifs: Scene graph parsing with global context, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 5831\u20135840.","DOI":"10.1109\/CVPR.2018.00611"},{"key":"10.1016\/j.patcog.2026.113833_b38","doi-asserted-by":"crossref","unstructured":"H. Liu, N. Yan, M. Mortazavi, B. Bhanu, Fully Convolutional Scene Graph Generation, in: 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2021, pp. 11541\u201311551.","DOI":"10.1109\/CVPR46437.2021.01138"},{"key":"10.1016\/j.patcog.2026.113833_b39","unstructured":"T. Chen, W. Yu, R. Chen, L. Lin, Knowledge-Embedded Routing Network for Scene Graph Generation, in: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2019, pp. 6156\u20136164."},{"key":"10.1016\/j.patcog.2026.113833_b40","doi-asserted-by":"crossref","unstructured":"N. Dhingra, F. Ritter, A. Kunz, BGT-Net: Bidirectional GRU Transformer Network for Scene Graph Generation, in: 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, 2021, pp. 2150\u20132159.","DOI":"10.1109\/CVPRW53098.2021.00244"},{"key":"10.1016\/j.patcog.2026.113833_b41","unstructured":"R. Li, S. Zhang, X. He, Sgtr: End-to-end scene graph generation with transformer, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 19486\u201319496."},{"issue":"9","key":"10.1016\/j.patcog.2026.113833_b42","doi-asserted-by":"crossref","first-page":"11169","DOI":"10.1109\/TPAMI.2023.3268066","article-title":"RelTR: Relation transformer for scene graph generation","volume":"45","author":"Cong","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"4","key":"10.1016\/j.patcog.2026.113833_b43","doi-asserted-by":"crossref","first-page":"2191","DOI":"10.1109\/TPAMI.2023.3332246","article-title":"SGTR+: End-to-end scene graph generation with transformer","volume":"46","author":"Li","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"5","key":"10.1016\/j.patcog.2026.113833_b44","first-page":"344","article-title":"End-to-end rough-and-refine model for scene graph generation based on transformer","volume":"57","author":"Junliang LI","year":"2025","journal-title":"Adv. Eng. Sci."},{"issue":"06","key":"10.1016\/j.patcog.2026.113833_b45","doi-asserted-by":"crossref","first-page":"829","DOI":"10.1142\/S0219530516400042","article-title":"Deep vs. shallow networks: An approximation theory perspective","volume":"14","author":"Mhaskar","year":"2016","journal-title":"Anal. Appl. (Singap.)"},{"key":"10.1016\/j.patcog.2026.113833_b46","doi-asserted-by":"crossref","unstructured":"L. Chen, H. Zhang, J. Xiao, L. Nie, J. Shao, W. Liu, T.-S. Chua, Sca-cnn: Spatial and channel-wise attention in convolutional networks for image captioning, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 5659\u20135667.","DOI":"10.1109\/CVPR.2017.667"},{"key":"10.1016\/j.patcog.2026.113833_b47","doi-asserted-by":"crossref","unstructured":"Y. Tewel, Y. Shalev, I. Schwartz, L. Wolf, Zerocap: Zero-shot image-to-text generation for visual-semantic arithmetic, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 17918\u201317928.","DOI":"10.1109\/CVPR52688.2022.01739"},{"key":"10.1016\/j.patcog.2026.113833_b48","series-title":"Multimodal knowledge alignment with reinforcement learning","author":"Yu","year":"2022"},{"key":"10.1016\/j.patcog.2026.113833_b49","doi-asserted-by":"crossref","first-page":"379","DOI":"10.1109\/TMM.2023.3265842","article-title":"Prompt-based learning for unpaired image captioning","volume":"26","author":"Zhu","year":"2024","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113833_b50","series-title":"Language models can see: Plugging visual controls in text generation","author":"Su","year":"2022"},{"key":"10.1016\/j.patcog.2026.113833_b51","series-title":"Findings of the Association for Computational Linguistics","first-page":"4055","article-title":"Text-only training for image captioning using noise-injected CLIP","author":"Nukrai","year":"2022"},{"key":"10.1016\/j.patcog.2026.113833_b52","doi-asserted-by":"crossref","unstructured":"J. Fei, T. Wang, J. Zhang, Z. He, C. Wang, F. Zheng, Transferable decoding with visual entities for zero-shot image captioning, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 3136\u20133146.","DOI":"10.1109\/ICCV51070.2023.00291"},{"key":"10.1016\/j.patcog.2026.113833_b53","first-page":"4089","article-title":"Image captioning with multi-context synthetic data","volume":"vol. 38","author":"Ma","year":"2024"},{"key":"10.1016\/j.patcog.2026.113833_b54","article-title":"Synthesize then align: Modality alignment augmentation for zero-shot image captioning with synthetic data","volume":"315","year":"2025","journal-title":"Knowl.-Based Syst."}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326007983?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326007983?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T11:18:36Z","timestamp":1783077516000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326007983"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":54,"alternative-id":["S0031320326007983"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113833","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"A novel multimodal semantic\u2013spatial representation method for embodied perception and spatial reasoning","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113833","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113833"}}