{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T07:48:24Z","timestamp":1785829704663,"version":"3.56.0"},"reference-count":41,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100002338","name":"Ministry of Education of the People's Republic of China","doi-asserted-by":"publisher","award":["24JJDM002"],"award-info":[{"award-number":["24JJDM002"]}],"id":[{"id":"10.13039\/501100002338","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012456","name":"National Social Science Fund of China","doi-asserted-by":"publisher","award":["2024"],"award-info":[{"award-number":["2024"]}],"id":[{"id":"10.13039\/501100012456","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012456","name":"National Social Science Fund of China","doi-asserted-by":"publisher","award":["24CYY050"],"award-info":[{"award-number":["24CYY050"]}],"id":[{"id":"10.13039\/501100012456","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100017963","name":"Education Department of Inner Mongolia Autonomous Region","doi-asserted-by":"publisher","award":["11900-262601"],"award-info":[{"award-number":["11900-262601"]}],"id":[{"id":"10.13039\/100017963","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Fusion"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.inffus.2026.104561","type":"journal-article","created":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T15:54:18Z","timestamp":1781625258000},"page":"104561","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Spatio-temporal fusion of 3D point clouds and acoustic signals for robust streaming Mongolian speech recognition"],"prefix":"10.1016","volume":"136","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-9770-0331","authenticated-orcid":false,"given":"Siqintu","family":"Qi","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-2713-071X","authenticated-orcid":false,"given":"Amuguleng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-7909-4895","authenticated-orcid":false,"given":"Dahu","family":"Baiyila","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.inffus.2026.104561_bib0001","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102422","article-title":"Automatic speech recognition using advanced deep learning approaches: a survey","volume":"109","author":"Kheddar","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104561_bib0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.compedu.2023.104898","article-title":"Beyond ChatGPT: a conceptual framework and systematic review of speech-recognition chatbots for language learning","volume":"206","author":"Jeon","year":"2023","journal-title":"Comput. Educ."},{"key":"10.1016\/j.inffus.2026.104561_bib0003","doi-asserted-by":"crossref","first-page":"325","DOI":"10.1109\/TASLP.2023.3328283","article-title":"End-to-end speech recognition: a survey","volume":"32","author":"Prabhavalkar","year":"2023","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"1","key":"10.1016\/j.inffus.2026.104561_bib0004","doi-asserted-by":"crossref","first-page":"2363","DOI":"10.1038\/s41467-025-57629-5","article-title":"Machine learning-assisted wearable sensing systems for speech recognition and interaction","volume":"16","author":"Liu","year":"2025","journal-title":"Nat. Commun."},{"key":"10.1016\/j.inffus.2026.104561_bib0005","doi-asserted-by":"crossref","DOI":"10.1109\/OJSP.2025.3528368","article-title":"Harnessing the multi-phasal nature of speech-EEG for enhancing imagined speech recognition","author":"Sharon","year":"2025","journal-title":"IEEE Open J. Signal Process."},{"key":"10.1016\/j.inffus.2026.104561_bib0006","series-title":"ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"Large language models are strong audio-visual speech recognition learners","author":"Cappellazzo","year":"2025"},{"issue":"9","key":"10.1016\/j.inffus.2026.104561_bib0007","doi-asserted-by":"crossref","DOI":"10.1007\/s10409-024-24507-x","article-title":"Artificial neural network validation of MHD natural bioconvection in a square enclosure: entropic analysis and optimization","volume":"41","author":"Alsedais","year":"2025","journal-title":"Acta Mech. Sin."},{"key":"10.1016\/j.inffus.2026.104561_bib0008","doi-asserted-by":"crossref","unstructured":"N. Elsedais, M.A. Mansour, A.M. Aly, S. Abdelsalam, Artificial intelligence-driven FVM-ANN model for entropy analysis of MHD natural bioconvection in nanofluid-filled porous cavities (2024).","DOI":"10.32604\/fhmt.2024.056087"},{"key":"10.1016\/j.inffus.2026.104561_bib0009","first-page":"103","article-title":"A review of algorithms for filtering the 3D point cloud","volume":"57","author":"Han","year":"2017","journal-title":"Signal Process.: Image Commun."},{"key":"10.1016\/j.inffus.2026.104561_bib0010","doi-asserted-by":"crossref","DOI":"10.1016\/j.displa.2023.102456","article-title":"Deep learning-based 3D point cloud classification: a systematic survey and outlook","volume":"79","author":"Zhang","year":"2023","journal-title":"Displays"},{"key":"10.1016\/j.inffus.2026.104561_bib0011","series-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"1","article-title":"VarArray meets t-SOT: advancing the state of the art of streaming distant conversational speech recognition","author":"Kanda","year":"2023"},{"key":"10.1016\/j.inffus.2026.104561_bib0012","series-title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"12041","article-title":"Stateful conformer with cache-based inference for streaming automatic speech recognition","author":"Noroozi","year":"2024"},{"key":"10.1016\/j.inffus.2026.104561_bib0013","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103717","article-title":"MFA-NRM: a novel framework for multimodal fusion and semantic alignment in visual neural decoding","volume":"127","author":"Huang","year":"2026","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104561_bib0014","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103983","article-title":"PV-MM3D: point-voxel parallel dual-stream framework with dual-attention region adaptive fusion for multimodal 3D object detection","volume":"128","author":"Wang","year":"2026","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104561_bib0015","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103879","article-title":"Multimodal fuzzy semantic fusion modeling for community disaster damage assessment from social sensing","volume":"127","author":"Lai","year":"2026","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104561_bib0016","article-title":"Thank you for attention: a survey on attention-based artificial neural networks for automatic speech recognition","volume":"23","author":"Karmakar","year":"2024","journal-title":"Intell. Syst. Appl."},{"key":"10.1016\/j.inffus.2026.104561_bib0017","series-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"5904","article-title":"Developing real-time streaming transformer transducer for speech recognition on large-scale dataset","author":"Chen","year":"2021"},{"key":"10.1016\/j.inffus.2026.104561_bib0018","series-title":"2023 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)","first-page":"1","article-title":"TorchAudio 2.1: advancing speech recognition, self-supervised learning, and audio processing components for pytorch","author":"Hwang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104561_bib0019","series-title":"Proceedings of the 16th ACM Conference on Security and Privacy in Wireless and Mobile Networks","first-page":"239","article-title":"VSMask: defending against voice synthesis attack via real-time predictive perturbation","author":"Wang","year":"2023"},{"issue":"1","key":"10.1016\/j.inffus.2026.104561_bib0020","first-page":"1","article-title":"Influences of integrating dynamic assessment into a speech recognition learning design to support students\u2019 English speaking skills, learning anxiety and cognitive load","volume":"25","author":"Chen","year":"2022","journal-title":"Educ. Technol. Soc."},{"key":"10.1016\/j.inffus.2026.104561_bib0021","doi-asserted-by":"crossref","DOI":"10.1109\/ACCESS.2025.3550855","article-title":"Advancements in speech recognition: a systematic review of deep learning transformer models, trends, innovations, and future directions","author":"Sharrab","year":"2025","journal-title":"IEEE Access"},{"key":"10.1016\/j.inffus.2026.104561_bib0022","series-title":"IEEE INFOCOM 2023-IEEE Conference on Computer Communications","first-page":"1","article-title":"mmMIC: multi-modal speech recognition based on mmWave radar","author":"Fan","year":"2023"},{"issue":"12","key":"10.1016\/j.inffus.2026.104561_bib0023","doi-asserted-by":"crossref","first-page":"2417","DOI":"10.3390\/app9122417","article-title":"Sound source localization fusion algorithm and performance analysis of a three-plane five-element microphone array","volume":"9","author":"Xing","year":"2019","journal-title":"Appl. Sci."},{"issue":"1","key":"10.1016\/j.inffus.2026.104561_bib0024","first-page":"15","article-title":"Acoustic positioning system for 3D localization of sound sources based on the time of arrival of a signal for a low-cost system","volume":"10","author":"D\u00eddac","year":"2021","journal-title":"Eng. Proc."},{"key":"10.1016\/j.inffus.2026.104561_bib0025","series-title":"2025 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV)","first-page":"5408","article-title":"SoundLoc3D: invisible 3D sound source localization and classification using a multimodal RGB-D acoustic camera","author":"He","year":"2025"},{"key":"10.1016\/j.inffus.2026.104561_bib0026","doi-asserted-by":"crossref","first-page":"1405","DOI":"10.1109\/LSP.2021.3092959","article-title":"Three-dimensional speaker localization: audio-refined visual scaling factor estimation","volume":"28","author":"Qian","year":"2021","journal-title":"IEEE Signal Process. Lett."},{"key":"10.1016\/j.inffus.2026.104561_bib0027","doi-asserted-by":"crossref","first-page":"8896","DOI":"10.52202\/068431-0647","article-title":"SoundSpaces 2.0: a simulation platform for visual-acoustic learning","volume":"35","author":"Chen","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"1","key":"10.1016\/j.inffus.2026.104561_bib0028","doi-asserted-by":"crossref","first-page":"34","DOI":"10.1109\/JSTSP.2018.2885636","article-title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks","volume":"13","author":"Adavanne","year":"2018","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"10.1016\/j.inffus.2026.104561_bib0029","series-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"4705","article-title":"Data fusion for audiovisual speaker localization: extending dynamic stream weights to the spatial domain","author":"Wissing","year":"2021"},{"key":"10.1016\/j.inffus.2026.104561_bib0030","series-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"8433","article-title":"Directional ASR: a new paradigm for E2E multi-speaker speech recognition with source localization","author":"Subramanian","year":"2021"},{"key":"10.1016\/j.inffus.2026.104561_bib0031","series-title":"2021 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","first-page":"6868","article-title":"AcousticFusion: fusing sound source localization to visual SLAM in dynamic environments","author":"Zhang","year":"2021"},{"issue":"1","key":"10.1016\/j.inffus.2026.104561_bib0032","doi-asserted-by":"crossref","first-page":"5684","DOI":"10.1038\/s41467-023-40869-8","article-title":"Creating speech zones with self-distributing acoustic swarms","volume":"14","author":"Itani","year":"2023","journal-title":"Nat. Commun."},{"key":"10.1016\/j.inffus.2026.104561_bib0033","unstructured":"J.S. Garofolo, D. Graff, D. Paul, D. Pallett, CSR-I (WSJ0) complete, (2007)."},{"issue":"3","key":"10.1016\/j.inffus.2026.104561_bib0034","doi-asserted-by":"crossref","first-page":"621","DOI":"10.1016\/j.csl.2012.10.004","article-title":"The PASCAL CHiME speech separation and recognition challenge","volume":"27","author":"Barker","year":"2013","journal-title":"Comput. Speech Lang."},{"issue":"3","key":"10.1016\/j.inffus.2026.104561_bib0035","doi-asserted-by":"crossref","first-page":"224","DOI":"10.1007\/s10489-024-06119-0","article-title":"DuAGNet: an unrestricted multimodal speech recognition framework using dual adaptive gating fusion","volume":"55","author":"Wu","year":"2025","journal-title":"Appl. Intell."},{"issue":"3","key":"10.1016\/j.inffus.2026.104561_bib0036","doi-asserted-by":"crossref","first-page":"2020","DOI":"10.1007\/s00034-024-02915-8","article-title":"Dhivehi speech recognition: a multimodal approach for Dhivehi language in resource-constrained settings","volume":"44","author":"Mehra","year":"2025","journal-title":"Circuits Syst. Signal Process."},{"key":"10.1016\/j.inffus.2026.104561_bib0037","article-title":"Raw acoustic-articulatory multimodal dysarthric speech recognition","author":"Yue","year":"2025","journal-title":"Comput. Speech Lang."},{"key":"10.1016\/j.inffus.2026.104561_bib0038","doi-asserted-by":"crossref","DOI":"10.1016\/j.mex.2025.103359","article-title":"Bridging language gaps: the role of NLP and speech recognition in oral english instruction","volume":"14","author":"Dubey","year":"2025","journal-title":"MethodsX"},{"issue":"3","key":"10.1016\/j.inffus.2026.104561_bib0039","doi-asserted-by":"crossref","first-page":"5219","DOI":"10.1109\/TNNLS.2024.3379020","article-title":"Trainable delays in time delay neural networks for learning delayed dynamics","volume":"36","author":"Ji","year":"2024","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"10.1016\/j.inffus.2026.104561_bib0040","first-page":"12449","article-title":"wav2vec 2.0: a framework for self-supervised learning of speech representations","volume":"33","author":"Baevski","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.inffus.2026.104561_bib0041","doi-asserted-by":"crossref","first-page":"1436","DOI":"10.1109\/TASLP.2023.3263789","article-title":"A CTC alignment-based non-autoregressive transformer for end-to-end automatic speech recognition","volume":"31","author":"Fan","year":"2023","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."}],"container-title":["Information Fusion"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526004392?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526004392?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T07:20:47Z","timestamp":1785828047000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1566253526004392"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":41,"alternative-id":["S1566253526004392"],"URL":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104561","relation":{},"ISSN":["1566-2535"],"issn-type":[{"value":"1566-2535","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Spatio-temporal fusion of 3D point clouds and acoustic signals for robust streaming Mongolian speech recognition","name":"articletitle","label":"Article Title"},{"value":"Information Fusion","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104561","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"104561"}}