{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T17:23:54Z","timestamp":1783099434612,"version":"3.54.6"},"reference-count":43,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62403345"],"award-info":[{"award-number":["62403345"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100013318","name":"Shanxi Provincial Science and Technology Department","doi-asserted-by":"publisher","award":["202403021221074"],"award-info":[{"award-number":["202403021221074"]}],"id":[{"id":"10.13039\/501100013318","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100013318","name":"Shanxi Provincial Science and Technology Department","doi-asserted-by":"publisher","award":["202403021212174"],"award-info":[{"award-number":["202403021212174"]}],"id":[{"id":"10.13039\/501100013318","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113916","type":"journal-article","created":{"date-parts":[[2026,5,8]],"date-time":"2026-05-08T23:58:39Z","timestamp":1778284719000},"page":"113916","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PD","title":["Global\u2013local distillation network-based audio\u2013visual speaker tracking with incomplete modalities"],"prefix":"10.1016","volume":"179","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5236-7010","authenticated-orcid":false,"given":"Yidi","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yihan","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5720-7051","authenticated-orcid":false,"given":"Zhenhuan","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0058-2819","authenticated-orcid":false,"given":"Weiwei","family":"Wan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7498-6541","authenticated-orcid":false,"given":"Hong","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113916_b1","doi-asserted-by":"crossref","unstructured":"Z. Tang, T. Xu, X. Wu, X.-F. Zhu, J. Kittler, Generative-based fusion mechanism for multi-modal tracking, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, (6) 2024, pp. 5189\u20135197.","DOI":"10.1609\/aaai.v38i6.28325"},{"key":"10.1016\/j.patcog.2026.113916_b2","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111432","article-title":"Audio-visual representation learning via knowledge distillation from speech foundation models","volume":"162","author":"Zhang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113916_b3","doi-asserted-by":"crossref","DOI":"10.1109\/TMM.2025.3599048","article-title":"Complementary and contrastive learning for audio-visual segmentation","author":"Gong","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113916_b4","doi-asserted-by":"crossref","first-page":"550","DOI":"10.1109\/TASLP.2022.3226330","article-title":"Audio-visual cross-attention network for robotic speaker ttacking","volume":"31","author":"Qian","year":"2022","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang. Process."},{"issue":"6","key":"10.1016\/j.patcog.2026.113916_b5","doi-asserted-by":"crossref","first-page":"2003","DOI":"10.1007\/s11263-023-01950-3","article-title":"Joint learning of audio\u2013visual saliency prediction and sound source localization on multi-face videos","volume":"132","author":"Qiao","year":"2024","journal-title":"Int. J. Comput. Vis."},{"issue":"7","key":"10.1016\/j.patcog.2026.113916_b6","doi-asserted-by":"crossref","first-page":"5847","DOI":"10.1109\/TPAMI.2025.3555485","article-title":"Cross-modality distillation for multi-modal tracking","volume":"47","author":"Zhang","year":"2025","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113916_b7","doi-asserted-by":"crossref","unstructured":"A. Sikdar, J. Teotia, S. Sundaram, OGP-Net: Optical Guidance Meets Pixel-Level Contrastive Distillation for Robust Multi-Modal and Missing Modality Segmentation, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 39, (7) 2025, pp. 6922\u20136930.","DOI":"10.1609\/aaai.v39i7.32743"},{"issue":"5","key":"10.1016\/j.patcog.2026.113916_b8","doi-asserted-by":"crossref","first-page":"2599","DOI":"10.1007\/s11263-024-02311-4","article-title":"Modality-missing RGBT tracking: Invertible prompt learning and high-quality benchmarks","volume":"133","author":"Lu","year":"2025","journal-title":"Int. J. Comput. Vis."},{"issue":"11","key":"10.1016\/j.patcog.2026.113916_b9","doi-asserted-by":"crossref","first-page":"18964","DOI":"10.1109\/TITS.2024.3437645","article-title":"EchoTrack: Auditory referring multi-object tracking for autonomous driving","volume":"25","author":"Lin","year":"2024","journal-title":"IEEE Trans. Intell. Transp. Syst."},{"key":"10.1016\/j.patcog.2026.113916_b10","doi-asserted-by":"crossref","DOI":"10.1109\/TPAMI.2025.3593932","article-title":"UniAV: Unified audio-visual perception for multi-task video event localization","author":"Geng","year":"2025","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113916_b11","article-title":"Listen with seeing: Cross-modal contrastive learning for audio-visual event localization","author":"Sun","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113916_b12","doi-asserted-by":"crossref","unstructured":"H. Zhao, D. Wang, H. Lu, Representation Learning for Visual Object Tracking by Masked Appearance Transfer, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 17916\u201317925.","DOI":"10.1109\/CVPR52729.2023.01793"},{"key":"10.1016\/j.patcog.2026.113916_b13","doi-asserted-by":"crossref","unstructured":"H. Liu, Y. Sun, Y. Li, B. Yang, 3D Audio-visual speaker tracking with a novel particle filter, in: International Conference on Pattern Recognition, 2021, pp. 7343\u20137348.","DOI":"10.1109\/ICPR48806.2021.9412682"},{"key":"10.1016\/j.patcog.2026.113916_b14","doi-asserted-by":"crossref","first-page":"1835","DOI":"10.1109\/TMM.2024.3521737","article-title":"STNet: Deep audio-visual fusion network for robust speaker tracking","volume":"27","author":"Li","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113916_b15","doi-asserted-by":"crossref","unstructured":"S. Mo, P. Morgado, Unveiling the Power of Audio-Visual Early Fusion Transformers with Dense Interactions through Masked Modeling, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 27186\u201327196.","DOI":"10.1109\/CVPR52733.2024.02567"},{"key":"10.1016\/j.patcog.2026.113916_b16","article-title":"AVCLNet: Multimodal multispeaker tracking network using audio-visual contrastive learning","author":"Li","year":"2025","journal-title":"CAAI Trans. Intell. Technol."},{"key":"10.1016\/j.patcog.2026.113916_b17","doi-asserted-by":"crossref","unstructured":"R. Guo, X. Ying, Y. Chen, D. Niu, G. Li, L. Qu, Y. Qi, J. Zhou, B. Xing, W. Yue, J. Shi, Q. Wang, P. Zhang, B. Liang, Audio-Visual Instance Segmentation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2025.","DOI":"10.1109\/CVPR52734.2025.01265"},{"key":"10.1016\/j.patcog.2026.113916_b18","doi-asserted-by":"crossref","unstructured":"Y. Li, H. Liu, H. Tang, Multi-modal perception attention network with self-supervised learning for audio-visual speaker tracking, in: Proceedings of the AAAI Conference on Artificial Intelligence, 2022, pp. 1456\u20131463.","DOI":"10.1609\/aaai.v36i2.20035"},{"issue":"7","key":"10.1016\/j.patcog.2026.113916_b19","doi-asserted-by":"crossref","first-page":"4896","DOI":"10.1109\/TPAMI.2024.3363508","article-title":"Robust audio-visual contrastive learning for proposal-based self-supervised sound source localization in videos","volume":"46","author":"Xuan","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113916_b20","doi-asserted-by":"crossref","unstructured":"X. Qian, Z. Pan, Q. Zhang, K. Chen, S. Lin, GLMB 3D Speaker Tracking with Video-Assisted Multi-Channel Audio Optimization Functions, in: IEEE International Conference on Acoustics, Speech and Signal Processing, 2024, pp. 8100\u20138104.","DOI":"10.1109\/ICASSP48485.2024.10446460"},{"key":"10.1016\/j.patcog.2026.113916_b21","series-title":"ACM Multimedia","article-title":"Leveraging knowledge of modality experts for incomplete multimodal learning","author":"Xu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113916_b22","doi-asserted-by":"crossref","unstructured":"R. Wu, H. Wang, F. Dayoub, H.-T. Chen, Segment Beyond View: Handling Partially Missing Modality for Audio-Visual Semantic Segmentation, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, (6) 2024, pp. 6100\u20136108.","DOI":"10.1609\/aaai.v38i6.28426"},{"key":"10.1016\/j.patcog.2026.113916_b23","doi-asserted-by":"crossref","unstructured":"M. Ma, J. Ren, L. Zhao, S. Tulyakov, C. Wu, X. Peng, Smil: Multimodal learning with severely missing modality, in: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 35, (3) 2021, pp. 2302\u20132310.","DOI":"10.1609\/aaai.v35i3.16330"},{"key":"10.1016\/j.patcog.2026.113916_b24","doi-asserted-by":"crossref","unstructured":"M. Ding, H. Lin, J. Zhu, C. Zou, Enhancing Incomplete Multimodal Learning via Modal Complementary Recovering, in: IEEE International Conference on Acoustics, Speech and Signal Processing, 2025.","DOI":"10.1109\/ICASSP49660.2025.10887570"},{"key":"10.1016\/j.patcog.2026.113916_b25","doi-asserted-by":"crossref","unstructured":"X. Yang, Y. Zhu, H. Liu, Z. Wen, N. Tang, Y. Luo, RAMer: Reconstruction-based Adversarial Model for Multi-party Multi-modal Multi-label Emotion Recognition, in: Proceedings of the International Joint Conference on Artificial Intelligence, 2025, pp. 2215\u20132223, Main Track.","DOI":"10.24963\/ijcai.2025\/247"},{"issue":"01","key":"10.1016\/j.patcog.2026.113916_b26","doi-asserted-by":"crossref","first-page":"708","DOI":"10.1109\/TAFFC.2025.3632063","article-title":"Affection-guided bottleneck diffusion for missing modality issue in multimodal affective computing","volume":"17","author":"Lin","year":"2026","journal-title":"IEEE Trans. Affect. Comput."},{"key":"10.1016\/j.patcog.2026.113916_b27","doi-asserted-by":"crossref","unstructured":"H. Wang, Y. Chen, C. Ma, J. Avery, L. Hull, G. Carneiro, Multi-modal learning with missing modality via shared-specific feature modelling, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 15878\u201315887.","DOI":"10.1109\/CVPR52729.2023.01524"},{"key":"10.1016\/j.patcog.2026.113916_b28","unstructured":"R. Lin, Q. He, S. Mai, Y. Zeng, A. Xiong, L. Huang, Y.-P. Tan, H. Hu, CyIN: Cyclic Informative Latent Space for Bridging Complete and Incomplete Multimodal Learning, in: Proceedings of the Annual Conference on Neural Information Processing Systems, 2025."},{"key":"10.1016\/j.patcog.2026.113916_b29","doi-asserted-by":"crossref","unstructured":"Y. Xu, F. Zhou, C. Zhao, Y. Wang, C. Yang, H. Chen, Distilled Prompt Learning for Incomplete Multimodal Survival Prediction, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2025, pp. 5102\u20135111.","DOI":"10.1109\/CVPR52734.2025.00481"},{"key":"10.1016\/j.patcog.2026.113916_b30","doi-asserted-by":"crossref","first-page":"1686","DOI":"10.1162\/tacl_a_00628","article-title":"Missmodal: Increasing robustness to missing modality in multimodal sentiment analysis","volume":"11","author":"Lin","year":"2023","journal-title":"Trans. Assoc. Comput. Linguist."},{"key":"10.1016\/j.patcog.2026.113916_b31","doi-asserted-by":"crossref","unstructured":"S. Zhou, W. Liu, C. Hu, S. Zhou, C. Ma, UniDistill: A Universal Cross-Modality Knowledge Distillation Framework for 3D Object Detection in Bird\u2019s-Eye View, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 5116\u20135125.","DOI":"10.1109\/CVPR52729.2023.00495"},{"key":"10.1016\/j.patcog.2026.113916_b32","doi-asserted-by":"crossref","unstructured":"M. Klingner, S. Borse, V.R. Kumar, B. Rezaei, V. Narayanan, S. Yogamani, F. Porikli, X3KD: Knowledge Distillation Across Modalities, Tasks and Stages for Multi-Camera 3D Object Detection, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 13343\u201313353.","DOI":"10.1109\/CVPR52729.2023.01282"},{"key":"10.1016\/j.patcog.2026.113916_b33","doi-asserted-by":"crossref","unstructured":"M. Li, D. Yang, X. Zhao, S. Wang, Y. Wang, K. Yang, M. Sun, D. Kou, Z. Qian, L. Zhang, Correlation-Decoupled Knowledge Distillation for Multimodal Sentiment Analysis with Incomplete Modalities, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 12458\u201312468.","DOI":"10.1109\/CVPR52733.2024.01184"},{"key":"10.1016\/j.patcog.2026.113916_b34","doi-asserted-by":"crossref","unstructured":"F. Huo, W. Xu, J. Guo, H. Wang, S. Guo, C2KD: Bridging the Modality Gap for Cross-Modal Knowledge Distillation, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 16006\u201316015.","DOI":"10.1109\/CVPR52733.2024.01515"},{"key":"10.1016\/j.patcog.2026.113916_b35","doi-asserted-by":"crossref","first-page":"7901","DOI":"10.1109\/TMM.2024.3372833","article-title":"Reciprocal teacher-student learning via forward and feedback knowledge distillation","volume":"26","author":"Gou","year":"2024","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113916_b36","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107404","article-title":"Intra-class progressive and adaptive self-distillation","volume":"188","author":"Gou","year":"2025","journal-title":"Neural Netw."},{"key":"10.1016\/j.patcog.2026.113916_b37","unstructured":"G. Hinton, O. Vinyals, J. Dean, Distilling the Knowledge in a Neural Network, in: Conference on Neural Information Processing Systems (NeurIPS), 2015."},{"key":"10.1016\/j.patcog.2026.113916_b38","first-page":"182","article-title":"AV16.3: An audiovisual corpus for speaker localization and tracking","author":"Lathoud","year":"2004","journal-title":"Lecture Notes in Comput. Sci."},{"issue":"10","key":"10.1016\/j.patcog.2026.113916_b39","doi-asserted-by":"crossref","first-page":"2576","DOI":"10.1109\/TMM.2019.2902489","article-title":"Multi-speaker tracking from an audio\u2013visual sensing device","volume":"21","author":"Qian","year":"2019","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113916_b40","doi-asserted-by":"crossref","unstructured":"B. Li, J. Yan, W. Wu, Z. Zhu, X. Hu, High Performance Visual Tracking with Siamese Region Proposal Network, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 8971\u20138980.","DOI":"10.1109\/CVPR.2018.00935"},{"issue":"5","key":"10.1016\/j.patcog.2026.113916_b41","doi-asserted-by":"crossref","first-page":"1562","DOI":"10.1109\/TPAMI.2019.2957464","article-title":"GOT-10k: A large high-diversity benchmark for generic object tracking","volume":"43","author":"Huang","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113916_b42","doi-asserted-by":"crossref","first-page":"186","DOI":"10.1109\/TMM.2014.2377515","article-title":"Audio assisted robust visual tracking with adaptive particle filtering","author":"K\u0131l\u0131\u00e7","year":"2015","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.113916_b43","doi-asserted-by":"crossref","unstructured":"H. Liu, Y. Li, B. Yang, 3D audio-visual speaker tracking with a two-layer particle filter, in: IEEE International Conference on Image Processing, 2019, pp. 1955\u20131959.","DOI":"10.1109\/ICIP.2019.8803117"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008812?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326008812?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T17:10:22Z","timestamp":1783098622000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326008812"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":43,"alternative-id":["S0031320326008812"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113916","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Global\u2013local distillation network-based audio\u2013visual speaker tracking with incomplete modalities","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113916","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113916"}}