{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T05:41:53Z","timestamp":1777354913210,"version":"3.51.4"},"reference-count":76,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/tip.2026.3682022","type":"journal-article","created":{"date-parts":[[2026,4,14]],"date-time":"2026-04-14T19:36:26Z","timestamp":1776195386000},"page":"4269-4279","source":"Crossref","is-referenced-by-count":0,"title":["Emphasizing Domain Differences Through Interactive-Augmented Prompts in Continual Audio-Visual Speech Recognition"],"prefix":"10.1109","volume":"35","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-7682-7678","authenticated-orcid":false,"given":"Dongjie","family":"Fu","sequence":"first","affiliation":[{"name":"School of Software Technology, Zhejiang University, Ningbo, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xize","family":"Cheng","sequence":"additional","affiliation":[{"name":"College of Computer Science and Technology, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0415-6937","authenticated-orcid":false,"given":"Jingyuan","family":"Chen","sequence":"additional","affiliation":[{"name":"College of Education, Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3564-1628","authenticated-orcid":false,"given":"Tao","family":"Jin","sequence":"additional","affiliation":[{"name":"School of Software Technology, Zhejiang University, Ningbo, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5098-2506","authenticated-orcid":false,"given":"Zhongfei","family":"Zhang","sequence":"additional","affiliation":[{"name":"Department of Computer Science, State University of New York at Binghamton, Binghamton, NY, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2022-99"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-2279"},{"key":"ref3","first-page":"3093","article-title":"An improved end-to-end audio-visual speech recognition model","volume-title":"Proc. INTERSPEECH","author":"Yang"},{"key":"ref4","first-page":"1","article-title":"Auto-AVSR: Audio-visual speech recognition with automatic labels","volume-title":"Proc. IEEE Int. Conf. Acoust., Speech Signal Process. (ICASSP)","author":"Ma"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1611835114"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3367329"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2019.01.012"},{"key":"ref8","article-title":"A comprehensive study of class incremental learning algorithms for visual tasks","author":"Belouadah","year":"2020","journal-title":"arXiv:2011.01844"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2023.3310336"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2025.3551918"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2889052"},{"key":"ref12","article-title":"Learning audio-visual speech representation by masked multimodal cluster prediction","author":"Shi","year":"2022","journal-title":"arXiv:2201.02184"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-322"},{"key":"ref14","first-page":"29313","article-title":"PACHAT: Persona-aware speech assistant for multi-party dialogue","volume-title":"Proc. Conf. Empirical Methods Natural Lang. Process.","author":"Fu"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2012.2205597"},{"key":"ref16","article-title":"Listen, attend and spell","author":"Chan","year":"2015","journal-title":"arXiv:1508.01211"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-3015"},{"key":"ref18","article-title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations","author":"Baevski","year":"2020","journal-title":"arXiv:2006.11477"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"ref20","article-title":"SynthVSR: Scaling up visual speech recognition with synthetic supervision","author":"Liu","year":"2023","journal-title":"arXiv:2303.17200"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1038\/s42256-022-00550-z"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/83.605417"},{"key":"ref23","first-page":"1246","article-title":"Continual learning in automatic speech recognition","volume-title":"Proc. Interspeech","author":"Sadhu"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2022-11093"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-2509"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU57964.2023.10389642"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01442"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3681347"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.02195"},{"key":"ref30","article-title":"OmniChat: Enhancing spoken dialogue systems with scalable synthetic data for diverse scenarios","author":"Cheng","year":"2025","journal-title":"arXiv:2501.01384"},{"key":"ref31","article-title":"AHa-bench: Benchmarking audio hallucinations in large audio-language models","volume-title":"Proc. 39th Annu. Conf. Neural Inf. Process. Syst. Datasets Benchmarks Track","author":"Cheng"},{"key":"ref32","first-page":"3816","article-title":"Making pre-trained language models better few-shot learners","volume-title":"Proc. 59th Annu. Meeting Assoc. Comput. Linguistics 11th Int. Joint Conf. Natural Lang. Process.","author":"Gao"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49660.2025.10888331"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414567"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.308"},{"key":"ref36","article-title":"Large language models are strong audio-visual speech recognition learners","author":"Cappellazzo","year":"2024","journal-title":"arXiv:2409.12319"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.findings-acl.1065"},{"key":"ref38","article-title":"Adapting speech foundation models for unified multimodal speech recognition with large language models","author":"Zhang","year":"2025","journal-title":"arXiv:2510.22961"},{"key":"ref39","article-title":"Omni-AVSR: Towards unified multimodal speech recognition with large language models","author":"Cappellazzo","year":"2025","journal-title":"arXiv:2511.07253"},{"key":"ref40","article-title":"MoHAVE: Mixture of hierarchical audio-visual experts for robust speech recognition","author":"Kim","year":"2025","journal-title":"arXiv:2502.10447"},{"key":"ref41","article-title":"On tiny episodic memories in continual learning","author":"Chaudhry","year":"2019","journal-title":"arXiv:1902.10486"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.587"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1080\/09540099550039318"},{"key":"ref44","article-title":"Memory aware synapses: Learning what (not) to forget","author":"Aljundi","year":"2017","journal-title":"arXiv:1711.09601"},{"key":"ref45","article-title":"Continual learning through synaptic intelligence","author":"Zenke","year":"2017","journal-title":"arXiv:1703.04200"},{"key":"ref46","article-title":"Lifelong learning with dynamically expandable networks","author":"Yoon","year":"2017","journal-title":"arXiv:1708.01547"},{"key":"ref47","article-title":"Overcoming catastrophic forgetting by incremental moment matching","author":"Lee","year":"2017","journal-title":"arXiv:1703.08475"},{"key":"ref48","article-title":"S-prompts learning with pre-trained transformers: An Occam\u2019s Razor for domain incremental learning","author":"Wang","year":"2022","journal-title":"arXiv:2207.12819"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_36"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00024"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/3560815"},{"key":"ref53","article-title":"GPT understands, too","author":"Liu","year":"2023","journal-title":"arXiv:2103.10385"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.346"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2025.3556531"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00280"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01653-1"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.346"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2024.3492713"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2024.3362062"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2024.3451935"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-acl.504"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01146"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.emnlp-main.609"},{"key":"ref69","article-title":"LRS3-TED: A large-scale dataset for visual speech recognition","author":"Afouras","year":"2018","journal-title":"arXiv:1809.00496"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-54184-6_6"},{"key":"ref71","doi-asserted-by":"crossref","first-page":"28","DOI":"10.1016\/j.neucom.2021.10.021","article-title":"Online continual learning in image classification: An empirical survey","volume":"469","author":"Mai","year":"2022","journal-title":"Neurocomputing"},{"issue":"60","key":"ref72","first-page":"1755","article-title":"Dlib-ml: A machine learning toolkit","volume":"10","author":"King","year":"2009","journal-title":"J. Mach. Learn. Res."},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01801"},{"key":"ref74","article-title":"MUSAN: A music, speech, and noise corpus","author":"Snyder","year":"2015","journal-title":"arXiv:1510.08484"},{"key":"ref75","article-title":"Multi-task corrupted prediction for learning robust audio-visual speech representation","author":"Kim","year":"2025","journal-title":"arXiv:2504.18539"},{"issue":"86","key":"ref76","first-page":"2579","article-title":"Visualizing data using t-SNE","volume":"9","author":"van der Maaten","year":"2008","journal-title":"J. Mach. Learn. Res."}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/83\/11355710\/11481589.pdf?arnumber=11481589","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,28]],"date-time":"2026-04-28T04:57:15Z","timestamp":1777352235000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11481589\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":76,"URL":"https:\/\/doi.org\/10.1109\/tip.2026.3682022","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}