{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,18]],"date-time":"2025-04-18T05:40:11Z","timestamp":1744954811441,"version":"3.40.4"},"reference-count":31,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,12,27]],"date-time":"2024-12-27T00:00:00Z","timestamp":1735257600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,12,27]],"date-time":"2024-12-27T00:00:00Z","timestamp":1735257600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62166050"],"award-info":[{"award-number":["62166050"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,12,27]]},"DOI":"10.1109\/icvisp64524.2024.10959642","type":"proceedings-article","created":{"date-parts":[[2025,4,17]],"date-time":"2025-04-17T17:37:52Z","timestamp":1744911472000},"page":"1-6","source":"Crossref","is-referenced-by-count":0,"title":["Multimodal Speech Recognition Assisted by Slide Information in Classroom Scenes"],"prefix":"10.1109","author":[{"given":"Jingen","family":"Li","sequence":"first","affiliation":[{"name":"Yunnan Normal University,Key Laboratory of Education Informatization for Nationalities,Kunming,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiatian","family":"Mei","sequence":"additional","affiliation":[{"name":"Yunnan Normal University,Key Laboratory of Education, Informatization for Nationalities &#x0026; Yunnan Key Laboratory of Smart Education,Kunming,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Di","family":"Wu","sequence":"additional","affiliation":[{"name":"Yunnan Normal University,Key Laboratory of Education, Informatization for Nationalities &#x0026; Yunnan Key Laboratory of Smart Education,Kunming,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mingtao","family":"Zhou","sequence":"additional","affiliation":[{"name":"Yunnan Normal University,Key Laboratory of Education, Informatization for Nationalities &#x0026; Yunnan Key Laboratory of Smart Education,Kunming,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lin","family":"Jiang","sequence":"additional","affiliation":[{"name":"Yunnan Normal University,Key Laboratory of Education Informatization for Nationalities,Kunming,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"issue":"1","key":"ref1","article-title":"Overview of Compression Algorithms for Automatic Speech Recognition Models","volume":"62","author":"Xiaohu","year":"2024","journal-title":"Journal of Jilin University (Science Edition)\/Jilin Daxue Xuebao (Lixue Ban)"},{"volume-title":"Research on Lip Language Recognition Technology Based on Deep Learning [D]","year":"2023","author":"Baosheng","key":"ref2"},{"issue":"2","key":"ref3","volume":"39","author":"Yunfeng","year":"2024","journal-title":"Speech emotion recognition based on multi task learning Journal of Data Acquisition & Processing\/Shu Ju Cai Ji Yu Chu Li"},{"issue":"1","key":"ref4","first-page":"90","volume":"47","author":"Tao","year":"2024","journal-title":"A review of research on robustness of natural language processing based on deep learning Journal of Computer Science"},{"issue":"16","key":"ref5","first-page":"63","article-title":"Research on Speech Recognition Technology Based on Deep Learning [J]","volume":"32","author":"Xude","year":"2024","journal-title":"Electronic Production"},{"key":"ref6","first-page":"2118","article-title":"Robust SelfSupervised Audio-Visual Speech Recognition","volume-title":"Proc. Interspeech","author":"Shi","year":"2022"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.3390\/s23042053"},{"key":"ref8","first-page":"22922","article-title":"Avformer:Injecting vision into frozen speech models for zero-shot av-asr","volume-title":"Proc. CVPR","author":"Seo","year":"2023"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2018.8639034"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU51503.2021.9687895"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095582"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/icassp40776.2020"},{"key":"ref13","article-title":"LRS3-TED: A Large Scale Dataset for Visual Speech Recognition","volume":"ABS\/1809.00496","author":"Afouras","year":"2018","journal-title":"Arsif"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178964"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2018-1929"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00272"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-1674"},{"key":"ref18","article-title":"How2: A Large-scale Dataset for Multimodal Language Understanding","volume":"abs\/1811.00347","author":"Sanabria","year":"2018","journal-title":"ArXiv"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/JSAC.2014.2332095"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICSDA.2017.8384449"},{"key":"ref21","article-title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","volume":"abs\/1808.10583","author":"Du","year":"2018","journal-title":"ArXiv"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2021-755"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6639249"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7179009"},{"key":"ref25","volume":"ABS\/2309.05396","author":"Haoxu","year":"2023","journal-title":"SlideSpeech: A Large-Scale Slide-Enriched Audio-Visual Corpus"},{"key":"ref26","volume":"ABS\/2305.11013","author":"Zhifu","year":"2023","journal-title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit."},{"key":"ref27","article-title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","volume-title":"Interlanguage","author":"Zhifu","year":"2022"},{"key":"ref28","article-title":"Conformer: Convolutional Augmented Transformer for Speech Recognition","author":"Anmol","year":"2020","journal-title":"Conformer: Convolutional Enhanced Transformer for Speech Recognition"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-3015"},{"key":"ref30","article-title":"E-Paraformer: A Faster and Better Parallel Transformer for Non-autoregressive End-to-End Mandarin Speech Recognition","volume-title":"Proc. Interspeech","volume":"2024","author":"Kun","year":"2024"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446106"}],"event":{"name":"2024 IEEE 8th International Conference on Vision, Image and Signal Processing (ICVISP)","start":{"date-parts":[[2024,12,27]]},"location":"Kunming, China","end":{"date-parts":[[2024,12,29]]}},"container-title":["2024 IEEE 8th International Conference on Vision, Image and Signal Processing (ICVISP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10959324\/10959149\/10959642.pdf?arnumber=10959642","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,18]],"date-time":"2025-04-18T05:08:23Z","timestamp":1744952903000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10959642\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,27]]},"references-count":31,"URL":"https:\/\/doi.org\/10.1109\/icvisp64524.2024.10959642","relation":{},"subject":[],"published":{"date-parts":[[2024,12,27]]}}}