{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T00:19:11Z","timestamp":1783556351050,"version":"3.55.0"},"publisher-location":"Cham","reference-count":39,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032222664","type":"print"},{"value":"9783032222671","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-032-22267-1_36","type":"book-chapter","created":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T00:10:34Z","timestamp":1783555834000},"page":"457-468","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["VCHFC: Visual-Content Hybrid Feature Cue Module for\u00a0Lipreading"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0645-1497","authenticated-orcid":false,"given":"Ziwei","family":"Cheng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9870-8925","authenticated-orcid":false,"given":"Zhenhua","family":"Tan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,7,2]]},"reference":[{"key":"36_CR1","doi-asserted-by":"crossref","unstructured":"Burchi, M., Timofte, R.: Audio-visual efficient conformer for robust speech recognition. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 2258\u20132267 (2023)","DOI":"10.1109\/WACV56688.2023.00229"},{"key":"36_CR2","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"87","DOI":"10.1007\/978-3-319-54184-6_6","volume-title":"Computer Vision \u2013 ACCV 2016","author":"JS Chung","year":"2017","unstructured":"Chung, J.S., Zisserman, A.: Lip reading in the wild. In: Lai, S.-H., Lepetit, V., Nishino, K., Sato, Y. (eds.) ACCV 2016. LNCS, vol. 10112, pp. 87\u2013103. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-54184-6_6"},{"key":"36_CR3","doi-asserted-by":"crossref","unstructured":"Deng, M., Xiong, S.: Phoneme-based lipreading of silent sentences. In: 2022 IEEE Asia-Pacific Conference on Image Processing, Electronics and Computers (IPEC), pp. 206\u2013210. IEEE (2022)","DOI":"10.1109\/IPEC54454.2022.9777317"},{"issue":"1","key":"36_CR4","doi-asserted-by":"publisher","first-page":"129","DOI":"10.1049\/cit2.12131","volume":"8","author":"R El-Bialy","year":"2023","unstructured":"El-Bialy, R., et al.: Developing phoneme-based lip-reading sentences system for silent speech recognition. CAAI Trans. Intell. Technol. 8(1), 129\u2013138 (2023)","journal-title":"CAAI Trans. Intell. Technol."},{"key":"36_CR5","doi-asserted-by":"crossref","unstructured":"Feng, D., Yang, S., Shan, S., Chen, X.: Audio-driven deformation flow for effective lip reading. In: 2022 26th International Conference on Pattern Recognition (ICPR), pp. 274\u2013280. IEEE (2022)","DOI":"10.1109\/ICPR56361.2022.9956316"},{"key":"36_CR6","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"36_CR7","doi-asserted-by":"crossref","unstructured":"He, Y., Yang, L., Wang, H., Zhu, Y., Wang, S.: Speaker-adaptive lipreading via spatio-temporal information learning. In: ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 10411\u201310415. IEEE (2024)","DOI":"10.1109\/ICASSP48485.2024.10447378"},{"key":"36_CR8","doi-asserted-by":"publisher","first-page":"4342","DOI":"10.1109\/TMM.2021.3115626","volume":"24","author":"M Kim","year":"2021","unstructured":"Kim, M., Hong, J., Park, S.J., Ro, Y.M.: CroMM-VSR: cross-modal memory augmented visual speech recognition. IEEE Trans. Multimedia 24, 4342\u20134355 (2021)","journal-title":"IEEE Trans. Multimedia"},{"key":"36_CR9","doi-asserted-by":"crossref","unstructured":"Kim, M., Hong, J., Park, S.J., Ro, Y.M.: Multi-modality associative bridging through memory: speech sound recollected from face video. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 296\u2013306 (2021)","DOI":"10.1109\/ICCV48922.2021.00036"},{"key":"36_CR10","doi-asserted-by":"crossref","unstructured":"Kim, M., Yeo, J.H., Ro, Y.M.: Distinguishing homophenes using multi-head visual-audio memory for lip reading. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a036, pp. 1174\u20131182 (2022)","DOI":"10.1609\/aaai.v36i1.20003"},{"key":"36_CR11","doi-asserted-by":"crossref","unstructured":"Li, B., Wu, Z., Wang, Y.: Cross-modal mask fusion and modality-balanced audio-visual speech recognition. In: 2022 IEEE 4th International Conference on Power, Intelligent Computing and Systems (ICPICS), pp. 371\u2013375. IEEE (2022)","DOI":"10.1109\/ICPICS55264.2022.9873574"},{"key":"36_CR12","doi-asserted-by":"publisher","unstructured":"Li, J., Li, Y., Li, S., Xue, F.: Lipmvcl: Lipreading based on multi-view and collaborative learning. In: Yu, S., et al. (eds.) CCBR 2024. LNCS, vol. 15353, pp. 133\u2013142. Springer, Singapore (2024). https:\/\/doi.org\/10.1007\/978-981-96-1071-6_13","DOI":"10.1007\/978-981-96-1071-6_13"},{"issue":"1","key":"36_CR13","doi-asserted-by":"publisher","first-page":"42","DOI":"10.1007\/s00530-023-01226-3","volume":"30","author":"Y Li","year":"2024","unstructured":"Li, Y., Xue, F., Wu, L., Xie, Y., Li, S.: Generalizing sentence-level lipreading to unseen speakers: a two-stream end-to-end approach. Multimedia Syst. 30(1), 42 (2024)","journal-title":"Multimedia Syst."},{"key":"36_CR14","doi-asserted-by":"crossref","unstructured":"Liu, L., Liu, L.: Cross-modal mutual learning for cued speech recognition. In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.\u00a01\u20135. IEEE (2023)","DOI":"10.1109\/ICASSP49357.2023.10095271"},{"key":"36_CR15","doi-asserted-by":"crossref","unstructured":"Luo, M., Yang, S., Chen, X., Liu, Z., Shan, S.: Synchronous bidirectional learning for multilingual lip reading. arXiv preprint arXiv:2005.03846 (2020)","DOI":"10.5244\/C.34.172"},{"key":"36_CR16","doi-asserted-by":"crossref","unstructured":"Ma, P., Martinez, B., Petridis, S., Pantic, M.: Towards practical lipreading with distilled and efficient models. In: ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 7608\u20137612. IEEE (2021)","DOI":"10.1109\/ICASSP39728.2021.9415063"},{"issue":"11","key":"36_CR17","doi-asserted-by":"publisher","first-page":"930","DOI":"10.1038\/s42256-022-00550-z","volume":"4","author":"P Ma","year":"2022","unstructured":"Ma, P., Petridis, S., Pantic, M.: Visual speech recognition for multiple languages in the wild. Nat. Mach. Intell. 4(11), 930\u2013939 (2022)","journal-title":"Nat. Mach. Intell."},{"key":"36_CR18","doi-asserted-by":"crossref","unstructured":"Ma, P., Wang, Y., Shen, J., Petridis, S., Pantic, M.: Lip-reading with densely connected temporal convolutional networks. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 2857\u20132866 (2021)","DOI":"10.1109\/WACV48630.2021.00290"},{"key":"36_CR19","doi-asserted-by":"crossref","unstructured":"Martinez, B., Ma, P., Petridis, S., Pantic, M.: Lipreading using temporal convolutional networks. In: ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6319\u20136323. IEEE (2020)","DOI":"10.1109\/ICASSP40776.2020.9053841"},{"key":"36_CR20","doi-asserted-by":"crossref","unstructured":"Mercea, O.B., Riesch, L., Koepke, A., Akata, Z.: Audio-visual generalised zero-shot learning with cross-modal attention and language. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10553\u201310563 (2022)","DOI":"10.1109\/CVPR52688.2022.01030"},{"key":"36_CR21","doi-asserted-by":"crossref","unstructured":"Prajwal, K., Momeni, L., Afouras, T., Zisserman, A.: Visual keyword spotting with attention. arXiv preprint arXiv:2110.15957 (2021)","DOI":"10.5244\/C.35.212"},{"key":"36_CR22","doi-asserted-by":"crossref","unstructured":"Sheng, C., et al.: Importance-aware information bottleneck learning paradigm for lip reading. IEEE Trans. Multimedia (2022)","DOI":"10.1109\/TMM.2022.3210761"},{"key":"36_CR23","doi-asserted-by":"crossref","unstructured":"Song, Q., Sun, B., Li, S.: Multimodal sparse transformer network for audio-visual speech recognition. IEEE Trans. Neural Netw. Learn. Syst. (2022)","DOI":"10.1109\/TNNLS.2022.3163771"},{"key":"36_CR24","doi-asserted-by":"crossref","unstructured":"Tan, G., Wang, Y., Han, H., Cao, Y., Wu, F., Zha, Z.J.: Multi-grained spatio-temporal features perceived network for event-based lip-reading. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 20094\u201320103 (2022)","DOI":"10.1109\/CVPR52688.2022.01946"},{"key":"36_CR25","doi-asserted-by":"crossref","unstructured":"Tian, W., Zhang, H., Peng, C., Zhao, Z.Q.: Lipreading model based on whole-part collaborative learning. In: ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 2425\u20132429. IEEE (2022)","DOI":"10.1109\/ICASSP43922.2022.9747052"},{"key":"36_CR26","unstructured":"Wei, L., Zhang, J., Hou, J., Dai, L.: Attentive fusion enhanced audio-visual encoding for transformer based robust speech recognition. In: 2020 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), pp. 638\u2013643. IEEE (2020)"},{"key":"36_CR27","doi-asserted-by":"crossref","unstructured":"Xiao, J., Yang, S., Zhang, Y., Shan, S., Chen, X.: Deformation flow based two-stream network for lip reading. In: 2020 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020), pp. 364\u2013370. IEEE (2020)","DOI":"10.1109\/FG47880.2020.00132"},{"key":"36_CR28","doi-asserted-by":"crossref","unstructured":"Xu, B., Lu, C., Guo, Y., Wang, J.: Discriminative multi-modality speech recognition. In: Proceedings of the IEEE\/CVF conference on Computer Vision and Pattern Recognition, pp. 14433\u201314442 (2020)","DOI":"10.1109\/CVPR42600.2020.01444"},{"key":"36_CR29","doi-asserted-by":"crossref","unstructured":"Xu, H., et al.: A multi-scale feature aggregation based lightweight network for audio-visual speech enhancement. In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.\u00a01\u20135. IEEE (2023)","DOI":"10.1109\/ICASSP49357.2023.10096565"},{"issue":"1","key":"36_CR30","doi-asserted-by":"publisher","first-page":"84","DOI":"10.1007\/s00530-024-01627-y","volume":"31","author":"F Xue","year":"2025","unstructured":"Xue, F., Li, P., Li, Y., Li, S.: WPELip: enhance lip reading with word-prior information. Multimedia Syst. 31(1), 84 (2025)","journal-title":"Multimedia Syst."},{"key":"36_CR31","doi-asserted-by":"crossref","unstructured":"Yang, C., Wang, S., Zhang, X., Zhu, Y.: Speaker-independent lipreading with limited data. In: 2020 IEEE International Conference on Image Processing (ICIP), pp. 2181\u20132185. IEEE (2020)","DOI":"10.1109\/ICIP40778.2020.9190780"},{"key":"36_CR32","doi-asserted-by":"crossref","unstructured":"Yang, K., Markovi\u0107, D., Krenn, S., Agrawal, V., Richard, A.: Audio-visual speech codecs: rethinking audio-visual speech enhancement by re-synthesis. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8227\u20138237 (2022)","DOI":"10.1109\/CVPR52688.2022.00805"},{"key":"36_CR33","doi-asserted-by":"crossref","unstructured":"Yang, S., et al.: LRW-1000: A naturally-distributed large-scale benchmark for lip reading in the wild. In: 2019 14th IEEE international conference on automatic face & gesture recognition (FG 2019), pp.\u00a01\u20138. IEEE (2019)","DOI":"10.1109\/FG.2019.8756582"},{"key":"36_CR34","doi-asserted-by":"crossref","unstructured":"Zhang, J.X., Mao, T., Guo, L., Li, J., Zhang, L.: Target speaker lipreading by audio-visual self-distillation pretraining and speaker adaptation. Expert Syst. Appl. 126741 (2025)","DOI":"10.1016\/j.eswa.2025.126741"},{"key":"36_CR35","doi-asserted-by":"crossref","unstructured":"Zhang, J.X., Wan, G., Ling, Z.H., Pan, J., Gao, J., Liu, C.: Self-supervised audio-visual speech representations learning by multimodal self-distillation. In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.\u00a01\u20135. IEEE (2023)","DOI":"10.1109\/ICASSP49357.2023.10095029"},{"key":"36_CR36","doi-asserted-by":"crossref","unstructured":"Zhang, Y., Yang, S., Xiao, J., Shan, S., Chen, X.: Can we read speech beyond the lips? Rethinking ROI selection for deep visual speech recognition. In: 2020 15th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2020), pp. 356\u2013363. IEEE (2020)","DOI":"10.1109\/FG47880.2020.00134"},{"key":"36_CR37","doi-asserted-by":"crossref","unstructured":"Zhang, Z.Q., Zhang, J., Zhang, J.S., Wu, M.H., Fang, X., Dai, L.R.: Learning contextually fused audio-visual representations for audio-visual speech recognition. In: 2022 IEEE International Conference on Image Processing (ICIP), pp. 1346\u20131350. IEEE (2022)","DOI":"10.1109\/ICIP46576.2022.9897235"},{"key":"36_CR38","doi-asserted-by":"crossref","unstructured":"Zhou, J., Guo, D., Wang, M.: Contrastive positive sample propagation along the audio-visual event line. IEEE Trans. Pattern Anal. Mach. Intell. (2022)","DOI":"10.1109\/TPAMI.2022.3223688"},{"key":"36_CR39","doi-asserted-by":"crossref","unstructured":"Zhou, J., Zheng, L., Zhong, Y., Hao, S., Wang, M.: Positive sample propagation along the audio-visual event line. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8436\u20138444 (2021)","DOI":"10.1109\/CVPR46437.2021.00833"}],"container-title":["Lecture Notes in Computer Science","Advances in Computer Graphics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-22267-1_36","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T00:10:39Z","timestamp":1783555839000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-22267-1_36"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"ISBN":["9783032222664","9783032222671"],"references-count":39,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-22267-1_36","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]},"assertion":[{"value":"2 July 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"CGI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Computer Graphics International Conference","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Hong Kong","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 July 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18 July 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"42","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"cgi2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/www.cgs-network.org\/cgi25","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}