{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T08:02:28Z","timestamp":1784361748804,"version":"3.55.0"},"publisher-location":"Singapore","reference-count":31,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819234288","type":"print"},{"value":"9789819234295","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T00:00:00Z","timestamp":1784419200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T00:00:00Z","timestamp":1784419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2027]]},"DOI":"10.1007\/978-981-92-3429-5_15","type":"book-chapter","created":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T07:05:39Z","timestamp":1784358339000},"page":"176-187","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Self-supervised Cross-Modal Alignment for High-Fidelity Audio-Driven Lip Sync with Latent Diffusion"],"prefix":"10.1007","author":[{"given":"Zhiyue","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Minjie","family":"Bian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huahu","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hailan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xueping","family":"Man","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,7,19]]},"reference":[{"key":"15_CR1","doi-asserted-by":"crossref","unstructured":"Mukhopadhyay, S., Suri, S., Gadde, R.T., Shrivastava, A.: Diff2Lip: Audio conditioned diffusion models for lip-synchronization (2023). https:\/\/arxiv.org\/abs\/2308.09716","DOI":"10.1109\/WACV57701.2024.00521"},{"key":"15_CR2","unstructured":"Ma, Y., et al.: DreamTalk: When emotional talking head generation meets diffusion probabilistic models (2024). https:\/\/arxiv.org\/abs\/2312.09767"},{"key":"15_CR3","unstructured":"Yu, Z., Yin, Z., Zhou, D., Wang, D., Wong, F., Wang, B.: Talking head generation with probabilistic audio-to-visual diffusion priors (2022). https:\/\/arxiv.org\/abs\/2212.04248"},{"key":"15_CR4","unstructured":"Raina, A., Arora, V.: SyncNet: Correlating objective for time delay estimation in audio signals (2025). https:\/\/arxiv.org\/abs\/2203.14639"},{"key":"15_CR5","doi-asserted-by":"crossref","unstructured":"Zhang, W., et al.: SadTalker: Learning realistic 3D motion coefficients for stylized audio-driven single image talking face animation (2023). https:\/\/arxiv.org\/abs\/2211.12194","DOI":"10.1109\/CVPR52729.2023.00836"},{"key":"15_CR6","doi-asserted-by":"crossref","unstructured":"Zhou, H., Sun, Y., Wu, W., Loy, C.C., Wang, X., Liu, Z.: Pose-controllable talking face generation by implicitly modularized audio-visual representation (2021). https:\/\/arxiv.org\/abs\/2104.11116","DOI":"10.1109\/CVPR46437.2021.00416"},{"key":"15_CR7","unstructured":"Durall, R., Jam, J., Strassel, D., Yap, M.H., Keuper, J.: FacialGAN: Style transfer and attribute manipulation on synthetic faces (2021). https:\/\/arxiv.org\/abs\/2110.09425"},{"key":"15_CR8","doi-asserted-by":"crossref","unstructured":"Liu, T., et al.: AniTalker: Animate vivid and diverse talking faces through identity-decoupled facial motion encoding (2024). https:\/\/arxiv.org\/abs\/2405.03121","DOI":"10.1145\/3664647.3681198"},{"key":"15_CR9","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models (2022). https:\/\/arxiv.org\/abs\/2112.10752","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"15_CR10","doi-asserted-by":"crossref","unstructured":"Ho, J., Salimans, T., Gritsenko, A., Chan, W., Norouzi, M., Fleet, D.J.: Video diffusion models (2022). https:\/\/arxiv.org\/abs\/2204.03458","DOI":"10.52202\/068431-0628"},{"key":"15_CR11","doi-asserted-by":"crossref","unstructured":"Chung, J.S., Senior, A., Vinyals, O., Zisserman, A.: Lip reading sentences in the wild. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.367"},{"key":"15_CR12","unstructured":"Afouras, T., Chung, J.S., Zisserman, A.: LRS3-TED: A large-scale dataset for visual speech recognition. arXiv preprint arXiv:1809.00496 (2018)"},{"key":"15_CR13","doi-asserted-by":"publisher","unstructured":"Chung, J.S., Nagrani, A., Zisserman, A.: VoxCeleb2: Deep speaker recognition. In: Interspeech 2018, pp. 1086\u20131090. ISCA (2018). https:\/\/doi.org\/10.21437\/Interspeech.2018-1929","DOI":"10.21437\/Interspeech.2018-1929"},{"issue":"6","key":"15_CR14","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3414685.3417774","volume":"39","author":"Y Zhou","year":"2020","unstructured":"Zhou, Y., Han, X., Shechtman, E., Echevarria, J., Kalogerakis, E., Li, D.: MakeItTalk: Speaker-aware talking-head animation. ACM Trans. Graph. 39(6), 1\u201315 (2020). https:\/\/doi.org\/10.1145\/3414685.3417774","journal-title":"ACM Trans. Graph."},{"key":"15_CR15","unstructured":"Shi, B., Hsu, W.-N., Lakhotia, K., Mohamed, A.: Learning audio-visual speech representation by masked multimodal cluster prediction (2022). https:\/\/arxiv.org\/abs\/2201.02184"},{"key":"15_CR16","unstructured":"Kim, J., Lee, H., Rho, K., Kim, J., Chung, J.S.: EquiAV: Leveraging equivariance for audio-visual contrastive learning (2024). https:\/\/arxiv.org\/abs\/2403.09502"},{"key":"15_CR17","doi-asserted-by":"crossref","unstructured":"Tian, L., Wang, Q., Zhang, B., Bo, L.: EMO: Emote portrait alive\u00a0\u2013\u00a0generating expressive portrait videos with audio-to-video diffusion model under weak conditions (2024). https:\/\/arxiv.org\/abs\/2402.17485","DOI":"10.1007\/978-3-031-73010-8_15"},{"key":"15_CR18","doi-asserted-by":"crossref","unstructured":"Hsu, W.-N., Bolte, B., Tsai, Y.-H.H., Lakhotia, K., Salakhutdinov, R., Mohamed, A.: HuBERT: Self-supervised speech representation learning by masked prediction of hidden units (2021). https:\/\/arxiv.org\/abs\/2106.07447","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"15_CR19","doi-asserted-by":"crossref","unstructured":"Zhang, R., Isola, P., Efros, A.A., Shechtman, E., Wang, O.: The unreasonable effectiveness of deep features as a perceptual metric (2018). https:\/\/arxiv.org\/abs\/1801.03924","DOI":"10.1109\/CVPR.2018.00068"},{"key":"15_CR20","unstructured":"Baevski, A., Zhou, H., Mohamed, A., Auli, M.: wav2vec 2.0: A framework for self-supervised learning of speech representations (2020). https:\/\/arxiv.org\/abs\/2006.11477"},{"key":"15_CR21","doi-asserted-by":"publisher","DOI":"10.1016\/j.chaos.2025.116898","volume":"199","author":"A Ali","year":"2025","unstructured":"Ali, A., Naeem, H.M.Y., Sharafian, A., Qiu, L., Wu, Z., Bai, X.: Dynamic multi-graph spatio-temporal learning for citywide traffic flow prediction in transportation systems. Chaos, Solitons Fractals. 199, 116898 (2025). https:\/\/doi.org\/10.1016\/j.chaos.2025.116898","journal-title":"Chaos, Solitons Fractals"},{"key":"15_CR22","doi-asserted-by":"publisher","first-page":"233","DOI":"10.1016\/j.neunet.2021.10.021","volume":"145","author":"A Ali","year":"2022","unstructured":"Ali, A., Zhu, Y., Zakarya, M.: Exploiting dynamic spatio-temporal graph convolutional neural networks for citywide traffic flows prediction. Neural Netw. 145, 233\u2013247 (2022). https:\/\/doi.org\/10.1016\/j.neunet.2021.10.021","journal-title":"Neural Netw."},{"key":"15_CR23","doi-asserted-by":"publisher","unstructured":"Ali, A., Sharafian, A., Naeem, H.M.Y., Zakarya, M., Wu, Z., Bai, X.: Advanced computational models for urban traffic flow prediction: a comprehensive review and future directions. Comput. Sci. Rev. 60 (2026). 100886, https:\/\/doi.org\/10.1016\/j.cosrev.2025.100886","DOI":"10.1016\/j.cosrev.2025.100886"},{"key":"15_CR24","doi-asserted-by":"crossref","unstructured":"Yin, J., Ali, R., Li, L., Ma, W., Ali, A.: Edge network model based on double dimension. In: IEEE 8th Annual Computing and Communication Workshop and Conference (CCWC), pp. 341\u2013346 (2018)","DOI":"10.1109\/CCWC.2018.8301694"},{"issue":"4","key":"15_CR25","doi-asserted-by":"publisher","DOI":"10.3390\/electronics15040861","volume":"15","author":"T Alsarhan","year":"2026","unstructured":"Alsarhan, T., et al.: GISLC: Gated-inception model for skin lesion classification. Electronics. 15(4), 861 (2026). https:\/\/doi.org\/10.3390\/electronics15040861","journal-title":"Electronics"},{"key":"15_CR26","doi-asserted-by":"crossref","unstructured":"Jayasumana, S., Ramalingam, S., Veit, A., Glasner, D., Chakrabarti, A., Kumar, S.: Rethinking FID: Towards a better evaluation metric for image generation (2024). https:\/\/arxiv.org\/abs\/2401.09603","DOI":"10.1109\/CVPR52733.2024.00889"},{"key":"15_CR27","doi-asserted-by":"publisher","unstructured":"Hore, A., Ziou, D.: Image quality metrics: PSNR vs. SSIM. In: 2010 20th International Conference on Pattern Recognition, pp. 2366\u20132369 (2010). https:\/\/doi.org\/10.1109\/ICPR.2010.579","DOI":"10.1109\/ICPR.2010.579"},{"key":"15_CR28","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2021.116087","volume":"189","author":"I Bakurov","year":"2022","unstructured":"Bakurov, I., Buzzelli, M., Schettini, R., Castelli, M., Vanneschi, L.: Structural similarity index (SSIM) revisited: a data-driven approach. Expert Syst. Appl. 189, 116087 (2022). https:\/\/doi.org\/10.1016\/j.eswa.2021.116087","journal-title":"Expert Syst. Appl."},{"key":"15_CR29","unstructured":"Goodfellow, I.J., et al.: Generative adversarial networks (2014). https:\/\/arxiv.org\/abs\/1406.2661"},{"key":"15_CR30","unstructured":"Chen, Z., et al.: DiP: Taming diffusion models in pixel space (2025). https:\/\/arxiv.org\/abs\/2511.18822"},{"key":"15_CR31","doi-asserted-by":"crossref","unstructured":"Li, Y., et al.: TS-Diff: Two-stage diffusion model for low-light RAW image enhancement (2025). https:\/\/arxiv.org\/abs\/2505.0428","DOI":"10.1109\/IJCNN64981.2025.11227851"}],"container-title":["Lecture Notes in Computer Science","Advanced Intelligent Computing Technology and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-92-3429-5_15","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T07:05:41Z","timestamp":1784358341000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-92-3429-5_15"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,19]]},"ISBN":["9789819234288","9789819234295"],"references-count":31,"URL":"https:\/\/doi.org\/10.1007\/978-981-92-3429-5_15","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7,19]]},"assertion":[{"value":"19 July 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICIC","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Intelligent Computing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Toronto","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Canada","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2026","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22 July 2026","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"26 July 2026","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icic2026a","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.ic-icc.cn\/2026\/index.htm","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}