{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T16:06:08Z","timestamp":1781798768744,"version":"3.54.5"},"reference-count":60,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2026,2,6]],"date-time":"2026-02-06T00:00:00Z","timestamp":1770336000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,2,6]],"date-time":"2026-02-06T00:00:00Z","timestamp":1770336000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1007\/s11263-025-02726-7","type":"journal-article","created":{"date-parts":[[2026,2,6]],"date-time":"2026-02-06T03:45:21Z","timestamp":1770349521000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Beyond Fixed Topologies: Unregistered Training and Comprehensive Evaluation Metrics for 3D Talking Heads"],"prefix":"10.1007","volume":"134","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-6585-6924","authenticated-orcid":false,"given":"Federico","family":"Nocentini","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Thomas","family":"Besnier","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Claudio","family":"Ferrari","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sylvain","family":"Arguillere","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mohamed","family":"Daoudi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Stefano","family":"Berretti","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,2,6]]},"reference":[{"key":"2726_CR1","doi-asserted-by":"publisher","DOI":"10.1145\/3528223.3530141","author":"N Aigerman","year":"2022","unstructured":"Aigerman, N., Gupta, K., Kim, V. G., Chaudhuri, S., Saito, J., & Groueix, T. (2022). Neural jacobian fields: Learning intrinsic mappings of arbitrary meshes. ACM Trans. Graph. https:\/\/doi.org\/10.1145\/3528223.3530141","journal-title":"ACM Trans. Graph."},{"key":"2726_CR2","doi-asserted-by":"crossref","unstructured":"Aneja, S., Thies, J., Dai, A., & Nie\u00dfner M. (2024). Facetalk: Audio-driven motion diffusion for neural parametric head models. In Proc. IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), .","DOI":"10.1109\/CVPR52733.2024.02009"},{"key":"2726_CR3","doi-asserted-by":"publisher","DOI":"10.1016\/j.cag.2023.06.027","author":"T Besnier","year":"2023","unstructured":"Besnier, T., Arguill\u00e8re, S., Pierson, E., & Daoudi, M. (2023). Toward Mesh-Invariant 3D Generative Deep Learning with Geometric Measures. Computers and Graphics. https:\/\/doi.org\/10.1016\/j.cag.2023.06.027","journal-title":"Computers and Graphics"},{"key":"2726_CR4","doi-asserted-by":"crossref","unstructured":"Bouritsas, G., Bokhnyak, S., Ploumpis, S., Bronstein, M., & Zafeiriou., S. (2019). Neural 3D morphable models: Spiral convolutional networks for 3D shape representation learning and generation. In IEEE Int. Conf. on Computer Vision (ICCV).","DOI":"10.1109\/ICCV.2019.00731"},{"key":"2726_CR5","doi-asserted-by":"crossref","unstructured":"Charles, R.Q., Su, H., Kaichun, M., & Guibas, L\u00a0J. (2017). Pointnet: Deep learning on point sets for 3d classification and segmentation. In IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), page 77\u201385. IEEE.","DOI":"10.1109\/CVPR.2017.16"},{"key":"2726_CR6","doi-asserted-by":"publisher","unstructured":"Charon, N., & Trouv\u00e9, A. (2013). The varifold representation of nonoriented shapes for diffeomorphic registration. SIAM Journal on Imaging Sciences,6(4), 2547\u20132580. https:\/\/doi.org\/10.1137\/130918885","DOI":"10.1137\/130918885"},{"key":"2726_CR7","doi-asserted-by":"crossref","unstructured":"Chen, P., Wei, X., Lu, M., Chen, H., & Tian, F. (2025). Diffusiontalker: Efficient and compact speech-driven 3d talking head via personalizer-guided distillation.","DOI":"10.1109\/ICME59968.2025.11208984"},{"key":"2726_CR8","volume-title":"Out of time: automated lip sync in the wild","author":"JS Chung","year":"2016","unstructured":"Chung, J. S., & Zisserman, A. (2016). Out of time: automated lip sync in the wild. ACCV: In Workshop on Multi-view Lip-reading."},{"key":"2726_CR9","doi-asserted-by":"crossref","unstructured":"Croquet, B., Christiaens, D., Weinberg, S\u00a0M., Bronstein, M., Vandermeulen, D., & Claes, P.(2021). Unsupervised diffeomorphic surface registration and non-linear modelling. In Medical Image Computing and Computer Assisted Intervention (MICCAI), page 118\u2013128. Springer.","DOI":"10.1007\/978-3-030-87202-1_12"},{"key":"2726_CR10","doi-asserted-by":"crossref","unstructured":"Cudeiro, D., Bolkart, T., Laidlaw, C., Ranjan, A., & Black., M.(2019). Capture, learning, and synthesis of 3D speaking styles. In IEEE Conf. on Computer Vision and Pattern Recognition (CVPR), pages 10101\u201310111.","DOI":"10.1109\/CVPR.2019.01034"},{"key":"2726_CR11","doi-asserted-by":"crossref","unstructured":"Dan\u011b\u010dek, R., Chhatre, K., Tripathi, S., Wen, Y., Black, M\u00a0J., & Bolkart,T. (2023) Emotional speech-driven animation with content-emotion disentanglement. arXiv:2306.08990","DOI":"10.1145\/3610548.3618183"},{"key":"2726_CR12","unstructured":"Defferrard, M., Bresson, X., & Vandergheynst., P.(2016). Convolutional neural networks on graphs with fast localized spectral filtering. Neural Information Processing Systems (NIPS), page 3844\u20133852."},{"key":"2726_CR13","unstructured":"Eiter, T., & Mannila H.(1994). Computing discrete fr\u00e9chet distance."},{"key":"2726_CR14","doi-asserted-by":"publisher","unstructured":"Fan, Y., Lin, Z.,Saito, J., Wang, W., & Komura, T. (2022). Faceformer: Speech-driven 3d facial animation with transformers. In IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR), page 18749\u201318758. IEEE https:\/\/doi.org\/10.1109\/CVPR52688.2022.01821.","DOI":"10.1109\/CVPR52688.2022.01821"},{"issue":"6","key":"2726_CR15","doi-asserted-by":"publisher","first-page":"591","DOI":"10.1109\/TMM.2010.2052239","volume":"12","author":"G Fanelli","year":"2010","unstructured":"Fanelli, G., Gall, J., Romsdorfer, H., Weise, T., & Van Gool, L. (2010). A 3-d audio-visual corpus of affective communication. IEEE Transactions on Multimedia,12(6), 591\u2013598. https:\/\/doi.org\/10.1109\/TMM.2010.2052239","journal-title":"IEEE Transactions on Multimedia"},{"key":"2726_CR16","doi-asserted-by":"crossref","unstructured":"Ferrari, C., Berretti, S., Pala, P., & Bimbo, A.D. (2021). A sparse and locally coherent morphable face model for dense semantic correspondence across heterogeneous 3d faces. IEEE Trans. on Pattern Analysis and Machine Intelligence, 44 (10): 6667\u20136682.","DOI":"10.1109\/TPAMI.2021.3090942"},{"key":"2726_CR17","doi-asserted-by":"publisher","first-page":"23","DOI":"10.1016\/j.patrec.2023.09.015","volume":"175","author":"C Ferrari","year":"2023","unstructured":"Ferrari, C., Berretti, S., Pala, P., & Del Bimbo, A. (2023). The florence multi-resolution 3d facial expression dataset. Pattern Recognition Letters,175, 23\u201329.","journal-title":"Pattern Recognition Letters"},{"key":"2726_CR18","doi-asserted-by":"crossref","unstructured":"Gilani, S\u00a0Z., Mian, A., Shafait, F., & Reid, I. (2017). Dense 3D face correspondence. IEEE Trans. on Pattern Analysis and Machine Intelligence, 40(7): 1584\u20131598 .","DOI":"10.1109\/TPAMI.2017.2725279"},{"key":"2726_CR19","doi-asserted-by":"crossref","unstructured":"Gong, S., Chen, L., Bronstein, M., & Zafeiriou, S.(2019). Spiralnet++: A fast and highly efficient mesh convolution operator. In IEEE Int. Conf. on Computer Vision Workshops, pages 4141\u20134148.","DOI":"10.1109\/ICCVW.2019.00509"},{"key":"2726_CR20","doi-asserted-by":"publisher","unstructured":"Haque, K I., & Yumak, Z. (2023). Facexhubert: Text-less speech-driven e(x)pressive 3d facial animation synthesis using self-supervised speech representation learning. In Int. Conf. on Multimodal Interaction (ICMI). https:\/\/doi.org\/10.1145\/3577190.3614157","DOI":"10.1145\/3577190.3614157"},{"key":"2726_CR21","doi-asserted-by":"publisher","unstructured":"Hsu, W-N., Bolte, B., Tsai, Y-H.H., Lakhotia, K., Salakhutdinov, R., & Mohamed, A.(2021). Hubert: Self-supervised speech representation learning by masked prediction of hidden units. IEEE\/ACM Trans. Audio, Speech and Lang. Proc., 29: 3451\u20133460. https:\/\/doi.org\/10.1109\/TASLP.2021.3122291.","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"2726_CR22","doi-asserted-by":"publisher","DOI":"10.1145\/3528233.3530745","author":"X Ji","year":"2022","unstructured":"Ji, X., Zhou, H., Wang, K., Qianyi, W., Wayne, W., Feng, X., & Cao, X. (2022). Eamm: One-shot emotional talking face via audio-based emotion-aware motion model. In ACM SIGGRAPH. https:\/\/doi.org\/10.1145\/3528233.3530745","journal-title":"In ACM SIGGRAPH"},{"key":"2726_CR23","doi-asserted-by":"publisher","unstructured":"Kaltenmark, I ., Charlier, B., & Charon, N.(2017). A General Framework for Curve and Surface Comparison and Registration with Oriented Varifolds. In IEEE Conf. on Computer Vision and Pattern Recognition (CVPR). https:\/\/doi.org\/10.1109\/CVPR.2017.487.","DOI":"10.1109\/CVPR.2017.487"},{"key":"2726_CR24","doi-asserted-by":"crossref","unstructured":"Li, T., Bolkart, T., Black, M.\u00a0J., Li, H., & Romero, J.(2017). Learning a model of facial shape and expression from 4D scans. ACM Trans. on Graphics, (Proc. SIGGRAPH Asia), 36 (6): 194:1\u2013194:17.","DOI":"10.1145\/3130800.3130813"},{"key":"2726_CR25","doi-asserted-by":"publisher","unstructured":"Lim, I., Dielen, A., Campen, M., & Kobbelt, L.(2019). A simple approach to intrinsic correspondence learning on unstructured 3d meshes. In European Conf. on Computer Vision Workshops, page 349\u2013362. https:\/\/doi.org\/10.1007\/978-3-030-11015-4_26.","DOI":"10.1007\/978-3-030-11015-4_26"},{"key":"2726_CR26","doi-asserted-by":"crossref","unstructured":"Lu, X., Zhuang, C., Lu, Z., Wang, Y., & Xiao, J. (2024). Fc-4dfs: Frequency-controlled flexible 4d facial expression synthesizing. In ACM Multimedia 2024.","DOI":"10.1145\/3664647.3681455"},{"key":"2726_CR27","doi-asserted-by":"crossref","unstructured":"M\u00fcller M (2007) Dynamic time warping. Information retrieval for music and motion, pages 69\u201384.","DOI":"10.1007\/978-3-540-74048-3_4"},{"key":"2726_CR28","volume-title":"Chun-Hao Paul Huang, Duygu Ceylan, and Niloy J","author":"S Muralikrishnan","year":"2023","unstructured":"Muralikrishnan, S. (2023). Chun-Hao Paul Huang, Duygu Ceylan, and Niloy J. Mitra. Bliss: Bootstrapped linear shape space."},{"key":"2726_CR29","doi-asserted-by":"crossref","unstructured":"Nocentini, F., Ferrari, C., & Berretti S. (2023). Learning landmarks motion from speech for speaker-agnostic 3d talking heads generation. In Int. Conf. on Image Analysis and Processing (ICIAP), pages 340\u2013351.","DOI":"10.1007\/978-3-031-43148-7_29"},{"key":"2726_CR30","doi-asserted-by":"crossref","unstructured":"Nocentini, F., Besnier, T., Ferrari, C., Arguillere, S., Berretti, S., & Daoudi, M .(2024). Scantalk: 3d talking heads from unregistered scans. In European Conf. on Computer Vision (ECCV).","DOI":"10.1007\/978-3-031-73397-0_2"},{"key":"2726_CR31","doi-asserted-by":"crossref","unstructured":"Nocentini, F., Ferrari, C., & Berretti, S.(2025). Emovoca: Speech-driven emotional 3d talking heads. In Proceedings of the Winter Conference on Applications of Computer Vision (WACV), pages 2859\u20132868.","DOI":"10.1109\/WACV61041.2025.00283"},{"key":"2726_CR32","doi-asserted-by":"crossref","unstructured":"Otberdout, N., Ferrari, C., Daoudi, M., Berretti, S., & Bimbo, A D.(2022). Sparse to dense dynamic 3d facial expression generation. In IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR), pages 20385\u201320394.","DOI":"10.1109\/CVPR52688.2022.01974"},{"issue":"2","key":"2726_CR33","doi-asserted-by":"publisher","first-page":"566","DOI":"10.1109\/TAFFC.2023.3280671","volume":"15","author":"N Otberdout","year":"2023","unstructured":"Otberdout, N., Ferrari, C., Daoudi, M., Berretti, S., & Del Bimbo, A. (2023). Generating multiple 4d expression transitions by learning face landmark trajectories. IEEE Transactions on Affective Computing,15(2), 566\u2013578.","journal-title":"IEEE Transactions on Affective Computing"},{"key":"2726_CR34","doi-asserted-by":"crossref","unstructured":"Ou, F-Z., Chen, X., Zhang, R., Huang, Y., Li, S., Li, J., Li, Y., Cao, L., & Wang, Y-G. (2021). SDD-FIQA: Unsupervised face image quality assessment with similarity distribution distance. In IEEE Conf. on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR46437.2021.00758"},{"key":"2726_CR35","doi-asserted-by":"publisher","unstructured":"Peng, Z., Luo, Y., Shi, Y., Xu, H., Zhu, X., Liu, H., He, J., & Fan, Z. (2023a). Selftalk: A self-supervised commutative training diagram to comprehend 3d talking faces. In ACM Int. Conf. on Multimedia, page 5292\u20135301, 2023a. https:\/\/doi.org\/10.1145\/3581783.3611734.","DOI":"10.1145\/3581783.3611734"},{"key":"2726_CR36","doi-asserted-by":"crossref","unstructured":"Peng, Z., Wu, H., Song, Z., Xu, H., Zhu, X., He, J., Liu, H., & Fan, Z.(2023b). Emotalk: Speech-driven emotional disentanglement for 3d face animation.","DOI":"10.1109\/ICCV51070.2023.01891"},{"key":"2726_CR37","doi-asserted-by":"publisher","unstructured":"Prajwal, K.\u00a0R., Mukhopadhyay, R., Namboodiri, V.\u00a0P., & Jawahar, C.V. (2020). A lip sync expert is all you need for speech to lip generation in the wild. In 28th ACM Int. Conf. on Multimedia (MM), page 484\u2013492. https:\/\/doi.org\/10.1145\/3394171.3413532.","DOI":"10.1145\/3394171.3413532"},{"key":"2726_CR38","doi-asserted-by":"crossref","unstructured":"Principi, F., Berretti, S., Ferrari, C., Otberdout, N., Daoudi, M., & Bimbo, A.D.(2023) The florence 4d facial expression dataset. In 2023 IEEE 17th International Conference on Automatic Face and Gesture Recognition (FG), pages 1\u20136. IEEE.","DOI":"10.1109\/FG57933.2023.10042606"},{"key":"2726_CR39","unstructured":"Qi, C.R., Yi, L., Su, H., & Guibas, L.J.(2017). Pointnet++: Deep hierarchical feature learning on point sets in a metric space. Advances in Neural Information Processing Systems (NeurIPS), 30."},{"key":"2726_CR40","doi-asserted-by":"crossref","unstructured":"Qin, D., Saito, J., & Aigerman, N.(2023) Groueix Thibault, and Taku Komura. Neural face rigging for animating and retargeting facial meshes in the wild. In SIGGRAPH 2023 Conference Papers, 2023.","DOI":"10.1145\/3588432.3591556"},{"key":"2726_CR41","doi-asserted-by":"crossref","unstructured":"Ranjan, A., Bolkart, T., Sanyal, S., & Black, M.J.(2018). Generating 3D faces using convolutional mesh autoencoders. In European Conf. on Computer Vision (ECCV), pages 725\u2013741, 2018.","DOI":"10.1007\/978-3-030-01219-9_43"},{"key":"2726_CR42","doi-asserted-by":"publisher","unstructured":"Ren, Z., Pan, Z., Zhou, X., & Kang, L.(2023) Diffusion motion: Generate text-guided 3d human motion by diffusion model. In IEEE Int. Conf. on Acoustics, Speech and Signal Processing (ICASSP), pages 1\u20135. https:\/\/doi.org\/10.1109\/ICASSP49357.2023.10096441.","DOI":"10.1109\/ICASSP49357.2023.10096441"},{"key":"2726_CR43","doi-asserted-by":"crossref","unstructured":"Richard, A., Zollh\u00f6fer, M., Wen, Y., de\u00a0la Torre, F., & Sheikh, Y.(2021). Meshtalk: 3d face animation from speech using cross-modality disentanglement. In IEEE\/CVF Int. Conf. on Computer Vision (ICCV), pages 1173\u20131182.","DOI":"10.1109\/ICCV48922.2021.00121"},{"key":"2726_CR44","doi-asserted-by":"crossref","unstructured":"Sariyanidi, E., Ferrari, C., Berretti, S., Schultz, R\u00a0T., & Tunc, B.(2023). Meta-evaluation for 3d face reconstruction via synthetic data. In IEEE Int. Joint Conf. on Biometrics (IJCB), pages 1\u201310.","DOI":"10.1109\/IJCB57857.2023.10448898"},{"key":"2726_CR45","doi-asserted-by":"publisher","unstructured":"Schneider, S., Baevski, A., Collobert, R., & Auli, M.(2019). wav2vec: Unsupervised pre-training for speech recognition. In Interspeech 2019, page 3465\u20133469. ISCA. https:\/\/doi.org\/10.21437\/Interspeech.2019-1873.","DOI":"10.21437\/Interspeech.2019-1873"},{"key":"2726_CR46","doi-asserted-by":"crossref","unstructured":"Sharp, N., Attaiki, S., Crane, K., & Ovsjanikov, M.(2022).Diffusionnet: Discretization agnostic learning on surfaces. ACM Trans. Graph., 01 (1).","DOI":"10.1145\/3507905"},{"key":"2726_CR47","doi-asserted-by":"publisher","unstructured":"Stan, S., Haque, K.I., & Yumak, Z.(2023). Facediffuser: Speech-driven 3d facial animation synthesis using diffusion. In ACM SIGGRAPH Conf. on Motion, Interaction and Games (MIG). https:\/\/doi.org\/10.1145\/3623264.3624447.","DOI":"10.1145\/3623264.3624447"},{"key":"2726_CR48","doi-asserted-by":"crossref","unstructured":"Sun, Z., Lv, T., Ye, S., Lin, M.G., Sheng, J., Wen, Y-H., Yu, M., & jin Liu Y.(2023) Diffposetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models","DOI":"10.1145\/3658221"},{"key":"2726_CR49","doi-asserted-by":"crossref","unstructured":"Thambiraja, B., Aliakbarian, S., Cosker, D., & Thies, J.(2023a). 3diface: Diffusion-based speech-driven 3d facial animation and editing.","DOI":"10.1109\/ICCV51070.2023.01885"},{"key":"2726_CR50","doi-asserted-by":"crossref","unstructured":"Thambiraja, B., Habibie, I., Aliakbarian, S., Cosker, D., Theobalt, C., & Thies,J. (2023b). Imitator: Personalized speech-driven 3d facial animation. In IEEE\/CVF Int. Conf. on Computer Vision (ICCV), pages 20621\u201320631.","DOI":"10.1109\/ICCV51070.2023.01885"},{"key":"2726_CR51","doi-asserted-by":"crossref","unstructured":"Torgerson. W\u00a0S. (1952). Multidimensional scaling: I. theory and method. Psychometrika, 17 (4): 401\u2013419.","DOI":"10.1007\/BF02288916"},{"key":"2726_CR52","doi-asserted-by":"crossref","unstructured":"Wang, J., Zhao, Y., \u00a0Liu, L., Xu, T-S., \u00a0Li, Q., & Li, S.(2023). Emotional talking head generation based on memory-sharing and attention-augmented networks. arXiv:abs\/2306.03594","DOI":"10.21437\/Interspeech.2023-749"},{"key":"2726_CR53","doi-asserted-by":"crossref","unstructured":"Wang, Y., Sun, Y., Liu, Z., Sarma, S.E., Bronstein, M.M., & Solomon, J.\u00a0M.(2019). Dynamic graph cnn for learning on point clouds. ACM Transactions on Graphics (TOG), .","DOI":"10.1145\/3326362"},{"key":"2726_CR54","doi-asserted-by":"publisher","unstructured":"Wiersma, R., Nasikun, A., Eisemann, E., & Hildebrandt, K. (2022). Deltaconv: Anisotropic operators for geometric deep learning on point clouds. ACM Transactions on Graphics,41(4), https:\/\/doi.org\/10.1145\/3528223.3530166.","DOI":"10.1145\/3528223.3530166"},{"key":"2726_CR55","doi-asserted-by":"crossref","unstructured":"Wu, H., Zhang, E., Liao, L., Chen, C., Hou, J\u00a0H., Wang, A., Sun, W\u00a0S., Yan, Q., & Lin, W.(2023). Exploring video quality assessment on user generated contents from aesthetic and technical perspectives. In IEEE Int. Conf. on Computer Vision (ICCV).","DOI":"10.1109\/ICCV51070.2023.01843"},{"key":"2726_CR56","unstructured":"Wuu, C. H., Zheng, N., Ardisson, S., Bali, R., Belko, D., Brockmeyer, E. & Sheikh, Y. (2022). Multiface: A dataset for neural face rendering. arXiv:2207.11243."},{"key":"2726_CR57","doi-asserted-by":"crossref","unstructured":"Xing, J., Xia, M., Zhang, Y., Cun, X., Wang, J., & Wong, T. T. (2023). Codetalker: Speech-driven 3d facial animation with discrete motion prior. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (pp. 12780-12790).","DOI":"10.1109\/CVPR52729.2023.01229"},{"key":"2726_CR58","doi-asserted-by":"crossref","unstructured":"Yi, H., Liang, H., Liu, Y., Cao, Q., Wen, Y., Bolkart, T., Tao, D., & Black, M.J.(2023). Generating holistic 3d human motion from speech. In IEEE\/CVF Conf. on Computer Vision and Pattern Recognition CVPR, 2023.","DOI":"10.1109\/CVPR52729.2023.00053"},{"key":"2726_CR59","doi-asserted-by":"publisher","unstructured":"Yin, L., Wei, X., Sun, Y., Wang, J., & Rosato, M.J.(2006). A 3D facial expression database for facial behavior research. In Int. Conf. on Automatic Face and Gesture Recognition (FGR), pages 211\u2013216 https:\/\/doi.org\/10.1109\/FGR.2006.6.","DOI":"10.1109\/FGR.2006.6"},{"key":"2726_CR60","doi-asserted-by":"publisher","unstructured":"Zhang, W., Cun, X., Wang, X., Zhang, Y., Shen, X., \u00a0Guo, Y., Shan, Y., & Wang, F.(2023). Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation. In IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR), pages 8652\u20138661, 2023. https:\/\/doi.org\/10.1109\/CVPR52729.2023.00836.","DOI":"10.1109\/CVPR52729.2023.00836"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02726-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02726-7","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02726-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,27]],"date-time":"2026-03-27T08:34:54Z","timestamp":1774600494000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02726-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,2,6]]},"references-count":60,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2026,3]]}},"alternative-id":["2726"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02726-7","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,2,6]]},"assertion":[{"value":"16 April 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 December 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 February 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"105"}}