{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T12:39:19Z","timestamp":1776775159273,"version":"3.51.2"},"reference-count":56,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100017596","name":"Natural Science Basic Research Program of Shaanxi Province","doi-asserted-by":"publisher","award":["2024JC-YBQN-0626"],"award-info":[{"award-number":["2024JC-YBQN-0626"]}],"id":[{"id":"10.13039\/501100017596","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100017596","name":"Natural Science Basic Research Program of Shaanxi Province","doi-asserted-by":"publisher","award":["2024JC-YBQN-0735"],"award-info":[{"award-number":["2024JC-YBQN-0735"]}],"id":[{"id":"10.13039\/501100017596","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100021171","name":"Basic and Applied Basic Research Foundation of Guangdong Province","doi-asserted-by":"publisher","award":["2020A1515110523"],"award-info":[{"award-number":["2020A1515110523"]}],"id":[{"id":"10.13039\/501100021171","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100013804","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100013804","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62507037"],"award-info":[{"award-number":["62507037"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"publisher","award":["QTZX25038"],"award-info":[{"award-number":["QTZX25038"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Neurocomputing"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.neucom.2026.133544","type":"journal-article","created":{"date-parts":[[2026,4,1]],"date-time":"2026-04-01T15:35:03Z","timestamp":1775057703000},"page":"133544","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["DESformer: Disentangling emotion and style for co-speech body-motion synthesis"],"prefix":"10.1016","volume":"683","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-9466-3604","authenticated-orcid":false,"given":"Zhitong","family":"He","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2743-2017","authenticated-orcid":false,"given":"Zixiang","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ping","family":"Gao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiguang","family":"Miao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yunan","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kun","family":"Xie","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Junan","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bujia","family":"Tian","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"78","reference":[{"issue":"1","key":"10.1016\/j.neucom.2026.133544_bib0005","doi-asserted-by":"crossref","first-page":"168","DOI":"10.1037\/0033-295X.96.1.168","article-title":"Gesture, speech, and computational stages: a reply to mcneill","volume":"96","author":"Butterworth","year":"1989","journal-title":"Psychol. Rev."},{"issue":"1","key":"10.1016\/j.neucom.2026.133544_bib0010","doi-asserted-by":"crossref","first-page":"140","DOI":"10.1111\/j.1468-2958.1990.tb00229.x","article-title":"Nonverbal behaviors, persuasion, and credibility","volume":"17","author":"Burgoon","year":"1990","journal-title":"Hum. Commun. Res."},{"key":"10.1016\/j.neucom.2026.133544_bib0015","series-title":"Proceedings of the Seventh Annual ACM\/IEEE International Conference on Human-Robot Interaction","first-page":"25","article-title":"Robot behavior toolkit: generating effective social behaviors for robots","author":"Huang","year":"2012"},{"key":"10.1016\/j.neucom.2026.133544_bib0020","series-title":"Proceedings of 2019 International Conference on 3D Vision (3DV)","first-page":"719","article-title":"Language2pose: natural language grounded pose forecasting","author":"Ahuja","year":"2019"},{"key":"10.1016\/j.neucom.2026.133544_bib0025","series-title":"Proc. Of the International Conference in Robotics and Automation (ICRA)","first-page":"4303","article-title":"Robots learn social skills: end-to-end learning of co-speech gesture generation for humanoid robots","author":"Yoon","year":"2019"},{"key":"10.1016\/j.neucom.2026.133544_bib0030","series-title":"Proceedings of the 21st ACM International Conference on Intelligent Virtual Agents","first-page":"101","article-title":"Learning speech-driven 3D conversational gestures from video","author":"Habibie","year":"2021"},{"key":"10.1016\/j.neucom.2026.133544_bib0035","series-title":"Proceedings of the 30th ACM International Conference on Multimedia","first-page":"3764","article-title":"Disco: disentangled implicit content and rhythm learning for diverse co-speech gestures synthesis","author":"Liu","year":"2022"},{"key":"10.1016\/j.neucom.2026.133544_bib0040","first-page":"21386","article-title":"Audio-driven co-speech gesture video generation","volume":"35","author":"Liu","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.133544_bib0045","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10462","article-title":"Learning hierarchical cross-modal association for co-speech gesture generation","author":"Liu","year":"2022"},{"issue":"4","key":"10.1016\/j.neucom.2026.133544_bib0050","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3592097","article-title":"Gesturediffuclip: gesture diffusion model with CLIP latents","volume":"42","author":"Ao","year":"2023","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.neucom.2026.133544_bib0055","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"2321","article-title":"Qpgesture: quantization-based and phase-guided motion matching for natural speech-driven gesture generation","author":"Yang","year":"2023"},{"key":"10.1016\/j.neucom.2026.133544_bib0060","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"6774","article-title":"Enabling synergistic full-body control in prompt-based co-speech motion generation","author":"Chen","year":"2024"},{"issue":"6","key":"10.1016\/j.neucom.2026.133544_bib0065","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3414685.3417838","article-title":"Speech gesture generation from the trimodal context of text, audio, and speaker identity","volume":"39","author":"Yoon","year":"2020","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.neucom.2026.133544_bib0070","series-title":"Proceedings of the 29th ACM International Conference on Multimedia","first-page":"2027","article-title":"Speech2affectivegestures: synthesizing co-speech gestures with generative adversarial affective expression learning","author":"Bhattacharya","year":"2021"},{"key":"10.1016\/j.neucom.2026.133544_bib0075","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"469","article-title":"Generating holistic 3d human motion from speech","author":"Yi","year":"2023"},{"key":"10.1016\/j.neucom.2026.133544_bib0080","author":"Xu"},{"key":"10.1016\/j.neucom.2026.133544_bib0085","series-title":"Proceedings of the Thirty-Second International Joint Conference on Artificial Intelligence","first-page":"5860","article-title":"Diffusestylegesture: stylized audio-driven co-speech gesture generation with diffusion models","author":"Yang","year":"2023"},{"key":"10.1016\/j.neucom.2026.133544_bib0090","series-title":"European Conference on Computer Vision","first-page":"612","article-title":"Beat: a large-scale semantic and emotional multi-modal dataset for conversational gestures synthesis","author":"Liu","year":"2022"},{"key":"10.1016\/j.neucom.2026.133544_bib0095","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1144","article-title":"Emage: towards unified holistic co-speech gesture generation via expressive masked audio gesture modeling","author":"Liu","year":"2024"},{"key":"10.1016\/j.neucom.2026.133544_bib0100","author":"Wang"},{"issue":"5","key":"10.1016\/j.neucom.2026.133544_bib0105","doi-asserted-by":"crossref","first-page":"353","DOI":"10.3758\/BF03337021","article-title":"Recognizing friends by their walk: gait perception without familiarity cues","volume":"9","author":"Cutting","year":"1977","journal-title":"Bull. Psychon. Soc."},{"issue":"6","key":"10.1016\/j.neucom.2026.133544_bib0110","doi-asserted-by":"crossref","first-page":"513","DOI":"10.1002\/(SICI)1099-0720(199912)13:6<513::AID-ACP616>3.0.CO;2-8","article-title":"Visual analysis of gait as a cue to identity","volume":"13","author":"Stevenage","year":"1999","journal-title":"Appl. Cogn. Psychol."},{"issue":"2","key":"10.1016\/j.neucom.2026.133544_bib0115","doi-asserted-by":"crossref","first-page":"316","DOI":"10.1109\/TPAMI.2006.38","article-title":"Individual recognition using gait energy image","volume":"28","author":"Han","year":"2005","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"1\u20132","key":"10.1016\/j.neucom.2026.133544_bib0120","doi-asserted-by":"crossref","first-page":"227","DOI":"10.1016\/S0167-6393(02)00084-5","article-title":"Vocal communication of emotion: a review of research paradigms","volume":"40","author":"Scherer","year":"2003","journal-title":"Speech Commun."},{"issue":"3","key":"10.1016\/j.neucom.2026.133544_bib0125","doi-asserted-by":"crossref","first-page":"614","DOI":"10.1037\/0022-3514.70.3.614","article-title":"Acoustic profiles in vocal emotion expression","volume":"70","author":"Banse","year":"1996","journal-title":"J. Pers. Soc. Psychol."},{"issue":"1","key":"10.1016\/j.neucom.2026.133544_bib0130","doi-asserted-by":"crossref","first-page":"32","DOI":"10.1109\/79.911197","article-title":"Emotion recognition in human-computer interaction","volume":"18","author":"Cowie","year":"2001","journal-title":"IEEE Signal Process. Mag."},{"key":"10.1016\/j.neucom.2026.133544_bib0135","doi-asserted-by":"crossref","first-page":"201","DOI":"10.1007\/s12369-011-0124-9","article-title":"Generation and evaluation of communicative robot gesture","volume":"4","author":"Salem","year":"2012","journal-title":"Int. J. Soc. Robot."},{"key":"10.1016\/j.neucom.2026.133544_bib0140","series-title":"2013 IEEE\/RSJ International Conference on Intelligent Robots and Systems","first-page":"2071","article-title":"Anticipating human activities for reactive robotic response","author":"Koppula","year":"2013"},{"key":"10.1016\/j.neucom.2026.133544_bib0145","series-title":"Proceedings of the 2022 CHI Conference on Human Factors in Computing Systems","first-page":"1","article-title":"Proxemics for human-agent interaction in augmented reality","author":"Huang","year":"2022"},{"key":"10.1016\/j.neucom.2026.133544_bib0150","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"7703","article-title":"Self-supervised correlation mining network for person image generation","author":"Wang","year":"2022"},{"issue":"4","key":"10.1016\/j.neucom.2026.133544_bib0155","doi-asserted-by":"crossref","first-page":"3757","DOI":"10.1109\/LRA.2018.2856281","article-title":"A speech-driven hand gesture generation method and evaluation in android robots","volume":"3","author":"Ishi","year":"2018","journal-title":"IEEE Robot. Autom. Lett."},{"key":"10.1016\/j.neucom.2026.133544_bib0160","series-title":"2019 International Conference on Robotics and Automation (ICRA)","first-page":"4303","article-title":"Robots learn social skills: end-to-end learning of co-speech gesture generation for humanoid robots","author":"Yoon","year":"2019"},{"key":"10.1016\/j.neucom.2026.133544_bib0165","series-title":"Proceedings of the 29th Annual Symposium on User Interface Software and Technology","first-page":"741","article-title":"Holoportation: virtual 3D teleportation in real-time","author":"Orts-Escolano","year":"2016"},{"issue":"5","key":"10.1016\/j.neucom.2026.133544_bib0170","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/1618452.1618518","article-title":"Real-time prosody-driven synthesis of body language","volume":"28","author":"Levine","year":"2009","journal-title":"ACM Trans. Graph."},{"issue":"4","key":"10.1016\/j.neucom.2026.133544_bib0175","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/1778765.1778861","article-title":"Gesture controllers","volume":"29","author":"Levine","year":"2010","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.neucom.2026.133544_bib0180","series-title":"International Workshop on Intelligent Virtual Agents","first-page":"127","article-title":"How to train your avatar: a data driven approach to gesture generation","author":"Chiu","year":"2011"},{"issue":"8","key":"10.1016\/j.neucom.2026.133544_bib0185","doi-asserted-by":"crossref","first-page":"2329","DOI":"10.1109\/TASL.2012.2201476","article-title":"Generating human-like behaviors using joint, speech-driven models for conversational agents","volume":"20","author":"Mariooryad","year":"2012","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"10.1016\/j.neucom.2026.133544_bib0190","series-title":"Proceedings of the 2014 International Conference on Autonomous Agents and Multiagent Systems","first-page":"781","article-title":"Gesture generation with low-dimensional embeddings","author":"Chiu","year":"2014"},{"key":"10.1016\/j.neucom.2026.133544_bib0195","series-title":"ACM SIGGRAPH 2022 Conference Proceedings","first-page":"1","article-title":"A motion matching-based framework for controllable gesture synthesis from speech","author":"Habibie","year":"2022"},{"key":"10.1016\/j.neucom.2026.133544_bib0200","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10544","article-title":"Taming diffusion models for audio-driven co-speech gesture generation","author":"Zhu","year":"2023"},{"key":"10.1016\/j.neucom.2026.133544_bib0205","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.neucom.2026.133544_bib0210","series-title":"Proceedings of the IEEE International Conference on Computer Vision","first-page":"1501","article-title":"Arbitrary style transfer in real-time with adaptive instance normalization","author":"Huang","year":"2017"},{"key":"10.1016\/j.neucom.2026.133544_bib0215","author":"Ji"},{"key":"10.1016\/j.neucom.2026.133544_bib0220","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1388","article-title":"Convofusion: multi-modal conversational diffusion for co-speech gesture synthesis","author":"Mughal","year":"2024"},{"key":"10.1016\/j.neucom.2026.133544_bib0225","author":"Cheng"},{"issue":"4","key":"10.1016\/j.neucom.2026.133544_bib0230","doi-asserted-by":"crossref","DOI":"10.1145\/3386569.3392469","article-title":"Unpaired motion style transfer from video to animation","volume":"39","author":"Aberman","year":"2020","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.neucom.2026.133544_bib0235","series-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","first-page":"4200","article-title":"Disentangling subject-dependent\/-independent representations for 2D motion retargeting","author":"Xie","year":"2021"},{"key":"10.1016\/j.neucom.2026.133544_bib0240","doi-asserted-by":"crossref","first-page":"10420","DOI":"10.1109\/TMM.2024.3407692","article-title":"Emotiongesture: audio-driven diverse emotional co-speech 3D gesture generation","volume":"26","author":"Qi","year":"2024","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/j.neucom.2026.133544_bib0245","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"10794","article-title":"Mambagesture: enhancing co-speech gesture generation with mamba and disentangled multi-modality fusion","author":"Fu","year":"2024"},{"key":"10.1016\/j.neucom.2026.133544_bib0250","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"17979","article-title":"Progressive disentangled representation learning for fine-grained controllable talking head synthesis","author":"Wang","year":"2023"},{"key":"10.1016\/j.neucom.2026.133544_bib0255","first-page":"12449","article-title":"Wav2vec 2.0: a framework for self-supervised learning of speech representations","volume":"33","author":"Baevski","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.neucom.2026.133544_bib0260","series-title":"International Conference on Machine Learning","first-page":"7748","article-title":"Meta-stylespeech: multi-speaker adaptive text-to-speech generation","author":"Min","year":"2021"},{"key":"10.1016\/j.neucom.2026.133544_bib0265","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"10975","article-title":"Expressive body capture: 3D hands, face, and body from a single image","author":"Pavlakos","year":"2019"},{"key":"10.1016\/j.neucom.2026.133544_bib0270","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"13401","article-title":"AI choreographer: music conditioned 3D dance generation with aist++","author":"Li","year":"2021"},{"key":"10.1016\/j.neucom.2026.133544_bib0275","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"11293","article-title":"Audio2gestures: generating diverse gestures from speech audio with conditional variational autoencoders","author":"Li","year":"2021"},{"key":"10.1016\/j.neucom.2026.133544_bib0280","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3497","article-title":"Learning individual styles of conversational gesture","author":"Ginosar","year":"2019"}],"container-title":["Neurocomputing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226009410?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0925231226009410?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T11:43:49Z","timestamp":1776771829000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0925231226009410"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":56,"alternative-id":["S0925231226009410"],"URL":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133544","relation":{},"ISSN":["0925-2312"],"issn-type":[{"value":"0925-2312","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"DESformer: Disentangling emotion and style for co-speech body-motion synthesis","name":"articletitle","label":"Article Title"},{"value":"Neurocomputing","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.neucom.2026.133544","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"133544"}}