{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,10]],"date-time":"2026-06-10T22:34:54Z","timestamp":1781130894064,"version":"3.54.1"},"reference-count":77,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2024]]},"DOI":"10.1109\/access.2024.3518300","type":"journal-article","created":{"date-parts":[[2024,12,16]],"date-time":"2024-12-16T19:28:05Z","timestamp":1734377285000},"page":"196984-196999","source":"Crossref","is-referenced-by-count":1,"title":["UniMotion-DM: Uniform Text-Motion Generation and Editing via Diffusion Model"],"prefix":"10.1109","volume":"12","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-3355-599X","authenticated-orcid":false,"given":"Song","family":"Lin","sequence":"first","affiliation":[{"name":"School of Intelligent Engineering and Automation, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenjun","family":"Hou","sequence":"additional","affiliation":[{"name":"Beijing Key Laboratory of Network Systems and Network Culture, Beijing University of Posts and Telecommunications, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01333"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00449"},{"key":"ref3","article-title":"Perpetual motion: Generating unbounded human motion","author":"Zhang","year":"2020","journal-title":"arXiv:2007.13886"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00626"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2019.00084"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i7.25996"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20047-2_28"},{"key":"ref8","article-title":"Human motion diffusion model","author":"Tevet","year":"2022","journal-title":"arXiv:2209.14916"},{"key":"ref9","article-title":"MotionGPT: Human motion as a foreign language","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"36","author":"Jiang"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19833-5_34"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00870"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00040"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00545"},{"key":"ref14","article-title":"Imagen video: High definition video generation with diffusion models","author":"Ho","year":"2022","journal-title":"arXiv:2210.02303"},{"key":"ref15","first-page":"8633","article-title":"Video diffusion models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ho"},{"key":"ref16","article-title":"DiffWave: A versatile diffusion model for audio synthesis","author":"Kong","year":"2020","journal-title":"arXiv:2009.09761"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/3528233.3530757"},{"key":"ref18","first-page":"2256","article-title":"Deep unsupervised learning using nonequilibrium thermodynamics","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Sohl-Dickstein"},{"key":"ref19","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Brown"},{"key":"ref20","article-title":"T2M-GPT: Generating human motion from textual descriptions with discrete representations","author":"Zhang","year":"2023","journal-title":"arXiv:2301.06052"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00527"},{"key":"ref22","article-title":"A recurrent variational autoencoder for human motion synthesis","volume-title":"Proc. 28th Brit. Mach. Vis. Conf. (BMVC)","author":"Komura"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_17"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3355414"},{"key":"ref25","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01080"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref28","article-title":"Single motion diffusion","author":"Raab","year":"2023","journal-title":"arXiv:2302.05905"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20047-2_21"},{"key":"ref30","article-title":"Uniform text-motion generation and editing model via diffusion","volume-title":"Proc. IEEE\/CVF Winter Conf. Appl. Comput. Vis. (WACV)","author":"Wang"},{"key":"ref31","volume-title":"MCRE: Multimodal conditional representation and editing for text-motion generation","author":"Sun","year":"2023"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01726"},{"key":"ref33","first-page":"12438","article-title":"Improved techniques for training score-based generative models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Song"},{"key":"ref34","article-title":"GLIDE: Towards photorealistic image generation and editing with text-guided diffusion models","author":"Nichol","year":"2021","journal-title":"arXiv:2112.10741"},{"key":"ref35","article-title":"Hierarchical text-conditional image generation with CLIP latents","author":"Ramesh","year":"2022","journal-title":"arXiv:2204.06125"},{"key":"ref36","first-page":"36479","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Saharia"},{"key":"ref37","first-page":"8780","article-title":"Diffusion models beat GANs on image synthesis","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Dhariwal"},{"key":"ref38","article-title":"Classifier-free diffusion guidance","author":"Ho","year":"2022","journal-title":"arXiv:2207.12598"},{"key":"ref39","article-title":"Prompt-to-Prompt image editing with cross attention control","author":"Hertz","year":"2022","journal-title":"arXiv:2208.01626"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3491102.3501825"},{"key":"ref41","article-title":"DiffusionDB: A large-scale prompt gallery dataset for text-to-image generative models","author":"Wang","year":"2022","journal-title":"arXiv:2210.14896"},{"key":"ref42","article-title":"Investigating prompt engineering in diffusion models","author":"Witteveen","year":"2022","journal-title":"arXiv:2211.15462"},{"key":"ref43","first-page":"17981","article-title":"Structured denoising diffusion models in discrete state-spaces","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Austin"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01043"},{"key":"ref45","article-title":"Discrete contrastive diffusion for cross-modal music and image generation","author":"Zhu","year":"2022","journal-title":"arXiv:2206.07771"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1312.6114"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00509"},{"key":"ref48","article-title":"Attention is all you need","volume-title":"Proc. 31st Conf. Neural Inf. Process. Syst. (NIPS)","author":"Vaswani"},{"key":"ref49","article-title":"We are more than our joints: Predicting how 3D bodies move","author":"Zhang","year":"2020","journal-title":"arXiv:2012.00619"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1089\/big.2016.0028"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00554"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N16-1098"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D13-1170"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58545-7_20"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00338"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref57","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of summaries","volume-title":"Text Summarization Branches Out","author":"Lin","year":"2004"},{"key":"ref58","article-title":"CIDEr: Consensus-based image description evaluation","author":"Vedantam","year":"2014","journal-title":"arXiv:1411.5726"},{"key":"ref59","article-title":"BERTScore: Evaluating text generation with BERT","author":"Zhang","year":"2019","journal-title":"arXiv:1904.09675"},{"key":"ref60","article-title":"MAUVE: Measuring the gap between neural text and human text using divergence frontiers","author":"Pillutla","year":"2021","journal-title":"arXiv:2102.01454"},{"key":"ref61","article-title":"Latent diffusion for language generation","author":"Lovelace","year":"2022","journal-title":"arXiv:2212.09462"},{"key":"ref62","article-title":"Adam: A method for stochastic optimization","author":"Kingma","year":"2014","journal-title":"arXiv:1412.6980"},{"key":"ref63","article-title":"Diffusion-LM improves controllable text generation","author":"Lisa Li","year":"2022","journal-title":"arXiv:2205.14217"},{"key":"ref64","article-title":"Unimotion: Unifying 3D human motion synthesis and understanding","author":"Li","year":"2024","journal-title":"arXiv:2409.15904"},{"issue":"70","key":"ref65","first-page":"1","article-title":"Scaling instruction-finetuned language models","volume":"25","author":"Chung","year":"2024","journal-title":"J. Mach. Learn. Res."},{"key":"ref66","first-page":"9118","article-title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Huang"},{"key":"ref67","article-title":"LLM+P: Empowering large language models with optimal planning proficiency","author":"Liu","year":"2023","journal-title":"arXiv:2304.11477"},{"key":"ref68","first-page":"27730","article-title":"Training language models to follow instructions with human feedback","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ouyang"},{"key":"ref69","article-title":"Improving language understanding by generative pre-training","author":"Radford","year":"2018"},{"issue":"8","key":"ref70","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI Blog"},{"issue":"140","key":"ref71","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00280"},{"key":"ref73","article-title":"AdaPlanner: Adaptive planning from feedback with language models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Sun"},{"key":"ref74","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv:2307.09288"},{"key":"ref75","article-title":"Finetuned language models are zero-shot learners","author":"Wei","year":"2021","journal-title":"arXiv:2109.01652"},{"key":"ref76","article-title":"Unified human-scene interaction via prompted chain-of-contacts","author":"Xiao","year":"2023","journal-title":"arXiv:2309.07918"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2022.110190"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/10380310\/10802885.pdf?arnumber=10802885","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,31]],"date-time":"2024-12-31T06:33:27Z","timestamp":1735626807000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10802885\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"references-count":77,"URL":"https:\/\/doi.org\/10.1109\/access.2024.3518300","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024]]}}}