{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T16:20:02Z","timestamp":1782318002269,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":54,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,12,11]],"date-time":"2023-12-11T00:00:00Z","timestamp":1702252800000},"content-version":"vor","delay-in-days":1,"URL":"http:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["IIS-2047677"],"award-info":[{"award-number":["IIS-2047677"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,12,10]]},"DOI":"10.1145\/3610548.3618185","type":"proceedings-article","created":{"date-parts":[[2023,12,11]],"date-time":"2023-12-11T12:28:40Z","timestamp":1702297720000},"page":"1-11","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":14,"title":["What is the Best Automated Metric for Text to Motion Generation?"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4663-5680","authenticated-orcid":false,"given":"Jordan","family":"Voas","sequence":"first","affiliation":[{"name":"Department of Computer Science, University of Texas at Austin, United States of America"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-0011-2380","authenticated-orcid":false,"given":"Yili","family":"Wang","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University of Texas at Austin, United States of America"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3452-1202","authenticated-orcid":false,"given":"Qixing","family":"Huang","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University of Texas at Austin, United States of America"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4504-0490","authenticated-orcid":false,"given":"Raymond","family":"Mooney","sequence":"additional","affiliation":[{"name":"Department of Computer Science, University of Texas at Austin, United States of America"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2023,12,11]]},"reference":[{"key":"e_1_3_2_2_1_1","volume-title":"Language2Pose: Natural Language Grounded Pose Forecasting. In 3DV","author":"Ahuja Chaitanya","unstructured":"Chaitanya Ahuja and Louis-Philippe Morency. 2019. Language2Pose: Natural Language Grounded Pose Forecasting. In 3DV. IEEE, 719\u2013728."},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00527"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","unstructured":"Emad Barsoum John Kender and Zicheng Liu. 2017. HP-GAN: Probabilistic 3D human motion prediction via GAN. https:\/\/doi.org\/10.48550\/ARXIV.1711.09561","DOI":"10.48550\/ARXIV.1711.09561"},{"key":"e_1_3_2_2_4_1","volume-title":"Executing your Commands via Motion Diffusion in Latent Space. ArXiv abs\/2212.04048","author":"Chen Xin","year":"2022","unstructured":"Xin Chen, Biao Jiang, Wen Liu, Zilong Huang, Bin Fu, Tao Chen, Jingyi Yu, and Gang Yu. 2022. Executing your Commands via Motion Diffusion in Latent Space. ArXiv abs\/2212.04048 (2022)."},{"key":"e_1_3_2_2_5_1","volume-title":"Blender - a 3D modelling and rendering package","author":"Community Blender\u00a0Online","unstructured":"Blender\u00a0Online Community. 2018. Blender - a 3D modelling and rendering package. Blender Foundation, Stichting Blender Foundation, Amsterdam. http:\/\/www.blender.org"},{"key":"e_1_3_2_2_6_1","volume-title":"ECCV (6)(Lecture Notes in Computer Science, Vol.\u00a013666)","author":"Delmas Ginger","unstructured":"Ginger Delmas, Philippe Weinzaepfel, Thomas Lucas, Francesc Moreno-Noguer, and Gr\u00e9gory Rogez. 2022. PoseScript: 3D Human Poses from Natural Language. In ECCV (6)(Lecture Notes in Computer Science, Vol.\u00a013666). Springer, New York, NY, USA, 346\u2013362."},{"key":"e_1_3_2_2_7_1","volume-title":"A new algorithm for data compression. The C Users Journal archive 12","author":"Gage Philip","year":"1994","unstructured":"Philip Gage. 1994. A new algorithm for data compression. The C Users Journal archive 12 (1994), 23\u201338. https:\/\/api.semanticscholar.org\/CorpusID:59804030"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00143"},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","unstructured":"Ian\u00a0J. Goodfellow Jean Pouget-Abadie Mehdi Mirza Bing Xu David Warde-Farley Sherjil Ozair Aaron Courville and Yoshua Bengio. 2014. Generative Adversarial Networks. https:\/\/doi.org\/10.48550\/ARXIV.1406.2661","DOI":"10.48550\/ARXIV.1406.2661"},{"key":"e_1_3_2_2_10_1","volume-title":"Generating Diverse and Natural 3D Human Motions from Text","author":"Guo Chuan","unstructured":"Chuan Guo, Shihao Zou, Xinxin Zuo, Sen Wang, Wei Ji, Xingyu Li, and Li Cheng. 2022a. Generating Diverse and Natural 3D Human Motions from Text. In CVPR. IEEE, Washington, DC, USA, 5142\u20135151."},{"key":"e_1_3_2_2_11_1","volume-title":"ECCV (35)(Lecture Notes in Computer Science, Vol.\u00a013695)","author":"Guo Chuan","unstructured":"Chuan Guo, Xinxin Zuo, Sen Wang, and Li Cheng. 2022b. TM2T: Stochastic and Tokenized Modeling for the Reciprocal Generation of 3D Human Motions and Texts. In ECCV (35)(Lecture Notes in Computer Science, Vol.\u00a013695). Springer, New York, NY, USA, 580\u2013597."},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413635"},{"key":"e_1_3_2_2_13_1","volume-title":"AMD: Autoregressive Motion Diffusion. ArXiv abs\/2305.09381","author":"Han Bo","year":"2023","unstructured":"Bo Han, Hao-Lun Peng, Minjing Dong, Changming Xu, Yi Ren, Yixuan Shen, and Yuheng Li. 2023. AMD: Autoregressive Motion Diffusion. ArXiv abs\/2305.09381 (2023)."},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1145\/3414685.3417836"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"crossref","unstructured":"Jack Hessel Ari Holtzman Maxwell Forbes Ronan\u00a0Le Bras and Yejin Choi. 2022. CLIPScore: A Reference-free Evaluation Metric for Image Captioning. arxiv:2104.08718\u00a0[cs.CV]","DOI":"10.18653\/v1\/2021.emnlp-main.595"},{"key":"e_1_3_2_2_16_1","volume-title":"Advances in Neural Information Processing Systems, I.\u00a0Guyon, U.\u00a0Von Luxburg, S.\u00a0Bengio, H.\u00a0Wallach, R.\u00a0Fergus, S.\u00a0Vishwanathan, and R.\u00a0Garnett (Eds.). Vol.\u00a030. Curran Associates","author":"Heusel Martin","year":"2017","unstructured":"Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, and Sepp Hochreiter. 2017. GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium. In Advances in Neural Information Processing Systems, I.\u00a0Guyon, U.\u00a0Von Luxburg, S.\u00a0Bengio, H.\u00a0Wallach, R.\u00a0Fergus, S.\u00a0Vishwanathan, and R.\u00a0Garnett (Eds.). Vol.\u00a030. Curran Associates, Inc., Red Hook, NY, USA. https:\/\/proceedings.neurips.cc\/paper\/2017\/file\/8a1d694707eb0fefe65871369074926d-Paper.pdf"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1145\/3072959.3073663"},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","unstructured":"Fangzhou Hong Mingyuan Zhang Liang Pan Zhongang Cai Lei Yang and Ziwei Liu. 2022. AvatarCLIP: Zero-Shot Text-Driven Generation and Animation of 3D Avatars. https:\/\/doi.org\/10.48550\/ARXIV.2205.08535","DOI":"10.48550\/ARXIV.2205.08535"},{"key":"e_1_3_2_2_19_1","volume-title":"Optimization, and Planning in 3D Scenes. arXiv preprint arXiv:2301.06015","author":"Huang Siyuan","year":"2023","unstructured":"Siyuan Huang, Zan Wang, Puhao Li, Baoxiong Jia, Tengyu Liu, Yixin Zhu, Wei Liang, and Song-Chun Zhu. 2023. Diffusion-based Generation, Optimization, and Planning in 3D Scenes. arXiv preprint arXiv:2301.06015 (2023)."},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"publisher","DOI":"10.1145\/1477926.1477927"},{"key":"e_1_3_2_2_21_1","volume-title":"MotionGPT: Human Motion as a Foreign Language. arXiv preprint arXiv:2306.14795","author":"Jiang Biao","year":"2023","unstructured":"Biao Jiang, Xin Chen, Wen Liu, Jingyi Yu, Gang Yu, and Tao Chen. 2023. MotionGPT: Human Motion as a Foreign Language. arXiv preprint arXiv:2306.14795 (2023)."},{"key":"e_1_3_2_2_22_1","volume-title":"FLAME: Free-form Language-based Motion Synthesis & Editing.","author":"Kim Jihoon","year":"2022","unstructured":"Jihoon Kim, Jiseob Kim, and Sungjoon Choi. 2022. FLAME: Free-form Language-based Motion Synthesis & Editing."},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"publisher","unstructured":"Diederik\u00a0P Kingma and Max Welling. 2013. Auto-Encoding Variational Bayes. https:\/\/doi.org\/10.48550\/ARXIV.1312.6114","DOI":"10.48550\/ARXIV.1312.6114"},{"key":"e_1_3_2_2_24_1","doi-asserted-by":"publisher","DOI":"10.1145\/3397481.3450692"},{"key":"e_1_3_2_2_25_1","unstructured":"Jiaman Li Yihang Yin Hang Chu Yi Zhou Tingwu Wang Sanja Fidler and Hao Li. 2020. Learning to Generate Diverse Dance Motions with Transformer."},{"key":"e_1_3_2_2_26_1","volume-title":"Proceedings of the Visually Grounded Interaction and Language Workshop at NeurIPS. 4\u00a0pages.","author":"Lin S.","year":"2018","unstructured":"Angela\u00a0S. Lin, Lemeng Wu, Rodolfo Corona, Kevin W.\u00a0H. Tai, Qixing Huang, and Raymond\u00a0J. Mooney. 2018. Generating Animated Videos of Human Activities from Natural Language Descriptions. In Proceedings of the Visually Grounded Interaction and Language Workshop at NeurIPS. 4\u00a0pages."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1145\/3386569.3392422"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1145\/3386569.3392422"},{"key":"e_1_3_2_2_29_1","unstructured":"Yinhan Liu Myle Ott Naman Goyal Jingfei Du Mandar Joshi Danqi Chen Omer Levy Mike Lewis Luke Zettlemoyer and Veselin Stoyanov. 2019. RoBERTa: A Robustly Optimized BERT Pretraining Approach. arxiv:1907.11692\u00a0[cs.CL]"},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"publisher","DOI":"10.1145\/2816795.2818013"},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1145\/1073204.1073313"},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"publisher","unstructured":"Mathis Petrovich Michael\u00a0J. Black and G\u00fcl Varol. 2021. Action-Conditioned 3D Human Motion Synthesis with Transformer VAE. https:\/\/doi.org\/10.48550\/ARXIV.2104.05670","DOI":"10.48550\/ARXIV.2104.05670"},{"key":"e_1_3_2_2_34_1","volume-title":"TEMOS: Generating Diverse Human Motions from Textual Descriptions. In ECCV (22)(Lecture Notes in Computer Science, Vol.\u00a013682)","author":"Petrovich Mathis","year":"2022","unstructured":"Mathis Petrovich, Michael\u00a0J. Black, and G\u00fcl Varol. 2022. TEMOS: Generating Diverse Human Motions from Textual Descriptions. In ECCV (22)(Lecture Notes in Computer Science, Vol.\u00a013682). Springer, New York, NY, USA, 480\u2013497."},{"key":"e_1_3_2_2_35_1","volume-title":"BABEL: Bodies, Action and Behavior With English Labels","author":"Punnakkal R.","year":"2021","unstructured":"Abhinanda\u00a0R. Punnakkal, Arjun Chandrasekaran, Nikos Athanasiou, Alejandra Quiros-Ramirez, and Michael\u00a0J. Black. 2021. BABEL: Bodies, Action and Behavior With English Labels. In CVPR. Computer Vision Foundation \/ IEEE, Washington, DC, USA, 722\u2013731."},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","unstructured":"Aditya Ramesh Prafulla Dhariwal Alex Nichol Casey Chu and Mark Chen. 2022. Hierarchical Text-Conditional Image Generation with CLIP Latents. https:\/\/doi.org\/10.48550\/ARXIV.2204.06125","DOI":"10.48550\/ARXIV.2204.06125"},{"key":"e_1_3_2_2_37_1","doi-asserted-by":"crossref","unstructured":"Davis Rempe Tolga Birdal Aaron Hertzmann Jimei Yang Srinath Sridhar and Leonidas\u00a0J. Guibas. 2021. HuMoR: 3D Human Motion Model for Robust Pose Estimation. arxiv:2105.04668\u00a0[cs.CV]","DOI":"10.1109\/ICCV48922.2021.01129"},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"publisher","DOI":"10.1136\/bmj.e4483"},{"key":"e_1_3_2_2_39_1","volume-title":"Human Motion Diffusion as a Generative Prior. ArXiv abs\/2303.01418","author":"Shafir Yonatan","year":"2023","unstructured":"Yonatan Shafir, Guy Tevet, Roy Kapon, and Amit\u00a0Haim Bermano. 2023. Human Motion Diffusion as a Generative Prior. ArXiv abs\/2303.01418 (2023)."},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","unstructured":"Uriel Singer Adam Polyak Thomas Hayes Xi Yin Jie An Songyang Zhang Qiyuan Hu Harry Yang Oron Ashual Oran Gafni Devi Parikh Sonal Gupta and Yaniv Taigman. 2022. Make-A-Video: Text-to-Video Generation without Text-Video Data. https:\/\/doi.org\/10.48550\/ARXIV.2209.14792","DOI":"10.48550\/ARXIV.2209.14792"},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"publisher","unstructured":"Guy Tevet Sigal Raab Brian Gordon Yonatan Shafir Daniel Cohen-Or and Amit\u00a0H. Bermano. 2022. Human Motion Diffusion Model. https:\/\/doi.org\/10.48550\/ARXIV.2209.14916","DOI":"10.48550\/ARXIV.2209.14916"},{"key":"e_1_3_2_2_42_1","volume-title":"EDGE: Editable Dance Generation From Music. arxiv:2211.10658\u00a0[cs.SD]","author":"Tseng Jonathan","year":"2022","unstructured":"Jonathan Tseng, Rodrigo Castellon, and C.\u00a0Karen Liu. 2022. EDGE: Editable Dance Generation From Music. arxiv:2211.10658\u00a0[cs.SD]"},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"publisher","unstructured":"Sergey Tulyakov Ming-Yu Liu Xiaodong Yang and Jan Kautz. 2017. MoCoGAN: Decomposing Motion and Content for Video Generation. https:\/\/doi.org\/10.48550\/ARXIV.1707.04993","DOI":"10.48550\/ARXIV.1707.04993"},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"publisher","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan\u00a0N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention Is All You Need. https:\/\/doi.org\/10.48550\/ARXIV.1706.03762","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"e_1_3_2_2_45_1","volume-title":"Weiqing Li, and Jian-Zhou Lu.","author":"Wei Dong","year":"2023","unstructured":"Dong Wei, Xiaoning Sun, Huaijiang Sun, Bin Li, Sheng liang Hu, Weiqing Li, and Jian-Zhou Lu. 2023. Understanding Text-driven Motion Synthesis with Keyframe Collaboration via Diffusion Models. ArXiv abs\/2305.13773 (2023)."},{"key":"e_1_3_2_2_46_1","doi-asserted-by":"publisher","DOI":"10.1145\/3536221.3558058"},{"key":"e_1_3_2_2_47_1","volume-title":"ECCV (3)(Lecture Notes in Computer Science, Vol.\u00a013663)","author":"Youwang Kim","unstructured":"Kim Youwang, Ji-Yeon Kim, and Tae-Hyun Oh. 2022. CLIP-Actor: Text-Driven Recommendation and Stylization for Animating Human Meshes. In ECCV (3)(Lecture Notes in Computer Science, Vol.\u00a013663). Springer, New York, NY, USA, 173\u2013191."},{"key":"e_1_3_2_2_48_1","volume-title":"PhysDiff: Physics-Guided Human Motion Diffusion Model. ArXiv abs\/2212.02500","author":"Yuan Ye","year":"2022","unstructured":"Ye Yuan, Jiaming Song, Umar Iqbal, Arash Vahdat, and Jan Kautz. 2022. PhysDiff: Physics-Guided Human Motion Diffusion Model. ArXiv abs\/2212.02500 (2022)."},{"key":"e_1_3_2_2_49_1","volume-title":"T2M-GPT: Generating Human Motion from Textual Descriptions with Discrete Representations. ArXiv abs\/2301.06052","author":"Zhang Jianrong","year":"2023","unstructured":"Jianrong Zhang, Yangsong Zhang, Xiaodong Cun, Shaoli Huang, Yong Zhang, Hongwei Zhao, Hongtao Lu, and Xiaodong Shen. 2023c. T2M-GPT: Generating Human Motion from Textual Descriptions with Discrete Representations. ArXiv abs\/2301.06052 (2023)."},{"key":"e_1_3_2_2_50_1","unstructured":"Mingyuan Zhang Zhongang Cai Liang Pan Fangzhou Hong Xinying Guo Lei Yang and Ziwei Liu. 2022. MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model."},{"key":"e_1_3_2_2_51_1","volume-title":"ReMoDiffuse: Retrieval-Augmented Motion Diffusion Model. ArXiv abs\/2304.01116","author":"Zhang Mingyuan","year":"2023","unstructured":"Mingyuan Zhang, Xinying Guo, Liang Pan, Zhongang Cai, Fangzhou Hong, Huirong Li, Lei Yang, and Ziwei Liu. 2023a. ReMoDiffuse: Retrieval-Augmented Motion Diffusion Model. ArXiv abs\/2304.01116 (2023)."},{"key":"e_1_3_2_2_52_1","doi-asserted-by":"publisher","unstructured":"Tianyi Zhang Varsha Kishore Felix Wu Kilian\u00a0Q. Weinberger and Yoav Artzi. 2019. BERTScore: Evaluating Text Generation with BERT. https:\/\/doi.org\/10.48550\/ARXIV.1904.09675","DOI":"10.48550\/ARXIV.1904.09675"},{"key":"e_1_3_2_2_53_1","volume-title":"MotionGPT: Finetuned LLMs are General-Purpose Motion Generators. arXiv preprint arXiv:2306.10900","author":"Zhang Yaqi","year":"2023","unstructured":"Yaqi Zhang, Di Huang, Bin Liu, Shixiang Tang, Yan Lu, Lu Chen, Lei Bai, Qi Chu, Nenghai Yu, and Wanli Ouyang. 2023b. MotionGPT: Finetuned LLMs are General-Purpose Motion Generators. arXiv preprint arXiv:2306.10900 (2023)."},{"key":"e_1_3_2_2_54_1","volume-title":"UDE: A Unified Driving Engine for Human Motion Generation. ArXiv abs\/2211.16016","author":"Zhou Zixiang","year":"2022","unstructured":"Zixiang Zhou and Baoyuan Wang. 2022. UDE: A Unified Driving Engine for Human Motion Generation. ArXiv abs\/2211.16016 (2022)."}],"event":{"name":"SA '23: SIGGRAPH Asia 2023","location":"Sydney NSW Australia","acronym":"SA '23","sponsor":["SIGGRAPH ACM Special Interest Group on Computer Graphics and Interactive Techniques"]},"container-title":["SIGGRAPH Asia 2023 Conference Papers"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3610548.3618185","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3610548.3618185","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3610548.3618185","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,21]],"date-time":"2025-08-21T09:34:13Z","timestamp":1755768853000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3610548.3618185"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12,10]]},"references-count":54,"alternative-id":["10.1145\/3610548.3618185","10.1145\/3610548"],"URL":"https:\/\/doi.org\/10.1145\/3610548.3618185","relation":{},"subject":[],"published":{"date-parts":[[2023,12,10]]},"assertion":[{"value":"2023-12-11","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}