{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,10]],"date-time":"2026-08-10T14:25:00Z","timestamp":1786371900664,"version":"build-2736575974"},"reference-count":226,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T00:00:00Z","timestamp":1777507200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Fusion"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.inffus.2026.104435","type":"journal-article","created":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T23:14:52Z","timestamp":1777590892000},"page":"104435","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":7,"special_numbering":"C","title":["Multimodal generative AI for human motion understanding and generation: A survey and way forward"],"prefix":"10.1016","volume":"135","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4845-4808","authenticated-orcid":false,"given":"Muhammad","family":"Islam","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8098-8906","authenticated-orcid":false,"given":"Tao","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7027-067X","authenticated-orcid":false,"given":"Euijoon","family":"Ahn","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0191-7171","authenticated-orcid":false,"given":"Usman","family":"Naseem","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.inffus.2026.104435_bib0001","doi-asserted-by":"crossref","unstructured":"N. Fei, et al., Towards artificial general intelligence via a multimodal foundation model2021, 10.48550\/ARXIV.2110.14378.","DOI":"10.1038\/s41467-022-30761-2"},{"key":"10.1016\/j.inffus.2026.104435_bib0002","unstructured":"T. Brooks, B. Peebles, C. Holmes, W. DePue, Y. Guo, L. Jing, D. Schnurr, J. Taylor, T. Luhman, E. Luhman, C. Ng, R. Wang, & A. Ramesh, Video generation models as world simulators openai SORA. [Online]. Available: https:\/\/openai.com\/research\/video-generation-models-as-world-simulators."},{"key":"10.1016\/j.inffus.2026.104435_bib0003","unstructured":"OpenAI, et al., GPT-4 Technical report, 2023, 10.48550\/ARXIV.2303.08774."},{"key":"10.1016\/j.inffus.2026.104435_bib0004","unstructured":"OpenAI, DALL\u00b7E 3. Available online: https:\/\/openai.com\/index\/dall-e-3\/. Accessed: 18 April 2025."},{"key":"10.1016\/j.inffus.2026.104435_bib0005","doi-asserted-by":"crossref","unstructured":"M. Zhang, Z. Cai, L. Pan, F. Hog, X. Guo, L. Yang, Z. Liu Motiondiffuse: Text-driven human motion generation with diffusion modelIEEE transactions on pattern analysis and machine intelligence, 46 (6), 4115\u201341282024, 10.1109\/TPAMI.2024.3355414.","DOI":"10.1109\/TPAMI.2024.3355414"},{"key":"10.1016\/j.inffus.2026.104435_bib0006","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.103184","article-title":"Explainability for vision foundation models: a survey","author":"Kazmierczak","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104435_bib0007","doi-asserted-by":"crossref","unstructured":"S. Tulyakov, M.-Y. Liu, X. Yang, and J. Kautz, Mocogan: Decomposing motion and content for video generation2018, 1526\u2013153510.1109\/CVPR.2018.00165.","DOI":"10.1109\/CVPR.2018.00165"},{"issue":"11","key":"10.1016\/j.inffus.2026.104435_bib0008","doi-asserted-by":"crossref","first-page":"7327","DOI":"10.1109\/TPAMI.2021.3116668","article-title":"Deep generative modelling: a comparative review of VAEs, GANs, normalizing flows, energy-Based and autoregressive models","volume":"44","author":"Bond-Taylor","year":"2022","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.inffus.2026.104435_bib0009","doi-asserted-by":"crossref","unstructured":"W. Yin, H. Yin, D. Kragic, and M. Bjorkman, Graph-based normalizing flow for human motion generation and reconstruction, 2021 30th IEEE International Conference on Robot & Human Interactive Communication (RO-MAN)Vancouver, BC, Canada: IEEE, 2021, pp. 641-648, 10.1109\/RO-MAN50785.2021.9515316.","DOI":"10.1109\/RO-MAN50785.2021.9515316"},{"key":"10.1016\/j.inffus.2026.104435_bib0010","doi-asserted-by":"crossref","unstructured":"E. Pinyoanuntapong, M.U. Saleem, P. Wang, M. Lee, S. Das, and C. Chen, BAMM: Bidirectional Autoregressive Motion Model, In: Leonardis, A., Ricci, E., Roth, S., Russakovsky, O., Sattler, T., Varol, G. (eds) Computer Vision - ECCV 2024. ECCV 2024, 2025, Lecture Notes in Computer Science, 15073, Springer, Cham.10.1007\/978-3-031-72633-0_10.","DOI":"10.1007\/978-3-031-72633-0_10"},{"key":"10.1016\/j.inffus.2026.104435_bib0011","first-page":"18000","article-title":"Executing your Commands via Motion Diffusion in Latent Space","author":"Chen","year":"2023","journal-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)"},{"key":"10.1016\/j.inffus.2026.104435_bib0012","unstructured":"J. Ho, A. Jain, P. Abbeel, Denoising diffusion probabilistic modelsIn Proceedings of the 34th International Conference on Neural Information Processing Systems (NIPS \u201920). Curran Associates Inc.Red Hook, NY, USA, Article 574(2020), 6840\u2013685110.5555\/3495724.3496298."},{"key":"10.1016\/j.inffus.2026.104435_bib0013","series-title":"European Conference on Computer Vision","first-page":"180","article-title":"Como: controllable motion generation through language guided pose code editing","author":"Huang","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0014","series-title":"European Conference on Computer Vision","first-page":"18","article-title":"EMDM: efficient motion diffusion model for fast and high-quality motion generation","author":"Zhou","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0015","article-title":"A survey of GPT-3 family large language models including ChatGPT and GPT-4","volume":"6","author":"Kalyan","year":"2024","journal-title":"Nat. Lang. Process. J."},{"key":"10.1016\/j.inffus.2026.104435_bib0016","unstructured":"A. Buscemi, D. Proverbio, ChatGPT vs Gemini vs LLaMA on multilingual sentiment analysis, 2024, Accessed: May 06, 2024. [Online]. Available: http:\/\/arxiv.org\/abs\/2402.01715."},{"key":"10.1016\/j.inffus.2026.104435_bib0017","series-title":"Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval","first-page":"2420","article-title":"Text-to-motion retrieval: towards joint understanding of human motion data and natural language","author":"Messina","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0018","doi-asserted-by":"crossref","unstructured":"J. Ni, G.H. Abrego, N. Constant, J. Ma, K. Hall, D. Cer, Y. Yang, Sentence-t5: Scalable sentence encoders from pre-trained text-to-text modelsIn Findings of the association for computational linguistics: ACL (2022), 1864\u2013187410.18653\/v1\/2022.findings-acl.146.","DOI":"10.18653\/v1\/2022.findings-acl.146"},{"key":"10.1016\/j.inffus.2026.104435_bib0019","doi-asserted-by":"crossref","unstructured":"E. Barsoum, J. Kender, Z. Liu, Hp-gan: Probabilistic 3d human motion prediction via gan, In Proceedings of the IEEE conference on computer vision and pattern recognition workshops, (2018) 1418\u20131427. 10.1109\/CVPRW.2018.00191.","DOI":"10.1109\/CVPRW.2018.00191"},{"key":"10.1016\/j.inffus.2026.104435_bib0020","series-title":"2024 International Conference on 3D Vision (3DV)","first-page":"1382","article-title":"RIVQ-VAE: discrete rotation-invariant 3D representation learning","author":"Mezghanni","year":"2024"},{"issue":"8","key":"10.1016\/j.inffus.2026.104435_bib0021","doi-asserted-by":"crossref","first-page":"6814","DOI":"10.1109\/TCSVT.2024.3351601","article-title":"A survey of cross-modal visual content generation","volume":"34","author":"Nazarieh","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"issue":"11","key":"10.1016\/j.inffus.2026.104435_bib0022","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3665869","article-title":"Human image generation: a comprehensive survey","volume":"56","author":"Jia","year":"2024","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.inffus.2026.104435_bib0023","doi-asserted-by":"crossref","first-page":"345","DOI":"10.1016\/j.neucom.2022.02.045","article-title":"3D human motion prediction: a survey","volume":"489","author":"Lyu","year":"2022","journal-title":"Neurocomputing"},{"issue":"4","key":"10.1016\/j.inffus.2026.104435_bib0024","doi-asserted-by":"crossref","first-page":"2430","DOI":"10.1109\/TPAMI.2023.3330935","article-title":"Human motion generation: a survey","volume":"46","author":"Zhu","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.inffus.2026.104435_bib0025","doi-asserted-by":"crossref","unstructured":"X. Wang, Y. Zhou, B. Huang, H. Chen, W. Zhu, Multi-Modal Generative AI: Multi-Modal LLMs, Diffusions, and the Unification, in IEEE Transactions on Circuits and Systems for Video Technology, 36 42026, pp. 5621\u2013564110.1109\/TCSVT.2025.3635224.","DOI":"10.1109\/TCSVT.2025.3635224"},{"issue":"3","key":"10.1016\/j.inffus.2026.104435_bib0026","doi-asserted-by":"crossref","first-page":"113","DOI":"10.1007\/s11263-025-02582-5","article-title":"A survey on human interaction motion generation","volume":"134","author":"Sui","year":"2026","journal-title":"International Journal of Computer Vision"},{"key":"10.1016\/j.inffus.2026.104435_bib0027","unstructured":"Z. Shi, et al., Deep generative models on 3D representations: a survey (2022). arXiv: 2210.15663."},{"key":"10.1016\/j.inffus.2026.104435_bib0028","series-title":"Proc. AAAI Conf. Artif. Intell.","first-page":"2580","article-title":"Human motion prediction via learning local structure representations and temporal dependencies","volume":"33","author":"Guo","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0029","series-title":"2019 IEEE 6th International Conference on Cloud Computing and Intelligence Systems (CCIS)","first-page":"138","article-title":"RNN-based human motion prediction via differential sequence representation","author":"Wang","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0030","series-title":"2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"4674","article-title":"On human motion prediction using recurrent neural networks","author":"Martinez","year":"2017"},{"key":"10.1016\/j.inffus.2026.104435_bib0031","series-title":"In Proceedings of the IEEE international conference on computer vision","first-page":"4346","article-title":"Recurrent network models for human dynamics","author":"Fragkiadaki","year":"2015"},{"key":"10.1016\/j.inffus.2026.104435_bib0032","series-title":"Efficient convolutional hierarchical autoencoder for human motion prediction","volume":"35","author":"Li","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0033","series-title":"IEEE International Conference on Development and Learning (ICDL)","first-page":"1","article-title":"Learning Multiscale Correlations for Human Motion Prediction","author":"Zhou","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_bib0034","series-title":"Proc. AAAI Conf. Artif. Intell.","first-page":"2225","article-title":"Aggregated multi-GANs for controlled 3D human motion prediction","volume":"35","author":"Liu","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_bib0035","doi-asserted-by":"crossref","unstructured":"M. Zanfir, A. Zanfir, E.G. Bazavan, W.T. Freeman, R. Sukthankar, C. Sminchisescu, THUNDR: Transformer-based 3D HUmaN Reconstruction with Markers (2021). IEEE\/CVF International Conference on Computer Vision (ICCV), Montreal, QC, Canada, pp. 12951-1296010.1109\/ICCV48922.2021.01273.","DOI":"10.1109\/ICCV48922.2021.01273"},{"key":"10.1016\/j.inffus.2026.104435_bib0036","series-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"3371","article-title":"We are more than our joints: predicting how 3D bodies move","author":"Zhang","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_sbref0022","series-title":"In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"534","article-title":"3d human mesh estimation from virtual markers","author":"Ma","year":"2023"},{"issue":"6","key":"10.1016\/j.inffus.2026.104435_bib0038","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/2816795.2818013","article-title":"SMPL: a skinned multi-person linear model","volume":"34","author":"Loper","year":"2015","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.inffus.2026.104435_sbref0024","series-title":"In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"10975","article-title":"Expressive body capture: 3d hands, face, and body from a single image","author":"Pavlakos","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0040","series-title":"In: Vedaldi, A., Bischof, H., Brox, T., Frahm, JM. (eds) Computer Vision - ECCV 2020. ECCV","article-title":"STAR: Sparse Trained Articulated Human Body Regressor","volume":"12351","author":"Osman","year":"2020"},{"key":"10.1016\/j.inffus.2026.104435_bib0041","series-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"6183","article-title":"GHUM & GHUML: generative 3D human shape and articulated pose models","author":"Xu","year":"2020"},{"key":"10.1016\/j.inffus.2026.104435_bib0042","unstructured":"D. Pavllo, D. Grangier, M. Auli, QuaterNet: a quaternion-based recurrent model for human motion (2018). arXiv: 1805.06485."},{"key":"10.1016\/j.inffus.2026.104435_bib0043","series-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"9996","article-title":"Towards natural and accurate future motion prediction of humans and animals","author":"Liu","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0044","series-title":"Proceedings of the 29th ACM International Conference on Multimedia","first-page":"713","article-title":"Motion prediction via joint dependency modeling in phase space","author":"Su","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_bib0045","doi-asserted-by":"crossref","first-page":"7760","DOI":"10.1109\/TIP.2021.3108708","article-title":"Multiscale spatio-temporal graph neural networks for 3D skeleton-based motion prediction","volume":"30","author":"Li","year":"2021","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.inffus.2026.104435_bib0046","series-title":"Lecture Notes in Computer Science Ser, No. v. 12359","article-title":"Computer vision - ECCV 2020: 16th european conference, glasgow, UK, August 23\u201328, 2020, proceedings, Part XIV","year":"2020"},{"key":"10.1016\/j.inffus.2026.104435_bib0047","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"5308","article-title":"Structural-RNN: deep learning on spatio-temporal graphs","author":"Jain","year":"2016"},{"key":"10.1016\/j.inffus.2026.104435_bib0048","series-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"211","article-title":"Dynamic multiscale graph neural networks for 3D skeleton based human motion prediction","author":"Li","year":"2020"},{"key":"10.1016\/j.inffus.2026.104435_bib0049","series-title":"2019 IEEE\/CVF International Conference on Computer Vision (ICCV)","first-page":"9488","article-title":"Learning trajectory dependencies for human motion prediction","author":"Mao","year":"2019"},{"issue":"6","key":"10.1016\/j.inffus.2026.104435_bib0050","doi-asserted-by":"crossref","first-page":"2133","DOI":"10.1109\/TCSVT.2020.3021409","article-title":"TrajectoryCNN: a new spatio-temporal feature learning network for human motion prediction","volume":"31","author":"Liu","year":"2021","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.inffus.2026.104435_bib0051","series-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"5308","article-title":"Structural-RNN: deep learning on spatio-temporal graphs","author":"Jain","year":"2016"},{"key":"10.1016\/j.inffus.2026.104435_bib0052","series-title":"2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"4799","article-title":"Towards accurate 3D human motion prediction from incomplete observations","author":"Cui","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_bib0053","article-title":"Computer Vision - ECCV 2018: 15th European Conference, Munich, Germany, September 8\u201314, 2018, Proceedings, Part IV","year":"2018"},{"key":"10.1016\/j.inffus.2026.104435_bib0054","doi-asserted-by":"crossref","first-page":"64241","DOI":"10.1109\/ACCESS.2021.3075766","article-title":"Content-based management of human motion data: survey and challenges","volume":"9","author":"Sedmidubsky","year":"2021","journal-title":"IEEE Access"},{"issue":"11","key":"10.1016\/j.inffus.2026.104435_bib0055","doi-asserted-by":"crossref","first-page":"10709","DOI":"10.1109\/TPAMI.2025.3594034","article-title":"Human motion video generation: a survey","volume":"47","author":"Xue","year":"2025","journal-title":"IEEE Trans. Pattern Anal.Mach. Intell."},{"issue":"7","key":"10.1016\/j.inffus.2026.104435_bib0056","doi-asserted-by":"crossref","first-page":"4957","DOI":"10.1109\/TPAMI.2024.3362821","article-title":"Synthetic data in human analysis: a survey","volume":"46","author":"Joshi","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"5","key":"10.1016\/j.inffus.2026.104435_bib0057","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3637060","article-title":"Appearance and pose-guided human generation: a survey","volume":"56","author":"Liao","year":"2024","journal-title":"ACM computing surveys"},{"key":"10.1016\/j.inffus.2026.104435_bib0058","doi-asserted-by":"crossref","unstructured":"A. Ismail-Fawaz, M. Devanne, S. Berretti, J. Weber, G. Forestier, Establishing a unified evaluation framework for human motion generation: A comparative analysis of metrics, Computer Vision and Image Understanding, 254, 104337bibinfonotearXiv: 2405.0768010.1016\/j.cviu.2025.104337(2025).","DOI":"10.1016\/j.cviu.2025.104337"},{"key":"10.1016\/j.inffus.2026.104435_bib0059","unstructured":"J. Xiong, G. Liu, L. Huang, C. Wu, T. Wu, Y. Mu, N. Wong, (2024). Autoregressive models in vision: a survey. arXiv: 2411.05902."},{"key":"10.1016\/j.inffus.2026.104435_bib0060","series-title":"Proceedings of the 39th ACM SIGMOD-SIGACT-SIGAI Symposium on Principles of Database Systems","first-page":"1","article-title":"Word2vec, node2vec, graph2vec, X2vec: towards a theory of vector embeddings of structured data","author":"Grohe","year":"2020"},{"key":"10.1016\/j.inffus.2026.104435_bib0061","series-title":"Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP)","first-page":"1532","article-title":"GloVe: global vectors for word representation","author":"Pennington","year":"2014"},{"key":"10.1016\/j.inffus.2026.104435_bib0062","unstructured":"M.V. Koroteev, BERT: a review of applications in natural language processing and understanding (2021). arXiv: 2103.11943."},{"issue":"12","key":"10.1016\/j.inffus.2026.104435_bib0063","doi-asserted-by":"crossref","first-page":"15406","DOI":"10.1109\/TPAMI.2023.3298850","article-title":"Recovering 3D human mesh from monocular images: a survey","volume":"45","author":"Tian","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.inffus.2026.104435_bib0064","unstructured":"Q. Wu, Y. Zhao, Y. Wang, Y.-W. Tai, C.-K. Tang, MotionLLM: multimodal motion-language learning with large language models, 2024, arXiv:arXiv: 2405.17013. Accessed: Sep. 29, 2024. [Online]. Available:."},{"key":"10.1016\/j.inffus.2026.104435_bib0065","series-title":"Proc. AAAI Conf. Artif. Intell.","first-page":"7368","article-title":"MotionGPT: finetuned LLMs are general-purpose motion generators","volume":"38","author":"Zhang","year":"2024"},{"issue":"7","key":"10.1016\/j.inffus.2026.104435_bib0066","doi-asserted-by":"crossref","first-page":"1325","DOI":"10.1109\/TPAMI.2013.248","article-title":"Human3.6M: large scale datasets and predictive methods for 3D human sensing in natural environments","volume":"36","author":"Ionescu","year":"2014","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"6","key":"10.1016\/j.inffus.2026.104435_bib0067","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/2661229.2661273","article-title":"MoSh: motion and shape capture from sparse markers","volume":"33","author":"Loper","year":"2014","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.inffus.2026.104435_bib0068","doi-asserted-by":"crossref","unstructured":"K. Iskakov, E. Burkov, V. Lempitsky, Y. Malkov, Learnable triangulation of human pose(2019). 7718\u20137727arXiv: 1905.0575410.1109\/ICCV.2019.00781.","DOI":"10.1109\/ICCV.2019.00781"},{"key":"10.1016\/j.inffus.2026.104435_bib0069","unstructured":"H. Tu, C. Wang, W. Zeng, VoxelPose: towards multi-camera 3D human pose estimation in wild environment, (2020), 97\u201321210.1007\/978-3-030-58452-8_12."},{"key":"10.1016\/j.inffus.2026.104435_bib0070","doi-asserted-by":"crossref","unstructured":"H. Ye, W. Zhu, C. Wang, R. Wu, & Y. Wang, Faster voxelpose: real-time 3D human pose estimation by orthographic projection, 142\u2013159arXiv: 2207.10955, (2022). 10.1007\/978-3-031-20068-7.","DOI":"10.1007\/978-3-031-20068-7_9"},{"key":"10.1016\/j.inffus.2026.104435_bib0071","unstructured":"Z. Cao, T. Simon, S.-E. Wei, Y. Sheikh, Realtime multi-person 2D pose estimation using part affinity fields (2016) 7291\u20137299. arXiv: 1611.0805010.1109\/CVPR.2017.143."},{"key":"10.1016\/j.inffus.2026.104435_bib0072","doi-asserted-by":"crossref","unstructured":"D. Pavllo, C. Feichtenhofer, D. Grangier, M. Auli, 3D human pose estimation in video with temporal convolutions and semi-supervised training (2018) 7753\u20137762. arXiv: 1811.11742. 10.1109\/CVPR.2019.00794.","DOI":"10.1109\/CVPR.2019.00794"},{"key":"10.1016\/j.inffus.2026.104435_bib0073","unstructured":"S. Shen, L.-J. Li, H. Tan, M. Bansal, A. Rohrbach, K.W. Chang, K. Keutzer, How much can CLIP benefit vision-and-language tasks?, 2021, arXiv: 2107.06383."},{"key":"10.1016\/j.inffus.2026.104435_bib0074","doi-asserted-by":"crossref","unstructured":"Z. Zhou, Y. Wan, B. Wang, AvatarGPT: all-in-One framework for motion understanding, planning, generation and beyond, arXiv: 2311.16468, (2023) 1357\u20131366. 10.1109\/CVPR52733.2024.00135.","DOI":"10.1109\/CVPR52733.2024.00135"},{"key":"10.1016\/j.inffus.2026.104435_bib0075","doi-asserted-by":"crossref","unstructured":"H. Miao, F. Ma, R. Quan, K. Zhan, Y. Yang, Autonomous LLM-enhanced adversarial attack for text-to-motion, 39 (6), pp. 6144-6152arXiv: 2408.00352(2024). Accessed: Sep. 22, 2024. [Online], 10.1609\/aaai.v39i6.32657.","DOI":"10.1609\/aaai.v39i6.32657"},{"key":"10.1016\/j.inffus.2026.104435_bib0076","series-title":"2024 IEEE Intelligent Vehicles Symposium (IV)","first-page":"3057","article-title":"Walk-the-talk: LLM driven pedestrian motion generation","author":"Ramesh","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0077","series-title":"Computer Vision \u2013 ECCV 2022","first-page":"358","article-title":"MotionCLIP: exposing human motion generation to CLIP space","volume":"13682","author":"Tevet","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0078","unstructured":"B. Jiang, X. Chen, W. Liu, J. Yu, G. Yu, T. Chen, MotionGPT: human motion as a foreign language, 2023, 3620067\u201320079bibinfonoteAccessed: Sep. 22, 2024. [Online]. Available at: 10.5555\/3666122.3667002."},{"key":"10.1016\/j.inffus.2026.104435_bib0079","doi-asserted-by":"crossref","unstructured":"C. Zhong, L. Hu, Z. Zhang, S. Xia, AttT2M: text-driven human motion generation with multi-perspective attention mechanism, 2023, 509\u2013519arXiv: 2309.00796. Accessed: Sep. 22, 2024. [Online]. Available:10.1109\/ICCV51070.2023.00053.","DOI":"10.1109\/ICCV51070.2023.00053"},{"key":"10.1016\/j.inffus.2026.104435_bib0080","doi-asserted-by":"crossref","unstructured":"J. Zhang, et al., Generating human motion from textual descriptions with discrete representations, 2023, 14730\u201314740arXiv: 2301.06052. Accessed: Sep. 29, 2024. [Online]. Available:10.1109\/CVPR52729.2023.01415.","DOI":"10.1109\/CVPR52729.2023.01415"},{"key":"10.1016\/j.inffus.2026.104435_bib0081","series-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"14730","article-title":"Generating human motion from textual descriptions with discrete representations","author":"Zhang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0082","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"23222","article-title":"Being comes from not-being: open-vocabulary text-to-motion generation with wordless training","author":"Lin","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0083","doi-asserted-by":"crossref","unstructured":"H. Kong, K. Gong, D. Lian, M.B. Mi, X. Wang, Priority-Centric Human Motion Generation in Discrete Latent Space, 2023, 14760\u20131477010.1109\/ICCV51070.2023.01360.","DOI":"10.1109\/ICCV51070.2023.01360"},{"key":"10.1016\/j.inffus.2026.104435_bib0084","unstructured":"C. Wang, T2M-HiFiGPT: generating high quality human motion from textual descriptions with residual discrete representations(2023). arXiv: 2312.10628."},{"key":"10.1016\/j.inffus.2026.104435_bib0085","series-title":"Computer Vision \u2013 ECCV 2024","first-page":"18","article-title":"M2D2M: multi-motion generation from text with discrete diffusion models","volume":"15072","author":"Chi","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0086","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"14730","article-title":"T2M-GPT: generating human motion from textual descriptions with discrete representations","author":"Zhang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0087","series-title":"2024 IEEE International Conference on Multimedia and Expo Workshops (ICMEW)","first-page":"1","article-title":"Anatomically-informed vector quantization variational auto-encoder for text to motion generation","author":"Chen","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0088","unstructured":"S. Ma, Q. Cao, J. Zhang, D. Tao, Contact-aware human motion generation from textual descriptions, 2024, arXiv: 2403.15709."},{"key":"10.1016\/j.inffus.2026.104435_bib0089","series-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"5632","article-title":"UDE: a unified driving engine for human motion generation","author":"Zhou","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0090","unstructured":"Q. Wu, Y. Zhao, Y. Wang, X. Liu, Y.-W. Tai, C.-K. Tang, Motion-agent: a conversational framework for human motion generation with LLMs, 2024, arXiv: 2405.17013."},{"key":"10.1016\/j.inffus.2026.104435_bib0091","doi-asserted-by":"crossref","unstructured":"H. Yang, et al., Unimumo: Unified text, music, and motion generation, arXiv: 2410.04534 (2024), 39 (24), 25615\u201325623. 10.1609\/aaai.v39i24.34752.","DOI":"10.1609\/aaai.v39i24.34752"},{"key":"10.1016\/j.inffus.2026.104435_bib0092","doi-asserted-by":"crossref","unstructured":"C. Guo, Y. Mu, M.G. Javed, S. Wang, L. Cheng, MoMask: generative masked modeling of 3D human motions, (2023) 1900\u20131910. 10.1109\/CVPR52733.2024.00186.","DOI":"10.1109\/CVPR52733.2024.00186"},{"key":"10.1016\/j.inffus.2026.104435_bib0093","unstructured":"Z. Zhang, et al., InfiniMotion: mamba boosts memory in transformer for arbitrary long motion generation, 2024, Accessed: Sep. 22, 2024. [Online]. Available: http:\/\/arxiv.org\/abs\/2407.10061."},{"key":"10.1016\/j.inffus.2026.104435_bib0094","doi-asserted-by":"crossref","unstructured":"L. Xu, et al., ActFormer: A GAN-based Transformer towards General Action-Conditioned 3D Human Motion Generation(2022) 2228\u20132238. arXiv: 2203.0770610.1109\/ICCV51070.2023.00212.","DOI":"10.1109\/ICCV51070.2023.00212"},{"key":"10.1016\/j.inffus.2026.104435_bib0095","doi-asserted-by":"crossref","unstructured":"T. Karras, S. Laine, M. Aittala, J. Hellsten, J. Lehtinen, T. Aila, Analyzing and improving the image quality of stylegan (2019) 8110-8119. 10.1109\/CVPR42600.2020.00813.","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"10.1016\/j.inffus.2026.104435_bib0096","series-title":"Seventh International Conference on Computer Graphics and Virtuality (ICCGV 2024)","first-page":"6","article-title":"Human motion generation with StyleGAN","author":"Yamamoto","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0097","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"22747","article-title":"Text2performer: text-driven human video generation","author":"Jiang","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0098","series-title":"Proceedings of the 32nd ACM International Conference on Multimedia","first-page":"1043","article-title":"Motion-aware latent diffusion models for video frame interpolation","author":"Huang","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0099","doi-asserted-by":"crossref","unstructured":"L.-H. Chen, et al., Motionllm: Understanding human behaviors from human motions and videos, 2024, 10.1109\/TPAMI.2025.3627546.","DOI":"10.1109\/TPAMI.2025.3627546"},{"key":"10.1016\/j.inffus.2026.104435_bib0100","unstructured":"F. Hong, M. Zhang, L. Pan, Z. Cai, L. Yang, Z. Liu, AvatarCLIP: zero-shot text-driven generation and animation of 3D avatars, 2022, arXiv: 2205.08535."},{"key":"10.1016\/j.inffus.2026.104435_bib0101","unstructured":"A. Ramesh, P. Dhariwal, A. Nichol, C. Chu, M. Chen, Hierarchical text-conditional image generation with CLIP latents (2022). arXiv: 2204.06125."},{"key":"10.1016\/j.inffus.2026.104435_bib0102","series-title":"Proc. Eur. Conf. Comput. Vis.","first-page":"358","article-title":"Motionclip: exposing human motion generation to clip space","author":"Tevet","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0103","unstructured":"Y. Mao, X. Liu, W. Zhou, Z. Lu, H. Li, Learning generalizable human motion generator with reinforcement learning, 2024, arXiv: 2405.15541. Accessed: Sep. 29, 2024. [Online]. Available:."},{"key":"10.1016\/j.inffus.2026.104435_bib0104","series-title":"2024 IEEE\/CVF Winter Conference on Applications of Computer Vision (WACV)","first-page":"5058","article-title":"MotionGPT: human motion synthesis with improved diversity and realism via GPT-3 prompting","author":"Gomes","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0105","doi-asserted-by":"crossref","unstructured":"P.J. Yazdian, E. Liu, L. Cheng, A. Lim, Motionscript: Natural language descriptions for expressive 3d human motions, 2023, 21574\u201321581Accessed: Sep. 29, 2024. [Online]. Available:10.1109\/IROS60139.2025.11247385.","DOI":"10.1109\/IROS60139.2025.11247385"},{"key":"10.1016\/j.inffus.2026.104435_sbref0061","series-title":"Motion generation from fine-grained textual descriptions","first-page":"11625","author":"Li","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0107","doi-asserted-by":"crossref","unstructured":"R. Wang, C. Ma, G. Li, Z. Wang, You Think, You ACT: The New Task of Arbitrary Text to Motion Generation, (2024) pp. 12012\u201312022. 10.48550\/ARXIV.2404.14745.","DOI":"10.1109\/ICCV51701.2025.01117"},{"key":"10.1016\/j.inffus.2026.104435_bib0108","series-title":"Proceedings of the Twenty-Eighth International Joint Conference on Artificial Intelligence","first-page":"2216","article-title":"IRC-GAN: introspective recurrent convolutional GAN for text-to-video generation","author":"Deng","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0109","unstructured":"A. Radford, L. Metz, S. Chintala, Unsupervised representation learning with deep convolutional generative adversarial networks, (2015). 10.48550\/ARXIV.1511.06434."},{"key":"10.1016\/j.inffus.2026.104435_bib0110","unstructured":"T. Karras, T. Aila, S. Laine, J. Lehtinen, Progressive growing of GANs for improved quality, stability, and variation, (2017). 10.48550\/ARXIV.1710.10196."},{"key":"10.1016\/j.inffus.2026.104435_bib0111","doi-asserted-by":"crossref","unstructured":"T. Huang, J. Liu, X. Zhou, D.C. Nguyen, M.R. Azghadi, Y. Xia, S. Sun, V2X cooperative perception for autonomous driving: recent advances and challenges, (2023) 113 (5), pp. 443\u2013477. arXiv: 2310.0352510.1109\/JPROC.2025.3600903.","DOI":"10.1109\/JPROC.2025.3600903"},{"key":"10.1016\/j.inffus.2026.104435_bib0112","series-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"4396","article-title":"A style-based generator architecture for generative adversarial networks","author":"Karras","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0113","unstructured":"M. Zhang, H. Li, Z. Cai, J. Ren, L. Yang, Z. Liu, FineMoGen: fine-grained spatio-temporal motion generation and editing."},{"key":"10.1016\/j.inffus.2026.104435_bib0114","doi-asserted-by":"crossref","unstructured":"Y. Pan, Z. Qiu, T. Yao, H. Li, T. Mei, To create what you tell: Generating videos from captions, (2018) 1789\u20131798. 10.1145\/3123266.3127905.","DOI":"10.1145\/3123266.3127905"},{"key":"10.1016\/j.inffus.2026.104435_bib0115","article-title":"Non-contact multimodal indoor human monitoring systems: a survey","volume":"110","author":"Susarla","year":"2024","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.inffus.2026.104435_bib0116","unstructured":"Y.e. a. Wang, MotionGPT-2: a general-purpose motion-language model for motion generation and understanding, 2024, arXiv: 2410.21747."},{"key":"10.1016\/j.inffus.2026.104435_bib0117","unstructured":"B. Jiang, et al., Motionchain: Conversational motion controllers via multimodal prompts, 2024, 54\u20137410.1007\/978-3-031-73347-5_4."},{"key":"10.1016\/j.inffus.2026.104435_bib0118","series-title":"2024 IEEE Intelligent Vehicles Symposium (IV)","first-page":"3057","article-title":"Walk-the-talk: LLM-driven pedestrian motion generation","author":"Ramesh","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0119","unstructured":"J. Liu, W. Dai, C. Wang, Y. Cheng, Y. Tang, X. Tong, Plan, posture and go: towards open-world text-to-motion generation, (2023). arXiv: 2312.14828."},{"issue":"11","key":"10.1016\/j.inffus.2026.104435_bib0120","doi-asserted-by":"crossref","first-page":"139","DOI":"10.1145\/3422622","article-title":"Generative adversarial nets","volume":"63","author":"Goodfellow","year":"2020","journal-title":"Commun. ACM"},{"key":"10.1016\/j.inffus.2026.104435_bib0121","unstructured":"A. Amballa, G. Akkinapalli, V. Muralikrishnan, LS-GAN: human motion synthesis with latent-space GANs, 2024, 326\u2013335arXiv: 2501.0144910.1109\/WACVW65960.2025.00039."},{"key":"10.1016\/j.inffus.2026.104435_bib0122","unstructured":"Z. Geng, C. Han, Z. Hayder, J. Liu, M. Shah, A. Mian, Text-guided 3D human motion generation with keyframe-based parallel skip transformer, 2024, Accessed: Sep. 22, 2024. [Online]. Available: http:\/\/arxiv.org\/abs\/2405.15439."},{"key":"10.1016\/j.inffus.2026.104435_bib0123","unstructured":"D.P. Kingma, M. Welling, Auto-encoding variational bayes, (2013). 10.48550\/ARXIV.1312.6114."},{"key":"10.1016\/j.inffus.2026.104435_bib0124","doi-asserted-by":"crossref","unstructured":"A. Ghosh, N. Cheema, C. Oguz, C. Theobalt, P. Slusallek, Synthesis of compositional animations from textual descriptions, 2021, 1376\u2013138610.1109\/ICCV48922.2021.00143.","DOI":"10.1109\/ICCV48922.2021.00143"},{"key":"10.1016\/j.inffus.2026.104435_bib0125","series-title":"2024 36th Chinese Control and Decision Conference (CCDC)","first-page":"4416","article-title":"MSFF-GAN: a refined method for human video motion transfer","author":"Xue","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0126","series-title":"Fifth International Conference on Computer Information Science and Artificial Intelligence (CISAI 2022)","first-page":"188","article-title":"TransCGan-based human motion generator","author":"Yu","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0127","doi-asserted-by":"crossref","unstructured":"M. Zhang, et al., ReMoDiffuse: retrieval-augmented motion diffusion model (2023), pp. 364\u2013373. arXiv: 2304.0111610.1109\/ICCV51070.2023.00040.","DOI":"10.1109\/ICCV51070.2023.00040"},{"key":"10.1016\/j.inffus.2026.104435_bib0128","doi-asserted-by":"crossref","unstructured":"N. Athanasiou, A. Ceske, M. Diomataris, M.J. Black, G. Varol, MotionFix: text-driven 3D human motion editing, (2024). Accessed: Sep. 22, 2024. [Online]. Available: http:\/\/arxiv.org\/abs\/2408.00712.","DOI":"10.1145\/3680528.3687559"},{"key":"10.1016\/j.inffus.2026.104435_bib0129","series-title":"Proceedings of the 30th ACM International Conference on Multimedia","first-page":"2249","article-title":"Action-conditioned on-demand motion generation","author":"Lu","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0130","series-title":"European Conference on Computer Vision","first-page":"392","article-title":"Local action-guided motion diffusion model for text-to-motion generation","author":"Jin","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0131","doi-asserted-by":"crossref","unstructured":"C. Guo, et al., Action2Motion: conditioned generation of 3D human motions, (2020). 10.48550\/ARXIV.2007.15240.","DOI":"10.1145\/3394171.3413635"},{"key":"10.1016\/j.inffus.2026.104435_bib0132","series-title":"Proceedings of the 26th ACM International Conference on Multimedia","first-page":"1510","article-title":"A large-scale RGB-D database for arbitrary-view human action recognition","author":"Ji","year":"2018"},{"key":"10.1016\/j.inffus.2026.104435_bib0133","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"722","article-title":"Babel: bodies, action and behavior with English labels","author":"Punnakkal","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_bib0134","series-title":"Proc. Assoc. Advance. Artif. Intell.","first-page":"1231","article-title":"MultiAct: long-term 3D human motion generation from multiple action labels","author":"Lee","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0135","doi-asserted-by":"crossref","unstructured":"H. Ahn, T. Ha, Y. Choi, H. Yoo, S. Oh, Text2Action: generative adversarial synthesis from language to action (2017). arXiv: 1710.05298.","DOI":"10.1109\/ICRA.2018.8460608"},{"key":"10.1016\/j.inffus.2026.104435_bib0136","unstructured":"S.R. Hosseyni, A.A. Rahmani, S.J. Seyedmohammadi, S. Seyedin, A. Mohammadi, BAD: bidirectional auto-regressive diffusion for text-to-motion generation (2024). arXiv: 2409.10847."},{"key":"10.1016\/j.inffus.2026.104435_bib0137","unstructured":"E. Pinyoanuntapong, et al., ControlMM: controllable masked motion generation, 2024, arXiv: 2410.10780."},{"key":"10.1016\/j.inffus.2026.104435_bib0138","doi-asserted-by":"crossref","unstructured":"B. Chen, Y. Li, Y.-X. Ding, T. Shao, K. Zhou, Enabling synergistic full-body control in prompt-based co-speech motion generation, 2024, arXiv: 2410.00464.","DOI":"10.1145\/3664647.3680847"},{"key":"10.1016\/j.inffus.2026.104435_bib0139","unstructured":"S. Lu, et al., HumanTOMATO: text-aligned whole-body motion generation, 2023, Accessed: Sep. 22, 2024. [Online]. Available: http:\/\/arxiv.org\/abs\/2310.12978."},{"key":"10.1016\/j.inffus.2026.104435_bib0140","doi-asserted-by":"crossref","unstructured":"C. Ahuja, L.-P. Morency, Language2Pose: natural language grounded pose forecasting, 2019, arXiv: 1907.01108.","DOI":"10.1109\/3DV.2019.00084"},{"key":"10.1016\/j.inffus.2026.104435_bib0141","unstructured":"J. Kim, J. Kim, S. Choi, FLAME: free-form language-based motion synthesis & editing, 2022, arXiv: 2209.00349."},{"key":"10.1016\/j.inffus.2026.104435_bib0142","doi-asserted-by":"crossref","unstructured":"Z. Ren, Z. Pan, X. Zhou, L. Kang, Diffusion motion: generate text-guided 3D human motion by diffusion model, 2022, arXiv: 2210.12315.","DOI":"10.1109\/ICASSP49357.2023.10096441"},{"key":"10.1016\/j.inffus.2026.104435_bib0143","series-title":"2023 IEEE\/CVF International Conference on Computer Vision (ICCV)","first-page":"2151","article-title":"Guided motion diffusion for controllable human motion synthesis","author":"Karunratanakul","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0144","first-page":"1","article-title":"GUESS: GradUally enriching synthesis for text-driven human motion generation","author":"Gao","year":"2024","journal-title":"IEEE Trans. Vis. Comput. Graph."},{"key":"10.1016\/j.inffus.2026.104435_bib0145","unstructured":"Z. Ling, B. Han, S. Li, H. Shen, J. Cheng, C. Zou, MotionLLaMA: a unified framework for motion synthesis and comprehension, 2024, arXiv: 2411.17335."},{"key":"10.1016\/j.inffus.2026.104435_bib0146","unstructured":"Z. Kiang, W. Chai, Z. Zhou, C.Y. Yang, H.W. Huang, J.N. Hwang, PackDiT: joint human motion and text generation via mutual prompting, 2025, arXiv: 2501.16551."},{"key":"10.1016\/j.inffus.2026.104435_bib0147","series-title":"Proc. AAAI Conf. Artif. Intell.","first-page":"2022","article-title":"AMD: autoregressive motion diffusion","volume":"38","author":"Han","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0148","series-title":"2024 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"1813","article-title":"AAMDM: accelerated auto-Regressive motion diffusion model","author":"Li","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0149","series-title":"Computer Vision \u2013 ECCV 2024","first-page":"397","article-title":"Large motion model for unified multi-modal motion generation","volume":"15071","author":"Zhang","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0150","unstructured":"K. Zhao, G. Li, S. Tang, DART: a diffusion-based autoregressive motion model for real-time text-driven motion control (2024). 10.48550\/ARXIV.2410.05260."},{"key":"10.1016\/j.inffus.2026.104435_bib0151","unstructured":"J. Ma, S. Bai, C. Zhou, Pretrained diffusion models for unified human motion synthesis, 2022, 10.48550\/arXiv.2212.02837."},{"key":"10.1016\/j.inffus.2026.104435_bib0152","series-title":"2021 IEEE\/CVF International Conference on Computer Vision (ICCV)","first-page":"11625","article-title":"A unified 3D human motion synthesis model via conditional variational auto-encoder","author":"Cai","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_bib0153","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"5632","article-title":"UDE: a unified driving engine for human motion generation","author":"Zhou","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0154","unstructured":"Z. Zhou, Y. Wan, B. Wang, A unified framework for multimodal, multi-part human motion synthesis (2023). arXiv: 2311.16471."},{"issue":"4","key":"10.1016\/j.inffus.2026.104435_bib0155","doi-asserted-by":"crossref","first-page":"236","DOI":"10.1089\/big.2016.0028","article-title":"The kit motion-language dataset","volume":"4","author":"Plappert","year":"2016","journal-title":"Big Data"},{"key":"10.1016\/j.inffus.2026.104435_bib0156","series-title":"Proc. Int. Conf. Comput. Vis. (ICCV)","first-page":"5441","article-title":"AMASS: archive of motion capture as surface shapes","author":"Mahmood","year":"2019"},{"key":"10.1016\/j.inffus.2026.104435_bib0157","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"5152","article-title":"Generating diverse and natural 3d human motions from text","author":"Guo","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0158","series-title":"Proceedings of the 28th ACM International Conference on Multimedia","first-page":"2021","article-title":"Action2motion: conditioned generation of 3d human motions","author":"Guo","year":"2020"},{"issue":"10","key":"10.1016\/j.inffus.2026.104435_bib0159","doi-asserted-by":"crossref","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","article-title":"Ntu rgb+d 120: a large-scale benchmark for 3d human activity understanding","volume":"42","author":"Liu","year":"2020","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.inffus.2026.104435_bib0160","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"1010","article-title":"NTU RGB+d: a large-scale dataset for 3d human activity analysis","author":"Shahroudy","year":"2016"},{"key":"10.1016\/j.inffus.2026.104435_bib0161","series-title":"Proc. Eur. Conf. Comput. Vis.","first-page":"351","article-title":"3D human shape reconstruction from a polarization image","author":"Zou","year":"2020"},{"key":"10.1016\/j.inffus.2026.104435_bib0162","doi-asserted-by":"crossref","DOI":"10.1109\/TPAMI.2013.248","article-title":"Human3.6m: large scale datasets and predictive methods for 3d human sensing in natural environments","author":"Ionescu","year":"2014","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.inffus.2026.104435_bib0163","unstructured":"CMU Graphics Lab, CMU Graphics Lab Motion Capture Database. Available online: https:\/\/mocap.cs.cmu.edu\/. Accessed: 26 March 2025."},{"key":"10.1016\/j.inffus.2026.104435_bib0164","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"Humman: multi-modal 4D human dataset for versatile sensing and modeling","author":"Cai","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0165","series-title":"Proc. Adv. Neural Inform. Process. Syst.","article-title":"HUMANISE: language-conditioned human motion generation in 3D scenes","author":"Wang","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0166","series-title":"Int. Conf. on Robot. and Automa.","first-page":"4303","article-title":"Robots learn social skills: end-to-end learning of co-speech gesture generation for humanoid robots","author":"Yoon","year":"2019"},{"issue":"6","key":"10.1016\/j.inffus.2026.104435_bib0167","doi-asserted-by":"crossref","DOI":"10.1145\/3414685.3417838","article-title":"Speech gesture generation from the trimodal context of text, audio, and speaker identity","volume":"39","author":"Yoon","year":"2020","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.inffus.2026.104435_bib0168","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"Style transfer for co-speech gesture animation: a multi-speaker conditional mixture approach","author":"Ahuja","year":"2020"},{"key":"10.1016\/j.inffus.2026.104435_bib0169","series-title":"Proc. Eur. Conf. Comput. Vis.","article-title":"Beat: a large-scale semantic and emotional multimodal dataset for conversational gestures synthesis","author":"Liu","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0170","series-title":"Advances in Neural Information Processing Systems 30","article-title":"Gans trained by a two-time-scale update rule converge to a local Nash equilibrium","author":"Heusel","year":"2017"},{"key":"10.1016\/j.inffus.2026.104435_bib0171","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR)","first-page":"18000","article-title":"Executing your commands via motion diffusion in latent space","author":"Xin","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0172","series-title":"Proc. Eur. Conf. Comput. Vis.","first-page":"580","article-title":"Tm2t: stochastic and tokenized modeling for the reciprocal generation of 3D human motions and texts","author":"Guo","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0173","series-title":"Proc. Eur. Conf. Comput. Vis.","first-page":"356","article-title":"Implicit neural representations for variable length human motion generation","author":"Cervantes","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0174","series-title":"Proc. IEEE Conf. Comput. Vis. Pattern Recognit.","first-page":"9760","article-title":"Mofusion: a framework for denoising-diffusion-based motion synthesis","author":"Dabral","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0175","series-title":"Proc. Int. Conf. Learn. Represent.","article-title":"Human motion diffusion model","author":"Tevet","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0176","series-title":"Proc. Int. Conf. Comput. Vis.","article-title":"Action-conditioned 3D human motion synthesis with transformer VAE","author":"Petrovich","year":"2021"},{"key":"10.1016\/j.inffus.2026.104435_bib0177","series-title":"Proceedings of the ACM International Conference on Multimedia","first-page":"2249","article-title":"Action-conditioned on-demand motion generation","author":"Lu","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0178","unstructured":"H. Wang, W. Zhu, L. Miao, Y. Xu, F. Gao, Q. Tian, (2024), Y. Wang, Aligning Human Motion Generation with Human Perceptions, arXiv: 2407.02272."},{"key":"10.1016\/j.inffus.2026.104435_bib0179","series-title":"SIGGRAPH Asia 2023 Conference Papers","first-page":"1","article-title":"What is the best automated metric for text-to-motion generation?","author":"Voas","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0180","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"3430","article-title":"ExerAIde: AI-assisted multimodal diagnosis for enhanced sports performance and personalised rehabilitation","author":"Qazi","year":"2024"},{"issue":"3","key":"10.1016\/j.inffus.2026.104435_bib0181","doi-asserted-by":"crossref","first-page":"234","DOI":"10.5573\/IEIESPC.2023.12.3.234","article-title":"AI-assisted physical therapy for post-injury rehabilitation: current state of the art","volume":"12","author":"Ekambaram","year":"2023","journal-title":"IEIE Trans. Smart Process. Comput."},{"key":"10.1016\/j.inffus.2026.104435_bib0182","unstructured":"Emerging role of artificial intelligence and robotics in physiotherapy: past, present, and future perspective."},{"key":"10.1016\/j.inffus.2026.104435_bib0183","series-title":"Revolutionizing the Healthcare Sector with AI","first-page":"311","article-title":"Futurecare: AI robots revolutionizing health and healing","author":"Kaur","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0184","doi-asserted-by":"crossref","unstructured":"B.J. Darter, J.M. Wilken, Gait training with virtual reality-based real-time feedback: improving gait performance following transfemoral amputation, Phys. Ther., 91 (9), 1385\u20131394.","DOI":"10.2522\/ptj.20100360"},{"issue":"5","key":"10.1016\/j.inffus.2026.104435_bib0185","doi-asserted-by":"crossref","first-page":"687","DOI":"10.1109\/TITB.2009.2022913","article-title":"Computational intelligence in gait research: a perspective on current applications and future challenges","volume":"13","author":"Lai","year":"2009","journal-title":"IEEE Trans. Inf. Technol. Biomed."},{"issue":"3","key":"10.1016\/j.inffus.2026.104435_bib0186","doi-asserted-by":"crossref","first-page":"933","DOI":"10.1109\/JSYST.2014.2318698","article-title":"Multimodal human\u2013robot interaction for walker-assisted gait","volume":"10","author":"Cifuentes","year":"2014","journal-title":"IEEE Syst. J."},{"issue":"4","key":"10.1016\/j.inffus.2026.104435_bib0187","doi-asserted-by":"crossref","first-page":"889","DOI":"10.1109\/TBCAS.2017.2699189","article-title":"A multimodal framework based on integration of cortical and muscular activities for decoding human intentions about lower limb motions","volume":"11","author":"Cui","year":"2017","journal-title":"IEEE Trans. Biomed. Circuits Syst."},{"issue":"1","key":"10.1016\/j.inffus.2026.104435_bib0188","doi-asserted-by":"crossref","first-page":"2","DOI":"10.3390\/data3010002","article-title":"A data set of human body movements for physical rehabilitation exercises","volume":"3","author":"Vakanski","year":"2018","journal-title":"Data"},{"issue":"3","key":"10.1016\/j.inffus.2026.104435_bib0189","doi-asserted-by":"crossref","DOI":"10.1002\/cav.2257","article-title":"A language-directed virtual human motion generation approach based on musculoskeletal models","volume":"35","author":"Sun","year":"2024","journal-title":"Comput. Animat. Virtual Worlds"},{"key":"10.1016\/j.inffus.2026.104435_bib0190","series-title":"2013 6th International IEEE\/EMBS Conference on Neural Engineering (NER)","first-page":"1274","article-title":"HARMONIE: a multimodal control framework for human assistive robotics","author":"Katyal","year":"2013"},{"key":"10.1016\/j.inffus.2026.104435_bib0191","doi-asserted-by":"crossref","unstructured":"Y. Liu, X. Cao, T. Chen, Y. Jiang, J. You, M. Wu, J. Chen, (2025). A survey of embodied AI in healthcare: techniques, applications, and opportunities, arXiv: 2501.07468.","DOI":"10.2139\/ssrn.5113818"},{"issue":"20","key":"10.1016\/j.inffus.2026.104435_bib0192","doi-asserted-by":"crossref","first-page":"6344","DOI":"10.1080\/10447318.2023.2254609","article-title":"Application of virtual avatar using motion capture in immersive virtual environment","volume":"40","author":"Park","year":"2024","journal-title":"Int. J. Hum.\u2013Comput. Interact."},{"key":"10.1016\/j.inffus.2026.104435_bib0193","series-title":"3D Human Motion Recovery and Generation: From Noisy Pose to Language Description","author":"Ma","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0194","unstructured":"Z. Fan, P. Dai, Z. Su, X. Gao, Z. Lv, J. Zhang, Y. Zhang, (2024). Emhi: a multimodal egocentric human motion dataset with hmd and body-worn imus, arXiv: 2408.17168."},{"key":"10.1016\/j.inffus.2026.104435_bib0195","article-title":"Improved non-player character (NPC) behavior using evolutionary algorithm\u2014a systematic review","volume":"52","author":"Armanto","year":"2024","journal-title":"Entertain. Comput."},{"key":"10.1016\/j.inffus.2026.104435_bib0196","series-title":"Proceedings of the Human Factors and Ergonomics Society Annual Meeting","first-page":"1540","article-title":"High-fidelity worker motion simulation with generative AI","volume":"68","author":"Macwan","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0197","doi-asserted-by":"crossref","unstructured":"J. Zhao, D. Weng, Q. Du, Z. Tian, Motion generation review: exploring deep learning for lifelike animation with manifold, 2024, arXiv: 2412.10458.","DOI":"10.1007\/978-981-96-3679-2_1"},{"key":"10.1016\/j.inffus.2026.104435_bib0198","series-title":"European Conference on Computer Vision","first-page":"246","article-title":"Generating human interaction motions in scenes with text control","author":"Yi","year":"2025"},{"issue":"2","key":"10.1016\/j.inffus.2026.104435_bib0199","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3635705","article-title":"Promptable game models: text-guided game simulation via masked diffusion models","volume":"43","author":"Menapace","year":"2024","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.inffus.2026.104435_bib0200","doi-asserted-by":"crossref","unstructured":"H. Yang, C. Li, Z. Wu, G. Li, J. Wang, J. Yu, L. Xu, SMGDiff: soccer motion generation using diffusion probabilistic models (2024) (pp. 11807\u201311817). arXiv: 2411.16216.","DOI":"10.1109\/ICCV51701.2025.01098"},{"key":"10.1016\/j.inffus.2026.104435_bib0201","series-title":"European Conference on Computer Vision","first-page":"381","article-title":"Disentangled clothed avatar generation from text descriptions","author":"Wang","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0202","series-title":"2024 International Conference on 3D Vision (3DV)","first-page":"1531","article-title":"Tech: text-guided reconstruction of lifelike clothed humans","author":"Huang","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0203","series-title":"2023 IEEE International Conference on Image Processing (ICIP)","first-page":"3484","article-title":"ClothFit: cloth-human-attribute guided virtual try-on network using 3D simulated dataset","author":"Cho","year":"2023"},{"key":"10.1016\/j.inffus.2026.104435_bib0204","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"7543","article-title":"Viton: an image-based virtual try-on network","author":"Han","year":"2018"},{"issue":"11","key":"10.1016\/j.inffus.2026.104435_bib0205","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3665869","article-title":"Human image generation: a comprehensive survey","volume":"56","author":"Jia","year":"2024","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.inffus.2026.104435_bib0206","series-title":"2009 IEEE\/RSJ International Conference on Intelligent Robots and Systems","first-page":"2518","article-title":"Stable whole-body motion generation for humanoid robots to imitate human motions","author":"Kim","year":"2009"},{"key":"10.1016\/j.inffus.2026.104435_bib0207","series-title":"2018 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","first-page":"562","article-title":"Teaching robots to predict human motion","author":"Gui","year":"2018"},{"key":"10.1016\/j.inffus.2026.104435_bib0208","series-title":"2018 IEEE International Conference on Robotics and Automation (ICRA)","first-page":"4563","article-title":"Anticipating many futures: online human motion prediction and generation for human-robot interaction","author":"B\u00fctepage","year":"2018"},{"key":"10.1016\/j.inffus.2026.104435_bib0209","series-title":"Proceedings of the 2024 ACM\/IEEE International Conference on Human-Robot Interaction","first-page":"830","article-title":"PoseTron: enabling close-proximity human-robot collaboration through multi-human motion prediction","author":"Yasar","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0210","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1577","article-title":"Text2HOI: text-guided 3D motion generation for hand-Object interaction","author":"Cha","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0211","unstructured":"T. Ren, S. Liu, A. Zeng, J. Lin, K. Li, H. Cao, L. Zhang, Grounded SAM: assembling open-world models for diverse visual tasks, (2024) arXiv: 2401.14159."},{"key":"10.1016\/j.inffus.2026.104435_bib0212","doi-asserted-by":"crossref","first-page":"(","DOI":"10.1007\/s11042-024-18305-w","article-title":"Real-time video surveillance-based human fall detection system using a hybrid Haar cascade classifier","volume":"83","author":"Kaur","year":"2024","journal-title":"Multimed. Tools Appl."},{"key":"10.1016\/j.inffus.2026.104435_bib0213","series-title":"Intelligent Systems Conference","first-page":"46","article-title":"3D reconstruction in crime scenes investigation: impacts, benefits, and limitations","author":"Rangelov","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0214","doi-asserted-by":"crossref","DOI":"10.1016\/j.forsciint.2024.111970","article-title":"3D reconstruction of events: search for a spatial correlation between injuries and the geometry of the body discovery site","volume":"357","author":"Maksymowicz","year":"2024","journal-title":"Forensic Sci. Int."},{"key":"10.1016\/j.inffus.2026.104435_bib0215","article-title":"Applicability of the madymo pedestrian model for forensic fall analysis","volume":"112068","author":"de Vette","year":"2024","journal-title":"Forensic Sci. Int."},{"key":"10.1016\/j.inffus.2026.104435_bib0216","series-title":"European Conference on Computer Vision","first-page":"246","article-title":"Generating human interaction motions in scenes with text control","author":"Yi","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0217","series-title":"European Conference on Computer Vision","first-page":"246","article-title":"Generating human interaction motions in scenes with text control","author":"Yi","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0218","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"20460","article-title":"Towards diverse and natural scene-aware 3d human motion synthesis","author":"Wang","year":"2022"},{"key":"10.1016\/j.inffus.2026.104435_bib0219","series-title":"2024 International Conference on 3D Vision (3DV)","first-page":"903","article-title":"Generating continual human motion in diverse 3d scenes","author":"Mir","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0220","series-title":"European Conference on Computer Vision","first-page":"130","article-title":"Massively multi-person 3d human motion forecasting with scene context","author":"Mueller","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0221","series-title":"ACM SIGGRAPH 2024 Conference Papers","first-page":"1","article-title":"Physics-based scene layout generation from human motion","author":"Li","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0222","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"19888","article-title":"CG-Hoi: contact-guided 3d human-object interaction generation","author":"Diller","year":"2024"},{"key":"10.1016\/j.inffus.2026.104435_bib0223","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"5280","article-title":"HandDiffuse: generative controllers for two-hand interactions via diffusion models","volume":"39","author":"Lin","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0224","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"1880","article-title":"MotionCraft: crafting whole-body motion with plug-and-play multimodal controls","volume":"39","author":"Bian","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0225","series-title":"Proceedings of the Computer Vision and Pattern Recognition Conference","first-page":"1940","article-title":"Exploring timeline control for facial motion generation","author":"Ma","year":"2025"},{"key":"10.1016\/j.inffus.2026.104435_bib0226","series-title":"2018 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS)","first-page":"562","article-title":"Teaching robots to predict human motion","author":"Gui","year":"2018"}],"container-title":["Information Fusion"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526003155?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1566253526003155?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,22]],"date-time":"2026-06-22T11:53:15Z","timestamp":1782129195000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1566253526003155"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":226,"alternative-id":["S1566253526003155"],"URL":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104435","relation":{},"ISSN":["1566-2535"],"issn-type":[{"value":"1566-2535","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Multimodal generative AI for human motion understanding and generation: A survey and way forward","name":"articletitle","label":"Article Title"},{"value":"Information Fusion","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.inffus.2026.104435","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier B.V.","name":"copyright","label":"Copyright"}],"article-number":"104435"}}