{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T17:46:55Z","timestamp":1782841615621,"version":"3.54.5"},"reference-count":97,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2022,1,4]],"date-time":"2022-01-04T00:00:00Z","timestamp":1641254400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,4]],"date-time":"2022-01-04T00:00:00Z","timestamp":1641254400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2022,2]]},"DOI":"10.1007\/s11263-021-01550-z","type":"journal-article","created":{"date-parts":[[2022,1,4]],"date-time":"2022-01-04T12:02:41Z","timestamp":1641297761000},"page":"285-315","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":21,"title":["Action2video: Generating Videos of Human 3D Actions"],"prefix":"10.1007","volume":"130","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4539-0634","authenticated-orcid":false,"given":"Chuan","family":"Guo","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinxin","family":"Zuo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sen","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinshuang","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shihao","family":"Zou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Minglun","family":"Gong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Li","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,1,4]]},"reference":[{"issue":"4","key":"1550_CR1","first-page":"62","volume":"39","author":"K Aberman","year":"2020","unstructured":"Aberman, K., Li, P. U., Lischinski, D., Sorkine-Hornung, O., Cohen-Or, D., & Chen, B. (2020). Skeleton-aware networks for deep motion retargeting. ACM Transactions on Graphics (TOG), 39(4), 62\u20131.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"1550_CR2","doi-asserted-by":"publisher","first-page":"6033","DOI":"10.1109\/LRA.2020.3010742","volume":"5","author":"V Adeli","year":"2020","unstructured":"Adeli, V., Adeli, E., Reid, I., Niebles, J. C., & Rezatofighi, S. H. (2020). Socially and contextually aware human motion and pose forecasting. IEEE Robotics and Automation Letters, 5, 6033\u20136040.","journal-title":"IEEE Robotics and Automation Letters"},{"key":"1550_CR3","doi-asserted-by":"crossref","unstructured":"Ahn, H., Ha, T., Choi Y., Yoo, H., & Oh, S. (2018). Text2action: Generative adversarial synthesis from language to action. In IEEE international conference on robotics and automation (pp. 5915\u20135920).","DOI":"10.1109\/ICRA.2018.8460608"},{"key":"1550_CR4","doi-asserted-by":"crossref","unstructured":"Ahuja, C., & Morency, L. P. (2019). Language2pose: Natural language grounded pose forecasting. In International conference on 3D vision (pp. 719\u2013728).","DOI":"10.1109\/3DV.2019.00084"},{"key":"1550_CR5","doi-asserted-by":"crossref","unstructured":"Aksan, E., Kaufmann, M., & Hilliges, O. (2019). Structured prediction helps 3D human motion modelling. In IEEE\/CVF international conference on computer vision (pp. 7144\u20137153).","DOI":"10.1109\/ICCV.2019.00724"},{"key":"1550_CR6","doi-asserted-by":"crossref","unstructured":"Aliakbarian, S., Saleh, F. S., Salzmann, M., Petersson, L., & Gould, S. (2020). A stochastic conditioning scheme for diverse human motion prediction. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 5223\u20135232).","DOI":"10.1109\/CVPR42600.2020.00527"},{"key":"1550_CR7","doi-asserted-by":"crossref","unstructured":"Alldieck, T., Magnor, M., Xu, W., Theobalt, C., & Pons-Moll, G. (2018). Video based reconstruction of 3d people models. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 8387\u20138397).","DOI":"10.1109\/CVPR.2018.00875"},{"key":"1550_CR8","doi-asserted-by":"crossref","unstructured":"Alp\u00a0G\u00fcler, R., Neverova, N., & Kokkinos, I. (2018). Densepose: Dense human pose estimation in the wild. In IEEE conference on computer vision and pattern recognition (pp. 7297\u20137306).","DOI":"10.1109\/CVPR.2018.00762"},{"key":"1550_CR9","unstructured":"Arjovsky, M., Chintala, S., & Bottou, L. (2017). Wasserstein GAN. arXiv:1701.07875."},{"key":"1550_CR10","doi-asserted-by":"crossref","unstructured":"Bengio, Y., Louradour, J., Collobert, R., & Weston, J. (2009). Curriculum learning. In International conference on machine learning (pp. 41\u201348).","DOI":"10.1145\/1553374.1553380"},{"key":"1550_CR11","unstructured":"Bengio, S., Vinyals, O., Jaitly, N., & Shazeer, N. (2015). Scheduled sampling for sequence prediction with recurrent neural networks. In Advances in neural information processing systems (pp. 1171\u20131179)."},{"key":"1550_CR12","doi-asserted-by":"crossref","unstructured":"Bogo, F., Kanazawa, A., Lassner, C., Gehler, P., Romero, J., & Black, M. J. (2016). Keep it SMPL: Automatic estimation of 3d human pose and shape from a single image. In European conference on computer vision (pp. 561\u2013578).","DOI":"10.1007\/978-3-319-46454-1_34"},{"key":"1550_CR13","doi-asserted-by":"crossref","unstructured":"Bowman, S. R., Vilnis, L., Vinyals, O., Dai, A. M., Jozefowicz, R., & Bengio, S. (2016) Generating sentences from a continuous space. In Conference on computational natural language learning.","DOI":"10.18653\/v1\/K16-1002"},{"key":"1550_CR14","doi-asserted-by":"crossref","unstructured":"Cai, H., Bai, C., Tai, Y. W., & Tang, C. K. (2018) Deep video generation, prediction and completion of human action sequences. In European conference on computer vision (pp. 366\u2013382).","DOI":"10.1007\/978-3-030-01216-8_23"},{"issue":"1","key":"1550_CR15","doi-asserted-by":"publisher","first-page":"172","DOI":"10.1109\/TPAMI.2019.2929257","volume":"43","author":"Z Cao","year":"2021","unstructured":"Cao, Z., Simon, T., Wei, S., Sheikh, Y., et al. (2021). Openpose: Realtime multi-person 2d pose estimation using part affinity fields. IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(1), 172\u2013186.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"3","key":"1550_CR16","doi-asserted-by":"publisher","first-page":"786","DOI":"10.1016\/j.eswa.2013.08.009","volume":"41","author":"AA Chaaraoui","year":"2014","unstructured":"Chaaraoui, A. A., Padilla-L\u00f3pez, J. R., Climent-P\u00e9rez, P., & Fl\u00f3rez-Revuelta, F. (2014). Evolutionary joint selection to improve human action recognition with RGB-D devices. Expert systems with applications, 41(3), 786\u2013794.","journal-title":"Expert systems with applications"},{"key":"1550_CR17","doi-asserted-by":"crossref","unstructured":"Chan, C., Ginosar, S., Zhou, T., & Efros, A. A. (2019). Everybody dance now. In IEEE\/CVF international conference on computer vision (pp. 5933\u20135942).","DOI":"10.1109\/ICCV.2019.00603"},{"key":"1550_CR18","doi-asserted-by":"crossref","unstructured":"Cheng, Y. C., Lee, H. Y., Sun, M., & Yang, M. H. (2020). Controllable image synthesis via segvae. In European conference on computer vision (pp. 159\u2013174).","DOI":"10.1007\/978-3-030-58571-6_10"},{"key":"1550_CR19","unstructured":"Chung, J., Kastner, K., Dinh, L., Goel, K., Courville, A. C., & Bengio, Y. (2015). A recurrent latent variable model for sequential data. In Advances in neural information processing systems (pp. 2980\u20132988)."},{"key":"1550_CR20","unstructured":"CMU (2003). CMU graphics lab motion capture database http:\/\/mocap.cs.cmu.edu\/."},{"issue":"5","key":"1550_CR21","doi-asserted-by":"publisher","first-page":"1505","DOI":"10.1007\/s11263-019-01222-z","volume":"128","author":"CR de Souza","year":"2020","unstructured":"de Souza, C. R., Gaidon, A., Cabon, Y., Murray, N., & L\u00f3pez, A. M. (2020). Generating human action videos by coupling 3d game engines and probabilistic graphical models. International Journal of Computer Vision, 128(5), 1505\u20131536.","journal-title":"International Journal of Computer Vision"},{"key":"1550_CR22","unstructured":"Denton, E., & Fergus, R. (2018). Stochastic video generation with a learned prior. In International conference on machine learning (pp. 1174\u20131183)."},{"key":"1550_CR23","unstructured":"Denton, E. L., et\u00a0al. (2017) Unsupervised learning of disentangled representations from video. In Advances in neural information processing systems (pp. 4414\u20134423)."},{"key":"1550_CR24","doi-asserted-by":"crossref","unstructured":"Ding, Z., Xu, Y., Xu, W., Parmar, G., Yang, Y., Welling, M., & Tu, Z. (2020). Guided variational autoencoder for disentanglement learning. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 7920\u20137929).","DOI":"10.1109\/CVPR42600.2020.00794"},{"key":"1550_CR25","doi-asserted-by":"crossref","unstructured":"Gao, H., Xu, H., Cai, Q. Z., Wang, R., Yu, F., & Darrell, T. (2019). Disentangling propagation and generation for video prediction. In IEEE\/CVF international conference on computer vision (pp. 9006\u20139015).","DOI":"10.1109\/ICCV.2019.00910"},{"key":"1550_CR26","unstructured":"Gavrila, D. M., Davis, L. S., et\u00a0al. (1995) Towards 3-D model-based tracking and recognition of human movement: A multi-view approach. In International workshop on automatic face-and gesture-recognition (pp. 272\u2013277)."},{"key":"1550_CR27","first-page":"5","volume":"4","author":"S Geman","year":"1987","unstructured":"Geman, S., & McClure, D. (1987). Statistical methods for tomographic image reconstruction. Bulletin of the International Statistical Institute, 4, 5\u201321.","journal-title":"Bulletin of the International Statistical Institute"},{"key":"1550_CR28","doi-asserted-by":"crossref","unstructured":"Guo, C., Zuo, X., Wang, S., Zou, S., Sun, Q., Deng, A., Gong, M., & Cheng, L. (2020). Action2motion: Conditioned generation of 3d human motions. In ACM international conference on multimedia (pp. 2021\u20132029).","DOI":"10.1145\/3394171.3413635"},{"key":"1550_CR29","doi-asserted-by":"crossref","unstructured":"Habibie, I., Holden, D., Schwarz, J., Yearsley, J., & Komura, T. (2017). A recurrent variational autoencoder for human motion synthesis. In British machine vision conference.","DOI":"10.5244\/C.31.119"},{"key":"1550_CR30","doi-asserted-by":"publisher","first-page":"85","DOI":"10.1016\/j.cviu.2017.01.011","volume":"158","author":"F Han","year":"2017","unstructured":"Han, F., Reily, B., Hoff, W., & Zhang, H. (2017). Space-time representation of people based on 3d skeletal data: A review. Computer Vision and Image Understanding, 158, 85\u2013105.","journal-title":"Computer Vision and Image Understanding"},{"key":"1550_CR31","doi-asserted-by":"crossref","unstructured":"He, J., Lehrmann, A., Marino, J., Mori, G., & Sigal, L. (2018). Probabilistic video generation using holistic attribute control. In European conference on computer vision (pp. 452\u2013467).","DOI":"10.1007\/978-3-030-01228-1_28"},{"key":"1550_CR32","unstructured":"Higgins, I., Matthey, L., Pal, A., Burgess, C., Glorot, X., Botvinick, M., Mohamed, S., & Lerchner, A. (2016). Beta-VAE: Learning basic visual concepts with a constrained variational framework. In International conference on learning representations."},{"issue":"1","key":"1550_CR33","doi-asserted-by":"publisher","first-page":"1-es","DOI":"10.1145\/1189762.1189763","volume":"26","author":"A Hornung","year":"2007","unstructured":"Hornung, A., Dekkers, E., & Kobbelt, L. (2007). Character animation from 2d pictures and 3d motion data. ACM Transactions on Graphics, 26(1), 1-es.","journal-title":"ACM Transactions on Graphics"},{"key":"1550_CR34","unstructured":"Huang, R., Hu, H., Wu, W., Sawada, K., & Zhang, M. (2021) Dance revolution: Long-term dance generation with music via curriculum learning. In International conference on learning representations."},{"key":"1550_CR35","doi-asserted-by":"crossref","unstructured":"Huang, Z., Wan, C., Probst, T., Van\u00a0Gool, L. (2017). Deep learning on lie groups for skeleton-based action recognition. In IEEE conference on computer vision and pattern recognition (pp. 6099\u20136108).","DOI":"10.1109\/CVPR.2017.137"},{"key":"1550_CR36","doi-asserted-by":"crossref","unstructured":"Huang, Z., Xu, Y., Lassner, C., Li, H., & Tung, T. (2020). Arch: Animatable reconstruction of clothed humans. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 3093\u20133102).","DOI":"10.1109\/CVPR42600.2020.00316"},{"key":"1550_CR37","unstructured":"Hussein, M. E., Torki, M., Gowayyed, M. A., & El-Saban, M. (2013). Human action recognition using a temporal hierarchy of covariance descriptors on 3d joint locations. In International joint conference on artificial intelligence (pp. 2466-2472)."},{"key":"1550_CR38","unstructured":"Kim, Y., Nam, S., Cho, I., Kim, S. J. (2019). Unsupervised keypoint learning for guiding class-conditional video prediction. In Advances in neural information processing systems (pp. 3814\u20133824)."},{"key":"1550_CR39","unstructured":"Kingma, D. P., & Welling, M. (2014). Auto-encoding variational bayes. In International conference on learning representations."},{"key":"1550_CR40","unstructured":"Kingma, D. P., Mohamed, S., Rezende, D. J., & Welling, M. (2014). Semi-supervised learning with deep generative models. In Advances in neural information processing systems (pp. 3581\u20133589)."},{"key":"1550_CR41","doi-asserted-by":"crossref","unstructured":"Kocabas, M., Athanasiou, N., & Black, M. J. (2020). Vibe: Video inference for human body pose and shape estimation. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 5253\u20135263).","DOI":"10.1109\/CVPR42600.2020.00530"},{"key":"1550_CR42","unstructured":"Larsen, A. B. L., S\u00f8nderby, S. K., Larochelle, H., & Winther, O. (2016). Autoencoding beyond pixels using a learned similarity metric. In International conference on machine learning (pp. 1558\u20131566)."},{"key":"1550_CR43","doi-asserted-by":"crossref","unstructured":"Lazova, V., Insafutdinov, E., & Pons-Moll, G. (2019). 360-degree textures of people in clothing from a single image. In International conference on 3D vision (pp. 643\u2013653).","DOI":"10.1109\/3DV.2019.00076"},{"key":"1550_CR44","unstructured":"Lee, H. Y., Yang, X., Liu, M. Y., Wang, T. C., Lu, Y. D., Yang, M. H., & Kautz, J. (2019). Dancing to music. In Advances in neural information processing systems (pp. 3581\u20133591)."},{"key":"1550_CR45","unstructured":"Lee, J., Ramanan, D., & Girdhar, R. (2020) MetaPix: Few-shot video retargeting. In International conference on learning representations."},{"key":"1550_CR46","doi-asserted-by":"crossref","unstructured":"Li, W., Zhang, Z., & Liu, Z. (2010). Action recognition based on a bag of 3d points. In CVPR workshop on human communicative behavior analysis (pp. 9\u201314).","DOI":"10.1109\/CVPRW.2010.5543273"},{"key":"1550_CR47","unstructured":"Lin, A. S., Wu, L., Corona, R., Tai, K., Huang, Q., Mooney, R. J. (2018). Generating animated videos of human activities from natural language descriptions. In NeurIPS workshop on visually grounded interaction and language."},{"key":"1550_CR48","doi-asserted-by":"crossref","unstructured":"Liu, W., Piao, Z., Min, J., Luo, W., Ma, L., & Gao, S. (2019a). Liquid warping GAN: A unified framework for human motion imitation, appearance transfer and novel view synthesis. In IEEE international conference on computer vision (pp. 5904\u20135913).","DOI":"10.1109\/ICCV.2019.00600"},{"issue":"10","key":"1550_CR49","doi-asserted-by":"publisher","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","volume":"42","author":"J Liu","year":"2020","unstructured":"Liu, J., Shahroudy, A., Perez, M. L., Wang, G., Duan, L. Y., & Chichung, A. K. (2020). Ntu rgb+d 120: A large-scale benchmark for 3d human activity understanding. IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(10), 2684\u20132701.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1550_CR50","doi-asserted-by":"crossref","unstructured":"Liu, Z., Wu, S., Jin, S., Liu, Q., Lu, S., Zimmermann, R., & Cheng, L. (2019b). Towards natural and accurate future motion prediction of humans and animals. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 10004\u201310012).","DOI":"10.1109\/CVPR.2019.01024"},{"issue":"6","key":"1550_CR51","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/2816795.2818013","volume":"34","author":"M Loper","year":"2015","unstructured":"Loper, M., Mahmood, N., Romero, J., Pons-Moll, G., & Black, M. J. (2015). Smpl: A skinned multi-person linear model. ACM Transactions on Graphics, 34(6), 1\u201316.","journal-title":"ACM Transactions on Graphics"},{"key":"1550_CR52","doi-asserted-by":"crossref","unstructured":"Marwah, T., Mittal, G., & Balasubramanian, V. N. (2017). Attentive semantic video generation using captions. In IEEE international conference on computer vision (pp. 1426\u20131434).","DOI":"10.1109\/ICCV.2017.159"},{"key":"1550_CR53","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-74048-3","volume-title":"Information retrieval for music and motion","author":"M M\u00fcller","year":"2007","unstructured":"M\u00fcller, M. (2007). Information retrieval for music and motion (Vol. 2). Berlin: Springer."},{"key":"1550_CR54","unstructured":"M\u00fcller, M., R\u00f6der, T., Clausen, M., Eberhardt, B., Kr\u00fcger, B., Weber, A. (2007). Mocap database hdm05. http:\/\/resources.mpi-inf.mpg.de\/HDM05\/."},{"key":"1550_CR55","volume-title":"A mathematical introduction to robotic manipulation","author":"RM Murray","year":"1994","unstructured":"Murray, R. M., Li, Z., Sastry, S. S., & Sastry, S. S. (1994). A mathematical introduction to robotic manipulation. Boca Raton: CRC Press."},{"issue":"4","key":"1550_CR56","doi-asserted-by":"publisher","first-page":"855","DOI":"10.1007\/s11263-019-01245-6","volume":"128","author":"D Pavllo","year":"2020","unstructured":"Pavllo, D., Feichtenhofer, C., Auli, M., & Grangier, D. (2020). Modeling human motion with quaternion-based neural networks. International Journal of Computer Vision, 128(4), 855\u2013872.","journal-title":"International Journal of Computer Vision"},{"key":"1550_CR57","doi-asserted-by":"publisher","first-page":"13","DOI":"10.1016\/j.robot.2018.07.006","volume":"109","author":"M Plappert","year":"2018","unstructured":"Plappert, M., Mandery, C., & Asfour, T. (2018). Learning a bidirectional mapping between human whole-body motion and natural language using deep recurrent neural networks. Robotics and Autonomous Systems, 109, 13\u201326.","journal-title":"Robotics and Autonomous Systems"},{"key":"1550_CR58","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., Brox, T. (2015). U-net: Convolutional networks for biomedical image segmentation. In International conference on medical image computing and computer-assisted intervention (pp. 234\u2013241).","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"1550_CR59","doi-asserted-by":"crossref","unstructured":"Saito, S., Huang, Z., Natsume, R., Morishima, S., Kanazawa, A., & Li, H. (2019). Pifu: Pixel-aligned implicit function for high-resolution clothed human digitization. In IEEE\/CVF international conference on computer vision (pp. 2304\u20132314).","DOI":"10.1109\/ICCV.2019.00239"},{"key":"1550_CR60","doi-asserted-by":"crossref","unstructured":"Saito, S., Simon, T., Saragih, J., & Joo, H. (2020) Pifuhd: Multi-level pixel-aligned implicit function for high-resolution 3d human digitization. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 84\u201393).","DOI":"10.1109\/CVPR42600.2020.00016"},{"key":"1550_CR61","doi-asserted-by":"crossref","unstructured":"Schonfeld, E., Ebrahimi, S., Sinha, S., Darrell, T., & Akata, Z. (2019) Generalized zero-and few-shot learning via aligned variational autoencoders. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 8247\u20138255).","DOI":"10.1109\/CVPR.2019.00844"},{"key":"1550_CR62","doi-asserted-by":"crossref","unstructured":"Shahroudy, A., Liu, J., Ng, T. T., & Wang, G. (2016). Ntu rgb+d: A large scale dataset for 3d human activity analysis. In IEEE conference on computer vision and pattern recognition (pp. 1010\u20131019).","DOI":"10.1109\/CVPR.2016.115"},{"key":"1550_CR63","doi-asserted-by":"crossref","unstructured":"Shlizerman, E., Dery, L., Schoen, H., & Kemelmacher-Shlizerman, I. (2018). Audio to body dynamics. In IEEE conference on computer vision and pattern recognition (pp. 7574\u20137583).","DOI":"10.1109\/CVPR.2018.00790"},{"key":"1550_CR64","doi-asserted-by":"crossref","unstructured":"Siarohin, A., Lathuili\u00e8re, S., Tulyakov, S., Ricci, E., & Sebe, N. (2019). Animating arbitrary objects via deep motion transfer. In IEEE conference on computer vision and pattern recognition (pp. 2377\u20132386).","DOI":"10.1109\/CVPR.2019.00248"},{"key":"1550_CR65","unstructured":"Siddharth, N., Paige, B., Van\u00a0de Meent, J. W., Desmaison, A., Goodman, N., Kohli, P., Wood, F., & Torr, P. (2017). Learning disentangled representations with semi-supervised deep generative models. In Advances in neural information processing systems (pp. 5925\u20135935)."},{"key":"1550_CR66","unstructured":"Sohn, K., Lee, H., & Yan, X. (2015). Learning structured output representation using deep conditional generative models. In Advances in neural information processing systems (pp. 3483\u20133491)."},{"key":"1550_CR67","first-page":"109","volume":"4","author":"O Sorkine","year":"2007","unstructured":"Sorkine, O., & Alexa, M. (2007). As-rigid-as-possible surface modeling. Symposium on Geometry processing, 4, 109\u2013116.","journal-title":"Symposium on Geometry processing"},{"key":"1550_CR68","doi-asserted-by":"publisher","first-page":"891","DOI":"10.1007\/s11263-019-01281-2","volume":"128","author":"S Stoll","year":"2020","unstructured":"Stoll, S., Camgoz, N. C., Hadfield, S., & Bowden, R. (2020). Text2sign: Towards sign language production using neural machine translation and generative adversarial networks. International Journal of Computer Vision, 128, 891\u2013908.","journal-title":"International Journal of Computer Vision"},{"key":"1550_CR69","doi-asserted-by":"crossref","unstructured":"Tang, T., Jia, J., & Mao, H. (2018). Dance with melody: An lstm-autoencoder approach to music-oriented dance synthesis. In ACM international conference on multimedia (pp. 1598\u20131606).","DOI":"10.1145\/3240508.3240526"},{"key":"1550_CR70","doi-asserted-by":"crossref","unstructured":"Tulyakov, S., Liu, M. Y., Yang, X., & Kautz, J. (2018). Mocogan: Decomposing motion and content for video generation. In IEEE conference on computer vision and pattern recognition (pp. 1526\u20131535).","DOI":"10.1109\/CVPR.2018.00165"},{"key":"1550_CR71","doi-asserted-by":"crossref","unstructured":"Vemulapalli, R., Arrate, F., & Chellappa, R. (2014). Human action recognition by representing 3d skeletons as points in a lie group. In IEEE conference on computer vision and pattern recognition (pp. 588\u2013595).","DOI":"10.1109\/CVPR.2014.82"},{"key":"1550_CR72","doi-asserted-by":"crossref","unstructured":"Villegas, R., Yang, J., Ceylan, D., & Lee, H. (2018). Neural kinematic networks for unsupervised motion retargetting. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 8639\u20138648).","DOI":"10.1109\/CVPR.2018.00901"},{"key":"1550_CR73","doi-asserted-by":"crossref","unstructured":"Vondrick, C., & Torralba, A. (2017). Generating the future with adversarial transformers. In IEEE conference on computer vision and pattern recognition (pp. 1020\u20131028).","DOI":"10.1109\/CVPR.2017.319"},{"key":"1550_CR74","unstructured":"Vondrick, C., Pirsiavash, H., & Torralba, A. (2016). Generating videos with scene dynamics. In Advances in neural information processing systems (pp. 613\u2013621)."},{"key":"1550_CR75","doi-asserted-by":"crossref","unstructured":"Wang, T. H., Cheng, Y. C., Lin, C. H., Chen, H. T., & Sun, M. (2019b). Point-to-point video generation. In IEEE\/CVF international conference on computer vision (pp. 10491\u201310500).","DOI":"10.1109\/ICCV.2019.01059"},{"key":"1550_CR76","doi-asserted-by":"crossref","unstructured":"Wang, J., Liu, Z., Wu, Y., & Yuan, J. (2012). Mining actionlet ensemble for action recognition with depth cameras. In IEEE conference on computer vision and pattern recognition (pp. 1290\u20131297).","DOI":"10.1109\/CVPR.2012.6247813"},{"key":"1550_CR77","unstructured":"Wang, T. C., Liu, M. Y., Tao, A., Liu, G., Kautz, J., & Catanzaro, B. (2019a). Few-shot video-to-video synthesis. In Advances in neural information processing systems."},{"key":"1550_CR78","unstructured":"Wang, T. C., Liu, M. Y., Zhu, J. Y., Liu, G., Tao, A., Kautz, J., & Catanzaro, B. (2018.) Video-to-video synthesis. In Advances in neural information processing systems (pp. 1144\u20131156)."},{"key":"1550_CR79","doi-asserted-by":"crossref","unstructured":"Wang, Z., Yu, P., Zhao, Y., Zhang, R., Zhou, Y., Yuan, J., & Chen, C. (2020). Learning diverse stochastic human-action generators by learning smooth latent transitions. In Proceedings of the AAAI conference on artificial intelligence (pp. 12281\u201312288).","DOI":"10.1609\/aaai.v34i07.6911"},{"key":"1550_CR80","doi-asserted-by":"crossref","unstructured":"Weng, C. Y., Curless, B., & Kemelmacher-Shlizerman, I. (2019). Photo wake-up: 3D character animation from a single photo. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 5908\u20135917).","DOI":"10.1109\/CVPR.2019.00606"},{"key":"1550_CR81","doi-asserted-by":"crossref","unstructured":"Wu, Y., Gao, R., Park, J., & Chen, Q. (2020). Future video synthesis with object motion prediction. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 5539\u20135548).","DOI":"10.1109\/CVPR42600.2020.00558"},{"key":"1550_CR82","doi-asserted-by":"crossref","unstructured":"Xia, L., Chen, C. C., & Aggarwal, J. K. (2012) View invariant human action recognition using histograms of 3d joints. In CVPR workshops (pp. 20\u201327).","DOI":"10.1109\/CVPRW.2012.6239233"},{"key":"1550_CR83","doi-asserted-by":"crossref","unstructured":"Xu, J., Xu, H., Ni, B., Yang, X., Wang, X., & Darrell, T. (2020). Hierarchical style-based networks for motion synthesis. In European conference on computer vision (pp. 178\u2013194).","DOI":"10.1007\/978-3-030-58621-8_11"},{"issue":"3","key":"1550_CR84","doi-asserted-by":"publisher","first-page":"454","DOI":"10.1007\/s11263-017-0998-6","volume":"123","author":"C Xu","year":"2017","unstructured":"Xu, C., Govindarajan, L. N., Zhang, Y., & Cheng, L. (2017). Lie-x: Depth image based articulated object pose estimation, tracking, and action recognition on lie groups. International Journal of Computer Vision, 123(3), 454\u2013478.","journal-title":"International Journal of Computer Vision"},{"issue":"2","key":"1550_CR85","doi-asserted-by":"publisher","first-page":"232","DOI":"10.1006\/cviu.1998.0726","volume":"73","author":"Y Yacoob","year":"1999","unstructured":"Yacoob, Y., & Black, M. J. (1999). Parameterized modeling and recognition of activities. Computer Vision and Image Understanding, 73(2), 232\u2013247.","journal-title":"Computer Vision and Image Understanding"},{"issue":"4","key":"1550_CR86","doi-asserted-by":"publisher","first-page":"3441","DOI":"10.1109\/LRA.2018.2852838","volume":"3","author":"T Yamada","year":"2018","unstructured":"Yamada, T., Matsunaga, H., & Ogata, T. (2018). Paired recurrent autoencoders for bidirectional translation between robot actions and linguistic descriptions. IEEE Robotics and Automation Letters, 3(4), 3441\u20133448.","journal-title":"IEEE Robotics and Automation Letters"},{"key":"1550_CR87","doi-asserted-by":"crossref","unstructured":"Yan, S., Li, Z., Xiong, Y., Yan, H., & Lin, D. (2019). Convolutional sequence generation for skeleton-based action synthesis. In IEEE\/CVF international conference on computer vision (pp. 4394\u20134402).","DOI":"10.1109\/ICCV.2019.00449"},{"key":"1550_CR88","doi-asserted-by":"crossref","unstructured":"Yan, X., Rastogi, A., Villegas, R., Sunkavalli, K., Shechtman, E., Hadap, S., Yumer, E., & Lee, H. (2018). Mt-vae: Learning motion transformations to generate multimodal human dynamics. In European conference on computer vision (pp. 265\u2013281).","DOI":"10.1007\/978-3-030-01228-1_17"},{"key":"1550_CR89","unstructured":"Yang, Z., Hu, Z., Salakhutdinov, R., & Berg-Kirkpatrick, T. (2017). Improved variational autoencoders for text modeling using dilated convolutions. In International conference on machine learning (pp. 3881\u20133890)."},{"key":"1550_CR90","doi-asserted-by":"crossref","unstructured":"Yang, C., Wang, Z., Zhu, X., Huang, C., Shi, J., & Lin, D. (2018). Pose guided human video generation. In European conference on computer vision (pp. 201\u2013216).","DOI":"10.1007\/978-3-030-01249-6_13"},{"key":"1550_CR91","doi-asserted-by":"crossref","unstructured":"Zhang, C., Pujades, S., Black, M. J., & Pons-Moll, G. (2017). Detailed, accurate, human shape estimation from clothed 3d scan sequences. In IEEE conference on computer vision and pattern recognition (pp. 5484\u20135493).","DOI":"10.1109\/CVPR.2017.582"},{"key":"1550_CR92","doi-asserted-by":"crossref","unstructured":"Zhao, R., & Ji, Q. (2018). An adversarial hierarchical hidden markov model for human pose modeling and generation. In AAAI conference on artificial intelligence (pp. 2636\u20132643).","DOI":"10.1609\/aaai.v32i1.11860"},{"key":"1550_CR93","doi-asserted-by":"crossref","unstructured":"Zhao, R., Su, H., Ji, Q. (2020). Bayesian adversarial human motion synthesis. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 6225\u20136234).","DOI":"10.1109\/CVPR42600.2020.00626"},{"key":"1550_CR94","doi-asserted-by":"crossref","unstructured":"Zheng, Z., Yu, T., Liu, Y., & Dai, Q. (2021). Pamir: Parametric model-conditioned implicit representation for image-based human reconstruction. In IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2021.3050505"},{"key":"1550_CR95","doi-asserted-by":"crossref","unstructured":"Zhou, Z., Shu, B., Zhuo, S., Deng, X., Tan, P., & Lin, S. (2012). Image-based clothes animation for virtual fitting. In SIGGRAPH Asia (pp. 1\u20134).","DOI":"10.1145\/2407746.2407779"},{"key":"1550_CR96","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Min, M. R., Kadav, A., & Graf, H. P. (2020). S3vae: Self-supervised sequential VAE for representation disentanglement and data generation. In IEEE\/CVF conference on computer vision and pattern recognition (pp. 6538\u20136547).","DOI":"10.1109\/CVPR42600.2020.00657"},{"key":"1550_CR97","doi-asserted-by":"publisher","first-page":"1617","DOI":"10.1109\/TMM.2020.3001506","volume":"23","author":"X Zuo","year":"2020","unstructured":"Zuo, X., Wang, S., Zheng, J., Yu, W., Gong, M., Yang, R., & Cheng, L. (2020). Sparsefusion: Dynamic human avatar modeling from sparse RGBD images. IEEE Transactions on Multimedia, 23, 1617\u20131629.","journal-title":"IEEE Transactions on Multimedia"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-021-01550-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-021-01550-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-021-01550-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,21]],"date-time":"2023-01-21T20:00:52Z","timestamp":1674331252000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-021-01550-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,1,4]]},"references-count":97,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2022,2]]}},"alternative-id":["1550"],"URL":"https:\/\/doi.org\/10.1007\/s11263-021-01550-z","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,1,4]]},"assertion":[{"value":"7 December 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 November 2021","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 January 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}