{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,31]],"date-time":"2025-10-31T07:44:51Z","timestamp":1761896691759},"reference-count":66,"publisher":"Springer Science and Business Media LLC","issue":"12","license":[{"start":{"date-parts":[[2018,1,31]],"date-time":"2018-01-31T00:00:00Z","timestamp":1517356800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2018,12]]},"DOI":"10.1007\/s11263-018-1066-6","type":"journal-article","created":{"date-parts":[[2018,1,31]],"date-time":"2018-01-31T12:07:17Z","timestamp":1517400437000},"page":"1326-1341","update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":62,"title":["Learning Latent Representations of 3D Human Pose with Deep Neural Networks"],"prefix":"10.1007","volume":"126","author":[{"given":"Isinsu","family":"Katircioglu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bugra","family":"Tekin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mathieu","family":"Salzmann","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vincent","family":"Lepetit","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pascal","family":"Fua","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,1,31]]},"reference":[{"key":"1066_CR1","doi-asserted-by":"crossref","unstructured":"Agarwal, A., & Triggs, B. (2004). 3D human pose from silhouettes by relevance vector regression. In CVPR.","DOI":"10.1109\/CVPR.2004.1315258"},{"key":"1066_CR2","doi-asserted-by":"crossref","unstructured":"Akhter, I., & Black, M.\u00a0J. (2015). Pose-conditioned joint angle limits for 3D human pose reconstruction. In CVPR.","DOI":"10.1109\/CVPR.2015.7298751"},{"key":"1066_CR3","doi-asserted-by":"publisher","first-page":"28","DOI":"10.1007\/s11263-008-0204-y","volume":"87","author":"L Bo","year":"2010","unstructured":"Bo, L., & Sminchisescu, C. (2010). Twin Gaussian processes for structured prediction. International Journal of Computer Vision, 87, 28\u201352.","journal-title":"International Journal of Computer Vision"},{"key":"1066_CR4","doi-asserted-by":"publisher","first-page":"561","DOI":"10.1007\/978-3-319-46454-1_34","volume-title":"Computer Vision \u2013 ECCV 2016","author":"Federica Bogo","year":"2016","unstructured":"Bogo, F., Kanazawa, A., Lassner, C., Gehler, P., Romero, J., & Black, M.\u00a0J. (2016). Keep it SMPL: Automatic estimation of 3D human pose and shape from a single image. In ECCV."},{"key":"1066_CR5","doi-asserted-by":"crossref","unstructured":"Burenius, M., Sullivan, J., & Carlsson, S. (2013). 3D pictorial structures for multiple view articulated pose estimation. In CVPR.","DOI":"10.1109\/CVPR.2013.464"},{"key":"1066_CR6","doi-asserted-by":"crossref","unstructured":"Carreira, J., Agrawal, P., Fragkiadaki, K., & Malik, J. (2016). Human pose estimation with iterative error feedback. In CVPR.","DOI":"10.1109\/CVPR.2016.512"},{"key":"1066_CR7","doi-asserted-by":"crossref","unstructured":"Chen, W., Wang, H., Li, Y., Su, H., Wang, Z., Tu, C., et al. (2016). Synthesizing training images for boosting human 3D pose estimation. In 3DV.","DOI":"10.1109\/3DV.2016.58"},{"key":"1066_CR8","unstructured":"Chen, X., & Yuille, A.\u00a0L. (2014). Articulated pose estimation by a graphical model with image dependent pairwise relations. In NIPS."},{"key":"1066_CR9","doi-asserted-by":"crossref","unstructured":"Cortes, C., Mohri, M., & Weston, J. (2005). A general regression technique for learning transductions. In ICML.","DOI":"10.1145\/1102351.1102371"},{"key":"1066_CR10","doi-asserted-by":"crossref","unstructured":"Donahue, J., Hendricks, L.\u00a0A., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., et al. (2015). Long-term recurrent convolutional networks for visual recognition and description. In CVPR.","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"1066_CR11","doi-asserted-by":"publisher","first-page":"167","DOI":"10.1007\/978-3-642-33786-4_13","volume-title":"Computer Vision \u2013 ECCV 2012","author":"Ming Du","year":"2012","unstructured":"Du, M., & Chellappa, R. (2012). Face association across unconstrained video frames using conditional random fields. In ECCV."},{"key":"1066_CR12","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1007\/978-3-319-46493-0_2","volume-title":"Computer Vision \u2013 ECCV 2016","author":"Yu Du","year":"2016","unstructured":"Du, Y., Wong, Y., Liu, Y., Han, F., Gui, Y., Wang, Z., et al. (2016). Marker-less 3D human motion capture with monocular image sequence and height-maps. In ECCV."},{"key":"1066_CR13","doi-asserted-by":"crossref","unstructured":"Elhayek, A., Aguiar, E., Jain, A., Tompson, J., Pishchulin, L., Andriluka, M., et al. (2015). Efficient convnet-based marker-less motion capture in general scenes with a low number of cameras. In CVPR.","DOI":"10.1109\/CVPR.2015.7299005"},{"key":"1066_CR14","doi-asserted-by":"crossref","unstructured":"Fragkiadaki, K., Levine, S., Felsen, P., & Malik, J. (2015). Recurrent network models for human dynamics. In ICCV.","DOI":"10.1109\/ICCV.2015.494"},{"key":"1066_CR15","doi-asserted-by":"publisher","first-page":"728","DOI":"10.1007\/978-3-319-46493-0_44","volume-title":"Computer Vision \u2013 ECCV 2016","author":"Georgia Gkioxari","year":"2016","unstructured":"Gkioxari, G., Toshev, A., & Jaitly, N. (2016). Chained predictions using convolutional neural networks. In ECCV."},{"key":"1066_CR16","unstructured":"Glorot, X., Bordes, A., & Bengio, Y. (2011). Deep sparse rectifier neural networks. In AISTATS."},{"key":"1066_CR17","doi-asserted-by":"crossref","unstructured":"Graves, A., Fernandez, S., & Schmidhuber, J. (2005). Bidirectional LSTM networks for improved phoneme classification and recognition. In ICANN.","DOI":"10.1007\/11550907_126"},{"key":"1066_CR18","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In CVPR, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"1066_CR19","doi-asserted-by":"publisher","first-page":"504","DOI":"10.1126\/science.1127647","volume":"313","author":"G Hinton","year":"2006","unstructured":"Hinton, G., & Salakutdinov, R. (2006). Reducing the dimensionality of data with neural networks. Science, 313, 504\u2013507.","journal-title":"Science"},{"issue":"8","key":"1066_CR20","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735\u20131780.","journal-title":"Neural Computation"},{"key":"1066_CR21","doi-asserted-by":"publisher","first-page":"5659","DOI":"10.1109\/TIP.2015.2487860","volume":"24","author":"C Hong","year":"2014","unstructured":"Hong, C., Yu, J., Wan, J., Tao, D., & Wang, M. (2014). Multimodal deep autoencoder for human pose recovery. IEEE Transactions on Image Processing, 24, 5659\u20135670.","journal-title":"IEEE Transactions on Image Processing"},{"key":"1066_CR22","doi-asserted-by":"crossref","unstructured":"Ionescu, C., Li, F., & Sminchisescu, C. (2011). Latent structured models for human pose estimation. In ICCV.","DOI":"10.1109\/ICCV.2011.6126500"},{"issue":"7","key":"1066_CR23","doi-asserted-by":"publisher","first-page":"1325","DOI":"10.1109\/TPAMI.2013.248","volume":"36","author":"Catalin Ionescu","year":"2014","unstructured":"Ionescu, C., Papava, I., Olaru, V., & Sminchisescu, C. (2014). Human3.6M: Large scale datasets and predictive methods for 3D human sensing in natural environments. PAMI.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1066_CR24","unstructured":"Jain, A., Tompson, J., Andriluka, M., Taylor, G.\u00a0W., & Bregler, C. (2014). Learning human pose estimation features with convolutional networks. In ICLR."},{"key":"1066_CR25","doi-asserted-by":"crossref","unstructured":"Jain, A., Zamir, A., Savarese, S., & Saxena, A. (2016). Structural-RNN: Deep learning on spatio-temporal graphs. In CVPR.","DOI":"10.1109\/CVPR.2016.573"},{"key":"1066_CR26","doi-asserted-by":"crossref","unstructured":"Johnson, J., Karpathy, A., & Fei-fei, L. (2016). Densecap: Fully convolutional localization networks for dense captioning. In CVPR.","DOI":"10.1109\/CVPR.2016.494"},{"key":"1066_CR27","doi-asserted-by":"crossref","unstructured":"Johnson, S., & Everingham, M. (2010). Clustered pose and nonlinear appearance models for human pose estimation. In BMVC.","DOI":"10.5244\/C.24.12"},{"key":"1066_CR28","unstructured":"Kingma, D.\u00a0P., & Welling, M. (2014). Auto-encoding variational bayes. In ICLR."},{"key":"1066_CR29","unstructured":"Kingma, D. P., & Ba, J. (2015). Adam: A method for stochastic optimisation. In ICLR."},{"key":"1066_CR30","doi-asserted-by":"crossref","unstructured":"Kombrink, S., Mikolov, T., Karafiat, M., & Burget, L. (2011). Recurrent neural network based language modeling in meeting recognition. In INTERSPEECH.","DOI":"10.21437\/Interspeech.2011-720"},{"key":"1066_CR31","unstructured":"Konda, K., Memisevic, R., & Krueger, D. (2015). Zero-bias autoencoders and the benefits of co-adapting features. In ICLR."},{"key":"1066_CR32","unstructured":"Li, S., & Chan, A. B. (2014). 3D human pose estimation from monocular images with deep convolutional neural network. In ACCV."},{"key":"1066_CR33","doi-asserted-by":"crossref","unstructured":"Li, S., Zhang, W., & Chan, A.\u00a0B. (2015). Maximum-margin structured learning with deep networks for 3D human pose estimation. In ICCV.","DOI":"10.1109\/ICCV.2015.326"},{"key":"1066_CR34","unstructured":"Li, S., Zhang, W., Chan, A.\u00a0B. (2016). Maximum-margin structured learning with deep networks for 3D human pose estimation. In IJCV."},{"key":"1066_CR35","doi-asserted-by":"crossref","unstructured":"Liang, M., & Hu, X. (2015). Recurrent convolutional neural network for object recognition. In CVPR.","DOI":"10.1109\/CVPR.2015.7298958"},{"key":"1066_CR36","first-page":"2579","volume":"9","author":"LVD Maaten","year":"2008","unstructured":"Maaten, L. V. D., & Hinton, G. E. (2008). Visualizing high dimensional data using t-SNE. Journal of Machine Learning Research, 9, 2579\u20132605.","journal-title":"Journal of Machine Learning Research"},{"key":"1066_CR37","doi-asserted-by":"crossref","unstructured":"Mehta, D., Rhodin, H., Casas, D., Fua, P., Sotnychenko, O., Xu, W., et al. (2017). Monocular 3D human pose estimation in the wild using improved CNN supervision. In International Conference on 3D Vision.","DOI":"10.1109\/3DV.2017.00064"},{"key":"1066_CR38","doi-asserted-by":"publisher","first-page":"483","DOI":"10.1007\/978-3-319-46484-8_29","volume-title":"Computer Vision \u2013 ECCV 2016","author":"Alejandro Newell","year":"2016","unstructured":"Newell, A., Yang, K., & Deng, J. (2016). Stacked hourglass networks for human pose estimation. In ECCV."},{"key":"1066_CR39","unstructured":"Oberweger, M., Wohlhart, P., & Lepetit, V. (2015). Hands deep in deep learning for hand pose estimation. arXiv Preprint, arXiv:abs\/1502.06807 ."},{"key":"1066_CR40","doi-asserted-by":"crossref","unstructured":"Park, S., Hwang, J., & Kwak, N. (2016) 3D human pose estimation using convolutional neural networks with 2D pose information. In ECCV Workshops.","DOI":"10.1007\/978-3-319-49409-8_15"},{"key":"1066_CR41","doi-asserted-by":"crossref","unstructured":"Pavlakos, G., Zhou, X., Derpanis, K.\u00a0G., & Daniilidis, K. (2017). Coarse-to-fine volumetric prediction for single-image 3D human pose. In CVPR.","DOI":"10.1109\/CVPR.2017.139"},{"key":"1066_CR42","doi-asserted-by":"crossref","unstructured":"Pfister, T., Charles, J., & Zisserman, A. (2015). Flowing convnets for human pose estimation in videos. In ICCV.","DOI":"10.1109\/ICCV.2015.222"},{"key":"1066_CR43","unstructured":"Pinheiro, P. O., & Collobert, R. (2014). Recurrent neural networks for scenel labelling. In ICML."},{"key":"1066_CR44","doi-asserted-by":"crossref","unstructured":"Pishchulin, L., Insafutdinov, E., Tang, S., Andres, B., Andriluka, M., Gehler, P., et al. (2016). Deepcut: Joint subset partition and labeling for multi person pose estimation. In CVPR.","DOI":"10.1109\/CVPR.2016.533"},{"key":"1066_CR45","doi-asserted-by":"crossref","unstructured":"Popa, A.-I., Zanfir, M., & Sminchisescu, C. (2017). Deep multitask architecture for integrated 2D and 3D human sensing. In CVPR.","DOI":"10.1109\/CVPR.2017.501"},{"key":"1066_CR46","doi-asserted-by":"publisher","first-page":"573","DOI":"10.1007\/978-3-642-33765-9_41","volume-title":"Computer Vision \u2013 ECCV 2012","author":"Varun Ramakrishna","year":"2012","unstructured":"Ramakrishna, V., Kanade, T., & Sheikh, Y. (2012). Reconstructing 3D human pose from 2D image landmarks. In ECCV."},{"key":"1066_CR47","unstructured":"Rifai, S., Vincent, P., Muller, X., Glorot, X., & Bengio, Y. (2011). Contractive auto-encoders: Explicit invariance during feature extraction. In ICML."},{"key":"1066_CR48","unstructured":"Rogez, G., & Schmid, C. (2016). Mocap guided data augmentation for 3D pose estimation in the wild. In NIPS."},{"key":"1066_CR49","unstructured":"Salzmann, M., & Urtasun, R. (2010). Implicitly constrained Gaussian process regression for monocular non-rigid pose estimation. In NIPS."},{"key":"1066_CR50","doi-asserted-by":"publisher","first-page":"566","DOI":"10.1007\/978-3-319-46484-8_34","volume-title":"Computer Vision \u2013 ECCV 2016","author":"Marta Sanzari","year":"2016","unstructured":"Sanzari, M., Ntouskos, V., & Pirri, F. (2016). Bayesian image based 3D pose estimation. In ECCV."},{"key":"1066_CR51","unstructured":"Sigal, L., & Black, M. J. (2006). Humaneva: Synchronized video and motion capture dataset for evaluation of articulated human motion. Technical report, Department of Computer Science, Brown University."},{"key":"1066_CR52","doi-asserted-by":"crossref","unstructured":"Simo-Serra, E., Quattoni, A., Torras, C., & Moreno-Noguer, F. (2013). A joint model for 2D and 3D pose estimation from a single image. In CVPR.","DOI":"10.1109\/CVPR.2013.466"},{"key":"1066_CR53","unstructured":"Sutskever, I., Hinton, G.\u00a0E., & Taylor, G.\u00a0W. (2011). Generating text with recurrent neural networks. In ICML."},{"key":"1066_CR54","doi-asserted-by":"crossref","unstructured":"Tekin, B., Katircioglu, I., Salzmann, M., Lepetit, V., & Fua, P. (2016). Structured prediction of 3D human pose with deep neural networks. In BMVC.","DOI":"10.5244\/C.30.130"},{"key":"1066_CR55","doi-asserted-by":"crossref","unstructured":"Tekin, B., Rozantsev, A., Lepetit, V., & Fua, P. (2016). Direct prediction of 3D body poses from motion compensated sequences. In CVPR, pp. 991\u20131000.","DOI":"10.1109\/CVPR.2016.113"},{"key":"1066_CR56","unstructured":"Tome, D., Russell, C., & Agapito, L. (2017). Lifting from the deep: Convolutional 3D pose estimation from a single image. arXiv preprint, arXiv:1701.00295 ."},{"key":"1066_CR57","unstructured":"Tompson, J., Jain, A., LeCun, Y., & Bregler, C. (2014). Joint training of a convolutional network and a graphical model for human pose estimation. In NIPS."},{"key":"1066_CR58","doi-asserted-by":"crossref","unstructured":"Toshev, A., & Szegedy, C. (2014). Deeppose: Human pose estimation via deep neural networks. In CVPR.","DOI":"10.1109\/CVPR.2014.214"},{"key":"1066_CR59","doi-asserted-by":"crossref","unstructured":"Vincent, P., Larochelle, H., Bengio, Y., & Manzagol, P.-A. (2008). Extracting and composing robust features with denoising autoencoders. In ICML.","DOI":"10.1145\/1390156.1390294"},{"key":"1066_CR60","first-page":"3371","volume":"11","author":"P Vincent","year":"2010","unstructured":"Vincent, P., Larochelle, H., Lajoie, I., Bengio, Y., & Manzagol, P.-A. (2010). Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion. Journal of Machine Learning Research, 11, 3371\u20133408.","journal-title":"Journal of Machine Learning Research"},{"key":"1066_CR61","doi-asserted-by":"crossref","unstructured":"Wei, S.\u00a0E., Ramakrishna, V., Kanade, T., & Sheikh, Y. (2016). Convolutional pose machines. In CVPR.","DOI":"10.1109\/CVPR.2016.511"},{"key":"1066_CR62","doi-asserted-by":"publisher","first-page":"635","DOI":"10.1007\/978-3-642-15558-1_46","volume-title":"Computer Vision \u2013 ECCV 2010","author":"Daniel Weinland","year":"2010","unstructured":"Weinland, D., Ozuysal, M., & Fua, P. (2010). Making action recognition robust to occlusions and viewpoint changes. In ECCV, pp. 635\u2013648."},{"key":"1066_CR63","doi-asserted-by":"crossref","unstructured":"Yang, Y., & Ramanan, D. (2011). Articulated pose estimation with flexible mixtures-of-parts. In CVPR.","DOI":"10.1109\/CVPR.2011.5995741"},{"key":"1066_CR64","doi-asserted-by":"crossref","unstructured":"Yasin, H., Iqbal, U., Kruger, B., Weber, A., & Gall, J. (2016). A dual-source approach for 3D pose estimation from a single image. In CVPR.","DOI":"10.1109\/CVPR.2016.535"},{"key":"1066_CR65","doi-asserted-by":"crossref","unstructured":"Zhou, X., Sun, X., Zhang, W., Liang, S., & Wei, Y. (2016). Deep kinematic pose regression. In ECCV Workshops.","DOI":"10.1007\/978-3-319-49409-8_17"},{"key":"1066_CR66","doi-asserted-by":"crossref","unstructured":"Zhou, X., Zhu, M., Leonardos, S., Derpanis, K., & Daniilidis, K. (2016). Sparseness meets deepness: 3D human pose estimation from monocular video. In CVPR.","DOI":"10.1109\/CVPR.2016.537"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-018-1066-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-018-1066-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-018-1066-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,13]],"date-time":"2022-08-13T16:29:27Z","timestamp":1660408167000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-018-1066-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,1,31]]},"references-count":66,"journal-issue":{"issue":"12","published-print":{"date-parts":[[2018,12]]}},"alternative-id":["1066"],"URL":"https:\/\/doi.org\/10.1007\/s11263-018-1066-6","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,1,31]]},"assertion":[{"value":"1 February 2017","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 January 2018","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 January 2018","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}