{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T19:22:53Z","timestamp":1776885773456,"version":"3.51.2"},"reference-count":73,"publisher":"Springer Science and Business Media LLC","issue":"11","license":[{"start":{"date-parts":[[2018,4,12]],"date-time":"2018-04-12T00:00:00Z","timestamp":1523491200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,4,12]],"date-time":"2018-04-12T00:00:00Z","timestamp":1523491200000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["0954083"],"award-info":[{"award-number":["0954083"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000006","name":"Office of Naval Research","doi-asserted-by":"publisher","award":["N00014-10-1-0933"],"award-info":[{"award-number":["N00014-10-1-0933"]}],"id":[{"id":"10.13039\/100000006","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100002418","name":"Intel Corporation","doi-asserted-by":"publisher","award":["Science and Technology Center - Visual Computing"],"award-info":[{"award-number":["Science and Technology Center - Visual Computing"]}],"id":[{"id":"10.13039\/100002418","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100000780","name":"European Commission","doi-asserted-by":"publisher","award":["Marie Curie IOF grant \u201cEgovision4Health\u201d (PIOF-GA-2012- 328288)"],"award-info":[{"award-number":["Marie Curie IOF grant \u201cEgovision4Health\u201d (PIOF-GA-2012- 328288)"]}],"id":[{"id":"10.13039\/501100000780","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2018,11]]},"DOI":"10.1007\/s11263-018-1081-7","type":"journal-article","created":{"date-parts":[[2018,4,12]],"date-time":"2018-04-12T15:09:55Z","timestamp":1523545795000},"page":"1180-1198","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":57,"title":["Depth-Based Hand Pose Estimation: Methods, Data, and Challenges"],"prefix":"10.1007","volume":"126","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1631-682X","authenticated-orcid":false,"suffix":"III","given":"James Steven","family":"Supan\u010di\u010d","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gr\u00e9gory","family":"Rogez","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jamie","family":"Shotton","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Deva","family":"Ramanan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,4,12]]},"reference":[{"key":"1081_CR1","doi-asserted-by":"crossref","unstructured":"Ballan, L., Taneja, A., Gall, J., Gool, L. J.\u00a0V., & Pollefeys, M. (2012). Motion capture of hands in action using discriminative salient points. In ECCV (6).","DOI":"10.1007\/978-3-642-33783-3_46"},{"key":"1081_CR2","unstructured":"Bray, M., Koller-Meier, E., M\u00fcller, P., Van\u00a0Gool, L., & Schraudolph, N.\u00a0N. (2004). 3D hand tracking by rapid stochastic gradient descent using a skinning model. In 1st European conference on visual media production (CVMP)."},{"key":"1081_CR3","doi-asserted-by":"crossref","unstructured":"Bullock, I. M., Member, S., Zheng, J. Z., Rosa, S. D. L., Guertler, C., & Dollar, A. M. (2013). IEEE transactions on grasp frequency and usage in daily household and machine shop tasks, Haptics.","DOI":"10.1109\/TOH.2013.6"},{"key":"1081_CR4","doi-asserted-by":"crossref","unstructured":"Camplani, M., & Salgado, L. (2012). Efficient spatio-temporal hole filling strategy for kinect depth maps. In Proceedings of SPIE.","DOI":"10.1117\/12.911909"},{"key":"1081_CR5","doi-asserted-by":"crossref","unstructured":"Castellini, C., Tommasi, T., Noceti, N., Odone, F., & Caputo, B. (2011). Using object affordances to improve object recognition. In IEEE transactions on autonomous mental development.","DOI":"10.1109\/TAMD.2011.2106782"},{"key":"1081_CR6","doi-asserted-by":"crossref","unstructured":"Choi, C., Sinha, A., Hee\u00a0Choi, J., Jang, S., & Ramani, K. (2015). A collaborative filtering approach to real-time hand pose estimation. In Proceedings of the IEEE international conference on computer vision (pp. 2336\u20132344).","DOI":"10.1109\/ICCV.2015.269"},{"key":"1081_CR7","first-page":"2205","volume":"13","author":"H Cooper","year":"2012","unstructured":"Cooper, H. (2012). Sign language recognition using sub-units. The Journal of Machine Learning Research, 13, 2205.","journal-title":"The Journal of Machine Learning Research"},{"key":"1081_CR8","doi-asserted-by":"publisher","first-page":"328","DOI":"10.1006\/cviu.2000.0892","volume":"81","author":"Q Delamarre","year":"2001","unstructured":"Delamarre, Q., & Faugeras, O. (2001). 3D articulated models and multiview tracking with physical forces. Computer Vision and Image Understanding., 81, 328.","journal-title":"Computer Vision and Image Understanding."},{"key":"1081_CR9","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., & Fei-Fei, L. (2009). Imagenet: A large-scale hierarchical image database. In Computer vision and pattern recognition (CVPR). IEEE.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1081_CR10","doi-asserted-by":"crossref","unstructured":"Dollar, P., Wojek, C., Schiele, B., & Perona, P. (2012). Pedestrian detection: An evaluation of the state of the art. In IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2011.155"},{"key":"1081_CR11","doi-asserted-by":"publisher","first-page":"52","DOI":"10.1016\/j.cviu.2006.10.012","volume":"108","author":"A Erol","year":"2007","unstructured":"Erol, A., Bebis, G., Nicolescu, M., Boyle, R. D., & Twombly, X. (2007). Vision-based hand pose estimation: A review. Computer Vision and Image Understanding., 108, 52.","journal-title":"Computer Vision and Image Understanding."},{"key":"1081_CR12","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","volume":"88","author":"M Everingham","year":"2010","unstructured":"Everingham, M., Van Gool, L., Williams, C. K., Winn, J., & Zisserman, A. (2010). The PASCAL visual object classes (VOC) challenge. International Journal of Computer Vision, 88, 303.","journal-title":"International Journal of Computer Vision"},{"key":"1081_CR13","doi-asserted-by":"crossref","unstructured":"Farabet, C., Couprie, C., Najman, L., & LeCun, Y. (2013). Learning hierarchical features for scene labeling. In IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2012.231"},{"key":"1081_CR14","doi-asserted-by":"crossref","unstructured":"Fathi, A., Ren, X., & Rehg, J.\u00a0M. (2011). Learning to recognize objects in egocentric activities. In 2011 IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3281\u20133288). IEEE.","DOI":"10.1109\/CVPR.2011.5995444"},{"key":"1081_CR15","doi-asserted-by":"publisher","first-page":"59","DOI":"10.1016\/j.cviu.2005.09.012","volume":"106","author":"L Fei-Fei","year":"2007","unstructured":"Fei-Fei, L., Fergus, R., & Perona, P. (2007). Learning generative visual models from few training examples: An incremental Bayesian approach tested on 101 object categories. Computer Vision and Image Understanding, 106, 59.","journal-title":"Computer Vision and Image Understanding"},{"key":"1081_CR16","doi-asserted-by":"crossref","unstructured":"Feix, T., Romero, J., Ek, C. H., Schmiedmayer, H., & Kragic, D. (2013). A metric for comparing the anthropomorphic motion capability of artificial hands. In IEEE transactions on robotics.","DOI":"10.1109\/TRO.2012.2217675"},{"key":"1081_CR17","doi-asserted-by":"crossref","unstructured":"Felzenszwalb, P. F., Girshick, R. B., McAllester, D., & Ramanan, D. (2010). Object detection with discriminatively trained part-based models. In IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2009.167"},{"key":"1081_CR18","doi-asserted-by":"publisher","first-page":"263","DOI":"10.1145\/325165.325244","volume":"19","author":"M Girard","year":"1985","unstructured":"Girard, M., & Maciejewski, A. A. (1985). Computational modeling for the computer animation of legged figures. ACM SIGGRAPH Computer Graphics, 19, 263.","journal-title":"ACM SIGGRAPH Computer Graphics"},{"key":"1081_CR19","doi-asserted-by":"crossref","unstructured":"Gupta, S., Girshick, R., Arbel\u00e1ez, P., & Malik, J. (2014). Learning rich features from RGB-D images for object detection and segmentation. In European conference on computer vision (ECCV). Springer.","DOI":"10.1007\/978-3-319-10584-0_23"},{"key":"1081_CR20","unstructured":"Intel. (2013). Perceptual computing SDK."},{"key":"1081_CR21","doi-asserted-by":"crossref","unstructured":"Janoch, A., Karayev, S., Jia, Y., Barron, J. T., Fritz, M., Saenko, K., et al. (2013). A category-level 3d object dataset: Putting the kinect to work. In Consumer depth cameras for computer vision. Springer, London","DOI":"10.1007\/978-1-4471-4640-7_8"},{"key":"1081_CR22","doi-asserted-by":"crossref","unstructured":"Keskin, C., K\u0131ra\u00e7, F., Kara, Y.\u00a0E., & Akarun, L. (2012). Hand pose estimation and hand shape classification using multi-layered randomized decision forests. In European conference on computer vision (ECCV).","DOI":"10.1007\/978-3-642-33783-3_61"},{"key":"1081_CR23","doi-asserted-by":"crossref","unstructured":"Khamis, S., Taylor, J., Shotton, J., Keskin, C., Izadi, S., & Fitzgibbon, A. (2015). Learning an efficient model of hand shape variation from depth images. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 2540\u20132548).","DOI":"10.1109\/CVPR.2015.7298869"},{"key":"1081_CR24","doi-asserted-by":"crossref","unstructured":"Li, C., & Kitani, K.\u00a0M. (2013). Pixel-level hand detection in ego-centric videos. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2013.458"},{"key":"1081_CR25","doi-asserted-by":"crossref","unstructured":"Li, P., Ling, H., Li, X., & Liao, C. (2015). 3d hand pose estimation using randomized decision forest with segmentation index points. In Proceedings of the IEEE international conference on computer vision (pp. 819\u2013827).","DOI":"10.1109\/ICCV.2015.100"},{"key":"1081_CR26","doi-asserted-by":"crossref","unstructured":"Martin, D. R., Fowlkes, C. C., & Malik, J. (2004). Learning to detect natural image boundaries using local brightness, color, and texture cues. in IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2004.1273918"},{"key":"1081_CR27","doi-asserted-by":"crossref","unstructured":"Melax, S., Keselman, L., & Orsten, S. (2013). Dynamics based 3D skeletal hand tracking. In Proceedings of the ACM SIGGRAPH symposium on interactive 3D graphics and games-I3D \u201913.","DOI":"10.1145\/2448196.2448232"},{"key":"1081_CR28","unstructured":"Mo, Z., & Neumann, U. (2006). Real-time hand pose recognition using low-resolution depth images. In 2006 IEEE computer society conference on computer vision and pattern recognition (vol. 2, pp. 1499\u20131505). IEEE."},{"key":"1081_CR29","doi-asserted-by":"crossref","unstructured":"Moore, A. W., Connolly, A. J., Genovese, C., Gray, A., Grone, L., & Kanidoris, N, I. I., et al. (2001). Fast algorithms and efficient statistics: N-point correlation functions. In Mining the Sky. Springer.","DOI":"10.1007\/10849171_5"},{"key":"1081_CR30","doi-asserted-by":"crossref","unstructured":"Muja, M., & Lowe, D. G. (2014). Scalable nearest neighbor algorithms for high dimensional data. In IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2014.2321376"},{"key":"1081_CR31","doi-asserted-by":"crossref","unstructured":"Oberweger, M., Riegler, G., Wohlhart, P., & Lepetit, V. (2016). Efficiently creating 3d training data for fine hand pose estimation. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4957\u20134965).","DOI":"10.1109\/CVPR.2016.536"},{"key":"1081_CR32","unstructured":"Oberweger, M., Wohlhart, P., & Lepetit, V. (2015a). Hands deep in deep learning for hand pose estimation. In Computer vision winter workshop (CVWW)."},{"key":"1081_CR33","doi-asserted-by":"crossref","unstructured":"Oberweger, M., Wohlhart, P., & Lepetit, V. (2015b). Training a feedback loop for hand pose estimation. In Proceedings of the IEEE international conference on computer vision (pp. 3316\u20133324).","DOI":"10.1109\/ICCV.2015.379"},{"key":"1081_CR34","doi-asserted-by":"crossref","unstructured":"Ohn-Bar, E., & Trivedi, M. M. (2014a). Hand gesture recognition in real time for automotive interfaces: A multimodal vision-based approach and evaluations. In IEEE transactions on intelligent transportation systems.","DOI":"10.1109\/TITS.2014.2337331"},{"issue":"6","key":"1081_CR35","doi-asserted-by":"publisher","first-page":"2368","DOI":"10.1109\/TITS.2014.2337331","volume":"15","author":"E Ohn-Bar","year":"2014","unstructured":"Ohn-Bar, E., & Trivedi, M. M. (2014b). Hand gesture recognition in real time for automotive interfaces: A multimodal vision-based approach and evaluations. IEEE Transactions on Intelligent Transportation Systems, 15(6), 2368\u20132377.","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"1081_CR36","doi-asserted-by":"crossref","unstructured":"Oikonomidis, I., Kyriazis, N., & Argyros, A. (2011). Efficient model-based 3D tracking of hand articulations using kinect. In British machine vision conference (BMVC).","DOI":"10.5244\/C.25.101"},{"key":"1081_CR37","doi-asserted-by":"crossref","unstructured":"Pang, Y., & Ling, H. (2013). Finding the best from the second bests-inhibiting subjective bias in evaluation of visual tracking algorithms. In International conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2013.346"},{"key":"1081_CR38","doi-asserted-by":"crossref","unstructured":"Pieropan, A., Salvi, G., Pauwels, K., & Kjellstrom, H. (2014). Audio-visual classification and detection of human manipulation actions. In International conference on intelligent robots and systems (IROS).","DOI":"10.1109\/IROS.2014.6942983"},{"key":"1081_CR39","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-14831-6_51","volume-title":"Human computer interaction using hand gestures","author":"P Premaratne","year":"2010","unstructured":"Premaratne, P., Nguyen, Q., & Premaratne, M. (2010). Human computer interaction using hand gestures. Berlin: Springer."},{"key":"1081_CR40","unstructured":"PrimeSense. (2013). Nite2 middleware, Version 2.2."},{"key":"1081_CR41","doi-asserted-by":"crossref","unstructured":"Qian, C., Sun, X., Wei, Y., Tang, X., & Sun, J. (2014). Realtime and robust hand tracking from depth. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2014.145"},{"key":"1081_CR42","doi-asserted-by":"crossref","unstructured":"Ren, Z., Yuan, J., & Zhang, Z. (2011). Robust hand gesture recognition based on finger-earth mover\u2019s distance with a commodity depth camera. In Proceedings of the 19th ACM international conference on Multimedia. ACM.","DOI":"10.1145\/2072298.2071946"},{"key":"1081_CR43","unstructured":"Rogez, G., Khademi, M., Supancic, III, J., Montiel, J. M.\u00a0M., & Ramanan, D. (2014). 3D hand pose detection in egocentric RGB-D images. CDC4CV workshop, European conference on computer vision (ECCV)."},{"key":"1081_CR44","doi-asserted-by":"crossref","unstructured":"Rogez, G., Supancic, III, J., & Ramanan, D. (2015a). First-person pose recognition using egocentric workspaces. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2015.7299061"},{"key":"1081_CR45","doi-asserted-by":"crossref","unstructured":"Rogez, G., Supancic, J.\u00a0S., & Ramanan, D. (2015b). Understanding everyday hands in action from RGB-D images. In Proceedings of the IEEE international conference on computer vision (pp. 3889\u20133897).","DOI":"10.1109\/ICCV.2015.443"},{"key":"1081_CR46","doi-asserted-by":"crossref","unstructured":"Romero, J., Kjellstr, H., & Kragic, D. (2009). Monocular real-time 3D articulated hand pose estimation. In International conference on humanoid robots.","DOI":"10.1109\/ICHR.2009.5379596"},{"key":"1081_CR47","unstructured":"Russakovsky, O., Deng, J., Huang, Z., Berg, A.\u00a0C., & Fei-Fei, L. (2013). Detecting avocados to zucchinis: What have we done, and where are we going? In International conference on computer vision (ICCV). IEEE."},{"key":"1081_CR48","unstructured":"\u0160ari\u0107, M. (2011). Libhand: A library for hand articulation, Version 0.9."},{"key":"1081_CR49","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1023\/A:1014573219977","volume":"47","author":"D Scharstein","year":"2002","unstructured":"Scharstein, D. (2002). A taxonomy and evaluation of dense two-frame stereo. International Journal of Computer Vision, 47, 7.","journal-title":"International Journal of Computer Vision"},{"key":"1081_CR50","doi-asserted-by":"crossref","unstructured":"Shakhnarovich, G., Viola, P., & Darrell, T. (2003). Fast pose estimation with parameter-sensitive hashing. In International conference on computer vision (ICCV). IEEE.","DOI":"10.1109\/ICCV.2003.1238424"},{"key":"1081_CR51","doi-asserted-by":"crossref","unstructured":"Sharp, T., Keskin, C., Robertson, D., Taylor, J., Shotton, J., Kim, D., Rhemann, C., Leichter, I., Vinnikov, A., Wei, Y., Freedman, D., Kohli, P., Krupka, E., Fitzgibbon, A., & Izadi, S. (2015). Accurate, robust, and flexible real-time hand tracking. In ACM conference on computer\u2013human interaction.","DOI":"10.1145\/2702123.2702179"},{"key":"1081_CR52","doi-asserted-by":"publisher","first-page":"116","DOI":"10.1145\/2398356.2398381","volume":"56","author":"J Shotton","year":"2013","unstructured":"Shotton, J., Sharp, T., Kipman, A., Fitzgibbon, A., Finocchio, M., Blake, A., et al. (2013). Real-time human pose recognition in parts from single depth images. Communications of the ACM., 56, 116.","journal-title":"Communications of the ACM."},{"key":"1081_CR53","doi-asserted-by":"crossref","unstructured":"Song, S., & Xiao, J. (2014). Sliding shapes for 3D object detection in depth images. In European conference on computer vision (ECCV).","DOI":"10.1007\/978-3-319-10599-4_41"},{"key":"1081_CR54","doi-asserted-by":"crossref","unstructured":"Sridhar, S., Mueller, F., Oulasvirta, A., & Theobalt, C. (2015). Fast and robust hand tracking using detection-guided optimization. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2015.7298941"},{"key":"1081_CR55","doi-asserted-by":"crossref","unstructured":"Sridhar, S., Oulasvirta, A., & Theobalt, C. (2013). Interactive markerless articulated hand motion tracking using RGB and depth data. In International conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2013.305"},{"key":"1081_CR56","doi-asserted-by":"crossref","unstructured":"Stenger, B., Thayananthan, A., Torr, P. H. S., & Cipolla, R. (2006). Model-based hand tracking using a hierarchical Bayesian filter. In IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2006.189"},{"key":"1081_CR57","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1093\/deafed\/eni001","volume":"10","author":"WC Stokoe","year":"2005","unstructured":"Stokoe, W. C. (2005). Sign language structure: An outline of the visual communication systems of the American deaf. Journal of Deaf Studies and Deaf Education, 10, 3.","journal-title":"Journal of Deaf Studies and Deaf Education"},{"key":"1081_CR58","doi-asserted-by":"crossref","unstructured":"Sun, X., Wei, Y., Liang, S., Tang, X., & Sun, J. (2015). Cascaded hand pose regression. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 824\u2013832).","DOI":"10.1109\/CVPR.2015.7298683"},{"key":"1081_CR59","doi-asserted-by":"crossref","unstructured":"Tang, D., Chang, H.\u00a0J., Tejani, A., & Kim, T.-K. (2014). Latent regression forest: Structured estimation of 3D articulated hand posture. In Computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2014.490"},{"key":"1081_CR60","doi-asserted-by":"crossref","unstructured":"Tang, D., Taylor, J., Kohli, P., Keskin, C., Kim, T.-K., & Shotton, J. (2015). Opening the black box: Hierarchical sampling optimization for estimating human hand pose. In Proceedings of the IEEE international conference on computer vision (pp. 3325\u20133333).","DOI":"10.1109\/ICCV.2015.380"},{"key":"1081_CR61","doi-asserted-by":"crossref","unstructured":"Tang, D.,\u00a0Yu, T.H. & Kim, T.-K. (2013). Real-time articulated hand pose estimation using semi-supervised transductive regression forests. In International conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2013.400"},{"key":"1081_CR62","doi-asserted-by":"crossref","unstructured":"Taylor, J., Stebbing, R., Ramakrishna, V., Keskin, C., Shotton, J., & Izadi, S., et al. (2014). User-specific hand modeling from monocular depth sequences. In Computer vision and pattern recognition (CVPR). IEEE.","DOI":"10.1109\/CVPR.2014.88"},{"issue":"4","key":"1081_CR63","doi-asserted-by":"publisher","first-page":"143","DOI":"10.1145\/2897824.2925965","volume":"35","author":"J Taylor","year":"2016","unstructured":"Taylor, J., Bordeaux, L., Cashman, T., Corish, B., Keskin, C., Sharp, T., et al. (2016). Efficient and precise interactive hand tracking through joint, continuous optimization of pose and correspondences. ACM Transactions on Graphics (TOG), 35(4), 143.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"1081_CR64","doi-asserted-by":"crossref","unstructured":"Tompson, J., Stein, M., Lecun, Y., & Perlin, K. (2014). Real-time continuous pose recovery of human hands using convolutional networks. In ACM Transactions on Graphics.","DOI":"10.1145\/2629500"},{"key":"1081_CR65","doi-asserted-by":"crossref","unstructured":"Torralba, A., & Efros, A. A. (2011). Unbiased look at dataset bias. In Computer vision and pattern recognition (CVPR). IEEE.","DOI":"10.1109\/CVPR.2011.5995347"},{"key":"1081_CR66","doi-asserted-by":"crossref","unstructured":"Tzionas, D., Srikantha, A., Aponte, P., & Gall, J. (2014). Capturing hand motion with an RGB-D sensor, fusing a generative model with salient points. In German Conference on Pattern Recognition (GCPR). Lecture notes in computer science. Springer.","DOI":"10.1007\/978-3-319-11752-2_22"},{"key":"1081_CR67","unstructured":"Vezhnevets, V., Sazonov, V., & Andreeva, A. (2003). A survey on pixel-based skin color detection techniques. In Proceedings of the Graphicon, Moscow, Russia."},{"key":"1081_CR68","doi-asserted-by":"crossref","unstructured":"Wan, C., Yao, A., & Van\u00a0Gool, L. (2016). Hand pose estimation from local surface normals. In European conference on computer vision (pp. 554\u2013569). Springer.","DOI":"10.1007\/978-3-319-46487-9_34"},{"key":"1081_CR69","doi-asserted-by":"crossref","unstructured":"Wetzler, A., Slossberg, R., & Kimmel, R. (2015). Rule of thumb: Deep derotation for improved fingertip detection. In British machine vision conference (BMVC). BMVA Press.","DOI":"10.5244\/C.29.33"},{"key":"1081_CR70","doi-asserted-by":"crossref","unstructured":"Xu, C., & Cheng, L. (2013). Efficient hand pose estimation from a single depth image. InInternational conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2013.429"},{"key":"1081_CR71","doi-asserted-by":"crossref","unstructured":"Yang, Y., & Ramanan, D. (2013). Articulated pose estimation with flexible mixtures-of-parts. In IEEE transactions on pattern analysis and machine intelligence.","DOI":"10.1109\/TPAMI.2012.261"},{"key":"1081_CR72","doi-asserted-by":"crossref","unstructured":"Ye, Q., Yuan, S., & Kim, T.-K. (2016). Spatial attention deep net with partial PSO for hierarchical hybrid hand pose estimation. In European conference on computer vision (pp. 346\u2013361). Springer.","DOI":"10.1007\/978-3-319-46484-8_21"},{"key":"1081_CR73","first-page":"5","volume":"3","author":"X Zhu","year":"2012","unstructured":"Zhu, X., Vondrick, C., Ramanan, D., & Fowlkes, C. (2012). Do we need more training data or better models for object detection? British Machine Vision Conference (BMVC), 3, 5.","journal-title":"British Machine Vision Conference (BMVC)"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-018-1081-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-018-1081-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-018-1081-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,5,17]],"date-time":"2020-05-17T07:21:26Z","timestamp":1589700086000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-018-1081-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,4,12]]},"references-count":73,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2018,11]]}},"alternative-id":["1081"],"URL":"https:\/\/doi.org\/10.1007\/s11263-018-1081-7","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,4,12]]},"assertion":[{"value":"3 December 2015","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 March 2018","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 April 2018","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}