{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T11:15:34Z","timestamp":1777547734143,"version":"3.51.4"},"reference-count":82,"publisher":"Springer Science and Business Media LLC","issue":"2-4","license":[{"start":{"date-parts":[[2017,2,20]],"date-time":"2017-02-20T00:00:00Z","timestamp":1487548800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2017,2,20]],"date-time":"2017-02-20T00:00:00Z","timestamp":1487548800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/100000083","name":"Directorate for Computer and Information Science and Engineering","doi-asserted-by":"publisher","award":["CNS 1544797"],"award-info":[{"award-number":["CNS 1544797"]}],"id":[{"id":"10.13039\/100000083","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100005717","name":"SBE Office of Multidisciplinary Activities","doi-asserted-by":"publisher","award":["SMA 1540917"],"award-info":[{"award-number":["SMA 1540917"]}],"id":[{"id":"10.13039\/100005717","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000185","name":"Defense Advanced Research Projects Agency","doi-asserted-by":"publisher","award":["W911NF-14-1-0384"],"award-info":[{"award-number":["W911NF-14-1-0384"]}],"id":[{"id":"10.13039\/100000185","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2018,4]]},"DOI":"10.1007\/s11263-017-0992-z","type":"journal-article","created":{"date-parts":[[2017,2,20]],"date-time":"2017-02-20T02:06:20Z","timestamp":1487556380000},"page":"358-374","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":32,"title":["Prediction of Manipulation Actions"],"prefix":"10.1007","volume":"126","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-2044-2386","authenticated-orcid":false,"given":"Cornelia","family":"Ferm\u00fcller","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fang","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yezhou","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Konstantinos","family":"Zampogiannis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Francisco","family":"Barranco","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Michael","family":"Pfeiffer","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,2,20]]},"reference":[{"issue":"12","key":"992_CR1","first-page":"2891","volume":"35","author":"Y Aloimonos","year":"2015","unstructured":"Aloimonos, Y., & Ferm\u00fcller, C. (2015). The cognitive dialogue: A new model for vision implementing common sense reasoning. Image and Vision Computing, 35(12), 2891\u20132903.","journal-title":"Image and Vision Computing"},{"issue":"1","key":"992_CR2","doi-asserted-by":"publisher","first-page":"111","DOI":"10.1007\/s00221-007-1136-4","volume":"185","author":"C Ansuini","year":"2008","unstructured":"Ansuini, C., Giosa, L., Turella, L., Alto\u00e9, G., & Castiello, U. (2008). An object for an action, the same object for other actions: Effects on hand shaping. Experimental Brain Research, 185(1), 111\u2013119.","journal-title":"Experimental Brain Research"},{"issue":"2","key":"992_CR3","doi-asserted-by":"publisher","first-page":"126","DOI":"10.1177\/1073858414533827","volume":"21","author":"C Ansuini","year":"2015","unstructured":"Ansuini, C., Cavallo, A., Bertone, C., & Becchio, C. (2015). Intentions in the brain: The unveiling of Mister Hyde. The Neuroscientist, 21(2), 126\u2013135.","journal-title":"The Neuroscientist"},{"issue":"5","key":"992_CR4","doi-asserted-by":"publisher","first-page":"469","DOI":"10.1016\/j.robot.2008.10.024","volume":"57","author":"BD Argall","year":"2009","unstructured":"Argall, B. D., Chernova, S., Veloso, M., & Browning, B. (2009). A survey of robot learning from demonstration. Robotics and Autonomous Systems, 57(5), 469\u2013483.","journal-title":"Robotics and Autonomous Systems"},{"key":"992_CR5","doi-asserted-by":"crossref","unstructured":"Aviles, A. I., Marban, A., Sobrevilla, P., Fernandez, J., & Casals, A. (2014). A recurrent neural network approach for 3d vision-based force estimation. In International conference on image processing theory, tools and applications (IPTA).","DOI":"10.1109\/IPTA.2014.7001941"},{"key":"992_CR6","unstructured":"Bradski, G. R. (1998). Computer vision face tracking for use in a perceptual user interface. Intel Technology Journal Q2."},{"key":"992_CR7","doi-asserted-by":"crossref","unstructured":"Bullock, I. M., Feix, T., & Dollar, A. M. (2015). The Yale human grasping data set: Grasp, object, and task data in household and machine shop environments. International Journal of Robotics Research. 34(3), 251\u2013255.","DOI":"10.1177\/0278364914555720"},{"key":"992_CR8","unstructured":"Cai, M., Kitani, K. M., & Sato, Y. (2015). A scalable approach for understanding the visual structures of hand grasps. In IEEE international conference on robotics and automation (ICRA), IEEE (pp. 1360\u20131366)."},{"key":"992_CR9","doi-asserted-by":"crossref","unstructured":"Comaniciu, D., Ramesh, V., & Meer, P. (2000). Real-time tracking of non-rigid objects using mean shift. In IEEE conference on computer vision and pattern recognition, IEEE (Vol. 2, pp. 142\u2013149).","DOI":"10.1109\/CVPR.2000.854761"},{"issue":"1","key":"992_CR10","doi-asserted-by":"publisher","first-page":"119","DOI":"10.1007\/s00221-011-2704-1","volume":"212","author":"C Craj\u00e9","year":"2011","unstructured":"Craj\u00e9, C., Lukos, J., Ansuini, C., Gordon, A., & Santello, M. (2011). The effects of task and content on digit placement on a bottle. Exp Brain Research, 212(1), 119\u2013124.","journal-title":"Exp Brain Research"},{"issue":"3","key":"992_CR11","doi-asserted-by":"publisher","first-page":"269","DOI":"10.1109\/70.34763","volume":"5","author":"MR Cutkosky","year":"1989","unstructured":"Cutkosky, M. R. (1989). On grasp choice, grasp models, and the design of hands for manufacturing tasks. IEEE Transactions on Robotics and Automation, 5(3), 269\u2013279.","journal-title":"IEEE Transactions on Robotics and Automation"},{"key":"992_CR12","doi-asserted-by":"crossref","unstructured":"Donahue, J., Anne\u00a0Hendricks, L., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., et al. (2015). Long-term recurrent convolutional networks for visual recognition and description. In IEEE conference on computer vision and pattern recognition (pp. 2625\u20132634).","DOI":"10.1109\/CVPR.2015.7298878"},{"issue":"Sup. 3","key":"992_CR13","doi-asserted-by":"publisher","first-page":"15624","DOI":"10.1073\/pnas.1103557108","volume":"108","author":"J Doyle","year":"2011","unstructured":"Doyle, J., & Csete, M. (2011). Architecture, constraints, and behavior. Proceedings of the National Academy of Sciences, 108(Sup. 3), 15624\u201315630.","journal-title":"Proceedings of the National Academy of Sciences"},{"issue":"1","key":"992_CR14","doi-asserted-by":"publisher","first-page":"52","DOI":"10.1016\/j.cviu.2006.10.012","volume":"108","author":"A Erol","year":"2007","unstructured":"Erol, A., Bebis, G., Nicolescu, M., Boyle, R. D., & Twombly, X. (2007). Vision-based hand pose estimation: A review. Computer Vision and Image Understanding, 108(1), 52\u201373.","journal-title":"Computer Vision and Image Understanding"},{"issue":"1","key":"992_CR15","first-page":"2617","volume":"14","author":"SR Fanello","year":"2013","unstructured":"Fanello, S. R., Gori, I., Metta, G., & Odone, F. (2013). Keep it simple and sparse: Real-time action recognition. The Journal of Machine Learning Research, 14(1), 2617\u20132640.","journal-title":"The Journal of Machine Learning Research"},{"key":"992_CR16","doi-asserted-by":"crossref","unstructured":"Fathi, A., Ren, X., & Rehg, J. M. (2011). Learning to recognize objects in egocentric activities. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 3281\u20133288).","DOI":"10.1109\/CVPR.2011.5995444"},{"key":"992_CR17","unstructured":"Feix, T., Pawlik, R., Schmiedmayer, H., Romero, J., & Kragic, D. (2009). A comprehensive grasp taxonomy. In Robotics, science and systems conference: Workshop on understanding the human hand for advancing robotic manipulation."},{"key":"992_CR18","unstructured":"Ferm\u00fcller, C. (2016). Prediction of manipulation actions. http:\/\/www.cfar.umd.edu\/~fer\/action-prediction\/ ."},{"key":"992_CR19","doi-asserted-by":"crossref","unstructured":"Fouhey, D. F., & Zitnick, C. (2014). Predicting object dynamics in scenes. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2014.260"},{"key":"992_CR20","unstructured":"Fragkiadaki, K., Levine, S., Felsen, P., & Malik, J. (2015). Recurrent network models for kinematic tracking. arXiv:1508.00271 ."},{"issue":"12","key":"992_CR21","doi-asserted-by":"publisher","first-page":"493","DOI":"10.1016\/S1364-6613(98)01262-5","volume":"2","author":"V Gallesse","year":"1998","unstructured":"Gallesse, V., & Goldman, A. (1998). Mirror neurons and the simulation theory of mind-reading. Trends in Cognitive Sciences, 2(12), 493\u2013501.","journal-title":"Trends in Cognitive Sciences"},{"key":"992_CR22","doi-asserted-by":"crossref","unstructured":"Gams, A., Do, M., Ude, A., Asfour, T., & Dillmann, R. (2010). On-line periodic movement and force-profile learning for adaptation to new surfaces. In IEEE International conference on robotics research (ICRA) (pp. 3192\u20133199).","DOI":"10.1109\/ICHR.2010.5686306"},{"key":"992_CR23","doi-asserted-by":"crossref","unstructured":"Graves, A., Mohamed, A. R., & Hinton, G. (2013). Speech recognition with deep recurrent neural networks. In IEEE international conference on acoustics, speech and signal processing (ICASSP) (pp. 6645\u20136649).","DOI":"10.1109\/ICASSP.2013.6638947"},{"issue":"3","key":"992_CR24","doi-asserted-by":"publisher","first-page":"290","DOI":"10.1109\/TPAMI.2004.1262305","volume":"26","author":"M Greminger","year":"2004","unstructured":"Greminger, M., & Nelson, B. (2004). Vision-based force measurement. IEEE Transactions on Pattern Analysis and Machine Intelligence, 26(3), 290\u2013298.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"2","key":"992_CR25","doi-asserted-by":"publisher","first-page":"191","DOI":"10.1007\/s11263-013-0683-3","volume":"107","author":"M Hoai","year":"2014","unstructured":"Hoai, M., & De la Torre, F. (2014). Max-margin early event detectors. International Journal of Computer Vision, 107(2), 191\u2013202.","journal-title":"International Journal of Computer Vision"},{"issue":"8","key":"992_CR26","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735\u20131780.","journal-title":"Neural Computation"},{"key":"992_CR27","doi-asserted-by":"crossref","unstructured":"Hoffman, J., Gupta, S., & Darrell, T. (2016) Learning with side information through modality hallucination. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.96"},{"key":"992_CR28","doi-asserted-by":"crossref","unstructured":"Ijina, E., & Mohan, S. (2014). Human action recognition based on recognition of linear patterns in action bank features using convolutional neural networks. In International conference on machine learning and applications.","DOI":"10.1109\/ICMLA.2014.33"},{"issue":"3","key":"992_CR29","doi-asserted-by":"publisher","first-page":"235","DOI":"10.1080\/00222895.1984.10735319","volume":"16","author":"M Jeannerod","year":"1984","unstructured":"Jeannerod, M. (1984). The timing of natural prehension movements. Journal of Motor Behavior, 16(3), 235\u2013254.","journal-title":"Journal of Motor Behavior"},{"key":"992_CR30","doi-asserted-by":"crossref","unstructured":"Joo, J., Li, W., Steen, F. F., & Zhu, S. C. (2014). Visual persuasion: Inferring communicative intents of images. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 216\u2013223).","DOI":"10.1109\/CVPR.2014.35"},{"key":"992_CR31","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., & Fei-Fei, L. (2014). Large-scale video classification with convolutional neural networks. In IEEE conference on computer vision and pattern recognition (CVPR) (pp. 1725\u20131732).","DOI":"10.1109\/CVPR.2014.223"},{"key":"992_CR32","unstructured":"Keskin, C., K\u0131ra\u00e7, F., Kara, Y. E., & Akarun, L. (2013). Real time hand pose estimation using depth sensors. In Consumer depth cameras for computer vision (pp. 119\u2013137). London: Springer."},{"key":"992_CR33","doi-asserted-by":"crossref","unstructured":"Kitani, K. M., Ziebart, B. D., Bagnell, J. A., & Hebert, M. (2012). Activity forecasting. In European conference on computer vision (ECCV).","DOI":"10.1007\/978-3-642-33765-9_15"},{"key":"992_CR34","first-page":"142","volume":"2","author":"J Kober","year":"2000","unstructured":"Kober, J., Gienger, M., & Steil, J. (2000). Learning movement primitives for force interaction tasks. IEEE Conference on Computer Vision and Pattern Recognition, 2, 142\u2013149.","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"992_CR35","doi-asserted-by":"crossref","unstructured":"Koppula, H., & Saxena, A. (2016). Anticipating human activities using object affordances for reactive robotic response. IEEE Transactions on pattern Analysis and Machine Intelligence, 38(1), 14\u201329.","DOI":"10.1109\/TPAMI.2015.2430335"},{"issue":"5","key":"992_CR36","doi-asserted-by":"publisher","first-page":"581","DOI":"10.1163\/016918611X558261","volume":"25","author":"P Kormushev","year":"2011","unstructured":"Kormushev, P., Calinon, S., & Caldwell, D. G. (2011). Imitation learning of positional and force skills demonstrated via kinesthetic teaching and haptic input. Advanced Robotics, 25(5), 581\u2013603.","journal-title":"Advanced Robotics"},{"key":"992_CR37","doi-asserted-by":"crossref","unstructured":"Lea, C., Reiter, A., Vidal, R., & Hager, G. D. (2016). Segmental spatiotemporal CNNS for fine-grained action segmentation. In European conference of computer vision (ECCV) (pp. 36\u201352).","DOI":"10.1007\/978-3-319-46487-9_3"},{"key":"992_CR38","doi-asserted-by":"crossref","unstructured":"Lenz, I., Lee, H., & Saxena, A. (2015) Deep learning for detecting robotic grasps. The International Journal of Robotics Research. 34(4\u20135), 705\u2013724.","DOI":"10.1177\/0278364914549607"},{"key":"992_CR39","doi-asserted-by":"crossref","unstructured":"Li, Y., Ferm\u00fcller, C., Aloimonos, Y., & Ji, H. (2010). Learning shift-invariant sparse representation of actions. In IEEE conference on computer vision and pattern recognition, San Francisco, CA, pp. 2630\u20132637.","DOI":"10.1109\/CVPR.2010.5539977"},{"key":"992_CR40","doi-asserted-by":"crossref","unstructured":"Liu, J., Feng, F., Nakamura, Y. C., & Pollard, N. S. (2014). A taxonomy of everyday grasps in action. In 14th IEEE-RAS international conference on humanoid robots, Humanoids.","DOI":"10.1109\/HUMANOIDS.2014.7041420"},{"key":"992_CR41","doi-asserted-by":"crossref","unstructured":"Lv, F., & Nevatia, R.(2006). Recognition and segmentation of 3-d human action using hmm and multi-class adaboost. In European conference on computer vision (ECCV) (pp. 359\u2013372). Springer.","DOI":"10.1007\/11744085_28"},{"key":"992_CR42","doi-asserted-by":"crossref","unstructured":"Ma, S., Sigal, L., & Sclaroff, S. (2016). Learning activity progression in LSTMS for activity detection and early detection. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2016.214"},{"key":"992_CR43","doi-asserted-by":"crossref","unstructured":"Mandary, C., Terlemez, O., Do, M., Vahrenkamp, N., & Asfour, T. (2015). The kit whole-body human motion database. In International conferences on advanced robotics (pp. 329\u2013336).","DOI":"10.1109\/ICAR.2015.7251476"},{"key":"992_CR44","doi-asserted-by":"crossref","unstructured":"Melax ,S., Keselman, L., & Orsten, S. (2013). Dynamics based 3d skeletal hand tracking. In Proceedings of graphics interface 2013, Canadian information processing society (pp. 63\u201370).","DOI":"10.1145\/2448196.2448232"},{"issue":"2","key":"992_CR45","doi-asserted-by":"publisher","first-page":"90","DOI":"10.1016\/j.cviu.2006.08.002","volume":"104","author":"T Moeslund","year":"2006","unstructured":"Moeslund, T., Hilton, A., & Kr\u00fcger, V. (2006). A survey of advances in vision-based human motion capture and analysis. Computer Vision and Image Understanding, 104(2), 90\u2013126.","journal-title":"Computer Vision and Image Understanding"},{"key":"992_CR46","doi-asserted-by":"crossref","unstructured":"Molchanov, P., Gupta, S., Kim. K., & Kautz, J. (2015). Hand gesture recognition with 3d convolutional neural networks. In IEEE conference on computer vision and pattern recognition workshops (pp. 1\u20137).","DOI":"10.1109\/CVPRW.2015.7301342"},{"key":"992_CR47","unstructured":"Ng, J. Y. H., Hausknecht, M., Vijayanarasimhan, S., Vinyals, O., Monga. R., & Toderici, G. (2015). Beyond short snippets: Deep networks for video classification. In CVPR 2015."},{"issue":"6","key":"992_CR48","doi-asserted-by":"publisher","first-page":"2368","DOI":"10.1109\/TITS.2014.2337331","volume":"15","author":"E Ohn-Bar","year":"2014","unstructured":"Ohn-Bar, E., & Trivedi, M. M. (2014). Hand gesture recognition in real time for automotive interfaces: A multimodal vision-based approach and evaluations. IEEE Transactions on Intelligent Transportation Systems, 15(6), 2368\u20132377.","journal-title":"IEEE Transactions on Intelligent Transportation Systems"},{"key":"992_CR49","doi-asserted-by":"crossref","unstructured":"Oikonomidis, I., Kyriazis, N., & Argyros, A. A. (2011). Efficient model-based 3d tracking of hand articulations using kinect. In British machine vision conference.","DOI":"10.5244\/C.25.101"},{"key":"992_CR50","doi-asserted-by":"crossref","unstructured":"Panteleris, P., Kyriazis, N., & Argyros, A. (2015). 3d tracking of human hands in interaction with unknown objects. In British machine vision conference (BMVC), BMVA Press, pp. 123.","DOI":"10.5244\/C.29.123"},{"key":"992_CR51","unstructured":"Pham, T. H., Kheddar, A., Qammaz, A., & Argyros, A. A. (2015). Towards force sensing from vision: Observing hand-object interactions to infer manipulation forces. In IEEE conference on computer vision and pattern recognition (CVPR)."},{"key":"992_CR52","doi-asserted-by":"crossref","unstructured":"Pieropan, A., Ek, C. H., & Kjellstrom, H. (2013). Functional object descriptors for human activity modeling. In IEEE international conference on robotics and automation (ICRA) (pp. 1282\u20131289).","DOI":"10.1109\/ICRA.2013.6630736"},{"key":"992_CR53","doi-asserted-by":"crossref","unstructured":"Pirsiavash, H., Vondrick, C., & Torralba, A. (2014). Inferring the why in images. arXiv:1406.5472","DOI":"10.21236\/ADA612444"},{"issue":"9","key":"992_CR54","doi-asserted-by":"publisher","first-page":"661","DOI":"10.1038\/35090060","volume":"2","author":"G Rizzolatti","year":"2001","unstructured":"Rizzolatti, G., Fogassi, L., & Gallese, V. (2001). Neurophysiological mechanisms underlying the understanding and imitation of action. Nature Reviews Neuroscience, 2(9), 661\u2013670.","journal-title":"Nature Reviews Neuroscience"},{"key":"992_CR55","unstructured":"Rogez, G., Khademi, M., Supan\u010di\u010d, J. III, Montiel, J. M. M., & Ramanan, D. (2014). 3d hand pose detection in egocentric RGB-D images. In Workshop at the European conference on computer vision (pp. 356\u2013371). Springer."},{"key":"992_CR56","doi-asserted-by":"crossref","unstructured":"Rogez, G., Supancic, J. S. III., & Ramanan, D. (2015). Understanding everyday hands in action from RGB-D images. In IEEE international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2015.443"},{"issue":"6","key":"992_CR57","doi-asserted-by":"publisher","first-page":"1342","DOI":"10.1109\/TRO.2013.2272249","volume":"29","author":"J Romero","year":"2013","unstructured":"Romero, J., Feix, T., Ek, C. H., Kjellstrom, H., & Kragic, D. (2013). A metric for comparing the anthropomorphic motion capability of artificial hands. IEEE Transactions on Robotics, 29(6), 1342\u20131352.","journal-title":"IEEE Transactions on Robotics"},{"issue":"3","key":"992_CR58","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., et al. (2015). Imagenet large scale visual recognition challenge. International Journal of Computer Vision, 115(3), 211\u2013252.","journal-title":"International Journal of Computer Vision"},{"key":"992_CR59","doi-asserted-by":"crossref","unstructured":"Ryoo, M. S. (2011). Human activity prediction: Early recognition of ongoing activities from streaming videos. In IEEE international conference on computer vision (ICCV).","DOI":"10.1109\/ICCV.2011.6126349"},{"key":"992_CR60","unstructured":"Ryoo, M. S., & Matthies, L. (2013). First-person activity recognition: What are they doing to me? In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 2730\u20132737)."},{"key":"992_CR61","unstructured":"Ryoo, M., Fuchs, T. J., Xia, L., Aggarwal, J., & Matthies, L. (2015). Robot-centric activity prediction from first-person videos: What will they do to me? In ACM\/IEEE international conference on human-robot interaction (HRI) (pp. 295\u2013302). ACM."},{"issue":"2","key":"992_CR62","doi-asserted-by":"publisher","first-page":"157","DOI":"10.1177\/0278364907087172","volume":"27","author":"A Saxena","year":"2008","unstructured":"Saxena, A., Driemeyer, J., & Ng, A. Y. (2008). Robotic grasping of novel objects using vision. The International Journal of Robotics Research, 27(2), 157\u2013173.","journal-title":"The International Journal of Robotics Research"},{"key":"992_CR63","doi-asserted-by":"crossref","unstructured":"Schuldt, C., Laptev, I., & Caputo, B. (2004). Recognizing human actions: A local SVM approach. In International conference on pattern recognition.","DOI":"10.1109\/ICPR.2004.1334462"},{"issue":"1","key":"992_CR64","doi-asserted-by":"publisher","first-page":"22","DOI":"10.1007\/s11263-010-0384-0","volume":"93","author":"Q Shi","year":"2011","unstructured":"Shi, Q., Cheng, L., Wang, L., & Smola, A. (2011). Human action segmentation and recognition using discriminative semi-Markov models. International Journal of Computer Vision, 93(1), 22\u201332.","journal-title":"International Journal of Computer Vision"},{"issue":"3","key":"992_CR65","doi-asserted-by":"publisher","first-page":"230","DOI":"10.1177\/027836499601500302","volume":"15","author":"KB Shimoga","year":"1996","unstructured":"Shimoga, K. B. (1996). Robot grasp synthesis algorithms: A survey. The International Journal of Robotics Research, 15(3), 230\u2013266.","journal-title":"The International Journal of Robotics Research"},{"issue":"1","key":"992_CR66","doi-asserted-by":"publisher","first-page":"116","DOI":"10.1145\/2398356.2398381","volume":"56","author":"J Shotton","year":"2013","unstructured":"Shotton, J., Sharp, T., Kipman, A., Fitzgibbon, A., Finocchio, M., Blake, A., et al. (2013). Real-time human pose recognition in parts from single depth images. Communications of the ACM, 56(1), 116\u2013124.","journal-title":"Communications of the ACM"},{"key":"992_CR67","unstructured":"Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556 ."},{"issue":"12","key":"992_CR68","doi-asserted-by":"publisher","first-page":"1371","DOI":"10.1109\/34.735811","volume":"20","author":"T Starner","year":"1998","unstructured":"Starner, T., Weaver, J., & Pentland, A. (1998). Real-time american sign language recognition using desk and wearable computer based video. IEEE Transactions on Pattern Analysis and Machine Intelligence, 20(12), 1371\u20131375.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"992_CR69","doi-asserted-by":"crossref","unstructured":"Stein, S., & McKenna, S. J. (2013). Combining embedded accelerometers with computer vision for recognizing food preparation activities. In Proceedings of the 2013 ACM international joint conference on pervasive and ubiquitous computing (pp. 729\u2013738). ACM.","DOI":"10.1145\/2493432.2493482"},{"key":"992_CR70","doi-asserted-by":"crossref","unstructured":"Supancic, J. S., Rogez, G., Yang, Y., Shotton, J., & Ramanan, D. (2015). Depth-based hand pose estimation: Data, methods, and challenges. In IEEE international conference on computer vision (pp. 1868\u20131876).","DOI":"10.1109\/ICCV.2015.217"},{"issue":"12","key":"992_CR71","doi-asserted-by":"publisher","first-page":"771","DOI":"10.1080\/01691864.2014.996604","volume":"29","author":"W Takano","year":"2015","unstructured":"Takano, W., Ishikawa, J., & Nakamura, Y. (2015). Using a human action database to recognize actions in monocular image sequences: Recovering human whole body configurations. Advanced Robotics, 29(12), 771\u2013784.","journal-title":"Advanced Robotics"},{"key":"992_CR72","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1007\/978-1-4471-6533-0_1","volume-title":"Multisensory softness","author":"WMB Tiest","year":"2014","unstructured":"Tiest, W. M. B., & Kappers, A. M. (2014). Physical aspects of softness perception. In M. D. Luca (Ed.), Multisensory softness (pp. 3\u201315). London: Springer."},{"issue":"11","key":"992_CR73","doi-asserted-by":"publisher","first-page":"1473","DOI":"10.1109\/TCSVT.2008.2005594","volume":"18","author":"P Turaga","year":"2008","unstructured":"Turaga, P., Chellappa, R., Subrahmanian, V., & Udrea, O. (2008). Machine recognition of human activities: A survey. IEEE Transactions on Circuits and Systems for Video Technology, 18(11), 1473\u20131488.","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"992_CR74","unstructured":"Venugopalan, S., Xu, H., Donahue, J., Rohrbach, M., Mooney, R., & Saenko, K. (2014). Translating videos to natural language using deep recurrent neural networks. arXiv:1412.4729 ."},{"key":"992_CR75","unstructured":"Visin, F., Kastner, K., Cho, K., Matteucci, M., Courville, A., & Bengio, Y. (2015). A recurrent neural network based alternative to convolutional networks. arXiv:1505.00393 ."},{"key":"992_CR76","doi-asserted-by":"crossref","unstructured":"Vondrick, C., Pirsiavash, H., & Torralba, A. (2016). Anticipating visual representations from unlabeled video. In IEEE conference on computer vision and pattern recognition.","DOI":"10.1109\/CVPR.2016.18"},{"key":"992_CR77","doi-asserted-by":"crossref","unstructured":"Walker, J., Gupta, A., & Hebert, M. (2014). Patch to the future: Unsupervised visual prediction. In IEEE conference on computer vision and pattern recognition (pp. 3302\u20133309).","DOI":"10.1109\/CVPR.2014.416"},{"key":"992_CR78","first-page":"1521","volume":"2","author":"SB Wang","year":"2006","unstructured":"Wang, S. B., Quattoni, A., Morency, L. P., Demirdjian, D., & Darrell, T. (2006). Hidden conditional random fields for gesture recognition. IEEE Conference on Computer Vision and Pattern Recognition, 2, 1521\u20131527.","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"issue":"5","key":"992_CR79","doi-asserted-by":"publisher","first-page":"914","DOI":"10.1109\/TPAMI.2013.198","volume":"36","author":"J Wang","year":"2014","unstructured":"Wang, J., Liu, Z., Wu, Y., & Yuan, J. (2014). Learning actionlet ensemble for 3d human action recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 36(5), 914\u2013927.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"992_CR80","unstructured":"Xie, D., Todorovic, S., & Zhu, S. C. (2013). Inferring \u201cdark matter\u201d and \u201cdark energy\u201d from videos. In IEEE international conference on computer vision (ICCV) (pp. 2224\u20132231)."},{"key":"992_CR81","doi-asserted-by":"crossref","unstructured":"Yang, Y., Ferm\u00fcller, C., Li, Y., & Aloimonos, Y. (2015). Grasp type revisited: A modern perspective on a classical feature for vision. In IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2015.7298637"},{"key":"992_CR82","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Zhao, Y., & Zhu, S. C. (2015). Understanding tools: Task-oriented object modeling, learning and recognition. In IEEE conference on computer vision and pattern recognition (pp. 2855\u20132864).","DOI":"10.1109\/CVPR.2015.7298903"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-017-0992-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-017-0992-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-017-0992-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,22]],"date-time":"2024-06-22T15:22:36Z","timestamp":1719069756000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-017-0992-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,2,20]]},"references-count":82,"journal-issue":{"issue":"2-4","published-print":{"date-parts":[[2018,4]]}},"alternative-id":["992"],"URL":"https:\/\/doi.org\/10.1007\/s11263-017-0992-z","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017,2,20]]},"assertion":[{"value":"16 March 2016","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 January 2017","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 February 2017","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}