{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,18]],"date-time":"2025-12-18T14:04:25Z","timestamp":1766066665142},"reference-count":80,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2016,10,5]],"date-time":"2016-10-05T00:00:00Z","timestamp":1475625600000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2017,3]]},"DOI":"10.1007\/s11263-016-0956-8","type":"journal-article","created":{"date-parts":[[2016,10,5]],"date-time":"2016-10-05T03:47:38Z","timestamp":1475639258000},"page":"84-115","update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":20,"title":["Semantic Decomposition and Recognition of Long and Complex Manipulation Action Sequences"],"prefix":"10.1007","volume":"122","author":[{"given":"Eren Erdal","family":"Aksoy","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Adil","family":"Orhan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Florentin","family":"W\u00f6rg\u00f6tter","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2016,10,5]]},"reference":[{"key":"956_CR1","unstructured":"Abramov, A., Aksoy, E.E., D\u00f6rr, J., Pauwels, K., W\u00f6rg\u00f6tter, F., Dellen, B. (2010). 3D semantic representation of actions from efficient stereo-image-sequence segmentation on GPUs. In 5th International Symposium 3D Data Processing, Visualization and Transmission (pp. 1\u20138)."},{"key":"956_CR2","doi-asserted-by":"crossref","unstructured":"Abramov, A., Pauwels, K., Papon, J., W\u00f6rg\u00f6tter, F., & Dellen, B. (2012). Depth-supported real-time video segmentation with the kinect. In IEEE Workshop on Applications of Computer Vision (pp. 457\u2013464).","DOI":"10.1109\/WACV.2012.6163000"},{"key":"956_CR3","doi-asserted-by":"crossref","DOI":"10.2991\/978-94-91216-20-6","volume-title":"Computer vision and action recognition: A guide for image processing and computer vision community for action understanding","author":"MAR Ahad","year":"2011","unstructured":"Ahad, M. A. R. (2011). Computer vision and action recognition: A guide for image processing and computer vision community for action understanding. New York: Atlantis Publishing Corporation."},{"key":"956_CR4","doi-asserted-by":"crossref","first-page":"1229","DOI":"10.1177\/0278364911410459","volume":"30","author":"EE Aksoy","year":"2011","unstructured":"Aksoy, E. E., Abramov, A., D\u00f6rr, J., Ning, K., Dellen, B., & W\u00f6rg\u00f6tter, F. (2011). Learning the semantics of object-action relations by observation. The International Journal of Robotics Research, 30, 1229\u20131249.","journal-title":"The International Journal of Robotics Research"},{"key":"956_CR5","doi-asserted-by":"crossref","unstructured":"Aksoy, E. E., Abramov, A., W\u00f6rg\u00f6tter, F., & Dellen, B. (2010). Categorizing object-action relations from semantic scene graphs. In: IEEE International Conference on Robotics and Automation (pp. 398\u2013405).","DOI":"10.1109\/ROBOT.2010.5509319"},{"key":"956_CR6","doi-asserted-by":"crossref","unstructured":"Aksoy, E. E., Tamosiunaite, M., Vuga, R., Ude, A., Geib, C., Steedman, M., & W\u00f6rg\u00f6tter, F. (2013). Structural bootstrapping at the sensorimotor level for the fast acquisition of action knowledge for cognitive robots. In IEEE International Conference on Development and Learning and Epigenetic Robotics (pp. 1\u20138).","DOI":"10.1109\/DevLrn.2013.6652537"},{"key":"956_CR7","doi-asserted-by":"crossref","first-page":"118","DOI":"10.1016\/j.robot.2014.11.003","volume":"71","author":"EE Aksoy","year":"2015","unstructured":"Aksoy, E. E., Tamosiunaite, M., & W\u00f6rg\u00f6tter, F. (2015). Model-free incremental learning of the semantics of manipulation actions. Robotics and Autonomous Systems, 71, 118\u2013133.","journal-title":"Robotics and Autonomous Systems"},{"key":"956_CR8","volume-title":"Intention","author":"GEM Anscombe","year":"1963","unstructured":"Anscombe, G. E. M. (1963). Intention. Ithaca: Cornell University Press."},{"key":"956_CR9","unstructured":"Badler, N. (1975). Temporal scene analysis: Conceptual descriptions of object movements. Ph.D. thesis. University of Toronto, Toronto."},{"key":"956_CR10","doi-asserted-by":"crossref","unstructured":"Bobick, A. F., & Ivanov, Y. A. (1998). Action recognition using probabilistic parsing. In Computer Vision and Pattern Recognition (pp. 196\u2013202).","DOI":"10.1109\/CVPR.1998.698609"},{"key":"956_CR11","doi-asserted-by":"crossref","first-page":"257","DOI":"10.1109\/34.910878","volume":"23","author":"AF Bobick","year":"2001","unstructured":"Bobick, A. F., & Davis, J. W. (2001). The recognition of human movement using temporal templates. IEEE Transactions on Pattern Analysis and Machine intelligence, 23, 257\u2013267.","journal-title":"IEEE Transactions on Pattern Analysis and Machine intelligence"},{"key":"956_CR12","doi-asserted-by":"crossref","unstructured":"Brand, M. (1996). Understanding manipulation in video. In Proceedings of the Second International Conference on Automatic Face and Gesture Recognition (pp. 94\u201399).","DOI":"10.1109\/AFGR.1996.557249"},{"key":"956_CR13","unstructured":"Brand, M. (1997). The inverse hollywood problem: From video to scripts and storyboards via causal analysis. In Proceedings, AAAI97 (pp. 12\u201396)."},{"key":"956_CR14","doi-asserted-by":"crossref","first-page":"129","DOI":"10.1109\/TOH.2012.53","volume":"6","author":"IM Bullock","year":"2013","unstructured":"Bullock, I. M., Ma, R. R., & Dollar, M. A. (2013). A hand-centric classification of human and robot dexterous manipulation. IEEE Transactions on Haptics, 6, 129\u2013144.","journal-title":"IEEE Transactions on Haptics"},{"key":"956_CR15","doi-asserted-by":"crossref","unstructured":"Chen, H. S., Chen, H. T., Chen, Y. W., & Lee, S. Y. (2006). Human action recognition using star skeleton. In Proceedings of the 4th ACM International Workshop on Video Surveillance and Sensor Networks (pp. 171\u2013178).","DOI":"10.1145\/1178782.1178808"},{"key":"956_CR16","doi-asserted-by":"crossref","unstructured":"Cutkosky, M. R. (1989). On grasp choice, grasp models, and the design of hands for manufacturing tasks. In IEEE International Conference on Robotics and Automation (pp. 269\u2013279).","DOI":"10.1109\/70.34763"},{"key":"956_CR17","unstructured":"Danelljan, M., Khan, F. S., Felsberg, M., & Weijer, J. (2006). Adaptive color attributes for real-time visual tracking. In Computer Vision and Pattern Recognition (pp. 1090\u20131097)."},{"key":"956_CR18","doi-asserted-by":"crossref","unstructured":"Efros, A. A., Berg, A. C., Mori, G., Malik, J. (2003). Recognizing action at a distance. In IEEE International Conference on Computer Vision (pp. 726\u2013733).","DOI":"10.1109\/ICCV.2003.1238420"},{"key":"956_CR19","doi-asserted-by":"crossref","unstructured":"Ekvall, S. & Kragic, D. (2005). Grasp recognition for programming by demonstration. In IEEE International Conference on Robotics and Automation (pp. 748\u2013753).","DOI":"10.1109\/ROBOT.2005.1570207"},{"key":"956_CR20","doi-asserted-by":"crossref","first-page":"283","DOI":"10.1111\/j.1469-8749.1984.tb04445.x","volume":"26","author":"JM Elliott","year":"1984","unstructured":"Elliott, J. M., & Connolly, K. J. (1984). A classification of manipulative hand movements. Developmental Medicine & Child Neurology, 26, 283\u2013296.","journal-title":"Developmental Medicine & Child Neurology"},{"key":"956_CR21","doi-asserted-by":"crossref","unstructured":"Fathi, A., Farhadi, A., & Rehg, J. M. (2011). Understanding egocentric activities. In International Conference on Computer Vision (pp. 407\u2013414).","DOI":"10.1109\/ICCV.2011.6126269"},{"key":"956_CR22","unstructured":"Feix, T., Pawlik, R., Schmiedmayer, H., Romero, J., & Kragic, D. (2009). A comprehensive grasp taxonomy. In Robotics, Science and Systems: Workshop on Understanding the Human Hand for Advancing Robotic Manipulation (pp. 407\u2013414)."},{"key":"956_CR23","unstructured":"Fern, A., Siskind, J. M., & Givan, R. (2002). Learning temporal, relational, force-dynamic event definitions from video. In National Conference on Artificial Intelligence (pp. 159\u2013166)."},{"key":"956_CR24","doi-asserted-by":"crossref","unstructured":"Fernando, B., Gavves, E., Oramas, M. J., Ghodrati, A., & Tuytelaars, T. (2015). Modeling video evolution for action recognition. In: IEEE Conference on Computer Vision and Pattern Recognition (pp. 5378\u20135387).","DOI":"10.1109\/CVPR.2015.7299176"},{"key":"956_CR25","unstructured":"Graf, J., Puls, S., & W\u00f6rn, H. (2010). Recognition and understanding situations and activities with description logics for safe human-robot cooperation. In The Second International Conference on Advanced Cognitive Technologies and Applications: Cognitive 2010 (p.\u00a07)."},{"key":"956_CR26","doi-asserted-by":"crossref","unstructured":"Gupta, A., & Davis, L. (2007). Objects in action: An approach for combining action understanding and object perception. In Computer Vision and Pattern Recognition (pp. 1\u20138).","DOI":"10.1109\/CVPR.2007.383331"},{"key":"956_CR27","doi-asserted-by":"crossref","first-page":"1775","DOI":"10.1109\/TPAMI.2009.83","volume":"31","author":"A Gupta","year":"2009","unstructured":"Gupta, A., Kembhavi, A., & Davis, L. (2009). Observing human-object interactions: Using spatial and functional compatibility for recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 31, 1775\u20131789.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"956_CR28","doi-asserted-by":"crossref","unstructured":"Hoai, M., Zhong Lan, Z., & De la Torre, F. (2011). Joint segmentation and classification of human actions in video. In IEEE Conference on Computer Vision and Pattern Recognition (pp. 3265\u20133272).","DOI":"10.1109\/CVPR.2011.5995470"},{"key":"956_CR29","doi-asserted-by":"crossref","unstructured":"Ke, Y., Sukthankar, R., & Hebert, M. (2007). Event detection in crowded videos. In IEEE International Conference on Computer Vision.","DOI":"10.1109\/ICCV.2007.4409011"},{"key":"956_CR30","doi-asserted-by":"crossref","first-page":"81","DOI":"10.1016\/j.cviu.2010.08.002","volume":"115","author":"H Kjellstr\u00f6m","year":"2011","unstructured":"Kjellstr\u00f6m, H., Romero, J., & Kragi\u0107, D. (2011). Visual object-action recognition: Inferring object affordances from human demonstration. Computer Vision and Image Understanding, 115, 81\u201390.","journal-title":"Computer Vision and Image Understanding"},{"key":"956_CR31","doi-asserted-by":"crossref","first-page":"108","DOI":"10.1016\/j.jvcir.2013.03.020","volume":"25","author":"SY Koo","year":"2014","unstructured":"Koo, S. Y., Lee, D., & Kwon, D. S. (2014). Incremental object learning and robust tracking of multiple objects from RGB-D point set data. Journal of Visual Communication and Image Representation, 25, 108\u2013121.","journal-title":"Journal of Visual Communication and Image Representation"},{"key":"956_CR32","doi-asserted-by":"crossref","first-page":"951","DOI":"10.1177\/0278364913478446","volume":"32","author":"HS Koppula","year":"2013","unstructured":"Koppula, H. S., Gupta, R., & Saxena, A. (2013). Learning human activities and object affordances from rgb-d videos. The International Journal of Robotics Research, 32, 951\u2013970.","journal-title":"The International Journal of Robotics Research"},{"key":"956_CR33","doi-asserted-by":"crossref","first-page":"740","DOI":"10.1016\/j.robot.2011.05.009","volume":"59","author":"N Kr\u00fcger","year":"2011","unstructured":"Kr\u00fcger, N., Geib, C., Piater, J., Petrick, R., Steedman, M., W\u00f6rg\u00f6tter, F., et al. (2011). Object-action complexes: Grounded abstractions of sensory-motor processes. Robotics and Autonomous Systems, 59, 740\u2013757.","journal-title":"Robotics and Autonomous Systems"},{"key":"956_CR34","doi-asserted-by":"crossref","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev, I. (2005). On space-time interest points. International Journal of Computer Vision, 64, 107\u2013123.","journal-title":"International Journal of Computer Vision"},{"key":"956_CR35","doi-asserted-by":"crossref","unstructured":"Laptev, I., & Lindeberg, T. (2003). Space-time interest points. In International Conference on Computer Vision (pp. 432\u2013439).","DOI":"10.1109\/ICCV.2003.1238378"},{"key":"956_CR36","doi-asserted-by":"crossref","unstructured":"Laptev, I., Marszalek, M., Schmid, C., & Rozenfeld, B. (2008). Learning realistic human actions from movies. In Computer Vision and Pattern Recognition (pp. 1\u20138).","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"956_CR37","doi-asserted-by":"crossref","first-page":"1323","DOI":"10.1016\/j.robot.2013.08.003","volume":"61","author":"K Lee","year":"2013","unstructured":"Lee, K., Su, Y., Kim, T. K., & Demiris, Y. (2013). A syntactic approach to robot imitation learning using probabilistic activity grammars. Robotics and Autonomous Systems, 61, 1323\u20131334.","journal-title":"Robotics and Autonomous Systems"},{"key":"956_CR38","doi-asserted-by":"crossref","unstructured":"Li, Y., Ye, Z., & Rehg, J. M. (2015). Delving into egocentric actions. In IEEE Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2015.7298625"},{"key":"956_CR39","doi-asserted-by":"crossref","unstructured":"Liu, J., Feng, F., Nakamura, Y. C., & Pollard, N. S. (2016). Annotating everyday grasps in action. In J.-P. Laumond & N. Abe (Eds.), Dance notations and robot motion (pp. 263\u2013282). Springer tracts in robotics Berlin: Springer.","DOI":"10.1007\/978-3-319-25739-6_12"},{"key":"956_CR40","unstructured":"Luo, G., Bergstrom, N., Ek, C., & Kragic, D. (2011). Representing actions with kernels. In 2011 IEEE\/RSJ International Conference on Intelligent Robots and Systems (pp. 2028\u20132035)."},{"key":"956_CR41","doi-asserted-by":"crossref","unstructured":"Lv, F., & Nevatia, R. (2006). Recognition and segmentation of 3-d human action using hmm and multi-class adaboost. In European Conference on Computer Vision (Vol. IV, pp. 359\u2013372).","DOI":"10.1007\/11744085_28"},{"key":"956_CR42","doi-asserted-by":"crossref","unstructured":"Martinez, D., Alenya, G., Jimenez, P., Torras, C., Rossmann, J., Wantia, N., Aksoy, E.E., Haller, S., & Piater, J. (2014). Active learning of manipulation sequences. In IEEE International Conference on Robotics and Automation (pp. 5671\u20135678).","DOI":"10.1109\/ICRA.2014.6907693"},{"key":"956_CR43","doi-asserted-by":"crossref","DOI":"10.1093\/oso\/9780195071146.001.0001","volume-title":"Springs of action: Understanding intentional behavior","author":"A Mele","year":"1992","unstructured":"Mele, A. (1992). Springs of action: Understanding intentional behavior. Oxford: Oxford University Press."},{"key":"956_CR44","doi-asserted-by":"crossref","unstructured":"Minnen, D., Essa, J., & Starner, T. (2003). Expectation grammars: Leveraging high-level expectations for activity recognition. In Computer Vision and Pattern Recognition (pp. 626\u2013632).","DOI":"10.1109\/CVPR.2003.1211525"},{"key":"956_CR45","doi-asserted-by":"crossref","unstructured":"Nagahama, K., Yamazaki, K., Okada, K., & Inaba, M. (2013). Manipulation of multiple objects in close proximity based on visual hierarchical relationships. In IEEE International Conference on Robotics and Automation (pp. 1303\u20131310).","DOI":"10.1109\/ICRA.2013.6630739"},{"key":"956_CR46","doi-asserted-by":"crossref","unstructured":"Papon, J., Abramov, A., Aksoy, E. E., & W\u00f6rg\u00f6tter, F. (2012). A modular system architecture for online parallel vision pipelines. In IEEE Workshop on Applications of Computer Vision (WACV) (pp. 361\u2013368).","DOI":"10.1109\/WACV.2012.6163002"},{"key":"956_CR47","doi-asserted-by":"crossref","unstructured":"Pardowitz, M., Haschke, R., Steil, J., & Ritter, H. (2008). Gestalt-based action segmentation for robot task learning. In IEEE-RAS International Conference on Humanoid Robots (pp. 347\u2013352).","DOI":"10.1109\/ICHR.2008.4756003"},{"key":"956_CR48","doi-asserted-by":"crossref","first-page":"18","DOI":"10.1167\/10.10.18","volume":"10","author":"K Pauwels","year":"2010","unstructured":"Pauwels, K., Kr\u00fcger, N., Lappe, M., W\u00f6rg\u00f6tter, F., & Van Hulle, M. (2010). A cortical architecture on parallel hardware for motion processing in real time. Journal of Vision, 10, 18.","journal-title":"Journal of Vision"},{"key":"956_CR49","doi-asserted-by":"crossref","first-page":"1369","DOI":"10.1016\/j.cviu.2012.12.003","volume":"117","author":"M Pei","year":"2013","unstructured":"Pei, M., Si, Z., Yao, B., & Zhu, S. C. (2013). Video event parsing and learning with goal and intent prediction. Computer Vision and Image Understanding, 117, 1369\u20131383.","journal-title":"Computer Vision and Image Understanding"},{"key":"956_CR50","doi-asserted-by":"crossref","unstructured":"Peursum, P., Bui, H. H., Venkatesh, S., & West, G. A. W. (2004). Human action segmentation via controlled use of missing data in HMMs. In International Conference on Pattern Recognition (pp. 440\u2013445).","DOI":"10.1109\/ICPR.2004.1333797"},{"key":"956_CR51","doi-asserted-by":"crossref","first-page":"976","DOI":"10.1016\/j.imavis.2009.11.014","volume":"28","author":"R Poppe","year":"2010","unstructured":"Poppe, R. (2010). A survey on vision-based human action recognition. Image and Vision Computing, 28, 976\u2013990.","journal-title":"Image and Vision Computing"},{"key":"956_CR52","doi-asserted-by":"crossref","unstructured":"Ramirez-Amaro, K., Kim, E.S., Kim, J., Zhang, B.T., Beetz, M., & Cheng, G. (2013). Enhancing human action recognition through spatio-temporal feature learning and semantic rules. In IEEE-RAS International Conference on Humanoid Robots.","DOI":"10.1109\/HUMANOIDS.2013.7030014"},{"key":"956_CR53","doi-asserted-by":"crossref","unstructured":"Rohrbach, M., Amin, S., Andriluka, M., & Schiele, B. (2012). A database for fine grained activity detection of cooking activities. In IEEE Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2012.6247801"},{"key":"956_CR54","doi-asserted-by":"crossref","unstructured":"Rui, Y., & Anandan, P. (2000). Segmenting visual actions based on spatio-temporal motion patterns. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (pp. 111\u2013118).","DOI":"10.1109\/CVPR.2000.855807"},{"key":"956_CR55","unstructured":"Ryoo, M. S., & Aggarwal, J. K. (2000). Recognition of composite human activities through context-free grammar based representation. In: Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (pp. 1709\u20131718)."},{"key":"956_CR56","doi-asserted-by":"crossref","unstructured":"Schuldt, C., Laptev, I., & Caputo, B. (2004). Recognizing human actions: A local svm approach. In Proceedings of the 17th International Conference on Pattern Recognition, 2004. ICPR 2004 (Vol. 3, pp. 32\u201336).","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"956_CR57","doi-asserted-by":"crossref","unstructured":"Scovanner, P., Ali, S., & Shah, M. (2007). A 3-dimensional sift descriptor and its application to action recognition. In Proceedings of the 15th International Conference on Multimedia (pp. 357\u2013360).","DOI":"10.1145\/1291233.1291311"},{"key":"956_CR58","doi-asserted-by":"crossref","first-page":"22","DOI":"10.1007\/s11263-010-0384-0","volume":"93","author":"Q Shi","year":"2011","unstructured":"Shi, Q., Cheng, L., Wang, L., & Smola, A. (2011). Human action segmentation and recognition using discriminative semi-Markov models. International Journal of Computer Vision, 93, 22\u201332.","journal-title":"International Journal of Computer Vision"},{"key":"956_CR59","doi-asserted-by":"crossref","first-page":"371","DOI":"10.1007\/BF00849726","volume":"8","author":"J Siskind","year":"1994","unstructured":"Siskind, J. (1994). Grounding language in perception. Artificial Intelligence Review, 8, 371\u2013391.","journal-title":"Artificial Intelligence Review"},{"key":"956_CR60","doi-asserted-by":"crossref","unstructured":"Siskind, J., & Morris, Q. (1996) . A maximum-likelihood approach to visual event classification. In European Conference on Computer Vision (pp. 347\u2013360).","DOI":"10.1007\/3-540-61123-1_152"},{"key":"956_CR61","doi-asserted-by":"crossref","first-page":"210","DOI":"10.1016\/j.cviu.2006.07.014","volume":"104","author":"C Sminchisescu","year":"2006","unstructured":"Sminchisescu, C., Kanaujia, A., & Metaxas, D. (2006). Conditional models for contextual human motion recognition. Computer Vision and Image Understanding, 104, 210\u2013220.","journal-title":"Computer Vision and Image Understanding"},{"key":"956_CR62","unstructured":"Sridhar, M., Cohn, G. A., & Hogg, D. (2008). Learning functional object-categories from a relational spatio-temporal representation. In Proceedings of 18th European Conference on Artificial Intelligence (pp. 606\u2013610)."},{"key":"956_CR63","unstructured":"Thuc, H. L. U., Ke, S. R., Hwang, J. N., Tuan, P. V., & Chau, T. N. (2012). Quasi-periodic action recognition from monocular videos via 3d human models and cyclic hmms. In International Conference on Advanced Technologies for Communications (pp. 110\u2013113)."},{"key":"956_CR64","doi-asserted-by":"crossref","unstructured":"Vitaladevuni, S. N. P., Kellokumpu, V., & Davis, L. S. (2008). Action recognition using ballistic dynamics. In IEEE Computer Society Conference on Computer Vision and Pattern Recognition.","DOI":"10.1109\/CVPR.2008.4587806"},{"key":"956_CR65","unstructured":"Vuga, R., Aksoy, E. E., W\u00f6rg\u00f6tter, F., & Ude, A. (2013). Augmenting semantic event chains with trajectory information for learning and recognition of manipulation tasks. In International Workshop on Robotics in Alpe-Adria-Danube Region (RAAD)."},{"key":"956_CR66","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., & Liu, C. L. (2011). Action recognition by dense trajectories. In IEEE Conference on Computer Vision & Pattern Recognition (pp. 3169\u20133176).","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"956_CR67","doi-asserted-by":"crossref","unstructured":"Wang, H., & Schmid, C. (2013). Action recognition with improved trajectories. In IEEE International Conference on Computer Vision.","DOI":"10.1109\/ICCV.2013.441"},{"key":"956_CR68","unstructured":"Wang, Z., Wang, J., Xiao, J., Lin, K. H., & Huang, T. (2012). Substructure and boundary modeling for continuous action recognition. In IEEE Conference on Computer Vision and Pattern Recognition (pp. 1330\u20131337)."},{"key":"956_CR69","unstructured":"Wei, P., Zhao, Y., Zheng, N., & Zhu, S. C. (2006). Modeling 4D human-object interactions for joint event segmentation, recognition, and object localization. IEEE Transactions on Pattern Analysis & Machine Intelligence"},{"key":"956_CR70","first-page":"1639","volume":"2","author":"D Weinland","year":"2006","unstructured":"Weinland, D., Ronfard, R., & Boyer, E. (2006). Automatic discovery of action taxonomies from multiple views. IEEE Conference on Computer Vision and Pattern Recognition, 2, 1639\u20131645.","journal-title":"IEEE Conference on Computer Vision and Pattern Recognition"},{"key":"956_CR71","doi-asserted-by":"crossref","first-page":"224","DOI":"10.1016\/j.cviu.2010.10.002","volume":"115","author":"D Weinland","year":"2011","unstructured":"Weinland, D., Ronfard, R., & Boyer, E. (2011). A survey of vision-based methods for action representation, segmentation and recognition. Computer Vision and Image Understanding, 115, 224\u2013241.","journal-title":"Computer Vision and Image Understanding"},{"key":"956_CR72","doi-asserted-by":"crossref","unstructured":"Wimmer, R. (2011). Grasp sensing for human-computer interaction. In Proceedings of the Fifth International Conference on Tangible, Embedded, and Embodied Interaction (pp. 221\u2013228).","DOI":"10.1145\/1935701.1935745"},{"key":"956_CR73","doi-asserted-by":"crossref","first-page":"420","DOI":"10.1016\/j.robot.2008.06.011","volume":"57","author":"F W\u00f6rg\u00f6tter","year":"2009","unstructured":"W\u00f6rg\u00f6tter, F., Agostini, A., Kr\u00fcger, N., Shylo, N., & Porr, B. (2009). Cognitive agents: A procedural perspective relying on the predictability of object-action-complexes oacs. Robotics and Autonomous Systems, 57, 420\u2013432.","journal-title":"Robotics and Autonomous Systems"},{"key":"956_CR74","doi-asserted-by":"crossref","first-page":"117","DOI":"10.1109\/TAMD.2012.2232291","volume":"5","author":"F W\u00f6rg\u00f6tter","year":"2013","unstructured":"W\u00f6rg\u00f6tter, F., Aksoy, E. E., Kr\u00fcger, N., Piater, J., Ude, A., & Tamosiunaite, M. (2013). A simple ontology of manipulation actions based on hand-object relations. IEEE Transactions on Autonomous Mental Development, 5, 117\u2013134.","journal-title":"IEEE Transactions on Autonomous Mental Development"},{"key":"956_CR75","doi-asserted-by":"crossref","unstructured":"W\u00f6rg\u00f6tter, F., Geib, C., Tamosiunaite, M., Aksoy, E. E., Piater, J., Hanchen, X., Ude, A., Nemec, B., Kraft, D., Kr\u00fcger, N., W\u00e4chter, M., & Asfour, T. (2015). Structural bootstrapping: A novel concept for the fast acquisition of action-knowledge. IEEE Transactions on Autonomous Mental Development, 140\u2013154.","DOI":"10.1109\/TAMD.2015.2427233"},{"key":"956_CR76","doi-asserted-by":"crossref","unstructured":"Yamato, J., Ohya, J., & Ishii, K. (1992). Recognizing human action in time-sequential images using hidden markov model. In IEEE Conference on Computer Vision and Pattern Recognition (pp. 379\u2013385).","DOI":"10.1109\/CVPR.1992.223161"},{"key":"956_CR77","doi-asserted-by":"crossref","unstructured":"Yang, Y., Ferm\u00fcller, C., & Aloimonos, Y. (2013). Detection of manipulation action consequences (mac). In International Conference on Computer Vision and Pattern Recognition (pp. 2563\u20132570).","DOI":"10.1109\/CVPR.2013.331"},{"key":"956_CR78","doi-asserted-by":"crossref","unstructured":"Yang, S., Gao, Q., Liu, C., Xiong, C., & Chai, J. (2016). Grounded Semantic Role Labeling. In The 15th Annual Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL 2016).","DOI":"10.18653\/v1\/N16-1019"},{"key":"956_CR79","doi-asserted-by":"crossref","unstructured":"Zhong, H., Shi, J., & Visontai, M. (2004). Detecting unusual activity in video. In Proceedings of the 2004 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (pp. 819\u2013826).","DOI":"10.1109\/CVPR.2004.1315249"},{"key":"956_CR80","doi-asserted-by":"crossref","first-page":"582","DOI":"10.1109\/TPAMI.2012.137","volume":"35","author":"F Zhou","year":"2013","unstructured":"Zhou, F., De la Torre Frade, F., & Hodgins, J. K. (2013). Hierarchical aligned cluster analysis for temporal clustering of human motion. IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI), 35, 582\u2013596.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI)"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-016-0956-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-016-0956-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-016-0956-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,19]],"date-time":"2024-06-19T19:30:00Z","timestamp":1718825400000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-016-0956-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,10,5]]},"references-count":80,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2017,3]]}},"alternative-id":["956"],"URL":"https:\/\/doi.org\/10.1007\/s11263-016-0956-8","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,10,5]]}}}