{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T14:18:07Z","timestamp":1761401887952,"version":"3.37.3"},"reference-count":59,"publisher":"Springer Science and Business Media LLC","issue":"21","license":[{"start":{"date-parts":[[2017,8,2]],"date-time":"2017-08-02T00:00:00Z","timestamp":1501632000000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61472103"],"award-info":[{"award-number":["61472103"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61133003"],"award-info":[{"award-number":["61133003"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004543","name":"China Scholarship Council","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004543","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2017,11]]},"DOI":"10.1007\/s11042-017-5038-6","type":"journal-article","created":{"date-parts":[[2017,8,2]],"date-time":"2017-08-02T05:16:46Z","timestamp":1501651006000},"page":"22195-22212","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Breaking video into pieces for action recognition"],"prefix":"10.1007","volume":"76","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8042-6196","authenticated-orcid":false,"given":"Ying","family":"Zheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongxun","family":"Yao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoshuai","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuesong","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fatih","family":"Porikli","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,8,2]]},"reference":[{"key":"5038_CR1","unstructured":"Abu-El-Haija S, Kothari N, Lee J, Natsev P, Toderici G, Varadarajan B, Vijayanarasimhan S (2016) Youtube-8m: a large-scale video classification benchmark. arXiv: 1609.08675"},{"issue":"3","key":"5038_CR2","doi-asserted-by":"crossref","first-page":"16","DOI":"10.1145\/1922649.1922653","volume":"43","author":"JK Aggarwal","year":"2011","unstructured":"Aggarwal JK, Ryoo MS (2011) Human activity analysis: a review. ACM Comput Surv 43(3):16","journal-title":"ACM Comput Surv"},{"issue":"2","key":"5038_CR3","doi-asserted-by":"crossref","first-page":"253","DOI":"10.1007\/s11042-012-1022-3","volume":"69","author":"R Benmokhtar","year":"2014","unstructured":"Benmokhtar R (2014) Robust human action recognition scheme based on high-level feature fusion. Multimed Tools Appl 69(2):253\u2013275","journal-title":"Multimed Tools Appl"},{"key":"5038_CR4","doi-asserted-by":"crossref","unstructured":"Bilen H, Fernando B, Gavves E, Vedaldi A, Gould S (2016) Dynamic image networks for action recognition. In: IEEE conference on computer vision and pattern recognition, pp 3034\u20133042","DOI":"10.1109\/CVPR.2016.331"},{"issue":"11","key":"5038_CR5","doi-asserted-by":"crossref","first-page":"1993","DOI":"10.1109\/TCSVT.2013.2270402","volume":"23","author":"PVK Borges","year":"2013","unstructured":"Borges PVK, Conci N, Cavallaro A (2013) Video-based human behavior understanding: a survey. IEEE Trans Circuits Syst Video Technol 23(11):1993\u20132008","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"5038_CR6","doi-asserted-by":"crossref","unstructured":"Boureau YL, Bach F, LeCun Y, Ponce J (2010) Learning mid-level features for recognition. In: IEEE conference on computer vision and pattern recognition, pp 2559\u20132566","DOI":"10.1109\/CVPR.2010.5539963"},{"key":"5038_CR7","doi-asserted-by":"crossref","unstructured":"Caba Heilbron F, Escorcia V, Ghanem B, Carlos Niebles J (2015) Activitynet: a large-scale video benchmark for human activity understanding. In: IEEE conference on computer vision and pattern recognition, pp 961\u2013970","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"5038_CR8","doi-asserted-by":"crossref","unstructured":"Cao Y, Barrett D, Barbu A, Narayanaswamy S, Yu H, Michaux A, Lin Y, Dickinson S, Siskind JM, Wang S (2013) Recognize human activities from partially observed videos. In: IEEE conference on computer vision and pattern recognition, pp 2658\u20132665","DOI":"10.1109\/CVPR.2013.343"},{"issue":"3","key":"5038_CR9","doi-asserted-by":"crossref","first-page":"27","DOI":"10.1145\/1961189.1961199","volume":"2","author":"CC Chang","year":"2011","unstructured":"Chang CC, Lin CJ (2011) Libsvm: a library for support vector machines. ACM Trans Intell Syst Technol 2(3):27","journal-title":"ACM Trans Intell Syst Technol"},{"key":"5038_CR10","doi-asserted-by":"crossref","unstructured":"Doll\u00e1r P, Rabaud V, Cottrell G, Belongie S (2005) Behavior recognition via sparse spatio-temporal features. In: IEEE international workshop on visual surveillance and performance evaluation of tracking and surveillance, pp 65\u201372","DOI":"10.1109\/VSPETS.2005.1570899"},{"key":"5038_CR11","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Zisserman A (2016) Convolutional two-stream network fusion for video action recognition. arXiv: 1604.06573","DOI":"10.1109\/CVPR.2016.213"},{"issue":"8","key":"5038_CR12","doi-asserted-by":"crossref","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"key":"5038_CR13","doi-asserted-by":"crossref","unstructured":"Jain A, Gupta A, Rodriguez M, Davis LS (2013) Representing videos using mid-level discriminative patches. In: IEEE conference on computer vision and pattern recognition, pp 2571\u20132578","DOI":"10.1109\/CVPR.2013.332"},{"issue":"1","key":"5038_CR14","doi-asserted-by":"crossref","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2013","unstructured":"Ji S, Xu W, Yang M, Yu K (2013) 3d convolutional neural networks for human action recognition. IEEE Trans Pattern Anal Mach Intell 35(1):221\u2013231","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"5038_CR15","doi-asserted-by":"crossref","unstructured":"Kantorov V, Laptev I (2014) Efficient feature extraction, encoding, and classification for action recognition. In: IEEE conference on computer vision and pattern recognition, pp 2593\u20132600","DOI":"10.1109\/CVPR.2014.332"},{"key":"5038_CR16","doi-asserted-by":"crossref","unstructured":"Karpathy A, Toderici G, Shetty S, Leung T, Sukthankar R, Fei-Fei L (2014) Large-scale video classification with convolutional neural networks. In: IEEE conference on computer vision and pattern recognition, pp 1725\u20131732","DOI":"10.1109\/CVPR.2014.223"},{"key":"5038_CR17","doi-asserted-by":"crossref","unstructured":"Klaser A, Marsza\u0142ek M, Schmid C (2008) A spatio-temporal descriptor based on 3d-gradients. In: British machine vision conference, vol 275, pp 1\u201310","DOI":"10.5244\/C.22.99"},{"key":"5038_CR18","doi-asserted-by":"crossref","unstructured":"Kong Y, Kit D, Fu Y (2014) A discriminative model with multiple temporal scales for action prediction. In: European conference on computer vision, pp 596\u2013611","DOI":"10.1007\/978-3-319-10602-1_39"},{"key":"5038_CR19","doi-asserted-by":"crossref","unstructured":"Kovashka A, Grauman K (2010) Learning a hierarchy of discriminative space-time neighborhood features for human action recognition. In: IEEE conference on computer vision and pattern recognition, pp 2046\u20132053","DOI":"10.1109\/CVPR.2010.5539881"},{"key":"5038_CR20","doi-asserted-by":"crossref","unstructured":"Kuehne H, Jhuang H, Garrote E, Poggio T, Serre T (2011) Hmdb: a large video database for human motion recognition. In: IEEE international conference on computer vision, pp 2556\u20132563","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"5038_CR21","doi-asserted-by":"crossref","unstructured":"Lan T, Zhu Y, Roshan Zamir A, Savarese S (2015) Action recognition by hierarchical mid-level action elements. In: IEEE international conference on computer vision, pp 4552\u20134560","DOI":"10.1109\/ICCV.2015.517"},{"issue":"2\u20133","key":"5038_CR22","doi-asserted-by":"crossref","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev I (2005) On space-time interest points. Int J Comput Vis 64(2\u20133):107\u2013123","journal-title":"Int J Comput Vis"},{"key":"5038_CR23","doi-asserted-by":"crossref","unstructured":"Laptev I, Marsza\u0142ek M, Schmid C, Rozenfeld B (2008) Learning realistic human actions from movies. In: IEEE conference on computer vision and pattern recognition, pp 1\u20138","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"5038_CR24","doi-asserted-by":"crossref","unstructured":"Le QV, Zou WY, Yeung SY, Ng AY (2011) Learning hierarchical invariant spatio-temporal features for action recognition with independent subspace analysis. In: IEEE conference on computer vision and pattern recognition, pp 3361\u20133368","DOI":"10.1109\/CVPR.2011.5995496"},{"key":"5038_CR25","doi-asserted-by":"crossref","unstructured":"Liu J, Luo J, Shah M (2009) Recognizing realistic actions from videos \u201cin the wild\u201d. In: IEEE conference on computer vision and pattern recognition, pp 1996\u20132003","DOI":"10.1109\/CVPR.2009.5206744"},{"key":"5038_CR26","doi-asserted-by":"crossref","unstructured":"Liu J, Kuipers B, Savarese S (2011) Recognizing human actions by attributes. In: IEEE conference on computer vision and pattern recognition, pp 3337\u20133344","DOI":"10.1109\/CVPR.2011.5995353"},{"key":"5038_CR27","doi-asserted-by":"crossref","first-page":"109","DOI":"10.1016\/j.cviu.2016.03.013","volume":"150","author":"X Peng","year":"2016","unstructured":"Peng X, Wang L, Wang X, Qiao Y (2016) Bag of visual words and fusion methods for action recognition: comprehensive study and good practice. Comput Vis Image Underst 150:109\u2013125","journal-title":"Comput Vis Image Underst"},{"issue":"6","key":"5038_CR28","doi-asserted-by":"crossref","first-page":"976","DOI":"10.1016\/j.imavis.2009.11.014","volume":"28","author":"R Poppe","year":"2010","unstructured":"Poppe R (2010) A survey on vision-based human action recognition. Image Vis Comput 28(6):976\u2013990","journal-title":"Image Vis Comput"},{"key":"5038_CR29","doi-asserted-by":"crossref","unstructured":"Raptis M, Kokkinos I, Soatto S (2012) Discovering discriminative action parts from mid-level video representations. In: IEEE conference on computer vision and pattern recognition, pp 1242\u20131249","DOI":"10.1109\/CVPR.2012.6247807"},{"issue":"5","key":"5038_CR30","doi-asserted-by":"crossref","first-page":"971","DOI":"10.1007\/s00138-012-0450-4","volume":"24","author":"KK Reddy","year":"2013","unstructured":"Reddy KK, Shah M (2013) Recognizing 50 human action categories of web videos. Mach Vis Appl 24(5):971\u2013981","journal-title":"Mach Vis Appl"},{"key":"5038_CR31","doi-asserted-by":"crossref","unstructured":"Ryoo M (2011) Human activity prediction: early recognition of ongoing activities from streaming videos. In: IEEE international conference on computer vision, pp 1036\u20131043","DOI":"10.1109\/ICCV.2011.6126349"},{"key":"5038_CR32","doi-asserted-by":"crossref","unstructured":"Ryoo MS, Aggarwal JK (2010) UT-Interaction Dataset, ICPR contest on Semantic Description of Human Activities (SDHA)","DOI":"10.1007\/978-3-642-17711-8_28"},{"key":"5038_CR33","doi-asserted-by":"crossref","unstructured":"Sadanand S, Corso JJ (2012) Action bank: a high-level representation of activity in video. In: IEEE conference on computer vision and pattern recognition, pp 1234\u20131241","DOI":"10.1109\/CVPR.2012.6247806"},{"key":"5038_CR34","doi-asserted-by":"crossref","unstructured":"Sch\u00fcldt C, Laptev I, Caputo B (2004) Recognizing human actions: a local svm approach. In: IEEE international conference on pattern recognition, vol 3, pp 32\u201336","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"5038_CR35","doi-asserted-by":"crossref","unstructured":"Scovanner P, Ali S, Shah M (2007) A 3-dimensional sift descriptor and its application to action recognition. In: ACM international conference on multimedia, pp 357\u2013360","DOI":"10.1145\/1291233.1291311"},{"issue":"2","key":"5038_CR36","doi-asserted-by":"crossref","first-page":"523","DOI":"10.1007\/s11042-014-1936-z","volume":"74","author":"H Shen","year":"2015","unstructured":"Shen H, Yan Y, Xu S, Ballas N, Chen W (2015) Evaluation of semi-supervised learning method on action recognition. Multimed Tools Appl 74 (2):523\u2013542","journal-title":"Multimed Tools Appl"},{"key":"5038_CR37","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. In: Advances in neural information processing systems, pp 568\u2013576"},{"key":"5038_CR38","unstructured":"Soomro K, Zamir AR, Shah M (2012) Ucf101: a dataset of 101 human actions classes from videos in the wild. arXiv: 1212.0402"},{"key":"5038_CR39","doi-asserted-by":"crossref","unstructured":"Sun L, Jia K, Yeung DY, Shi BE (2015) Human action recognition using factorized spatio-temporal convolutional networks. In: IEEE international conference on computer vision, pp 4597\u20134605","DOI":"10.1109\/ICCV.2015.522"},{"key":"5038_CR40","doi-asserted-by":"crossref","unstructured":"Tamrakar A, Ali S, Yu Q, Liu J, Javed O, Divakaran A, Cheng H, Sawhney H (2012) Evaluation of low-level features and their combinations for complex event detection in open source videos. In: IEEE conference on computer vision and pattern recognition, pp 3681\u20133688","DOI":"10.1109\/CVPR.2012.6248114"},{"key":"5038_CR41","doi-asserted-by":"crossref","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3d convolutional networks. In: IEEE international conference on computer vision, pp 4489\u20134497","DOI":"10.1109\/ICCV.2015.510"},{"key":"5038_CR42","doi-asserted-by":"crossref","first-page":"28","DOI":"10.3389\/frobt.2015.00028","volume":"2","author":"M Vrigkas","year":"2015","unstructured":"Vrigkas M, Nikou C, Kakadiaris IA (2015) A review of human activity recognition methods. Front Robot AI 2:28","journal-title":"Front Robot AI"},{"key":"5038_CR43","doi-asserted-by":"crossref","unstructured":"Wang H, Kl\u00e4ser A, Schmid C, Liu CL (2011) Action recognition by dense trajectories. In: IEEE conference on computer vision and pattern recognition, pp 3169\u20133176","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"5038_CR44","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In: IEEE international conference on computer vision, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"5038_CR45","doi-asserted-by":"crossref","unstructured":"Wang H, Ullah MM, Klaser A, Laptev I, Schmid C (2009) Evaluation of local spatio-temporal features for action recognition. In: British machine vision conference, vol 124, pp 1\u201311","DOI":"10.5244\/C.23.124"},{"key":"5038_CR46","doi-asserted-by":"crossref","unstructured":"Wang L, Qiao Y, Tang X (2013) Mining motion atoms and phrases for complex action recognition. In: IEEE international conference on computer vision, pp 2680\u20132687","DOI":"10.1109\/ICCV.2013.333"},{"key":"5038_CR47","doi-asserted-by":"crossref","unstructured":"Wang L, Qiao Y, Tang X (2015) Action recognition with trajectory-pooled deep-convolutional descriptors. In: IEEE conference on computer vision and pattern recognition, pp 4305\u20134314","DOI":"10.1109\/CVPR.2015.7299059"},{"key":"5038_CR48","doi-asserted-by":"crossref","unstructured":"Wang L, Ouyang W, Wang X, Lu H (2015) Visual tracking with fully convolutional networks. In: IEEE international conference on computer vision, pp 3119\u20133127","DOI":"10.1109\/ICCV.2015.357"},{"issue":"2","key":"5038_CR49","doi-asserted-by":"crossref","first-page":"224","DOI":"10.1016\/j.cviu.2010.10.002","volume":"115","author":"D Weinland","year":"2011","unstructured":"Weinland D, Ronfard R, Boyer E (2011) A survey of vision-based methods for action representation, segmentation and recognition. Comput Vis Image Underst 115 (2):224\u2013241","journal-title":"Comput Vis Image Underst"},{"issue":"10","key":"5038_CR50","doi-asserted-by":"crossref","first-page":"5701","DOI":"10.1007\/s11042-015-2536-2","volume":"75","author":"H Xu","year":"2016","unstructured":"Xu H, Tian Q, Wang Z, Wu J (2016) A survey on aggregating methods for action recognition with dense trajectories. Multimed Tools Appl 75(10):5701\u20135717","journal-title":"Multimed Tools Appl"},{"key":"5038_CR51","doi-asserted-by":"crossref","unstructured":"Xu Z, Qing L, Miao J (2015) Activity auto-completion: predicting human activities from partial videos. In: IEEE international conference on computer vision, pp 3191\u20133199","DOI":"10.1109\/ICCV.2015.365"},{"key":"5038_CR52","doi-asserted-by":"crossref","unstructured":"Xu Z, Yang Y, Hauptmann AG (2015) A discriminative cnn video representation for event detection. In: IEEE conference on computer vision and pattern recognition, pp 1798\u20131807","DOI":"10.1109\/CVPR.2015.7298789"},{"key":"5038_CR53","doi-asserted-by":"crossref","unstructured":"Yue-Hei Ng J, Hausknecht M, Vijayanarasimhan S, Vinyals O, Monga R, Toderici G (2015) Beyond short snippets: deep networks for video classification. In: IEEE conference on computer vision and pattern recognition, pp 4694\u20134702","DOI":"10.1109\/CVPR.2015.7299101"},{"key":"5038_CR54","doi-asserted-by":"crossref","first-page":"635","DOI":"10.1016\/j.ins.2013.12.052","volume":"281","author":"S Zhang","year":"2014","unstructured":"Zhang S, Yao H, Sun X, Wang K, Zhang J, Lu X, Zhang Y (2014) Action recognition based on overcomplete independent components analysis. Inf Sci 281:635\u2013647","journal-title":"Inf Sci"},{"key":"5038_CR55","doi-asserted-by":"crossref","first-page":"132","DOI":"10.1016\/j.sigpro.2014.08.027","volume":"110","author":"S Zhang","year":"2015","unstructured":"Zhang S, Zhou H, Yao H, Zhang Y, Wang K, Zhang J (2015) Adaptive normalhedge for robust visual tracking. Signal Process 110:132\u2013142","journal-title":"Signal Process"},{"key":"5038_CR56","doi-asserted-by":"crossref","unstructured":"Zhang S, Lan X, Yao H, Zhou H, Tao D, Li X (2016) A biologically inspired appearance model for robust visual tracking. In: IEEE transactions on neural networks and learning systems","DOI":"10.1109\/TNNLS.2016.2586194"},{"key":"5038_CR57","doi-asserted-by":"crossref","unstructured":"Zhang W, Zhu M, Derpanis KG (2013) From actemes to action: a strongly-supervised representation for detailed action understanding. In: IEEE international conference on computer vision, pp 2248\u20132255","DOI":"10.1109\/ICCV.2013.280"},{"key":"5038_CR58","doi-asserted-by":"crossref","unstructured":"Zhou Y, Ni B, Hong R, Wang M, Tian Q (2015) Interaction part mining: a mid-level approach for fine-grained action recognition. In: IEEE conference on computer vision and pattern recognition, pp 3323\u20133331","DOI":"10.1109\/CVPR.2015.7298953"},{"key":"5038_CR59","doi-asserted-by":"crossref","unstructured":"Zhu J, Wang B, Yang X, Zhang W, Tu Z (2013) Action recognition with actons. In: IEEE international conference on computer vision, pp 3559\u20133566","DOI":"10.1109\/ICCV.2013.442"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-017-5038-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-5038-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-5038-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,10,1]],"date-time":"2019-10-01T19:17:25Z","timestamp":1569957445000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-017-5038-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,8,2]]},"references-count":59,"journal-issue":{"issue":"21","published-print":{"date-parts":[[2017,11]]}},"alternative-id":["5038"],"URL":"https:\/\/doi.org\/10.1007\/s11042-017-5038-6","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"type":"print","value":"1380-7501"},{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2017,8,2]]}}}