{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,28]],"date-time":"2025-10-28T10:44:24Z","timestamp":1761648264188,"version":"3.41.0"},"publisher-location":"Cham","reference-count":41,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319166278"},{"type":"electronic","value":"9783319166285"}],"license":[{"start":{"date-parts":[[2015,1,1]],"date-time":"2015-01-01T00:00:00Z","timestamp":1420070400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2015,1,1]],"date-time":"2015-01-01T00:00:00Z","timestamp":1420070400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2015]]},"DOI":"10.1007\/978-3-319-16628-5_8","type":"book-chapter","created":{"date-parts":[[2015,4,11]],"date-time":"2015-04-11T06:31:51Z","timestamp":1428733911000},"page":"99-112","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Action Recognition Using Hybrid Feature Descriptor and VLAD Video Encoding"],"prefix":"10.1007","author":[{"given":"Dong","family":"Xing","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xianzhong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongtao","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2015,4,12]]},"reference":[{"key":"8_CR1","doi-asserted-by":"crossref","unstructured":"J\u00e9gou, H., Douze, M., Schmid, C., P\u00e9rez, P.: Aggregating local descriptors into a compact image representation. In: 2010 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3304\u20133311. IEEE (2010)","DOI":"10.1109\/CVPR.2010.5540039"},{"key":"8_CR2","doi-asserted-by":"crossref","unstructured":"Arandjelovic, R., Zisserman, A.: All about vlad. In: 2013 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1578\u20131585. IEEE (2013)","DOI":"10.1109\/CVPR.2013.207"},{"key":"8_CR3","doi-asserted-by":"crossref","unstructured":"Wang, H., Ullah, M.M., Klaser, A., Laptev, I., Schmid, C., et al.: Evaluation of local spatio-temporal features for action recognition. In: BMVC 2009-British Machine Vision Conference (2009)","DOI":"10.5244\/C.23.124"},{"key":"8_CR4","doi-asserted-by":"crossref","unstructured":"Dalal, N., Triggs, B.: Histograms of oriented gradients for human detection. In: IEEE Computer Society Conference on Computer Vision and Pattern Recognition, CVPR 2005, vol. 1, pp. 886\u2013893. IEEE (2005)","DOI":"10.1109\/CVPR.2005.177"},{"key":"8_CR5","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"428","DOI":"10.1007\/11744047_33","volume-title":"Computer Vision \u2013 ECCV 2006","author":"N Dalal","year":"2006","unstructured":"Dalal, N., Triggs, B., Schmid, C.: Human detection using oriented histograms of flow and appearance. In: Leonardis, A., Bischof, H., Pinz, A. (eds.) ECCV 2006. LNCS, vol. 3952, pp. 428\u2013441. Springer, Heidelberg (2006)"},{"key":"8_CR6","doi-asserted-by":"crossref","unstructured":"Wang, H., Klaser, A., Schmid, C., Liu, C.L.: Action recognition by dense trajectories. In: 2011 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3169\u20133176. IEEE (2011)","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"8_CR7","doi-asserted-by":"crossref","unstructured":"Liu, J., Luo, J., Shah, M.: Recognizing realistic actions from videos in the wild. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2009, pp. 1996\u20132003. IEEE (2009)","DOI":"10.1109\/CVPR.2009.5206744"},{"key":"8_CR8","doi-asserted-by":"publisher","first-page":"2247","DOI":"10.1109\/TPAMI.2007.70711","volume":"29","author":"L Gorelick","year":"2007","unstructured":"Gorelick, L., Blank, M., Shechtman, E., Irani, M., Basri, R.: Actions as space-time shapes. IEEE Trans. Pattern Anal. Mach. Intell. 29, 2247\u20132253 (2007)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"8_CR9","doi-asserted-by":"crossref","unstructured":"Schuldt, C., Laptev, I., Caputo, B.: Recognizing human actions: a local svm approach. In: Proceedings of the 17th International Conference on Pattern Recognition, ICPR 2004, vol. 3, pp. 32\u201336. IEEE (2004)","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"8_CR10","doi-asserted-by":"publisher","first-page":"976","DOI":"10.1016\/j.imavis.2009.11.014","volume":"28","author":"R Poppe","year":"2010","unstructured":"Poppe, R.: A survey on vision-based human action recognition. Image Vis. Comput. 28, 976\u2013990 (2010)","journal-title":"Image Vis. Comput."},{"key":"8_CR11","doi-asserted-by":"publisher","first-page":"257","DOI":"10.1109\/34.910878","volume":"23","author":"AF Bobick","year":"2001","unstructured":"Bobick, A.F., Davis, J.W.: The recognition of human movement using temporal templates. IEEE Trans. Pattern Anal. Mach. Intell. 23, 257\u2013267 (2001)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"8_CR12","unstructured":"Carlsson, S., Sullivan, J.: Action recognition by shape matching to key frames. In: Workshop on Models versus Exemplars in Computer Vision, vol. 1, p. 18 (2001)"},{"key":"8_CR13","doi-asserted-by":"crossref","unstructured":"Efros, A.A., Berg, A.C., Mori, G., Malik, J.: Recognizing action at a distance. In: Ninth IEEE International Conference on Computer Vision, Proceedings, pp. 726\u2013733. IEEE (2003)","DOI":"10.1109\/ICCV.2003.1238420"},{"key":"8_CR14","doi-asserted-by":"crossref","unstructured":"Laptev, I., Marszalek, M., Schmid, C., Rozenfeld, B.: Learning realistic human actions from movies. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2008, pp. 1\u20138. IEEE (2008)","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"8_CR15","doi-asserted-by":"crossref","unstructured":"Lowe, D.G.: Object recognition from local scale-invariant features. In: The Proceedings of the Seventh IEEE International Conference on Computer vision, vol. 2, pp. 1150\u20131157. IEEE (1999)","DOI":"10.1109\/ICCV.1999.790410"},{"key":"8_CR16","doi-asserted-by":"crossref","unstructured":"Klaser, A., Marszalek, M.: A spatio-temporal descriptor based on 3d-gradients (2008)","DOI":"10.5244\/C.22.99"},{"key":"8_CR17","doi-asserted-by":"crossref","unstructured":"Scovanner, P., Ali, S., Shah, M.: A 3-dimensional sift descriptor and its application to action recognition. In: Proceedings of the 15th International Conference on Multimedia, pp. 357\u2013360. ACM (2007)","DOI":"10.1145\/1291233.1291311"},{"key":"8_CR18","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"650","DOI":"10.1007\/978-3-540-88688-4_48","volume-title":"Computer Vision \u2013 ECCV 2008","author":"G Willems","year":"2008","unstructured":"Willems, G., Tuytelaars, T., Van Gool, L.: An efficient dense and scale-invariant spatio-temporal interest point detector. In: Forsyth, D., Torr, P., Zisserman, A. (eds.) ECCV 2008, Part II. LNCS, vol. 5303, pp. 650\u2013663. Springer, Heidelberg (2008)"},{"key":"8_CR19","doi-asserted-by":"crossref","unstructured":"Doll\u00e1r, P., Rabaud, V., Cottrell, G., Belongie, S.: Behavior recognition via sparse spatio-temporal features. In: 2nd Joint IEEE International Workshop on Visual Surveillance and Performance Evaluation of Tracking and Surveillance, pp. 65\u201372. IEEE (2005)","DOI":"10.1109\/VSPETS.2005.1570899"},{"key":"8_CR20","doi-asserted-by":"crossref","unstructured":"Laptev, I., P\u00e9rez, P.: Retrieving actions in movies. In: IEEE 11th International Conference on Computer Vision, ICCV 2007, pp. 1\u20138. IEEE (2007)","DOI":"10.1109\/ICCV.2007.4409105"},{"key":"8_CR21","doi-asserted-by":"crossref","unstructured":"Lin, Z., Jiang, Z., Davis, L.S.: Recognizing actions by shape-motion prototype trees. In: 2009 IEEE 12th International Conference on Computer Vision, pp. 444\u2013451. IEEE (2009)","DOI":"10.1109\/ICCV.2009.5459184"},{"key":"8_CR22","doi-asserted-by":"crossref","unstructured":"Liu, J., Ali, S., Shah, M.: Recognizing human actions using multiple features. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2008, pp. 1\u20138. IEEE (2008)","DOI":"10.1109\/CVPR.2008.4587527"},{"key":"8_CR23","doi-asserted-by":"crossref","unstructured":"Liu, J., Shah, M.: Learning human actions via information maximization. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2008, pp. 1\u20138. IEEE (2008)","DOI":"10.1109\/CVPR.2008.4587723"},{"key":"8_CR24","doi-asserted-by":"crossref","unstructured":"Wang, J., Yang, J., Yu, K., Lv, F., Huang, T., Gong, Y.: Locality-constrained linear coding for image classification. In: 2010 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3360\u20133367. IEEE (2010)","DOI":"10.1109\/CVPR.2010.5540018"},{"key":"8_CR25","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"143","DOI":"10.1007\/978-3-642-15561-1_11","volume-title":"Computer Vision \u2013 ECCV 2010","author":"F Perronnin","year":"2010","unstructured":"Perronnin, F., S\u00e1nchez, J., Mensink, T.: Improving the fisher kernel for large-scale image classification. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part IV. LNCS, vol. 6314, pp. 143\u2013156. Springer, Heidelberg (2010)"},{"key":"8_CR26","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"141","DOI":"10.1007\/978-3-642-15555-0_11","volume-title":"Computer Vision \u2013 ECCV 2010","author":"X Zhou","year":"2010","unstructured":"Zhou, X., Yu, K., Zhang, T., Huang, T.S.: Image classification using super-vector coding of local image descriptors. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part V. LNCS, vol. 6315, pp. 141\u2013154. Springer, Heidelberg (2010)"},{"key":"8_CR27","doi-asserted-by":"crossref","unstructured":"Kovashka, A., Grauman, K.: Learning a hierarchy of discriminative space-time neighborhood features for human action recognition. In: 2010 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2046\u20132053. IEEE (2010)","DOI":"10.1109\/CVPR.2010.5539881"},{"key":"8_CR28","unstructured":"Yang, J., Yu, K., Gong, Y., Huang, T.: Linear spatial pyramid matching using sparse coding for image classification. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2009, pp. 1794\u20131801. IEEE (2009)"},{"key":"8_CR29","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev, I.: On space-time interest points. Int. J. Comput. Vis. 64, 107\u2013123 (2005)","journal-title":"Int. J. Comput. Vis."},{"key":"8_CR30","first-page":"27","volume":"2","author":"CC Chang","year":"2011","unstructured":"Chang, C.C., Lin, C.J.: Libsvm: a library for support vector machines. ACM Trans. Intell. Syst. Technol. (TIST) 2, 27 (2011)","journal-title":"ACM Trans. Intell. Syst. Technol. (TIST)"},{"key":"8_CR31","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"707","DOI":"10.1007\/978-3-642-33712-3_51","volume-title":"Computer Vision \u2013 ECCV 2012","author":"Y Zhang","year":"2012","unstructured":"Zhang, Y., Liu, X., Chang, M.-C., Ge, W., Chen, T.: Spatio-temporal phrases for activity recognition. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012, Part III. LNCS, vol. 7574, pp. 707\u2013721. Springer, Heidelberg (2012)"},{"key":"8_CR32","doi-asserted-by":"publisher","first-page":"971","DOI":"10.1007\/s00138-012-0450-4","volume":"24","author":"KK Reddy","year":"2013","unstructured":"Reddy, K.K., Shah, M.: Recognizing 50 human action categories of web videos. Mach. Vis. Appl. 24, 971\u2013981 (2013)","journal-title":"Mach. Vis. Appl."},{"key":"8_CR33","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"494","DOI":"10.1007\/978-3-642-15549-9_36","volume-title":"Computer Vision \u2013 ECCV 2010","author":"N Ikizler-Cinbis","year":"2010","unstructured":"Ikizler-Cinbis, N., Sclaroff, S.: Object, scene and actions: combining multiple features for human action recognition. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part I. LNCS, vol. 6311, pp. 494\u2013507. Springer, Heidelberg (2010)"},{"key":"8_CR34","doi-asserted-by":"crossref","unstructured":"Le, Q.V., Zou, W.Y., Yeung, S.Y., Ng, A.Y.: Learning hierarchical invariant spatio-temporal features for action recognition with independent subspace analysis. In: 2011 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3361\u20133368. IEEE (2011)","DOI":"10.1109\/CVPR.2011.5995496"},{"key":"8_CR35","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"721","DOI":"10.1007\/978-3-642-15552-9_52","volume-title":"Computer Vision \u2013 ECCV 2010","author":"W Brendel","year":"2010","unstructured":"Brendel, W., Todorovic, S.: Activities as time series of human postures. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part II. LNCS, vol. 6312, pp. 721\u2013734. Springer, Heidelberg (2010)"},{"key":"8_CR36","doi-asserted-by":"publisher","first-page":"159","DOI":"10.1007\/s00138-013-0545-6","volume":"25","author":"X Cao","year":"2014","unstructured":"Cao, X., Zhang, H., Deng, C., Liu, Q., Liu, H.: Action recognition using 3d daisy descriptor. Mach. Vis. Appl. 25, 159\u2013171 (2014)","journal-title":"Mach. Vis. Appl."},{"key":"8_CR37","doi-asserted-by":"crossref","unstructured":"Grundmann, M., Meier, F., Essa, I.: 3d shape context and distance transform for action recognition. In: 19th International Conference on Pattern Recognition, ICPR 2008, pp. 1\u20134. IEEE (2008)","DOI":"10.1109\/ICPR.2008.4761435"},{"key":"8_CR38","doi-asserted-by":"crossref","unstructured":"Fathi, A., Mori, G.: Action recognition by learning mid-level motion features. In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2008, pp. 1\u20138. IEEE (2008)","DOI":"10.1109\/CVPR.2008.4587735"},{"key":"8_CR39","doi-asserted-by":"crossref","unstructured":"Schindler, K., Van Gool, L.: Action snippets: How many frames does human action recognition require? In: IEEE Conference on Computer Vision and Pattern Recognition, CVPR 2008, pp. 1\u20138. IEEE (2008)","DOI":"10.1109\/CVPR.2008.4587730"},{"key":"8_CR40","doi-asserted-by":"crossref","unstructured":"Cai, Q., Yin, Y., Man, H.: Learning spatio-temporal dependencies for action recognition, ICIP (2013)","DOI":"10.1109\/ICIP.2013.6738771"},{"key":"8_CR41","doi-asserted-by":"crossref","unstructured":"Liu, L., Shao, L., Zhen, X., Li, X.: Learning discriminative key poses for action recognition (2013)","DOI":"10.1109\/TSMCB.2012.2231959"}],"container-title":["Lecture Notes in Computer Science","Computer Vision - ACCV 2014 Workshops"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-16628-5_8","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,22]],"date-time":"2025-05-22T10:23:56Z","timestamp":1747909436000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-319-16628-5_8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015]]},"ISBN":["9783319166278","9783319166285"],"references-count":41,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-16628-5_8","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2015]]},"assertion":[{"value":"12 April 2015","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}}]}}