{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,19]],"date-time":"2026-02-19T02:13:20Z","timestamp":1771467200217,"version":"3.50.1"},"publisher-location":"Cham","reference-count":37,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783319106014","type":"print"},{"value":"9783319106021","type":"electronic"}],"license":[{"start":{"date-parts":[[2014,1,1]],"date-time":"2014-01-01T00:00:00Z","timestamp":1388534400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2014]]},"DOI":"10.1007\/978-3-319-10602-1_38","type":"book-chapter","created":{"date-parts":[[2014,8,14]],"date-time":"2014-08-14T07:07:56Z","timestamp":1408000076000},"page":"581-595","source":"Crossref","is-referenced-by-count":180,"title":["Action Recognition with Stacked Fisher Vectors"],"prefix":"10.1007","author":[{"given":"Xiaojiang","family":"Peng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Changqing","family":"Zou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yu","family":"Qiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiang","family":"Peng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","reference":[{"issue":"3","key":"38_CR1","doi-asserted-by":"publisher","first-page":"16","DOI":"10.1145\/1922649.1922653","volume":"43","author":"J.K. Aggarwal","year":"2011","unstructured":"Aggarwal, J.K., Ryoo, M.S.: Human activity analysis: A review. ACM Computing Surveys\u00a043(3), 16 (2011)","journal-title":"ACM Computing Surveys"},{"key":"38_CR2","unstructured":"Bishop, C.M., Nasrabadi, N.M.: Pattern recognition and machine learning, vol.\u00a01 (2006)"},{"issue":"3","key":"38_CR3","first-page":"27","volume":"2","author":"C.-C. Chang","year":"2011","unstructured":"Chang, C.-C., Lin, C.-J.: Libsvm: a library for support vector machines. ACM Transactions on Intelligent Systems and Technology (TIST)\u00a02(3), 27 (2011)","journal-title":"ACM Transactions on Intelligent Systems and Technology (TIST)"},{"key":"38_CR4","doi-asserted-by":"crossref","unstructured":"Chatfield, K., Lempitsky, V., Vedaldi, A., Zisserman, A.: The devil is in the details: an evaluation of recent feature encoding methods. In: BMVC (2011)","DOI":"10.5244\/C.25.76"},{"key":"38_CR5","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"494","DOI":"10.1007\/978-3-642-15549-9_36","volume-title":"Computer Vision \u2013 ECCV 2010","author":"N. Ikizler-Cinbis","year":"2010","unstructured":"Ikizler-Cinbis, N., Sclaroff, S.: Object, scene and actions: Combining multiple features for human action recognition. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part I. LNCS, vol.\u00a06311, pp. 494\u2013507. Springer, Heidelberg (2010)"},{"key":"38_CR6","unstructured":"Jaakkola, T., Haussler, D., et al.: Exploiting generative models in discriminative classifiers. In: NIPS pp. 487\u2013493 (1999)"},{"key":"38_CR7","doi-asserted-by":"crossref","unstructured":"Jain, A., Gupta, A., Rodriguez, M., Davis, L.S.: Representing videos using mid-level discriminative patches. In: CVPR, pp. 2571\u20132578 (2013)","DOI":"10.1109\/CVPR.2013.332"},{"key":"38_CR8","doi-asserted-by":"crossref","unstructured":"Jain, M., J\u00e9gou, H., Bouthemy, P.: Better exploiting motion for better action recognition. In: CVPR, pp. 2555\u20132562 (2013)","DOI":"10.1109\/CVPR.2013.330"},{"key":"38_CR9","doi-asserted-by":"crossref","unstructured":"J\u00e9gou, H., Douze, M., Schmid, C., P\u00e9rez, P.: Aggregating local descriptors into a compact image representation. In: CVPR, pp. 3304\u20133311 (2010)","DOI":"10.1109\/CVPR.2010.5540039"},{"key":"38_CR10","doi-asserted-by":"crossref","unstructured":"Jhuang, H., Gall, J., Zuffi, S., Schmid, C., Black, M.J., et al.: Towards understanding action recognition. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.396"},{"key":"38_CR11","doi-asserted-by":"crossref","unstructured":"Ji, S., Xu, W., Yang, M., Yu, K.: 3d convolutional neural networks for human action recognition. TPAMI, 221\u2013231 (2013)","DOI":"10.1109\/TPAMI.2012.59"},{"key":"38_CR12","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"38_CR13","doi-asserted-by":"crossref","unstructured":"Klaser, A., Marsza\u0142ek, M., Schmid, C.: et\u00a0al.: A spatio-temporal descriptor based on 3d-gradients. In: BMVC (2008)","DOI":"10.5244\/C.22.99"},{"key":"38_CR14","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: NIPS, vol.\u00a01, p. 4 (2012)"},{"key":"38_CR15","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., Serre, T.: Hmdb: a large video database for human motion recognition. In: ICCV, pp. 2556\u20132563 (2011)","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"38_CR16","doi-asserted-by":"crossref","unstructured":"Laptev, I., Marszalek, M., Schmid, C., Rozenfeld, B.: Learning realistic human actions from movies. In: CVPR, pp. 1\u20138 (2008)","DOI":"10.1109\/CVPR.2008.4587756"},{"issue":"2","key":"38_CR17","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I. Laptev","year":"2005","unstructured":"Laptev, I.: On space-time interest points. IJCV\u00a064(2), 107\u2013123 (2005)","journal-title":"IJCV"},{"key":"38_CR18","doi-asserted-by":"crossref","unstructured":"Le, Q.V., et al.: Learning hierarchical invariant spatio-temporal features for action recognition with independent subspace analysis. In: CVPR, pp. 3361\u20133368 (2011)","DOI":"10.1109\/CVPR.2011.5995496"},{"key":"38_CR19","doi-asserted-by":"crossref","unstructured":"Liu, J., Kuipers, B., Savarese, S.: Recognizing human actions by attributes. In: CVPR, pp. 3337\u20133344 (2011)","DOI":"10.1109\/CVPR.2011.5995353"},{"key":"38_CR20","doi-asserted-by":"crossref","unstructured":"Liu, J., Luo, J., Shah, M.: Recognizing realistic actions from videos in the wild. In: CVPR. pp. 1996\u20132003 (2009)","DOI":"10.1109\/CVPR.2009.5206744"},{"key":"38_CR21","doi-asserted-by":"crossref","unstructured":"Liu, L., Wang, L., Liu, X.: In defense of soft-assignment coding. In: ICCV, pp. 2486\u20132493 (2011)","DOI":"10.1109\/ICCV.2011.6126534"},{"key":"38_CR22","doi-asserted-by":"crossref","unstructured":"Peng, X., Qiao, Y., Peng, Q., Qi, X.: Exploring motion boundary based sampling and spatial-temporal context descriptors for action recognition. In: BMVC, pp. 1\u201311 (2013)","DOI":"10.5244\/C.27.59"},{"key":"38_CR23","unstructured":"Peng, X., Wang, L., Wang, X., Qiao, Y.: Bag of visual words and fusion methods for action recognition: Comprehensive study and good practice. CoRR abs\/1405.4506 (2014)"},{"key":"38_CR24","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"143","DOI":"10.1007\/978-3-642-15561-1_11","volume-title":"Computer Vision \u2013 ECCV 2010","author":"F. Perronnin","year":"2010","unstructured":"Perronnin, F., S\u00e1nchez, J., Mensink, T.: Improving the fisher kernel for large-scale image classification. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010, Part IV. LNCS, vol.\u00a06314, pp. 143\u2013156. Springer, Heidelberg (2010)"},{"key":"38_CR25","doi-asserted-by":"crossref","unstructured":"Ren, X., Ramanan, D.: Histograms of sparse codes for object detection. In: CVPR, pp. 3246\u20133253 (2013)","DOI":"10.1109\/CVPR.2013.417"},{"key":"38_CR26","doi-asserted-by":"crossref","unstructured":"Sadanand, S., Corso, J.J.: Action bank: A high-level representation of activity in video. In: CVPR, pp. 1234\u20131241 (2012)","DOI":"10.1109\/CVPR.2012.6247806"},{"key":"38_CR27","doi-asserted-by":"crossref","unstructured":"Sapienza, M., Cuzzolin, F., Torr, P.H.: Learning discriminative space\u2013time action parts from weakly labelled videos. IJCV, 1\u201318 (2014)","DOI":"10.1007\/s11263-013-0662-8"},{"key":"38_CR28","unstructured":"Simonyan, K., Vedaldi, A., Zisserman, A.: Deep fisher networks for large-scale image classification. In: NIPS, pp. 163\u2013171 (2013)"},{"key":"38_CR29","doi-asserted-by":"crossref","unstructured":"Sivic, J., Zisserman, A.: Video google: A text retrieval approach to object matching in videos. In: ICCV, pp. 1470\u20131477 (2003)","DOI":"10.1109\/ICCV.2003.1238663"},{"key":"38_CR30","doi-asserted-by":"crossref","unstructured":"Wang, H., Klaser, A., Schmid, C., Liu, C.-L.: Action recognition by dense trajectories. In: CVPR, pp. 3169\u20133176 (2011)","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"38_CR31","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Liu, C.-L.: Dense trajectories and motion boundary descriptors for action recognition. IJCV, 1\u201320 (2013)","DOI":"10.1007\/s11263-012-0594-8"},{"key":"38_CR32","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C., et al.: Action recognition with improved trajectories. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"38_CR33","doi-asserted-by":"crossref","unstructured":"Wang, H., Ullah, M.M., Klaser, A., Laptev, I., Cordelia, Schmid, o.: Evaluation of local spatio-temporal features for action recognition. In: BMVC (2009)","DOI":"10.5244\/C.23.124"},{"key":"38_CR34","doi-asserted-by":"crossref","unstructured":"Wang, L., Qiao, Y., Tang, X.: Mining motion atoms and phrases for complex action recognition. In: ICCV, pp. 2680\u20132687 (2013)","DOI":"10.1109\/ICCV.2013.333"},{"key":"38_CR35","doi-asserted-by":"crossref","unstructured":"Wang, L., Qiao, Y., Tang, X.: Motionlets: Mid-level 3d parts for human motion recognition. In: CVPR, pp. 2674\u20132681 (2013)","DOI":"10.1109\/CVPR.2013.345"},{"key":"38_CR36","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"572","DOI":"10.1007\/978-3-642-37431-9_44","volume-title":"Computer Vision \u2013 ACCV 2012","author":"X. Wang","year":"2013","unstructured":"Wang, X., Wang, L., Qiao, Y.: A comparative study of encoding, pooling and normalization methods for action recognition. In: Lee, K.M., Matsushita, Y., Rehg, J.M., Hu, Z. (eds.) ACCV 2012, Part III. LNCS, vol.\u00a07726, pp. 572\u2013585. Springer, Heidelberg (2013)"},{"key":"38_CR37","doi-asserted-by":"crossref","unstructured":"Zhu, J., Wang, B., Yang, X., Zhang, W., Tu, Z.: Action recognition with actons. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.442"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2014"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-10602-1_38","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,4]],"date-time":"2025-05-04T05:37:19Z","timestamp":1746337039000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-10602-1_38"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014]]},"ISBN":["9783319106014","9783319106021"],"references-count":37,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-10602-1_38","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2014]]}}}