{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,12]],"date-time":"2025-06-12T04:13:56Z","timestamp":1749701636325,"version":"3.41.0"},"publisher-location":"Cham","reference-count":36,"publisher":"Springer International Publishing","isbn-type":[{"type":"print","value":"9783319486796"},{"type":"electronic","value":"9783319486802"}],"license":[{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2016]]},"DOI":"10.1007\/978-3-319-48680-2_56","type":"book-chapter","created":{"date-parts":[[2016,10,20]],"date-time":"2016-10-20T17:31:00Z","timestamp":1476984660000},"page":"638-647","source":"Crossref","is-referenced-by-count":3,"title":["Spatiotemporal Features Learning with 3DPyraNet"],"prefix":"10.1007","author":[{"given":"Ihsan","family":"Ullah","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alfredo","family":"Petrosino","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2016,10,21]]},"reference":[{"key":"56_CR1","doi-asserted-by":"crossref","unstructured":"Laptev, I., Marszaek, M., Schmid, C., Rozenfeld, B.: Learning realistic human actions from movies. In: 26th IEEE Conference on Computer Vision and Pattern Recognition, CVPR (2008)","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"56_CR2","doi-asserted-by":"crossref","unstructured":"Wang, H., Ullah, M.M., Klaser, A., Laptev, I., Schmid, C.: Evaluation of local spatiotemporal features for action recognition. In: BMVC 2009 - British Machine Vision Conference, pp. 124.1\u2013124.11 (2009)","DOI":"10.5244\/C.23.124"},{"key":"56_CR3","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Cheng-Lin, L.: Action recognition by dense trajectories. In: CVPR 2011 - IEEE Conference on Computer Vision & Pattern Recognition, Colorado Springs, United States, pp. 3169\u20133176. IEEE, June 2011","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"56_CR4","doi-asserted-by":"crossref","unstructured":"Sch\u00fcldt, C., Laptev, I., Caputo, B.: Recognizing human actions: a local SVM approach. In: Proceedings - International Conference on Pattern Recognition, vol. 3, pp. 32\u201336 (2004)","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"56_CR5","doi-asserted-by":"crossref","unstructured":"Derpanis, K.G., Lecce, M., Daniilidis, K., Wildes, R.P.: Dynamic scene understanding: the role of orientation features in space and time in scene classification. In: 2012 IEEE Conference on Computer Vision and Pattern Recognition, pp. 1306\u20131313 (2012)","DOI":"10.1109\/CVPR.2012.6247815"},{"key":"56_CR6","unstructured":"Soomro, K., Zamir, A.R., Shah, M.: UCF101: a dataset of 101 human actions classes from videos in the wild. CoRR abs\/1212.0402 (2012)"},{"key":"56_CR7","doi-asserted-by":"crossref","unstructured":"Le, Q.V., Zou, W.Y., Yeung, S.Y., Ng, A.Y.: Learning hierarchical invariant spatiotemporal features for action recognition with independent subspace analysis. In: Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, pp. 3361\u20133368 (2011)","DOI":"10.1109\/CVPR.2011.5995496"},{"key":"56_CR8","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3D convolutional networks. In: ICCV, pp. 1725\u20131732. IEEE, June 2015","DOI":"10.1109\/ICCV.2015.510"},{"key":"56_CR9","doi-asserted-by":"crossref","unstructured":"Scovanner, P., Ali, S., Shah, M.: A 3-dimensional sift descriptor and its application to action recognition. In: Proceedings of the ACM International Conference on Multimedia (MM 2007), pp. 357\u2013360 (2007)","DOI":"10.1145\/1291233.1291311"},{"key":"56_CR10","doi-asserted-by":"crossref","unstructured":"Klaser, A., Marszalek, M., Schmid, C.: A spatiotemporal descriptor based on 3D-gradients. In: Proceedings of the British Machine Conference, pp. 99.1\u201399.10 (2008)","DOI":"10.5244\/C.22.99"},{"key":"56_CR11","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"650","DOI":"10.1007\/978-3-540-88688-4_48","volume-title":"Computer Vision \u2013 ECCV 2008","author":"G Willems","year":"2008","unstructured":"Willems, G., Tuytelaars, T., Gool, L.: An efficient dense and scale-invariant spatiotemporal interest point detector. In: Forsyth, D., Torr, P., Zisserman, A. (eds.) ECCV 2008. LNCS, vol. 5303, pp. 650\u2013663. Springer, Heidelberg (2008). doi: 10.1007\/978-3-540-88688-4_48"},{"key":"56_CR12","doi-asserted-by":"crossref","unstructured":"Yeffet, L., Wolf, L.: Local trinary patterns for human action recognition. In: IEEE 12th International Conference on Computer Vision, pp. 492\u2013497, September 2009","DOI":"10.1109\/ICCV.2009.5459201"},{"key":"56_CR13","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"140","DOI":"10.1007\/978-3-642-15567-3_11","volume-title":"Computer Vision \u2013 ECCV 2010","author":"GW Taylor","year":"2010","unstructured":"Taylor, G.W., Fergus, R., LeCun, Y., Bregler, C.: Convolutional learning of spatiotemporal features. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010. LNCS, vol. 6316, pp. 140\u2013153. Springer, Heidelberg (2010). doi: 10.1007\/978-3-642-15567-3_11"},{"key":"56_CR14","unstructured":"Freitas, N.D.: Deep learning of invariant spatiotemporal features from video. In: Workshop on Deep Learning and Unsupervised Feature Learning in NIPS, pp. 1\u20139 (2010)"},{"key":"56_CR15","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"29","DOI":"10.1007\/978-3-642-25446-8_4","volume-title":"Human Behavior Understanding","author":"M Baccouche","year":"2011","unstructured":"Baccouche, M., Mamalet, F., Wolf, C., Garcia, C., Baskurt, A.: Sequential deep learning for human action recognition. In: Salah, A.A., Lepri, B. (eds.) HBU 2011. LNCS, vol. 7065, pp. 29\u201339. Springer, Heidelberg (2011). doi: 10.1007\/978-3-642-25446-8_4"},{"key":"56_CR16","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"crossref","first-page":"236","DOI":"10.1007\/978-3-319-23231-7_22","volume-title":"Image Analysis and Processing \u2013 ICIAP 2015","author":"I Ullah","year":"2015","unstructured":"Ullah, I., Petrosino, A.: A strict pyramidal deep neural network for action recognition. In: Murino, V., Puppo, E. (eds.) ICIAP 2015. LNCS, vol. 9279, pp. 236\u2013245. Springer, Heidelberg (2015)"},{"issue":"1","key":"56_CR17","doi-asserted-by":"crossref","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2013","unstructured":"Ji, S., Yang, M., Yu, K.: 3D convolutional neural networks for human action recognition. IEEE Trans. Pattern Anal. Mach. Intell. 35(1), 221\u2013231 (2013)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"56_CR18","unstructured":"Simonyan, K., Zisserman, A.: Two-Stream Convolutional Networks for Action Recognition in Videos. arXiv preprint arXiv:1406.2199 , pp. 1\u201311, June 2014"},{"key":"56_CR19","unstructured":"Uetz, R., Behnke, S.: Locally-connected hierarchical neural networks for gpu-accelerated object recognition. In: NIPS: Workshop on Large-Scale Machine Learning: Parallelism and Massive Datasets, Whistler, Canada, pp. 10\u201313, December 2009"},{"issue":"2","key":"56_CR20","doi-asserted-by":"crossref","first-page":"472","DOI":"10.1109\/72.991433","volume":"13","author":"V Cantoni","year":"2002","unstructured":"Cantoni, V., Petrosino, A.: Neural recognition in a pyramidal structure. IEEE Trans. Neural Netw. 13(2), 472\u2013480 (2002)","journal-title":"IEEE Trans. Neural Netw."},{"issue":"2","key":"56_CR21","doi-asserted-by":"crossref","first-page":"329","DOI":"10.1109\/TNN.2006.884677","volume":"18","author":"SL Phung","year":"2007","unstructured":"Phung, S.L., Bouzerdoum, A.: A pyramidal neural network for visual pattern recognition. IEEE Trans. Neural Netw. Publ. IEEE Neural Netw. Counc. 18(2), 329\u2013343 (2007)","journal-title":"IEEE Trans. Neural Netw. Publ. IEEE Neural Netw. Counc."},{"key":"56_CR22","doi-asserted-by":"crossref","first-page":"65","DOI":"10.1016\/j.cviu.2013.11.006","volume":"122","author":"L Maddalena","year":"2014","unstructured":"Maddalena, L., Petrosino, A.: The 3dsobs+ algorithm for moving object detection. Comput. Vis. Image Underst. 122, 65\u201373 (2014)","journal-title":"Comput. Vis. Image Underst."},{"key":"56_CR23","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Leung, T.: Large-scale video classification with convolutional neural networks. In: Proceedings of 2014 IEEE Conference on Computer Vision and Pattern Recognition, pp. 1725\u20131732 (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"56_CR24","doi-asserted-by":"crossref","unstructured":"Blank, M., Gorelick, L., Shechtman, E., Irani, M., Basri, R.: Actions as space-time shapes. In: Tenth IEEE International Conference on Computer Vision (ICCV 2005), vol. 1, pp. 1395\u20131402 (2005). Vol. 2","DOI":"10.1109\/ICCV.2005.28"},{"key":"56_CR25","unstructured":"MATLAB: Matlab version 8.4.0.150421 (R2014b). The MathWorks Inc., Natick, Massachusetts (2014)"},{"key":"56_CR26","doi-asserted-by":"crossref","unstructured":"Maninis, K., Koutras, P., Maragos, P.: Advances on action recognition in videos using an interest point detector based on multiband spatiotemporal energies. In: 2014 IEEE International Conference on Image Processing, ICIP 2014, Paris, France, October 27\u201330, 2014, pp. 1490\u20131494 (2014)","DOI":"10.1109\/ICIP.2014.7025298"},{"key":"56_CR27","unstructured":"Chen, B., Ting, J.A., Marlin, B., de Freitas, N.: Deep learning of invariant spatiotemporal features from video. In: NIPS 2010 Deep Learning and Unsupervised Feature Learning Workshop (2010)"},{"key":"56_CR28","doi-asserted-by":"crossref","unstructured":"Doll\u00e1r, P., Rabaud, V., Cottrell, G., Belongie, S.: Behavior recognition via sparse spatiotemporal features. In: Proceedings - 2nd Joint IEEE International Workshop on Visual Surveillance and Performance Evaluation of Tracking and Surveillance, VS-PETS 2005, pp. 65\u201372 (2005)","DOI":"10.1109\/VSPETS.2005.1570899"},{"key":"56_CR29","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"635","DOI":"10.1007\/978-3-642-15558-1_46","volume-title":"Computer Vision \u2013 ECCV 2010","author":"D Weinland","year":"2010","unstructured":"Weinland, D., \u00d6zuysal, M., Fua, P.: Making action recognition robust to occlusions and viewpoint changes. In: Daniilidis, K., Maragos, P., Paragios, N. (eds.) ECCV 2010. LNCS, vol. 6313, pp. 635\u2013648. Springer, Heidelberg (2010). doi: 10.1007\/978-3-642-15558-1_46"},{"key":"56_CR30","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., Wildes, R.P.: Spacetime forests with complementary features for dynamic scene recognition. In: BMVC (2013)","DOI":"10.5244\/C.27.56"},{"key":"56_CR31","doi-asserted-by":"crossref","unstructured":"Theriault, C., Thome, N., Cord, M.: Dynamic scene classification: Learning motion descriptors with slow features analysis. In: 2013 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2603\u20132610, June 2013","DOI":"10.1109\/CVPR.2013.336"},{"key":"56_CR32","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., Wildes, R.: Bags of spacetime energies for dynamic scene recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2681\u20132688 (2014)","DOI":"10.1109\/CVPR.2014.343"},{"key":"56_CR33","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Advances in Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"56_CR34","unstructured":"Han, S., Pool, J., Tran, J., Dally, W.J.: Learning both weights and connections for efficient neural networks. CoRR abs\/1506.02626 (2015)"},{"key":"56_CR35","unstructured":"Lin, M., Chen, Q., Yan, S.: Network in network. CoRR abs\/1312.4400 (2013)"},{"key":"56_CR36","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., Rabinovich, A.: Going deeper with convolutions. In: CVPR, USA, June 7\u201312, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPR.2015.7298594"}],"container-title":["Lecture Notes in Computer Science","Advanced Concepts for Intelligent Vision Systems"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-48680-2_56","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,11]],"date-time":"2025-06-11T18:41:23Z","timestamp":1749667283000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-48680-2_56"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016]]},"ISBN":["9783319486796","9783319486802"],"references-count":36,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-48680-2_56","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2016]]}}}