{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,30]],"date-time":"2026-01-30T00:25:34Z","timestamp":1769732734055,"version":"3.49.0"},"reference-count":36,"publisher":"Springer Science and Business Media LLC","issue":"37-38","license":[{"start":{"date-parts":[[2020,6,20]],"date-time":"2020-06-20T00:00:00Z","timestamp":1592611200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,6,20]],"date-time":"2020-06-20T00:00:00Z","timestamp":1592611200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"Natural Science Foundation of China","doi-asserted-by":"crossref","award":["U1536203 and 61972169"],"award-info":[{"award-number":["U1536203 and 61972169"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"name":"National key research and development program of China","award":["2016QY01W0200"],"award-info":[{"award-number":["2016QY01W0200"]}]},{"name":"Major Scientific and Technological Project of Hubei Province","award":["2018AAA068 and 2019AAA051"],"award-info":[{"award-number":["2018AAA068 and 2019AAA051"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2020,10]]},"DOI":"10.1007\/s11042-020-09137-5","type":"journal-article","created":{"date-parts":[[2020,6,20]],"date-time":"2020-06-20T07:02:37Z","timestamp":1592636557000},"page":"26913-26926","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["XwiseNet: action recognition with Xwise separable convolutions"],"prefix":"10.1007","volume":"79","author":[{"given":"Hefei","family":"Ling","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2008-2691","authenticated-orcid":false,"given":"Yao","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiazhong","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lei","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuxuan","family":"Shi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jing","family":"Deng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,6,20]]},"reference":[{"key":"9137_CR1","doi-asserted-by":"publisher","first-page":"48451","DOI":"10.1109\/ACCESS.2020.2979348","volume":"8","author":"W Cai","year":"2020","unstructured":"Cai W, Wei Z (2020) PiiGAN: generative adversarial network for pluralistic image inpainting. IEEE Access 8:48451\u201348463. https:\/\/doi.org\/10.1109\/ACCESS.2979348","journal-title":"IEEE Access"},{"key":"9137_CR2","doi-asserted-by":"crossref","unstructured":"Carreira J, Zisserman A (2017) Quo vadis, action recognition? a new model and the kinetics dataset. In: The IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","DOI":"10.1109\/CVPR.2017.502"},{"key":"9137_CR3","doi-asserted-by":"crossref","unstructured":"Chen Y, Fang H, Xu B, Yan Z, Kalantidis Y, Rohrbach M, Yan S, Feng J (2019) Drop an octave: reducing spatial redundancy in convolutional neural networks with octave convolution. 1904.05049","DOI":"10.1109\/ICCV.2019.00353"},{"key":"9137_CR4","doi-asserted-by":"crossref","unstructured":"Chen Y, Kalantidis Y, Li J, Yan S, Feng J (2018) Multi-fiber networks for video recognition. arXiv:1807.11195","DOI":"10.1007\/978-3-030-01246-5_22"},{"key":"9137_CR5","unstructured":"Diba A, Fayyaz M, Sharma V, Karami AH, Arzani MM, Yousefzadeh R, Van Gool L (2017) Temporal 3d convnets: New architecture and transfer learning for video classification.1711.08200"},{"key":"9137_CR6","unstructured":"Doll\u00e1r P, Rabaud V, Cottrell G, et al. (2005) Behavior recognition via sparse spatio-temporal features. Beijing, China:VS-PETS"},{"key":"9137_CR7","doi-asserted-by":"publisher","unstructured":"Feichtenhofer C, Fan H, Malik J, He K (2019) Slow fast networks for video recognition. pp 16201\u20136210. https:\/\/doi.org\/10.1109\/ICCV.2019.00630","DOI":"10.1109\/ICCV.2019.00630"},{"key":"9137_CR8","doi-asserted-by":"crossref","unstructured":"Hara K, H Kataoka, Y Satoh (2018) Can spatiotemporal 3d cnns retrace the history of 2d cnns and imagenet?. In: The IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2018.00685"},{"key":"9137_CR9","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2015) Deep residual learning for image recognition. volume 1512.03385","DOI":"10.1109\/CVPR.2016.90"},{"key":"9137_CR10","unstructured":"Howard AG, Zhu M, Chen B, Kalenichenko D, Wang W, Weyand T, Andreetto M, Adam H (2017) Mobilenets: efficient convolutional neural networks for mobile vision applications. 1704.04861"},{"key":"9137_CR11","unstructured":"Iandola FN, Moskewicz MW, Ashraf K, Song H, Dally WJ, Squeezenet Kurt Keutzer. (2016) Squeezenet: Alexnet-level accuracy with 50x fewer parameters and <\u20090.5MB model size. 1602.07360"},{"key":"9137_CR12","doi-asserted-by":"crossref","unstructured":"Ikizler N, Cinbis R G, Duygulu P. (2008) Human action recognition with line and flow histograms. In: 2008 19th international conference on pattern recognition. IEEE, Piscataway, pp 1\u20134","DOI":"10.1109\/ICPR.2008.4761434"},{"key":"9137_CR13","unstructured":"Ioffe S, Szegedy C (2015) Batch normalization: accelerating deep network training by reducing internal covariate shift. 1502.03167"},{"key":"9137_CR14","doi-asserted-by":"crossref","unstructured":"Jhuang H, Serre T, Wolf L, et al. (2007) A biologically inspired system for action recognition. In: 2007 IEEE 11th international conference on computer vision. IEEE, Piscataway, pp 1\u20138","DOI":"10.1109\/ICCV.2007.4408988"},{"issue":"1","key":"9137_CR15","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2013","unstructured":"Ji S, Yang M, Yu K (2013) 3d Convolutional neural networks for human action recognition. IEEE Trans Pattern Anal 35(1):221\u2013231","journal-title":"IEEE Trans Pattern Anal"},{"key":"9137_CR16","doi-asserted-by":"crossref","unstructured":"Kim TK, Wong SF, Cipolla R (2007) Tensor canonical correlation analysis for action classification. In: 2007 IEEE conference on computer vision and pattern recognition. IEEE, Piscataway, pp 1\u20138","DOI":"10.1109\/CVPR.2007.383137"},{"key":"9137_CR17","doi-asserted-by":"crossref","unstructured":"Klaser A, Marsza\u0142ek M, Schmid C (2008) A spatio-temporal descriptor based on 3d-gradients. british machine vision conference","DOI":"10.5244\/C.22.99"},{"key":"9137_CR18","unstructured":"Lin M, Chen Q, Yan S (2013) Network in network. Computer Science"},{"key":"9137_CR19","doi-asserted-by":"crossref","unstructured":"Ma N, Zhang X, Zheng HT, Sun J (2018) Shufflenet v2: practical guidelines for efficient cnn architecture design. In: Proceedings of the european conference on computer vision (ECCV). pp 116\u2013131","DOI":"10.1007\/978-3-030-01264-9_8"},{"key":"9137_CR20","unstructured":"Nair V, Hinton GE (2010) Rectified linear units improve restricted boltzmann machines. In: International conference on international conference on machine learning"},{"issue":"3","key":"9137_CR21","doi-asserted-by":"publisher","first-page":"299","DOI":"10.1007\/s11263-007-0122-4","volume":"79","author":"JC Niebles","year":"2008","unstructured":"Niebles JC, Wang H, Fei-Fei L (2008) Unsupervised learning of human action categories using spatial-temporal words. Int J Comput Vis 79(3):299\u2013318","journal-title":"Int J Comput Vis"},{"key":"9137_CR22","doi-asserted-by":"crossref","unstructured":"Qiu Z., Yao T., Mei T. (2017) Learning Spatio-Temporal representation with Pseudo-3D residual networks. In: Proceedings of the international conference on computer vision (ICCV)","DOI":"10.1109\/ICCV.2017.590"},{"key":"9137_CR23","doi-asserted-by":"crossref","unstructured":"Schuldt C, Laptev I, Caputo B (2004) Recognizing human actions: a local SVM approach. In: Proceedings of the 17th international conference on pattern recognition, 2004. ICPR 2004. IEEE","DOI":"10.1109\/ICPR.2004.1334462"},{"key":"9137_CR24","unstructured":"Sifre L, Mallat S (2014) Rigid-motion scattering for image classification. PhD thesis, 1:3"},{"key":"9137_CR25","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. 1406.2199"},{"key":"9137_CR26","doi-asserted-by":"crossref","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3d convolutional networks. In: The IEEE international conference on computer vision (ICCV)","DOI":"10.1109\/ICCV.2015.510"},{"key":"9137_CR27","doi-asserted-by":"crossref","unstructured":"Tran D, Wang H, Torresani L, Ray J, LeCun Y, Paluri M (2017) A closer look at spatiotemporal convolutions for action recognition. 1711.11248","DOI":"10.1109\/CVPR.2018.00675"},{"key":"9137_CR28","doi-asserted-by":"crossref","unstructured":"Wang L, Li W, Li W, et al. (2017) Appearance-and-relation networks for video classification. In: The IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2018.00155"},{"key":"9137_CR29","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y, Lin D, Tang X, Van Gool L (2016) Temporal segment networks: Towards good practices for deep action recognition. In: Leibe B, Matas J, Sebe N, Welling M (eds) Computer Vision \u2013 ECCV 2016. Springer International Publishing, Cham, pp 20\u201336","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"9137_CR30","doi-asserted-by":"publisher","unstructured":"Wang Z, Zou C, Cai W (2020) Small sample classification of hyperspectral remote sensing images based on sequential joint deeping learning model. IEEE Access, pp 1\u20131 https:\/\/doi.org\/10.1109\/ACCESS.2986267","DOI":"10.1109\/ACCESS.2986267"},{"key":"9137_CR31","doi-asserted-by":"crossref","unstructured":"Wong SF, Kim TK, Cipolla R (2007) Learning motion categories using both semantic and structural information. In: 2007 IEEE conference on computer vision and pattern recognition. IEEE, Piscataway, pp 1\u20136","DOI":"10.1109\/CVPR.2007.383332"},{"key":"9137_CR32","doi-asserted-by":"crossref","unstructured":"Xie S, Sun C, Huang J, et al. (2018) Rethinking spatiotemporal feature learning: speed-accuracy trade-offs in video classification. In: Proceedings of the european conference on computer vision (ECCV). pp 305\u2013321","DOI":"10.1007\/978-3-030-01267-0_19"},{"key":"9137_CR33","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.patcog.2018.07.028","volume":"85","author":"H Yang","year":"2019","unstructured":"Yang H, Yuan C, Li B, Du Y, Xing J, Hu W, Maybank SJ (2019) Asymmetric 3D Convolutional Neural Networks for action recognition. Pattern Recognit 85:1\u201312","journal-title":"Pattern Recognit"},{"key":"9137_CR34","doi-asserted-by":"publisher","unstructured":"You H, Tian S, Yu L, Lv Y (2019) Pixel-level remote sensing image recognition based on bidirectional word vectors. IEEE Trans Geosci Remote Sens, pp 1\u201313. https:\/\/doi.org\/10.1109\/TGRS.2019.2945591","DOI":"10.1109\/TGRS.2019.2945591"},{"key":"9137_CR35","doi-asserted-by":"crossref","unstructured":"Zhang X, Zhou X, Lin M, Sun J (2018) Shufflenet: an extremely efficient convolutional neural network for mobile devices. In: The IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2018.00716"},{"key":"9137_CR36","doi-asserted-by":"crossref","unstructured":"Zhou Y, Sun X, Zha Z-J, Zeng W (2018) MiCT mixed 3D\/2D convolutional tube for human action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition. pp 449\u2013458","DOI":"10.1109\/CVPR.2018.00054"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09137-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-09137-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09137-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,6,19]],"date-time":"2021-06-19T23:16:30Z","timestamp":1624144590000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-09137-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,6,20]]},"references-count":36,"journal-issue":{"issue":"37-38","published-print":{"date-parts":[[2020,10]]}},"alternative-id":["9137"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-09137-5","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,6,20]]},"assertion":[{"value":"8 October 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 May 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 May 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 June 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}