{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,18]],"date-time":"2026-03-18T17:05:50Z","timestamp":1773853550849,"version":"3.50.1"},"reference-count":136,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2020,11,6]],"date-time":"2020-11-06T00:00:00Z","timestamp":1604620800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,11,6]],"date-time":"2020-11-06T00:00:00Z","timestamp":1604620800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100012226","name":"Fundamental Research Funds for the Central Universities","doi-asserted-by":"crossref","award":["2019JBZ104"],"award-info":[{"award-number":["2019JBZ104"]}],"id":[{"id":"10.13039\/501100012226","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2021,4]]},"DOI":"10.1007\/s10489-020-01905-y","type":"journal-article","created":{"date-parts":[[2020,11,6]],"date-time":"2020-11-06T00:04:54Z","timestamp":1604621094000},"page":"2589-2608","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":23,"title":["Video sketch: A middle-level representation for action recognition"],"prefix":"10.1007","volume":"51","author":[{"given":"Xing-Yuan","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ya-Ping","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yang","family":"Mi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yan-Ting","family":"Pei","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qi","family":"Zou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Song","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,11,6]]},"reference":[{"key":"1905_CR1","doi-asserted-by":"crossref","unstructured":"Shi Y, Tian Y, Wang Y, Huang T (2017) Sequential deep trajectory descriptor for action recognition with three-stream cnn. IEEE TMM","DOI":"10.1109\/TMM.2017.2666540"},{"key":"1905_CR2","doi-asserted-by":"crossref","unstructured":"Zhang P, Lan C, Xing J, Zeng W, Xue J, Zheng N (2019) View adaptive neural networks for high performance skeleton-based human action recognition. PAMI","DOI":"10.1109\/CVPR42600.2020.00119"},{"key":"1905_CR3","doi-asserted-by":"crossref","unstructured":"Liu Y, Pados DA (2016) Compressed-sensed-domain l 1-pca video surveillance. IEEE TMM","DOI":"10.1117\/12.2179722"},{"key":"1905_CR4","doi-asserted-by":"crossref","unstructured":"P\u00e9rez-Hern\u00e1ndez F, Tabik S, Lamas AC, Olmos R, Fujita H, Herrera F (2020) Object detection binary classifiers methodology based on deep learning to identify small objects handled similarly: Application in video surveillance. Knowledge Based Systems, pp 105590","DOI":"10.1016\/j.knosys.2020.105590"},{"key":"1905_CR5","doi-asserted-by":"crossref","unstructured":"Yang X, Shyu M-L, Yu H-Q, Sun S-M, Yin N-S, Chen W (2018) Integrating image and textual information in human\u2013robot interactions for children with autism spectrum disorder. IEEE TMM","DOI":"10.1109\/TMM.2018.2865828"},{"key":"1905_CR6","doi-asserted-by":"crossref","unstructured":"Kuanar SK, Ranga KB, Chowdhury AS (2015) Multi-view video summarization using bipartite matching constrained optimum-path forest clustering. IEEE TMM","DOI":"10.1109\/TMM.2015.2443558"},{"key":"1905_CR7","doi-asserted-by":"crossref","unstructured":"Liu M, Liu H, Chen C (2017) Enhanced skeleton visualization for view invariant human action recognition. PR","DOI":"10.1016\/j.patcog.2017.02.030"},{"key":"1905_CR8","doi-asserted-by":"crossref","unstructured":"Zheng Y, Yao H, Sun X, Zhao S, Porikli F (2018) Distinctive action sketch for human action recognition. Signal Processing","DOI":"10.1016\/j.sigpro.2017.10.022"},{"key":"1905_CR9","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y, Lin D, Tang X, Van Gool L (2016) Temporal segment networks: Towards good practices for deep action recognition. In: ECCV","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"1905_CR10","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. In: NIPS"},{"key":"1905_CR11","doi-asserted-by":"crossref","unstructured":"Tang Y, Yi T, Lu J, Li P, Zhou J (2018) Deep progressive reinforcement learning for skeleton-based action recognition. In: CVPR","DOI":"10.1109\/CVPR.2018.00558"},{"key":"1905_CR12","doi-asserted-by":"crossref","unstructured":"Yan S, Xiong Y, Lin D (2018) Spatial temporal graph convolutional networks for skeleton-based action recognition. In: AAAI","DOI":"10.1609\/aaai.v32i1.12328"},{"key":"1905_CR13","doi-asserted-by":"crossref","unstructured":"Han Z, Xu Z, Zhu S-C (2015) Video primal sketch: A unified middle-level representation for video. JMIV","DOI":"10.1007\/s10851-015-0563-2"},{"key":"1905_CR14","unstructured":"Yilmaz A, Shah M (2015) Actions sketch: a novel action representation. In: CVPR"},{"key":"1905_CR15","doi-asserted-by":"crossref","unstructured":"Klaser A, Marsza\u0142ek M, Schmid C (2008) A spatio-temporal descriptor based on 3d-gradients. In: BMVC","DOI":"10.5244\/C.22.99"},{"key":"1905_CR16","doi-asserted-by":"crossref","unstructured":"Scovanner P, Ali S, Shah M (2007) A 3-dimensional sift descriptor and its application to action recognition. In: ACM MM","DOI":"10.1145\/1291233.1291311"},{"key":"1905_CR17","doi-asserted-by":"crossref","unstructured":"Ojala T, Pietik\u00e4inen M, M\u00e4enp\u00e4\u00e4 T (2002) Multiresolution gray-scale and rotation invariant texture classification with local binary patterns. PAMI","DOI":"10.1007\/3-540-44732-6_41"},{"key":"1905_CR18","doi-asserted-by":"crossref","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3d convolutional networks. In: ICCV","DOI":"10.1109\/ICCV.2015.510"},{"key":"1905_CR19","doi-asserted-by":"crossref","unstructured":"Wang X, Gao L, Wang P, Sun X, Liu X (2017) Two-stream 3-d convnet fusion for action recognition in videos with arbitrary size and length. IEEE TMM","DOI":"10.1109\/TMM.2017.2749159"},{"key":"1905_CR20","doi-asserted-by":"crossref","unstructured":"Hu J-F, Zheng W-S, Pan J, Lai J, Zhang J (2018) Deep bilinear learning for rgb-d action recognition. In: ECCV","DOI":"10.1007\/978-3-030-01234-2_21"},{"key":"1905_CR21","doi-asserted-by":"publisher","first-page":"545","DOI":"10.1016\/j.patcog.2018.04.022","volume":"81","author":"L Li","year":"2018","unstructured":"Li L, Wang S, Hu B, Qiong Q, Wen J, Rosenblum DS (2018) Learning structures of interval-based bayesian networks in probabilistic generative model for human complex activity recognition. Pattern Recognition 81:545\u2013561","journal-title":"Pattern Recognition"},{"key":"1905_CR22","doi-asserted-by":"crossref","unstructured":"Carreira J, Zisserman A (2017) Quo vadis, action recognition? a new model and the kinetics dataset. In: CVPR","DOI":"10.1109\/CVPR.2017.502"},{"key":"1905_CR23","doi-asserted-by":"crossref","unstructured":"Gao R, Bo X, Grauman K (2018) Im2flow: Motion hallucination from static images for action recognition. In: CVPR","DOI":"10.1109\/CVPR.2018.00622"},{"key":"1905_CR24","doi-asserted-by":"crossref","unstructured":"Ng JY-H, Choi J, Neumann J, Davis LS (2018) Actionflownet: Learning motion representation for action recognition. In: WACV","DOI":"10.1109\/WACV.2018.00179"},{"key":"1905_CR25","doi-asserted-by":"crossref","unstructured":"Zhang B, Wang L, Wang Z, Qiao Y, Wang H (2016) Real-time action recognition with enhanced motion vector cnns. In: CVPR","DOI":"10.1109\/CVPR.2016.297"},{"key":"1905_CR26","doi-asserted-by":"crossref","unstructured":"Sun S, Kuang Z, Sheng L, Ouyang W, Zhang W (2018) Optical flow guided feature: a fast and robust motion representation for video action recognition. In: CVPR","DOI":"10.1109\/CVPR.2018.00151"},{"key":"1905_CR27","doi-asserted-by":"crossref","unstructured":"Piergiovanni AJ, Ryoo MS (2019) Representation flow for action recognition. In: CVPR","DOI":"10.1109\/CVPR.2019.01018"},{"key":"1905_CR28","doi-asserted-by":"publisher","first-page":"634","DOI":"10.1109\/TMM.2017.2749159","volume":"20","author":"X Wang","year":"2018","unstructured":"Wang X, Gao L, Wang P, Sun X, Liu X (2018) Two-stream 3-d convnet fusion for action recognition in videos with arbitrary size and length. IEEE Transactions on Multimedia 20:634\u2013644","journal-title":"IEEE Transactions on Multimedia"},{"key":"1905_CR29","doi-asserted-by":"crossref","unstructured":"Zolfaghari M, Oliveira GL, Sedaghat N, Brox T (2017) Chained multi-stream networks exploiting pose, motion, and appearance for action classification and detection. In: ICCV","DOI":"10.1109\/ICCV.2017.316"},{"key":"1905_CR30","doi-asserted-by":"crossref","unstructured":"Wang C, Wang Y, Yuille AL (2013) An approach to pose-based action recognition. In: CVPR","DOI":"10.1109\/CVPR.2013.123"},{"key":"1905_CR31","doi-asserted-by":"crossref","unstructured":"Nie BX, Xiong C, Zhu S-C (2015) Joint action recognition and pose estimation from video. In: CVPR","DOI":"10.1109\/CVPR.2015.7298734"},{"key":"1905_CR32","doi-asserted-by":"crossref","unstructured":"Luvizon DC, Picard D, Tabia H (2018) 2d\/3d pose estimation and action recognition using multitask deep learning. In: CVPR","DOI":"10.1109\/CVPR.2018.00539"},{"key":"1905_CR33","doi-asserted-by":"crossref","unstructured":"Weng J, Liu M, Jiang X, Yuan J (2018) Deformable pose traversal convolution for 3d action and gesture recognition. In: ECCV","DOI":"10.1007\/978-3-030-01234-2_9"},{"key":"1905_CR34","doi-asserted-by":"crossref","unstructured":"Song S, Lan C, Xing J, Zeng W, Liu J (2017) An end-to-end spatio-temporal attention model for human action recognition from skeleton data. In: AAAI","DOI":"10.1609\/aaai.v31i1.11212"},{"key":"1905_CR35","unstructured":"Hussein ME, Torki M, Gowayyed MA, El-Saban M (2013) Human action recognition using a temporal hierarchy of covariance descriptors on 3d joint locations. In: IJCAI"},{"key":"1905_CR36","unstructured":"Wang J, Liu Z, Wu Y, Yuan J (2012) Mining actionlet ensemble for action recognition with depth cameras. In: CVPR"},{"key":"1905_CR37","doi-asserted-by":"crossref","unstructured":"Wang P, Yuan C, Hu W, Li B, Zhang Y (2016) Graph based skeleton motion representation and similarity measurement for action recognition. In: ECCV","DOI":"10.1007\/978-3-319-46478-7_23"},{"key":"1905_CR38","doi-asserted-by":"crossref","unstructured":"Vemulapalli R, Arrate F, Chellappa R (2014) Human action recognition by representing 3d skeletons as points in a lie group. In: CVPR","DOI":"10.1109\/CVPR.2014.82"},{"key":"1905_CR39","doi-asserted-by":"crossref","unstructured":"Ke Q, Bennamoun M, An S, Sohel F, Boussaid F (2017) A new representation of skeleton sequences for 3d action recognition. In: CVPR","DOI":"10.1109\/CVPR.2017.486"},{"key":"1905_CR40","doi-asserted-by":"crossref","unstructured":"Jain A, Zamir AR, Savarese S, Saxena A (2016) Structural-rnn: Deep learning on spatio-temporal graphs. In: CVPR","DOI":"10.1109\/CVPR.2016.573"},{"key":"1905_CR41","doi-asserted-by":"crossref","unstructured":"Zhang S, Yang Y, Xiao J, Liu X, Yang Y, Xie D, Zhuang Y (2018) Fusing geometric features for skeleton-based action recognition using multilayer lstm networks. IEEE TMM","DOI":"10.1109\/WACV.2017.24"},{"key":"1905_CR42","doi-asserted-by":"publisher","first-page":"807","DOI":"10.1109\/TCSVT.2016.2628339","volume":"28","author":"Y Hou","year":"2018","unstructured":"Hou Y, Li Z, Wang P, Li W (2018) Skeleton optical spectra-based action recognition using convolutional neural networks. IEEE Transactions on Circuits and Systems for Video Technology 28:807\u2013811","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"key":"1905_CR43","doi-asserted-by":"crossref","unstructured":"Liu J, Wang G, Hu P, Duan L-Y, Kot AC (2017) Global context-aware attention lstm networks for 3d action recognition. In: CVPR","DOI":"10.1109\/CVPR.2017.391"},{"key":"1905_CR44","doi-asserted-by":"crossref","unstructured":"Li D, Yao T, Duan L-Y, Mei T, Rui Y (2018) Unified spatio-temporal attention networks for action recognition in videos. IEEE TMM","DOI":"10.1109\/TMM.2018.2862341"},{"key":"1905_CR45","doi-asserted-by":"crossref","unstructured":"Du W., Wang Y, Qiao Y (2017) Rpan An end-to-end recurrent pose-attention network for action recognition in videos. In: ICCV","DOI":"10.1109\/ICCV.2017.402"},{"key":"1905_CR46","doi-asserted-by":"crossref","unstructured":"Zhu Q, Song G, Shi J (2007) Untangling cycles for contour grouping","DOI":"10.1109\/ICCV.2007.4408929"},{"key":"1905_CR47","doi-asserted-by":"crossref","unstructured":"Wang S, Kubota T, Siskind JM, Wang J (2005) Salient closed boundary extraction with ratio contour. PAMI","DOI":"10.1109\/TPAMI.2005.84"},{"key":"1905_CR48","doi-asserted-by":"crossref","unstructured":"Arbelaez P, Maire M, Fowlkes C, Malik J (2010) Contour detection and hierarchical image segmentation. PAMI","DOI":"10.1109\/TPAMI.2010.161"},{"key":"1905_CR49","doi-asserted-by":"crossref","unstructured":"Marvaniya S, Bhattacharjee S, Manickavasagam V, Mittal A (2012) Drawing an automatic sketch of deformable objects using only a few images. In: ECCV. Springer","DOI":"10.1007\/978-3-642-33863-2_7"},{"key":"1905_CR50","doi-asserted-by":"crossref","unstructured":"Lim JJ, Zitnick LC, Doll\u00e1r P (2013) Sketch tokens: A learned mid-level representation for contour and object detection. In: CVPR","DOI":"10.1109\/CVPR.2013.406"},{"key":"1905_CR51","doi-asserted-by":"crossref","unstructured":"Qi Y, Song Y-Z, Xiang T, Zhang H, Hospedales T, Li Y, Guo J (2015) Making better use of edges via perceptual grouping. In: CVPR","DOI":"10.1109\/CVPR.2015.7298795"},{"key":"1905_CR52","doi-asserted-by":"crossref","unstructured":"Xie S, Tu Z (2015) Holistically-nested edge detection. In: ICCV","DOI":"10.1109\/ICCV.2015.164"},{"key":"1905_CR53","doi-asserted-by":"crossref","unstructured":"Liu Y, Cheng M-M, Hu X, Wang K, Bai X (2017) Richer convolutional features for edge detection. In: CVPR","DOI":"10.1109\/CVPR.2017.622"},{"key":"1905_CR54","doi-asserted-by":"crossref","unstructured":"Zhang X, Huang Y, Qi Z, Guan Q, Liu J (2018) Making better use of edges for sketch generation. JEI","DOI":"10.1117\/1.JEI.27.6.063006"},{"key":"1905_CR55","doi-asserted-by":"crossref","unstructured":"Yu Z, Feng C, Liu M-Y, Ramalingam S (2017) Casenet: Deep category-aware semantic edge detection. In: CVPR","DOI":"10.1109\/CVPR.2017.191"},{"key":"1905_CR56","unstructured":"Goodfellow I, Pouget-Abadie J, Mirza M, Xu B, Warde-Farley D, Ozair S, Courville A, Bengio Y (2014) Generative adversarial nets. In: NIPS"},{"key":"1905_CR57","doi-asserted-by":"crossref","unstructured":"Isola P, Zhu J-Y, Zhou T, Efros AA (2017) Image-to-image translation with conditional adversarial networks. In: CVPR","DOI":"10.1109\/CVPR.2017.632"},{"key":"1905_CR58","doi-asserted-by":"crossref","unstructured":"Zhang X, Li X, Li X, Shen M (2018) Better freehand sketch synthesis for sketch-based image retrieval: Beyond image edges. Neurocomputing","DOI":"10.1016\/j.neucom.2018.09.047"},{"key":"1905_CR59","doi-asserted-by":"crossref","unstructured":"Eitz M, Hays J, Alexa M (2012) How do humans sketch objects? ACM TOG","DOI":"10.1145\/2185520.2185540"},{"key":"1905_CR60","doi-asserted-by":"crossref","unstructured":"Eitz M, Hildebrand K, Boubekeur T, Alexa M (2010) Sketch-based image retrieval: Benchmark and bag-of-features descriptors. TVCG","DOI":"10.1145\/1837026.1837033"},{"key":"1905_CR61","doi-asserted-by":"crossref","unstructured":"Schneider RG, Tuytelaars T (2014) Sketch classification and classification-driven analysis using fisher vectors. ACM TOG","DOI":"10.1145\/2661229.2661231"},{"key":"1905_CR62","doi-asserted-by":"crossref","unstructured":"Li Y, Hospedales TM, Song Y-Z, Gong S (2015) Free-hand sketch recognition by multi-kernel feature learning. CVIU","DOI":"10.1016\/j.cviu.2015.02.003"},{"key":"1905_CR63","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556"},{"key":"1905_CR64","doi-asserted-by":"crossref","unstructured":"Sert M, Boyac\u0131 E (2019) Sketch recognition using transfer learning. Multimedia Tools and Applications","DOI":"10.1007\/s11042-018-7067-1"},{"key":"1905_CR65","doi-asserted-by":"crossref","unstructured":"Zhang H, She P, Liu Y, Gan J, Cao X, Foroosh H (2019) Learning structural representations via dynamic object landmarks discovery for sketch recognition and retrieval. IEEE TIP","DOI":"10.1109\/TIP.2019.2910398"},{"key":"1905_CR66","doi-asserted-by":"crossref","unstructured":"Yu Q., Yang Y, Liu F, Song Y-Z, Xiang T, Hospedales TM (2017) Sketch-a-net: A deep neural network that beats humans. IJCV","DOI":"10.1007\/s11263-016-0932-3"},{"key":"1905_CR67","unstructured":"Sarvadevabhatla RK, Babu RV (2015) Freehand sketch recognition using deep features. arXiv"},{"key":"1905_CR68","doi-asserted-by":"crossref","unstructured":"Zhang H, Si L, Zhang C, Ren W, Wang R, Cao X (2016) Sketchnet: Sketch classification with web images. In: CVPR","DOI":"10.1109\/CVPR.2016.125"},{"key":"1905_CR69","doi-asserted-by":"publisher","first-page":"118","DOI":"10.1016\/j.knosys.2019.03.023","volume":"175","author":"Q Xiao","year":"2019","unstructured":"Xiao Q, Dai J, Luo J, Fujita H (2019) Multi-view manifold regularized learning-based method for prioritizing candidate disease mirnas. Knowl Based Syst 175:118\u2013129","journal-title":"Knowl Based Syst"},{"key":"1905_CR70","doi-asserted-by":"publisher","first-page":"117","DOI":"10.1016\/j.inffus.2016.09.008","volume":"35","author":"S Sun","year":"2017","unstructured":"Sun S, Shawe-Taylor J, Mao L (2017) Pac-bayes analysis of multi-view learning. Inf Fusion 35:117\u2013131","journal-title":"Inf Fusion"},{"key":"1905_CR71","doi-asserted-by":"crossref","unstructured":"Higgs M, Shawe-Taylor J (2010) A pac-bayes bound for tailored density estimation. In: ALT","DOI":"10.1007\/978-3-642-16108-7_15"},{"key":"1905_CR72","doi-asserted-by":"publisher","first-page":"7086","DOI":"10.1109\/TIT.2012.2211334","volume":"58","author":"Y Seldin","year":"2012","unstructured":"Seldin Y, Laviolette F, Cesa-Bianchi N, Shawe-Taylor J, Auer P (2012) Pac-bayesian inequalities for martingales. IEEE Trans Inf Theory 58:7086\u20137093","journal-title":"IEEE Trans Inf Theory"},{"key":"1905_CR73","doi-asserted-by":"publisher","first-page":"1009","DOI":"10.1016\/j.knosys.2018.10.022","volume":"163","author":"H Wang","year":"2019","unstructured":"Wang H, Yang Y, Liu B, Fujita H (2019) A study of graph-based system for multi-view clustering. Knowl Based Syst 163:1009\u20131019","journal-title":"Knowl Based Syst"},{"key":"1905_CR74","doi-asserted-by":"crossref","unstructured":"Sun S, Mao L, Dong Z, Wu L (2019) Multiview machine learning. In: Springer, Singapore","DOI":"10.1007\/978-981-13-3029-2"},{"key":"1905_CR75","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1016\/j.inffus.2018.10.004","volume":"50","author":"S Sun","year":"2019","unstructured":"Sun S, Liu Y, Mao L (2019) Multi-view learning for visual violence recognition with maximum entropy discrimination and deep features. Inf Fusion 50:43\u201353","journal-title":"Inf Fusion"},{"key":"1905_CR76","doi-asserted-by":"publisher","first-page":"123","DOI":"10.1016\/j.media.2016.11.002","volume":"36","author":"M Liu","year":"2017","unstructured":"Liu M, Zhang J, Yap P-T, Shen D (2017) View-aligned hypergraph learning for alzheimer\u2019s disease diagnosis with incomplete multi-modality data. Med Image Anal 36:123\u2013134","journal-title":"Med Image Anal"},{"key":"1905_CR77","doi-asserted-by":"crossref","unstructured":"Zhang W, Zhou H, Sun S, Wang Z, Shi J, Loy CC (2019) Robust multi-modality multi-object tracking. In: 2019 IEEE\/CVF International Conference on Computer Vision (ICCV), pp 2365\u20132374","DOI":"10.1109\/ICCV.2019.00245"},{"key":"1905_CR78","doi-asserted-by":"crossref","unstructured":"Gkalelis N, Nikolaidis N, Pitas I (2009) View indepedent human movement recognition from multi-view video exploiting a circular invariant posture representation. In: 2009 IEEE International Conference on Multimedia and Expo. IEEE, pp 394\u2013397","DOI":"10.1109\/ICME.2009.5202517"},{"key":"1905_CR79","doi-asserted-by":"crossref","unstructured":"Iosifidis A, Tefas A, Pitas I (2013) View-independent human action recognition based on multi-view action images and discriminant learning. In: IVMSP 2013. IEEE, pp 1\u20134","DOI":"10.1109\/IVMSPW.2013.6611931"},{"key":"1905_CR80","doi-asserted-by":"crossref","unstructured":"Ren Z, Zhang Q, Gao X, Hao P, Cheng J (2020) Multi-modality learning for human action recognition. Multimedia Tools and Applications 1\u201319","DOI":"10.1007\/s11042-019-08576-z"},{"key":"1905_CR81","unstructured":"Wang T, Brown H-F Drawing aid system for multi-touch devices, October 14 2014. US Patent 8,860,675"},{"key":"1905_CR82","doi-asserted-by":"crossref","unstructured":"Zhao H, Tian M, Sun S, Shao J, Yan J, Yi S, Wang X, Tang X (2017) Spindle net: Person re-identification with human body region guided feature decomposition and fusion. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1077\u20131085","DOI":"10.1109\/CVPR.2017.103"},{"key":"1905_CR83","doi-asserted-by":"crossref","unstructured":"Chen H, Wang G, Xue J-H, He L (2016) A novel hierarchical framework for human action recognition. PR","DOI":"10.1016\/j.patcog.2016.01.020"},{"key":"1905_CR84","doi-asserted-by":"crossref","unstructured":"Selvaraju RR, Cogswell M, Das A, Vedantam R, Parikh D, Batra D (2017) Grad-cam: Visual explanations from deep networks via gradient-based localization. In: ICCV","DOI":"10.1109\/ICCV.2017.74"},{"key":"1905_CR85","unstructured":"Laptev I, Caputo B, et al. (2004) Recognizing human actions: a local svm approach. In: Null"},{"key":"1905_CR86","doi-asserted-by":"crossref","unstructured":"Kuehne H, Jhuang H, Garrote E, Poggio T, Serre T (2011) Hmdb: a large video database for human motion recognition. In: ICCV","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"1905_CR87","unstructured":"Soomro K, Zamir AR, Shah M (2012) Ucf101: A dataset of 101 human actions classes from videos in the wild. arXiv:1212.0402"},{"key":"1905_CR88","unstructured":"Qi J, Yu M, Fan X, Li H (2017) Sequential dual deep learning with shape and texture features for sketch recognition"},{"key":"1905_CR89","unstructured":"Ioffe S, Szegedy C (2015) Batch normalization: Accelerating deep network training by reducing internal covariate shift. arXiv:1502.03167"},{"key":"1905_CR90","doi-asserted-by":"crossref","unstructured":"Liu Z, Gao J, Yang G, Zhang H, He Y (2016) Localization and classification of paddy field pests using a saliency map and deep convolutional neural network. Scientific reports","DOI":"10.1038\/srep20410"},{"key":"1905_CR91","doi-asserted-by":"crossref","unstructured":"Belongie S, Malik J, Puzicha J (2002) Shape matching and object recognition using shape contexts. PAMI","DOI":"10.1109\/34.993558"},{"key":"1905_CR92","unstructured":"Carlsson S, Sullivan J (2001) Action recognition by shape matching to key frames. In: Workshop on models versus exemplars in computer vision, volume 1"},{"key":"1905_CR93","doi-asserted-by":"crossref","unstructured":"Li W, Zhang Z, Liu Z (2010) Action recognition based on a bag of 3d points. In: CVPR Workshops. IEEE","DOI":"10.1109\/CVPRW.2010.5543273"},{"key":"1905_CR94","unstructured":"Li W, Zhang Z, Liu Z (2008) Expandable data-driven graphical modeling of human actions based on salient postures. IEEE transactions on Circuits and Systems for Video Technology"},{"key":"1905_CR95","doi-asserted-by":"crossref","unstructured":"Devanne M, Wannous H, Berretti S, Pala P, Daoudi M, Del Bimbo A (2014) 3-d human action recognition by shape analysis of motion trajectories on riemannian manifold. IEEE transactions on cybernetics","DOI":"10.1109\/TCYB.2014.2350774"},{"key":"1905_CR96","doi-asserted-by":"crossref","unstructured":"Ha VHS, Moura JMF (2005) Affine-permutation invariance of 2-d shapes. IEEE TIP","DOI":"10.1109\/TIP.2005.857271"},{"key":"1905_CR97","doi-asserted-by":"crossref","unstructured":"Eldar Y, Lindenbaum M, Porat M, Zeevi YY (1997) The farthest point strategy for progressive image sampling. IEEE TIP","DOI":"10.1109\/83.623193"},{"key":"1905_CR98","unstructured":"Moenning C, Dodgson NA (2003) Fast marching farthest point sampling. Technical report, University of Cambridge, Computer Laboratory"},{"key":"1905_CR99","doi-asserted-by":"crossref","unstructured":"Parameswaran V, Chellappa R (2006) View invariance for human action recognition. IJCV","DOI":"10.1007\/s11263-005-3671-4"},{"key":"1905_CR100","doi-asserted-by":"crossref","unstructured":"Ahmad M, Lee S-W (2008) Human action recognition using shape and clg-motion flow from multi-view image sequences. PR","DOI":"10.1016\/j.patcog.2007.12.008"},{"key":"1905_CR101","unstructured":"Christopher M, et al. (1995) Bishop Neural networks for pattern recognition. Oxford University Press"},{"key":"1905_CR102","unstructured":"Vinyals O, Bengio S, Kudlur M (2015) Order matters: Sequence to sequence for sets. Computer Science"},{"key":"1905_CR103","unstructured":"Qi CR, Su H., Mo K, Guibas LJ (2017) Pointnet: Deep learning on point sets for 3d classification and segmentation. In: CVPR"},{"key":"1905_CR104","doi-asserted-by":"crossref","unstructured":"Donahue J, Hendricks LA, Guadarrama S, Rohrbach M, Venugopalan S, Saenko K, Darrell T (2015) Long-term recurrent convolutional networks for visual recognition and description. In: CVPR","DOI":"10.21236\/ADA623249"},{"key":"1905_CR105","doi-asserted-by":"crossref","unstructured":"Li Z, Gavrilyuk K, Gavves E, Jain M, Snoek CGM (2018) Videolstm convolves, attends and flows for action recognition. CVIU","DOI":"10.1016\/j.cviu.2017.10.011"},{"key":"1905_CR106","doi-asserted-by":"crossref","unstructured":"Goyal R, Kahou SE, Michalski V, Materzynska J, Westphal S, Kim H, Haenel V, Fruend I, Yianilos P, Mueller-Freitag M, et al. (2017) The \u201csomething something\u201d video database for learning and evaluating visual common sense. In: ICCV","DOI":"10.1109\/ICCV.2017.622"},{"key":"1905_CR107","unstructured":"Ryoo MS, Aggarwal JK (2010) Ut-interaction dataset, icpr contest on semantic description of human activities (sdha). In: IEEE International Conference on Pattern Recognition Workshops, vol 2, p 4"},{"key":"1905_CR108","doi-asserted-by":"crossref","unstructured":"Russakovsky O, Deng J, Su H, Krause J, Satheesh S, Ma S, Huang Z, Karpathy A, Khosla A, Bernstein M, et al. (2015) Imagenet large scale visual recognition challenge. IJCV","DOI":"10.1007\/s11263-015-0816-y"},{"key":"1905_CR109","doi-asserted-by":"crossref","unstructured":"Qiu Z, Yao T, Mei T (2017) Deep quantization: Encoding convolutional activations with deep generative model. In: CVPR","DOI":"10.1109\/CVPR.2017.435"},{"key":"1905_CR110","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In: Proceedings of the IEEE international conference on computer vision, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"1905_CR111","doi-asserted-by":"crossref","unstructured":"Mahmood M, Jalal A, Sidduqi MA (2018) Robust spatio-temporal features for human interaction recognition via artificial neural network. 2018 International Conference on Frontiers of Information Technology (FIT), pp 218\u2013223","DOI":"10.1109\/FIT.2018.00045"},{"key":"1905_CR112","doi-asserted-by":"crossref","unstructured":"Jalal A, Mahmood M (2019) Students\u2019 behavior mining in e-learning environment using cognitive processes with information technologies. Educ Inf Technol, pp 1\u201325","DOI":"10.1007\/s10639-019-09892-5"},{"key":"1905_CR113","doi-asserted-by":"crossref","unstructured":"Nour el Houda Slimani K, Benezeth Y, Souami F (2020) Learning bag of spatio-temporal features for human interaction recognition. In: International Conference on Machine Vision","DOI":"10.1117\/12.2559268"},{"key":"1905_CR114","doi-asserted-by":"publisher","first-page":"220","DOI":"10.1049\/iet-cvi.2015.0189","volume":"10","author":"C Chattopadhyay","year":"2016","unstructured":"Chattopadhyay C, Das S (2016) Supervised framework for automatic recognition and retrieval of interaction: a framework for classification and retrieving videos with similar human interactions. IET Comput Vis 10:220\u2013227","journal-title":"IET Comput Vis"},{"key":"1905_CR115","doi-asserted-by":"crossref","unstructured":"Donahue J, Hendricks LA, Rohrbach M, Venugopalan S, Guadarrama S, Saenko K, Darrell T (2017) Long-term recurrent convolutional networks for visual recognition and description. IEEE Transactions on Pattern Analysis and Machine Intelligence","DOI":"10.1109\/TPAMI.2016.2599174"},{"key":"1905_CR116","doi-asserted-by":"crossref","unstructured":"Akbarian MSA, Saleh F, Salzmann M, Fernando B, Petersson L, Andersson L (2017) Encouraging lstms to anticipate actions very early. 2017 IEEE International Conference on Computer Vision (ICCV), pp 280\u2013289","DOI":"10.1109\/ICCV.2017.39"},{"key":"1905_CR117","doi-asserted-by":"publisher","first-page":"1844","DOI":"10.1109\/TPAMI.2015.2491928","volume":"38","author":"Y Kong","year":"2016","unstructured":"Kong Y, Fu Y (2016) Max-margin action prediction machine. IEEE Trans Pattern Anal Mach Intell 38:1844\u20131858","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"1905_CR118","doi-asserted-by":"crossref","unstructured":"Raptis M, Sigal L (2013) Poselet key-framing: A model for human activity recognition. 2013 IEEE Conference on Computer Vision and Pattern Recognition, pp 2650\u20132657","DOI":"10.1109\/CVPR.2013.342"},{"key":"1905_CR119","doi-asserted-by":"publisher","first-page":"1712","DOI":"10.1109\/TMM.2017.2778559","volume":"20","author":"Q Ke","year":"2018","unstructured":"Ke Q, Bennamoun M, An S, Sohel F, Boussaid F (2018) Leveraging structural context models and ranking score fusion for human interaction prediction. IEEE Transactions on Multimedia 20:1712\u20131723","journal-title":"IEEE Transactions on Multimedia"},{"key":"1905_CR120","doi-asserted-by":"crossref","unstructured":"Chen L, Lu J, Song Z, Zhou J (2018) Part-activated deep reinforcement learning for action prediction. In: Proceedings of the European Conference on Computer Vision (ECCV), pp 421\u2013436","DOI":"10.1007\/978-3-030-01219-9_26"},{"key":"1905_CR121","doi-asserted-by":"crossref","unstructured":"Xu W, Yu J, Miao Z, Wan L, Ji Q (2019) Prediction-cgan: Human action prediction with conditional generative adversarial networks. Proceedings of the 27th ACM International Conference on Multimedia","DOI":"10.1145\/3343031.3351073"},{"key":"1905_CR122","unstructured":"Perez M, Liu J, Kot AC (2019) Interaction relational network for mutual action recognition. arXiv:1910.04963"},{"key":"1905_CR123","doi-asserted-by":"crossref","unstructured":"Cai Z, Wang L, Peng X, Qiao Y u (2014) Multi-view super vector for action recognition. In: CVPR","DOI":"10.1109\/CVPR.2014.83"},{"key":"1905_CR124","doi-asserted-by":"crossref","unstructured":"Peng X., Wang L, Xingxing W., Yu Q (2016) Bag of visual words and fusion methods for action recognition: Comprehensive study and good practice. CVIU","DOI":"10.1016\/j.cviu.2016.03.013"},{"key":"1905_CR125","unstructured":"Wang L, Yu Q, Tang X (2016) Mofap: A multi-level representation for action recognition. IJCV"},{"key":"1905_CR126","doi-asserted-by":"crossref","unstructured":"Wang X, Farhadi A, Gupta A (2016) Actions transformations. In: CVPR","DOI":"10.1109\/CVPR.2016.291"},{"key":"1905_CR127","unstructured":"Ng JY-H, Hausknecht M, Vijayanarasimhan S, Vinyals O, Monga R, Toderici G (2015) Beyond short snippets: Deep networks for video classification. In: CVPR"},{"key":"1905_CR128","doi-asserted-by":"crossref","unstructured":"Sun L, Jia K, Yeung D-Y, Shi BE (2015) Human action recognition using factorized spatio-temporal convolutional networks. In: ICCV","DOI":"10.1109\/ICCV.2015.522"},{"key":"1905_CR129","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Zisserman A (2016) Convolutional two-stream network fusion for video action recognition. In: CVPR","DOI":"10.1109\/CVPR.2016.213"},{"key":"1905_CR130","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.patcog.2018.07.028","volume":"85","author":"HT Yang","year":"2019","unstructured":"Yang HT, Yuan C, Li B, Du Y, Xing J, Hu W, Maybank SJ (2019) Asymmetric 3d convolutional neural networks for action recognition. Pattern Recognit 85:1\u201312","journal-title":"Pattern Recognit"},{"key":"1905_CR131","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Wildes R (2016) Spatiotemporal residual networks for video action recognition. In: NIPS","DOI":"10.1109\/CVPR.2017.787"},{"key":"1905_CR132","doi-asserted-by":"publisher","first-page":"416","DOI":"10.1109\/TMM.2018.2862341","volume":"21","author":"D Li","year":"2019","unstructured":"Li D, Yao T, Duan Ly, Mei T, Rui Y (2019) Unified spatio-temporal attention networks for action recognition in videos. IEEE Trans Multimed 21:416\u2013428","journal-title":"IEEE Trans Multimed"},{"key":"1905_CR133","doi-asserted-by":"crossref","unstructured":"Li Y, Song S, Li Y, Liu J (2019) Temporal bilinear networks for video action recognition. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol 33, pp 8674\u20138681","DOI":"10.1609\/aaai.v33i01.33018674"},{"key":"1905_CR134","doi-asserted-by":"crossref","unstructured":"Li Y, Ji B, Shi X, Zhang J, Kang B, Wang L (2020) Tea: Temporal excitation and aggregation for action recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 909\u2013918","DOI":"10.1109\/CVPR42600.2020.00099"},{"key":"1905_CR135","unstructured":"Du T, Wang H, Torresani L, Ray J, LeCun Y, Paluri M (2018) A closer look at spatiotemporal convolutions for action recognition. In: CVPR"},{"key":"1905_CR136","doi-asserted-by":"crossref","unstructured":"Carreira J, Zisserman A (2017) Quo vadis, action recognition? a new model and the kinetics dataset. 2017 IEEE Conference on Computer Vision and Patter Recognition (CVPR) pp 4724\u20134733","DOI":"10.1109\/CVPR.2017.502"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-020-01905-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10489-020-01905-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-020-01905-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,26]],"date-time":"2022-11-26T22:56:41Z","timestamp":1669503401000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10489-020-01905-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,11,6]]},"references-count":136,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2021,4]]}},"alternative-id":["1905"],"URL":"https:\/\/doi.org\/10.1007\/s10489-020-01905-y","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,11,6]]},"assertion":[{"value":"6 November 2020","order":1,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}