{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T15:01:32Z","timestamp":1784905292896,"version":"3.55.0"},"reference-count":79,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"1","license":[{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61571147"],"award-info":[{"award-number":["61571147"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61871016"],"award-info":[{"award-number":["61871016"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"National Science Foundation of Heilongjiang","award":["F2015027"],"award-info":[{"award-number":["F2015027"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2019,1]]},"DOI":"10.1109\/tip.2018.2866688","type":"journal-article","created":{"date-parts":[[2018,8,22]],"date-time":"2018-08-22T18:47:12Z","timestamp":1534963632000},"page":"205-215","source":"Crossref","is-referenced-by-count":8,"title":["Learning Match Kernels on Grassmann Manifolds for Action Recognition"],"prefix":"10.1109","volume":"28","author":[{"given":"Lei","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiantong","family":"Zhen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8264-6117","authenticated-orcid":false,"given":"Ling","family":"Shao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2549-8322","authenticated-orcid":false,"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref73","first-page":"1817","article-title":"Action and event recognition with Fisher vectors on a compact feature set","author":"dan","year":"2013","journal-title":"Proc IEEE Int Conf Comput Vis"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.442"},{"key":"ref71","first-page":"2555","article-title":"Better exploiting motion for better action recognition","author":"jain","year":"2013","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2012.6247806"},{"key":"ref76","first-page":"660","article-title":"Boosting VLAD with supervised dictionary learning and high-order statistics","author":"peng","year":"2014","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref77","first-page":"3","article-title":"Improving human action recognition using score distribution and ranking","author":"hoai","year":"2014","journal-title":"Proc Asian Conf Comput Vis"},{"key":"ref74","first-page":"2577","article-title":"Towards good practices for action video encoding","author":"wu","year":"2014","journal-title":"Proc Comput Vis Pattern Recognit"},{"key":"ref39","first-page":"111","article-title":"A theoretical analysis of feature pooling in visual recognition","author":"boureau","year":"2010","journal-title":"Proc ICML"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.441"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/34.910878"},{"key":"ref78","first-page":"5378","article-title":"Modeling video evolution for action recognition","author":"fernando","year":"2015","journal-title":"Proc Comput Vis Pattern Recognit"},{"key":"ref79","first-page":"660","article-title":"Action recognition with stacked Fisher vectors","author":"peng","year":"2014","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref33","first-page":"452","article-title":"Improved image set classification via joint sparse approximated nearest subspaces","author":"chen","year":"2013","journal-title":"Proc CVPR"},{"key":"ref32","first-page":"429","article-title":"Manifold discriminant analysis","author":"wang","year":"2009","journal-title":"Proc CVPR"},{"key":"ref31","first-page":"1","article-title":"Manifold-manifold distance with application to face recognition based on image set","author":"wang","year":"2008","journal-title":"Proc CVPR"},{"key":"ref30","first-page":"1991","article-title":"A key volume mining deep framework for action recognition","author":"zhu","year":"2016","journal-title":"Proc CVPR"},{"key":"ref37","author":"simonyan","year":"2014","journal-title":"Very Deep Convolutional Networks for Large-scale Image Recognition"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2009.06.002"},{"key":"ref35","first-page":"1441","article-title":"Binet-cauchy kernels","author":"vishwanathan","year":"2004","journal-title":"Proc NIPS"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2007.1037"},{"key":"ref60","first-page":"130","article-title":"Human activities as stochastic kronecker graphs","author":"todorovic","year":"2012","journal-title":"Proc ECCV"},{"key":"ref62","first-page":"204","article-title":"Beyond Gaussian pyramid: Multi-skip feature stacking for action recognition","author":"lan","year":"2015","journal-title":"Proc CVPR"},{"key":"ref61","first-page":"412","article-title":"Ordered trajectories for large scale human action recognition","author":"murthy","year":"2013","journal-title":"Proc ICCV Workshops"},{"key":"ref63","first-page":"2625","article-title":"Long-term recurrent convolutional networks for visual recognition and description","author":"donahue","year":"2015","journal-title":"Proc CVPR"},{"key":"ref28","first-page":"1","article-title":"Modeling temporal dynamics and spatial configurations of actions using two-stream recurrent neural networks","author":"wang","year":"2017","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref64","first-page":"4597","article-title":"Human action recognition using factorized spatio-temporal convolutional networks","author":"sun","year":"2015","journal-title":"Proc ICCV"},{"key":"ref27","first-page":"416","article-title":"Scene flow to action map: A new representation for RGB-D based action recognition with convolutional neural networks","author":"wang","year":"2017","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref65","first-page":"4694","article-title":"Beyond short snippets: Deep networks for video classification","author":"ng","year":"2015","journal-title":"Proc CVPR"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299059"},{"key":"ref29","first-page":"3671","article-title":"Global context-aware attention LSTM networks for 3D action recognition","author":"liu","year":"2017","journal-title":"Proc IEEE Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref67","first-page":"1951","article-title":"VLAD3: Encoding dynamics of deep features for action recognition","author":"li","year":"2016","journal-title":"Proc CVPR"},{"key":"ref68","first-page":"65","article-title":"Behavior recognition via sparse spatio-temporal features","author":"doll\u00e1r","year":"2005","journal-title":"Proc VS-PETS"},{"key":"ref69","first-page":"1","article-title":"Evaluation of local spatio-temporal features for action recognition","author":"wang","year":"2009","journal-title":"Proc BMVC"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2013.2273174"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1016\/j.ins.2014.05.021"},{"key":"ref20","first-page":"843","article-title":"Unsupervised learning of video representations using LSTMs","author":"srivastava","year":"2015","journal-title":"Proc ICML"},{"key":"ref22","first-page":"1725","article-title":"Large-scale video classification with convolutional neural networks","author":"karpathy","year":"2014","journal-title":"Proc CVPR"},{"key":"ref21","first-page":"3054","article-title":"Regularizing long short term memory with 3D human-skeleton sequences for action recognition","author":"mahasseni","year":"2016","journal-title":"Proc CVPR"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.213"},{"key":"ref23","first-page":"2625","article-title":"DL-SFA: Deeply-learned slow feature analysis for action recognition","author":"sun","year":"2014","journal-title":"Proc CVPR"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.59"},{"key":"ref25","first-page":"3034","article-title":"Dynamic image networks for action recognition","author":"bilen","year":"2016","journal-title":"Proc CVPR"},{"key":"ref50","first-page":"2248","article-title":"From actemes to action: A strongly-supervised representation for detailed action understanding","author":"zhang","year":"2013","journal-title":"Proc ICCV"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1007\/s00138-012-0449-x"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.367"},{"key":"ref57","first-page":"256","article-title":"Motion interchange patterns for action recognition in unconstrained videos","author":"kliper-gross","year":"2012","journal-title":"Proc ECCV"},{"key":"ref56","first-page":"1881","article-title":"Action recognition using interest points capturing differential motion information","author":"yadav","year":"2016","journal-title":"Proc ICASSP"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-012-0594-8"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2014.04.005"},{"key":"ref53","first-page":"3361","article-title":"Learning hierarchical invariant spatio-temporal features for action recognition with independent subspace analysis","author":"le","year":"2011","journal-title":"Proc CVPR"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1145\/1961189.1961199"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2011.52"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2011.11.001"},{"key":"ref40","first-page":"3193","article-title":"Activity recognition using dynamic subspace angles","author":"li","year":"2011","journal-title":"Proc CVPR"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2013.01.008"},{"key":"ref13","first-page":"1097","article-title":"Imagenet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref14","first-page":"601","article-title":"Extended Grassmann kernels for subspace-based learning","author":"hamm","year":"2009","journal-title":"Proc NIPS"},{"key":"ref15","first-page":"408","article-title":"Expanding the family of Grassmannian kernels: An embedding perspective","author":"harandi","year":"2014","journal-title":"Proc ECCV"},{"key":"ref16","first-page":"913","article-title":"Learning over sets using kernel principal angles","volume":"4","author":"wolf","year":"2003","journal-title":"J Mach Learn Res"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2015.2414422"},{"key":"ref18","first-page":"4489","article-title":"Learning spatiotemporal features with 3D convolutional networks","author":"tran","year":"2015","journal-title":"Proc ICCV"},{"key":"ref19","first-page":"568","article-title":"Two-stream convolutional networks for action recognition in videos","author":"simonyan","year":"2014","journal-title":"Proc NIPS"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2688363"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2821921"},{"key":"ref6","author":"turaga","year":"2015","journal-title":"Riemannian computing in computer vision"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1145\/1390156.1390204"},{"key":"ref8","first-page":"1782","article-title":"Kernel learning for extrinsic classification of manifold features","author":"vemulapalli","year":"2013","journal-title":"Proc CVPR"},{"key":"ref7","first-page":"4112","article-title":"Beyond Gauss: Image-set matching on the Riemannian manifold of PDFs","author":"harandi","year":"2015","journal-title":"Proc ICCV"},{"key":"ref49","author":"soomro","year":"2012","journal-title":"Ucf101 A Dataset of 101 Human Actions Classes from Videos in the Wild"},{"key":"ref9","first-page":"140","article-title":"Projection metric learning on Grassmann manifold with application to video based face recognition","author":"huang","year":"2015","journal-title":"Proc CVPR"},{"key":"ref46","first-page":"239","article-title":"Two-stage learning kernel algorithms","author":"cortes","year":"2010","journal-title":"Proc ICML"},{"key":"ref45","first-page":"367","article-title":"On kernel-target alignment","author":"cristianini","year":"2001","journal-title":"Proc NIPS"},{"key":"ref48","first-page":"1","article-title":"Recognizing 50 human action categories of Web videos","author":"reddy","year":"2012","journal-title":"Proc of MVA"},{"key":"ref47","first-page":"1996","article-title":"Recognizing realistic actions from videos &#x2018;in the wild","author":"liu","year":"2009","journal-title":"Proc CVPR"},{"key":"ref42","author":"absil","year":"2009","journal-title":"Optimization Algorithms on Matrix Manifolds"},{"key":"ref41","first-page":"581","article-title":"Face recognition with image sets using manifold density divergence","volume":"1","author":"arandjelovi?","year":"2005","journal-title":"Proc IEEE Comput Soc Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511809682"},{"key":"ref43","article-title":"Subspace-based learning with Grassmann kernels","author":"hamm","year":"2008"}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/83\/8468142\/08444452.pdf?arnumber=8444452","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,13]],"date-time":"2022-07-13T21:10:52Z","timestamp":1657746652000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8444452\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,1]]},"references-count":79,"journal-issue":{"issue":"1"},"URL":"https:\/\/doi.org\/10.1109\/tip.2018.2866688","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,1]]}}}