{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,27]],"date-time":"2025-07-27T07:39:10Z","timestamp":1753601950072,"version":"3.41.0"},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2017,1,9]],"date-time":"2017-01-09T00:00:00Z","timestamp":1483920000000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61472281"],"award-info":[{"award-number":["61472281"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"\u201cShu Guang\u201d project of Shanghai Municipal Education Commission and Shanghai Education Development Foundation","award":["12SG23"],"award-info":[{"award-number":["12SG23"]}]},{"DOI":"10.13039\/501100013285","name":"Program for Professor of Special Appointment (Eastern Scholar) at Shanghai Institutions of Higher Learning","doi-asserted-by":"crossref","award":["GZ2015005"],"award-info":[{"award-number":["GZ2015005"]}],"id":[{"id":"10.13039\/501100013285","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2018,3]]},"DOI":"10.1007\/s00371-016-1345-6","type":"journal-article","created":{"date-parts":[[2017,1,9]],"date-time":"2017-01-09T09:16:06Z","timestamp":1483953366000},"page":"391-403","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":20,"title":["Motion keypoint trajectory and covariance descriptor for human action recognition"],"prefix":"10.1007","volume":"34","author":[{"given":"Yun","family":"Yi","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hanli","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,1,9]]},"reference":[{"issue":"2","key":"1345_CR1","doi-asserted-by":"crossref","first-page":"411","DOI":"10.1002\/mrm.20965","volume":"56","author":"V Arsigny","year":"2006","unstructured":"Arsigny, V., Fillard, P., Pennec, X., Ayache, N.: Log-Euclidean metrics for fast and simple calculus on diffusion tensors. Magn. Reson. Med. 56(2), 411\u2013421 (2006)","journal-title":"Magn. Reson. Med."},{"key":"1345_CR2","doi-asserted-by":"crossref","unstructured":"Bay, H., Tuytelaars, T., Van\u00a0Gool, L.: SURF: speeded up robust features. In: European Conference on Computer Vision, pp. 404\u2013417 (2006)","DOI":"10.1007\/11744023_32"},{"key":"1345_CR3","unstructured":"Bilinski, P., Bremond, F.: Video covariance matrix logarithm for human action recognition in videos. In: International Joint Conference on Artificial Intelligence, pp. 2140\u20132147 (2015)"},{"issue":"11","key":"1345_CR4","doi-asserted-by":"crossref","first-page":"1993","DOI":"10.1109\/TCSVT.2013.2270402","volume":"23","author":"PVK Borges","year":"2013","unstructured":"Borges, P.V.K., Conci, N., Cavallaro, A.: Video-based human behavior understanding: a survey. IEEE Trans. Circuits Syst. Video Technol. 23(11), 1993\u20132008 (2013)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1345_CR5","doi-asserted-by":"crossref","unstructured":"Brendel, W., Todorovic, S.: Learning spatiotemporal graphs of human activities. In: International Conference on Computer Vision, pp. 778\u2013785 (2011)","DOI":"10.1109\/ICCV.2011.6126316"},{"issue":"2","key":"1345_CR6","doi-asserted-by":"crossref","first-page":"99","DOI":"10.1002\/int.21690","volume":"30","author":"G Cheng","year":"2015","unstructured":"Cheng, G., Huang, Y., Wan, Y., Buckles, B.P.: Exploring temporal structure of trajectory components for action recognition. Int. J. Intell. Syst. 30(2), 99\u2013119 (2015)","journal-title":"Int. J. Intell. Syst."},{"key":"1345_CR7","doi-asserted-by":"crossref","unstructured":"Dalal, N., Triggs, B.: Histograms of oriented gradients for human detection. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 886\u2013893 (2005)","DOI":"10.1109\/CVPR.2005.177"},{"key":"1345_CR8","doi-asserted-by":"crossref","unstructured":"Dalal, N., Triggs, B., Schmid, C.: Human detection using oriented histograms of flow and appearance. In: European Conference on Computer Vision, pp. 428\u2013441 (2006)","DOI":"10.1007\/11744047_33"},{"issue":"3","key":"1345_CR9","doi-asserted-by":"crossref","first-page":"289","DOI":"10.1007\/s00371-015-1066-2","volume":"32","author":"DD Dawn","year":"2016","unstructured":"Dawn, D.D., Shaikh, S.H.: A comprehensive survey of human action recognition with spatio-temporal interest point (STIP) detector. Vis. Comput. 32(3), 289\u2013306 (2016)","journal-title":"Vis. Comput."},{"key":"1345_CR10","first-page":"1871","volume":"9","author":"RE Fan","year":"2008","unstructured":"Fan, R.E., Chang, K.W., Hsieh, C.J., Wang, X.R., Lin, C.J.: LIBLINEAR: a library for large linear classification. J. Mach. Learn. Res. 9, 1871\u20131874 (2008)","journal-title":"J. Mach. Learn. Res."},{"key":"1345_CR11","doi-asserted-by":"crossref","unstructured":"Farneb\u00e4ck, G.: Two-frame motion estimation based on polynomial expansion. In: Image Analysis, pp. 363\u2013370 (2003)","DOI":"10.1007\/3-540-45103-X_50"},{"key":"1345_CR12","doi-asserted-by":"crossref","unstructured":"F\u00f6rstner, W., Moonen, B.: A metric for covariance matrices. In: Geodesy\u2014The Challenge of the 3rd Millennium, pp. 299\u2013309 (2003)","DOI":"10.1007\/978-3-662-05296-9_31"},{"issue":"6","key":"1345_CR13","doi-asserted-by":"crossref","first-page":"2479","DOI":"10.1109\/TIP.2013.2252622","volume":"22","author":"K Guo","year":"2013","unstructured":"Guo, K., Ishwar, P., Konrad, J.: Action recognition from video using feature covariance matrices. IEEE Trans. Image Process. 22(6), 2479\u20132494 (2013)","journal-title":"IEEE Trans. Image Process."},{"key":"1345_CR14","doi-asserted-by":"crossref","unstructured":"Hoai, M., Zisserman, A.: Improving human action recognition using score distribution and ranking. In: Asian Conference on Computer Vision, pp. 3\u201320 (2014)","DOI":"10.1007\/978-3-319-16814-2_1"},{"key":"1345_CR15","doi-asserted-by":"crossref","unstructured":"Jain, M., Jegou, H., Bouthemy, P.: Better exploiting motion for better action recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 2555\u20132562 (2013)","DOI":"10.1109\/CVPR.2013.330"},{"issue":"3","key":"1345_CR16","doi-asserted-by":"crossref","first-page":"259","DOI":"10.1007\/s00371-013-0842-0","volume":"30","author":"IN Junejo","year":"2014","unstructured":"Junejo, I.N., Junejo, K.N., Aghbari, Z.A.: Silhouette-based human action recognition using sax-shapes. Vis. Comput. 30(3), 259\u2013269 (2014)","journal-title":"Vis. Comput."},{"key":"1345_CR17","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Annual Conference on Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"1345_CR18","doi-asserted-by":"crossref","unstructured":"Kuehne, H., Jhuang, H., Garrote, E., Poggio, T., Serre, T.: HMDB: a large video database for human motion recognition. In: International Conference on Computer Vision, pp. 2556\u20132563 (2011)","DOI":"10.1109\/ICCV.2011.6126543"},{"issue":"2","key":"1345_CR19","doi-asserted-by":"crossref","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev, I.: On space-time interest points. Int. J. Comput. Vis. 64(2), 107\u2013123 (2005)","journal-title":"Int. J. Comput. Vis."},{"key":"1345_CR20","doi-asserted-by":"crossref","unstructured":"Laptev, I., Marszalek, M., Schmid, C., Rozenfeld, B.: Learning realistic human actions from movies. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 1\u20138 (2008)","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"1345_CR21","doi-asserted-by":"crossref","unstructured":"Lazebnik, S., Schmid, C., Ponce, J.: Beyond bags of features: spatial pyramid matching for recognizing natural scene categories. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 2169\u20132178 (2006)","DOI":"10.1109\/CVPR.2006.68"},{"issue":"10","key":"1345_CR22","doi-asserted-by":"crossref","first-page":"1383","DOI":"10.1007\/s00371-014-1020-8","volume":"31","author":"Y Li","year":"2015","unstructured":"Li, Y., Ye, J., Wang, T., Huang, S.: Augmenting bag-of-words: a robust contextual representation of spatiotemporal interest points for action recognition. Vis. Comput. 31(10), 1383\u20131394 (2015)","journal-title":"Vis. Comput."},{"issue":"4","key":"1345_CR23","doi-asserted-by":"crossref","first-page":"1706","DOI":"10.1109\/TIP.2014.2307478","volume":"23","author":"J Ma","year":"2014","unstructured":"Ma, J., Zhao, J., Tian, J., Yuille, A.L., Tu, Z.: Robust point matching via vector field consensus. IEEE Trans. Image Process. 23(4), 1706\u20131721 (2014)","journal-title":"IEEE Trans. Image Process."},{"key":"1345_CR24","doi-asserted-by":"crossref","unstructured":"Messing, R., Pal, C., Kautz, H.: Activity recognition using the velocity histories of tracked keypoints. In: International Conference on Computer Vision, pp. 104\u2013111 (2009)","DOI":"10.1109\/ICCV.2009.5459154"},{"key":"1345_CR25","doi-asserted-by":"crossref","unstructured":"Niebles, J.C., Chen, C.W., Fei-Fei, L.: Modeling temporal structure of decomposable motion segments for activity classification. In: European Conference on Computer Vision, pp. 392\u2013405 (2010)","DOI":"10.1007\/978-3-642-15552-9_29"},{"key":"1345_CR26","doi-asserted-by":"crossref","unstructured":"Oneata, D., Verbeek, J., Schmid, C.: Action and event recognition with fisher vectors on a compact feature set. In: International Conference on Computer Vision, pp. 1817\u20131824 (2013)","DOI":"10.1109\/ICCV.2013.228"},{"issue":"7","key":"1345_CR27","doi-asserted-by":"crossref","first-page":"989","DOI":"10.1109\/TCSVT.2008.924108","volume":"18","author":"Y Pang","year":"2008","unstructured":"Pang, Y., Yuan, Y., Li, X.: Gabor-based region covariance matrices for face recognition. IEEE Trans. Circuits Syst. Video Technol. 18(7), 989\u2013993 (2008)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"issue":"5","key":"1345_CR28","doi-asserted-by":"crossref","first-page":"971","DOI":"10.1007\/s00138-012-0450-4","volume":"24","author":"KK Reddy","year":"2013","unstructured":"Reddy, K.K., Shah, M.: Recognizing 50 human action categories of web videos. Mach. Vis. Appl. 24(5), 971\u2013981 (2013)","journal-title":"Mach. Vis. Appl."},{"issue":"3","key":"1345_CR29","doi-asserted-by":"crossref","first-page":"222","DOI":"10.1007\/s11263-013-0636-x","volume":"105","author":"J Sanchez","year":"2013","unstructured":"Sanchez, J., Perronnin, F., Mensink, T., Verbeek, J.: Image classification with the fisher vector: theory and practice. Int. J. Comput. Vis. 105(3), 222\u2013245 (2013)","journal-title":"Int. J. Comput. Vis."},{"key":"1345_CR30","doi-asserted-by":"crossref","unstructured":"Shi, J., Tomasi, C.: Good features to track. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 593\u2013600 (1994)","DOI":"10.1109\/CVPR.1994.323794"},{"key":"1345_CR31","doi-asserted-by":"crossref","unstructured":"Sun, J., Mu, Y., Yan, S., Cheong, L.F.: Activity recognition using dense long-duration trajectories. In: IEEE International Conference on Multimedia and Expo, pp. 322\u2013327 (2010)","DOI":"10.1109\/ICME.2010.5583046"},{"issue":"1","key":"1345_CR32","doi-asserted-by":"crossref","first-page":"83","DOI":"10.1007\/s00371-014-1057-8","volume":"32","author":"A Truong","year":"2016","unstructured":"Truong, A., Boujut, H., Zaharia, T.: Laban descriptors for gesture recognition and emotional analysis. Vis. Comput. 32(1), 83\u201398 (2016)","journal-title":"Vis. Comput."},{"key":"1345_CR33","doi-asserted-by":"crossref","unstructured":"Tuzel, O., Porikli, F., Meer, P.: Region covariance: a fast descriptor for detection and classification. In: European Conference on Computer Vision, pp. 589\u2013600 (2006)","DOI":"10.1007\/11744047_45"},{"issue":"10","key":"1345_CR34","doi-asserted-by":"crossref","first-page":"983","DOI":"10.1007\/s00371-012-0752-6","volume":"29","author":"S Vishwakarma","year":"2013","unstructured":"Vishwakarma, S., Agrawal, A.: A survey on activity recognition and behavior understanding in video surveillance. Vis. Comput. 29(10), 983\u20131009 (2013)","journal-title":"Vis. Comput."},{"issue":"1","key":"1345_CR35","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Liu, C.L.: Dense trajectories and motion boundary descriptors for action recognition. Int. J. Comput. Vis. 103(1), 60\u201379 (2013)","journal-title":"Int. J. Comput. Vis."},{"issue":"3","key":"1345_CR36","doi-asserted-by":"crossref","first-page":"219","DOI":"10.1007\/s11263-015-0846-5","volume":"119","author":"H Wang","year":"2016","unstructured":"Wang, H., Oneata, D., Verbeek, J., Schmid, C.: A robust and efficient video representation for action recognition. Int. J. Comput. Vis. 119(3), 219\u2013238 (2016)","journal-title":"Int. J. Comput. Vis."},{"key":"1345_CR37","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C.: Action recognition with improved trajectories. In: International Conference on Computer Vision, pp. 3551\u20133558 (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"1345_CR38","doi-asserted-by":"crossref","unstructured":"Wang, H., Yi, Y., Wu, J.: Human action recognition with trajectory based covariance descriptor in unconstrained videos. In: ACM international conference on Multimedia, pp. 1175\u20131178 (2015)","DOI":"10.1145\/2733373.2806310"},{"key":"1345_CR39","doi-asserted-by":"crossref","unstructured":"Willems, G., Tuytelaars, T., Gool, L.V.: An efficient dense and scale-invariant spatio-temporal interest point detector. In: European Conference on Computer Vision, pp. 650\u2013663 (2008)","DOI":"10.1007\/978-3-540-88688-4_48"},{"issue":"12","key":"1345_CR40","doi-asserted-by":"crossref","first-page":"1395","DOI":"10.1007\/s00371-013-0899-9","volume":"30","author":"J Wu","year":"2014","unstructured":"Wu, J., Hu, D., Chen, F.: Action recognition by hidden temporal models. Vis. Comput. 30(12), 1395\u20131404 (2014)","journal-title":"Vis. Comput."},{"issue":"6","key":"1345_CR41","doi-asserted-by":"crossref","first-page":"845","DOI":"10.1007\/s00371-014-0957-y","volume":"30","author":"L Zhou","year":"2014","unstructured":"Zhou, L., Lu, Z., Leung, H., Shang, L.: Spatial temporal pyramid matching using temporal sparse representation for human motion retrieval. Vis. Comput. 30(6), 845\u2013854 (2014)","journal-title":"Vis. Comput."}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00371-016-1345-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-016-1345-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-016-1345-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,14]],"date-time":"2025-06-14T03:45:45Z","timestamp":1749872745000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00371-016-1345-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,1,9]]},"references-count":41,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2018,3]]}},"alternative-id":["1345"],"URL":"https:\/\/doi.org\/10.1007\/s00371-016-1345-6","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"type":"print","value":"0178-2789"},{"type":"electronic","value":"1432-2315"}],"subject":[],"published":{"date-parts":[[2017,1,9]]}}}