{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T20:30:48Z","timestamp":1780086648594,"version":"3.54.0"},"reference-count":54,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2020,8,21]],"date-time":"2020-08-21T00:00:00Z","timestamp":1597968000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,8,21]],"date-time":"2020-08-21T00:00:00Z","timestamp":1597968000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61571342"],"award-info":[{"award-number":["61571342"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2021,1]]},"DOI":"10.1007\/s10489-020-01803-3","type":"journal-article","created":{"date-parts":[[2020,8,21]],"date-time":"2020-08-21T10:20:45Z","timestamp":1598005245000},"page":"560-570","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":28,"title":["Spatio-temporal attention on manifold space for 3D human action recognition"],"prefix":"10.1007","volume":"51","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4344-8142","authenticated-orcid":false,"given":"Chongyang","family":"Ding","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kai","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fei","family":"Cheng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Evgeny","family":"Belyaev","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2020,8,21]]},"reference":[{"key":"1803_CR1","volume-title":"Optimization algorithms on matrix manifolds","author":"PA Absil","year":"2009","unstructured":"Absil PA, Mahony R, Sepulchre R (2009) Optimization algorithms on matrix manifolds. Princeton University Press, Princeton"},{"key":"1803_CR2","doi-asserted-by":"crossref","unstructured":"Anirudh R, Turaga P, Su J, Srivastava A (2015) Elastic functional coding of human actions: from vector-fields to latent variables. In: Proceedings of the IEEE conference on computer vision and pattern recognition. IEEE, pp 3147\u20133155","DOI":"10.1109\/CVPR.2015.7298934"},{"issue":"5","key":"1803_CR3","doi-asserted-by":"publisher","first-page":"922","DOI":"10.1109\/TPAMI.2016.2564409","volume":"39","author":"R Anirudh","year":"2017","unstructured":"Anirudh R, Turaga P, Su J, Srivastava A (2017) Elastic functional coding of riemannian trajectories. IEEE Trans Pattern Anal Mach Intell 39(5):922\u2013936","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"1803_CR4","unstructured":"Ba J, Mnih V, Kavukcuoglu K (2014) Multiple object recognition with visual attention. arXiv:1412.7755"},{"key":"1803_CR5","unstructured":"Bahdanau D, Cho K, Bengio Y (2014) Neural machine translation by jointly learning to align and translate. arXiv:1409.0473"},{"key":"1803_CR6","doi-asserted-by":"crossref","unstructured":"Ben Tanfous A, Drira H, Ben Amor B (2018) Coding kendall\u2019s shape trajectories for 3d action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2840\u20132849","DOI":"10.1109\/CVPR.2018.00300"},{"key":"1803_CR7","doi-asserted-by":"crossref","unstructured":"Bloom V, Makris D, Argyriou V (2012) G3d: a gaming action dataset and real time action recognition evaluation framework. In: 2012 IEEE computer society conference on computer vision and pattern recognition workshops. IEEE, pp 7\u201312","DOI":"10.1109\/CVPRW.2012.6239175"},{"issue":"1","key":"1803_CR8","doi-asserted-by":"publisher","first-page":"2284","DOI":"10.3182\/20110828-6-IT-1002.00542","volume":"44","author":"N Boumal","year":"2011","unstructured":"Boumal N, Absil PA (2011) A discrete regression method on manifolds and its application to data on so (n). IFAC Proc 44(1):2284\u20132289","journal-title":"IFAC Proc"},{"issue":"2","key":"1803_CR9","doi-asserted-by":"publisher","first-page":"141","DOI":"10.1109\/TMM.2015.2505089","volume":"18","author":"X Cai","year":"2015","unstructured":"Cai X, Zhou W, Wu L, Luo J, Li H (2015) Effective active skeleton representation for low latency human action recognition. IEEE Trans Multimed 18(2):141\u2013154","journal-title":"IEEE Trans Multimed"},{"issue":"3","key":"1803_CR10","doi-asserted-by":"publisher","first-page":"201","DOI":"10.1038\/nrn755","volume":"3","author":"M Corbetta","year":"2002","unstructured":"Corbetta M, Shulman GL (2002) Control of goal-directed and stimulus-driven attention in the brain. Nat Rev Neurosci 3(3):201","journal-title":"Nat Rev Neurosci"},{"issue":"1","key":"1803_CR11","doi-asserted-by":"publisher","first-page":"62","DOI":"10.1007\/s10489-016-0876-x","volume":"47","author":"E Da\u011flarl\u0131","year":"2017","unstructured":"Da\u011flarl\u0131 E, Da\u011flarl\u0131 SF, G\u00fcnel G\u00d6, K\u00f6se H (2017) Improving human-robot interaction based on joint attention. Appl Intell 47(1):62\u201382","journal-title":"Appl Intell"},{"key":"1803_CR12","unstructured":"Du Y, Wang W, Wang L (2015) Hierarchical recurrent neural network for skeleton based action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1110\u20131118"},{"issue":"2","key":"1803_CR13","doi-asserted-by":"publisher","first-page":"363","DOI":"10.1109\/TMM.2018.2859620","volume":"21","author":"Z Fan","year":"2018","unstructured":"Fan Z, Zhao X, Lin T, Su H (2018) Attention-based multiview re-observation fusion network for skeletal action recognition. IEEE Trans Multimed 21(2):363\u2013374","journal-title":"IEEE Trans Multimed"},{"issue":"29","key":"1803_CR14","doi-asserted-by":"publisher","first-page":"105217","DOI":"10.1016\/j.knosys.2019.105217","volume":"190","author":"L Fiorini","year":"2020","unstructured":"Fiorini L, Mancioppi G, Semeraro F, Fujita H, Cavallo F (February 2020) Unsupervised emotional state classification through physiological parameters for social robotics applications. Knowl-Based Syst 190(29):105217","journal-title":"Knowl-Based Syst"},{"key":"1803_CR15","doi-asserted-by":"publisher","first-page":"105448","DOI":"10.1016\/j.knosys.2019.105448","volume":"193","author":"P Gao","year":"2020","unstructured":"Gao P, Yuan R, Wang F, Xiao L, Fujita H, Zhang Y (6 April 2020) Siamese attentional keypoint network for high performance visual tracking. Knowl-Based Syst 193:105448","journal-title":"Knowl-Based Syst"},{"key":"1803_CR16","doi-asserted-by":"publisher","first-page":"52","DOI":"10.1016\/j.ins.2019.12.084","volume":"517","author":"P Gao","year":"2020","unstructured":"Gao P, Zhang Q, Wang F, Xiao L, Fujita H, Zhang Y (2020) Learning reinforced attentional representation for end-to-end visual tracking. Inf Sci 517:52\u201367","journal-title":"Inf Sci"},{"key":"1803_CR17","doi-asserted-by":"crossref","unstructured":"Gkioxari G, Girshick R, Malik J (2015) Contextual action recognition with r* cnn. In: Proceedings of the IEEE international conference on computer vision, pp 1080\u20131088","DOI":"10.1109\/ICCV.2015.129"},{"issue":"5\u20136","key":"1803_CR18","doi-asserted-by":"publisher","first-page":"602","DOI":"10.1016\/j.neunet.2005.06.042","volume":"18","author":"A Graves","year":"2005","unstructured":"Graves A, Schmidhuber J (2005) Framewise phoneme classification with bidirectional lstm and other neural network architectures. Neural Netw 18(5\u20136):602\u2013610","journal-title":"Neural Netw"},{"key":"1803_CR19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-13467-3","volume-title":"Lie groups, Lie algebras, and representations: an elementary introduction, vol 222","author":"B Hall","year":"2015","unstructured":"Hall B (2015) Lie groups, Lie algebras, and representations: an elementary introduction, vol 222. Springer, Berlin"},{"key":"1803_CR20","doi-asserted-by":"crossref","unstructured":"Huang Z, Van Gool L (2017) A riemannian network for spd matrix learning. In: Thirty-first AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v31i1.10866"},{"key":"1803_CR21","doi-asserted-by":"crossref","unstructured":"Huang Z, Wan C, Probst T, Van Gool L (2017) Deep learning on lie groups for skeleton-based action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6099\u20136108","DOI":"10.1109\/CVPR.2017.137"},{"issue":"2","key":"1803_CR22","doi-asserted-by":"publisher","first-page":"201","DOI":"10.3758\/BF03212378","volume":"14","author":"G Johansson","year":"1973","unstructured":"Johansson G (1973) Visual perception of biological motion and a model for its analysis. Percept Psychophys 14(2):201\u2013211","journal-title":"Percept Psychophys"},{"issue":"1","key":"1803_CR23","doi-asserted-by":"publisher","first-page":"204","DOI":"10.1007\/s10489-017-0970-8","volume":"48","author":"S Kalita","year":"2018","unstructured":"Kalita S, Karmakar A, Hazarika S M (2018) Efficient extraction of spatial relations for extended objects vis-\u00e0-vis human activity recognition in video. Appl Intell 48(1):204\u2013219","journal-title":"Appl Intell"},{"key":"1803_CR24","unstructured":"Kingma DP, Ba J (2014) Adam: a method for stochastic optimization. arXiv:1409.1556"},{"key":"1803_CR25","unstructured":"Kr\u00fcger B, Weber A (2007) Documentation mocap database hdm05"},{"issue":"2","key":"1803_CR26","doi-asserted-by":"publisher","first-page":"416","DOI":"10.1109\/TMM.2018.2862341","volume":"21","author":"D Li","year":"2018","unstructured":"Li D, Yao T, Duan LY, Mei T, Rui Y (2018) Unified spatio-temporal attention networks for action recognition in videos. IEEE Trans Multimed 21(2):416\u2013428","journal-title":"IEEE Trans Multimed"},{"key":"1803_CR27","doi-asserted-by":"crossref","unstructured":"Liu J, Shahroudy A, Xu D, Wang G (2016) Spatio-temporal lstm with trust gates for 3d human action recognition. In: European conference on computer vision. Springer, Berlin, pp 816\u2013833","DOI":"10.1007\/978-3-319-46487-9_50"},{"key":"1803_CR28","doi-asserted-by":"publisher","first-page":"346","DOI":"10.1016\/j.patcog.2017.02.030","volume":"68","author":"M Liu","year":"2017","unstructured":"Liu M, Liu H, Chen C (2017) Enhanced skeleton visualization for view invariant human action recognition. Pattern Recognit 68:346\u2013362","journal-title":"Pattern Recognit"},{"issue":"8","key":"1803_CR29","doi-asserted-by":"publisher","first-page":"1932","DOI":"10.1109\/TMM.2017.2786868","volume":"20","author":"M Liu","year":"2017","unstructured":"Liu M, Liu H, Chen C (2017) Robust 3d action recognition through sampling local appearances and global distributions. IEEE Trans Multimed 20(8):1932\u20131947","journal-title":"IEEE Trans Multimed"},{"key":"1803_CR30","doi-asserted-by":"crossref","unstructured":"Majd M, Safabakhsh R (2019) A motion-aware convlstm network for action recognition. Appl Intell pp 1\u20137","DOI":"10.1007\/s10489-018-1395-8"},{"key":"1803_CR31","doi-asserted-by":"crossref","unstructured":"Mallya A, Lazebnik S (2016) Learning models for actions and person-object interactions with transfer to question answering European conference on computer vision. Springer, Berlin, pp 414\u2013428","DOI":"10.1007\/978-3-319-46448-0_25"},{"key":"1803_CR32","doi-asserted-by":"publisher","DOI":"10.1201\/9781315136370","volume-title":"A mathematical introduction to robotic manipulation","author":"RM Murray","year":"2017","unstructured":"Murray RM (2017) A mathematical introduction to robotic manipulation. CRC Press, Boca Raton"},{"key":"1803_CR33","doi-asserted-by":"crossref","unstructured":"Nie S, Ji Q (2014) Capturing global and local dynamics for human action recognition. In: 2014 22nd international conference on pattern recognition. IEEE, pp 1946\u20131951","DOI":"10.1109\/ICPR.2014.340"},{"key":"1803_CR34","doi-asserted-by":"crossref","unstructured":"Shahroudy A, Liu J, Ng TT, Wang G (2016) Ntu rgb+ d: a large scale dataset for 3d human activity analysis. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1010\u20131019","DOI":"10.1109\/CVPR.2016.115"},{"key":"1803_CR35","unstructured":"Sharma S, Kiros R, Salakhutdinov R (2015) Action recognition using visual attention. arXiv:1511.04119"},{"issue":"1","key":"1803_CR36","doi-asserted-by":"publisher","first-page":"116","DOI":"10.1145\/2398356.2398381","volume":"56","author":"J Shotton","year":"2013","unstructured":"Shotton J, Sharp T, Kipman A, Fitzgibbon A, Finocchio M, Blake A, Cook M, Moore R (2013) Real-time human pose recognition in parts from single depth images. Commun ACM 56(1):116\u2013124","journal-title":"Commun ACM"},{"key":"1803_CR37","doi-asserted-by":"crossref","unstructured":"Song S, Lan C, Xing J, Zeng W, Liu J (2017) An end-to-end spatio-temporal attention model for human action recognition from skeleton data. In: Thirty-First AAAI conference on artificial intelligence","DOI":"10.1609\/aaai.v31i1.11212"},{"key":"1803_CR38","doi-asserted-by":"crossref","unstructured":"Turaga P, Chellappa R (2009) Locally time-invariant models of human activities using trajectories on the grassmannian. In: 2009 IEEE conference on computer vision and pattern recognition. IEEE, pp 2435\u20132441","DOI":"10.1109\/CVPRW.2009.5206710"},{"key":"1803_CR39","doi-asserted-by":"crossref","unstructured":"Vemulapalli R, Arrate F, Chellappa R (2014) Human action recognition by representing 3d skeletons as points in a lie group. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 588\u2013595","DOI":"10.1109\/CVPR.2014.82"},{"key":"1803_CR40","doi-asserted-by":"crossref","unstructured":"Vemulapalli R, Chellapa R (2016) Rolling rotations for recognizing human actions from 3d skeletal data. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4471\u20134479","DOI":"10.1109\/CVPR.2016.484"},{"key":"1803_CR41","doi-asserted-by":"crossref","unstructured":"Wang H, Wang L (2017) Modeling temporal dynamics and spatial configurations of actions using two-stream recurrent neural networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 499\u2013508","DOI":"10.1109\/CVPR.2017.387"},{"key":"1803_CR42","doi-asserted-by":"crossref","unstructured":"Wang J, Liu Z, Wu Y, Yuan J (2012) Mining actionlet ensemble for action recognition with depth cameras. In: 2012 IEEE conference on computer vision and pattern recognition. IEEE, pp 1290\u20131297","DOI":"10.1109\/CVPR.2012.6247813"},{"key":"1803_CR43","doi-asserted-by":"crossref","unstructured":"Wang J, Nie X, Xia Y, Wu Y, Zhu SC (2014) Cross-view action modeling, learning and recognition. In: The IEEE conference on computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR.2014.339"},{"key":"1803_CR44","doi-asserted-by":"crossref","unstructured":"Wang P, Yuan C, Hu W, Li B, Zhang Y (2016) Graph based skeleton motion representation and similarity measurement for action recognition. In: European conference on computer vision. Springer, Berlin, pp 370\u2013385","DOI":"10.1007\/978-3-319-46478-7_23"},{"key":"1803_CR45","doi-asserted-by":"crossref","unstructured":"Weng J, Weng C, Yuan J (2017) Spatio-temporal naive-bayes nearest-neighbor (st-nbnn) for skeleton-based action recognition. In: Proceedings of the IEEE Conference on computer vision and pattern recognition, pp 4171\u20134180","DOI":"10.1109\/CVPR.2017.55"},{"issue":"3\u20134","key":"1803_CR46","first-page":"229","volume":"8","author":"RJ Williams","year":"1992","unstructured":"Williams RJ (1992) Simple statistical gradient-following algorithms for connectionist reinforcement learning. Mach Learn 8(3\u20134):229\u2013256","journal-title":"Mach Learn"},{"key":"1803_CR47","doi-asserted-by":"crossref","unstructured":"Xia L, Chen CC, Aggarwal JK (2012) View invariant human action recognition using histograms of 3d joints. In: 2012 IEEE computer society conference on computer vision and pattern recognition workshops. IEEE, pp 20\u201327","DOI":"10.1109\/CVPRW.2012.6239233"},{"key":"1803_CR48","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: neural image caption generation with visual attention. In: International conference on machine learning, pp 2048\u20132057"},{"key":"1803_CR49","doi-asserted-by":"crossref","unstructured":"Yan S, Xiong Y, Lin D (2018) Spatial temporal graph convolutional networks for skeleton-based action recognition. In: Thirty-Second AAAI conference on artificial intelligence, pp 7444\u20137452","DOI":"10.1609\/aaai.v32i1.12328"},{"issue":"3","key":"1803_CR50","doi-asserted-by":"publisher","first-page":"519","DOI":"10.1109\/TMM.2016.2626959","volume":"19","author":"Y Yang","year":"2016","unstructured":"Yang Y, Deng C, Gao S, Liu W, Tao D, Gao X (2016) Discriminative multi-instance multitask learning for 3d action recognition. IEEE Trans Multimed 19(3):519\u2013529","journal-title":"IEEE Trans Multimed"},{"issue":"6","key":"1803_CR51","doi-asserted-by":"publisher","first-page":"2017","DOI":"10.1007\/s10489-018-1347-3","volume":"49","author":"G Yao","year":"2019","unstructured":"Yao G, Lei T, Zhong J, Jiang P (2019) Learning multi-temporal-scale deep information for action recognition. Appl Intell 49(6):2017\u20132029","journal-title":"Appl Intell"},{"issue":"4","key":"1803_CR52","first-page":"769","volume":"20","author":"S Zhang","year":"2017","unstructured":"Zhang S, Gao C, Zhang J, Chen F, Sang N (2017) Discriminative part selection for human action recognition. IEEE Transa Multimed 20(4):769\u2013780","journal-title":"IEEE Transa Multimed"},{"issue":"9","key":"1803_CR53","doi-asserted-by":"publisher","first-page":"2330","DOI":"10.1109\/TMM.2018.2802648","volume":"20","author":"S Zhang","year":"2018","unstructured":"Zhang S, Yang Y, Xiao J, Liu X, Yang Y, Xie D, Zhuang Y (2018) Fusing geometric features for skeleton-based action recognition using multilayer lstm networks. IEEE Trans Multimed 20(9):2330\u20132343","journal-title":"IEEE Trans Multimed"},{"key":"1803_CR54","doi-asserted-by":"crossref","unstructured":"Zhao Z, Elgammal AM (2008) Information theoretic key frame selection for action recognition. In: BMVC, pp 1\u201310","DOI":"10.5244\/C.22.109"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-020-01803-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-020-01803-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-020-01803-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,9]],"date-time":"2022-11-09T07:40:28Z","timestamp":1667979628000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-020-01803-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,8,21]]},"references-count":54,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2021,1]]}},"alternative-id":["1803"],"URL":"https:\/\/doi.org\/10.1007\/s10489-020-01803-3","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,8,21]]},"assertion":[{"value":"21 August 2020","order":1,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}