{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,12]],"date-time":"2026-05-12T16:32:26Z","timestamp":1778603546766,"version":"3.51.4"},"reference-count":67,"publisher":"Springer Science and Business Media LLC","issue":"23","license":[{"start":{"date-parts":[[2023,10,5]],"date-time":"2023-10-05T00:00:00Z","timestamp":1696464000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,10,5]],"date-time":"2023-10-05T00:00:00Z","timestamp":1696464000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100004085","name":"Ministry of Education, Science and Technology","doi-asserted-by":"publisher","award":["2022R1I1A3058128"],"award-info":[{"award-number":["2022R1I1A3058128"]}],"id":[{"id":"10.13039\/501100004085","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Appl Intell"],"published-print":{"date-parts":[[2023,12]]},"DOI":"10.1007\/s10489-023-04978-7","type":"journal-article","created":{"date-parts":[[2023,10,5]],"date-time":"2023-10-05T08:01:38Z","timestamp":1696492898000},"page":"28446-28459","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":13,"title":["STAR++: Rethinking spatio-temporal cross attention transformer for video action recognition"],"prefix":"10.1007","volume":"53","author":[{"given":"Dasom","family":"Ahn","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sangwon","family":"Kim","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7284-0768","authenticated-orcid":false,"given":"Byoung Chul","family":"Ko","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,10,5]]},"reference":[{"key":"4978_CR1","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. Adv Neural Inf Process Syst 27"},{"key":"4978_CR2","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Zisserman A (2016) Convolutional two-stream network fusion for video action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1933\u20131941","DOI":"10.1109\/CVPR.2016.213"},{"key":"4978_CR3","doi-asserted-by":"crossref","unstructured":"Carreira J, Zisserman A (2017) Quo vadis, action recognition? A new model and the kinetics dataset. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6299\u20136308","DOI":"10.1109\/CVPR.2017.502"},{"key":"4978_CR4","doi-asserted-by":"crossref","unstructured":"Arnab A, Dehghani M, Heigold G, Sun C, Lu\u010di\u0107 M, Schmid C (2021) Vivit: a video vision transformer. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 6836\u20136846","DOI":"10.1109\/ICCV48922.2021.00676"},{"key":"4978_CR5","unstructured":"Bertasius G, Wang H, Torresani L (2021) Is space-time attention all you need for video understanding? In: ICML, 2:4"},{"key":"4978_CR6","doi-asserted-by":"crossref","unstructured":"Liu Z, Ning J, Cao Y, Wei Y, Zhang Z, Lin S, Hu H (2022) Video swin transformer. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 3202\u20133211","DOI":"10.1109\/CVPR52688.2022.00320"},{"key":"4978_CR7","doi-asserted-by":"crossref","unstructured":"Wang J, Torresani L (2022) Deformable video transformer. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 14053\u201314062","DOI":"10.1109\/CVPR52688.2022.01366"},{"key":"4978_CR8","unstructured":"Zhu X, Su W, Lu L, Li B, Wang X, Dai J (2020) Deformable detr: deformable transformers for end-to-end object detection. arXiv:2010.04159"},{"key":"4978_CR9","doi-asserted-by":"crossref","unstructured":"Xia Z, Pan X, Song S, Li LE, Huang G (2022) Vision transformer with deformable attention. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 4794\u20134803","DOI":"10.1109\/CVPR52688.2022.00475"},{"key":"4978_CR10","doi-asserted-by":"crossref","unstructured":"Wang J, Yang X, Li H, Liu L, Wu Z, Jiang Y-G (2022) Efficient video transformers with spatial-temporal token selection. In: Computer Vision\u2013ECCV 2022: 17th European conference, Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part XXXV, pp 69\u201386","DOI":"10.1007\/978-3-031-19833-5_5"},{"key":"4978_CR11","doi-asserted-by":"crossref","unstructured":"Yin H, Vahdat A, Alvarez JM, Mallya A, Kautz J, Molchanov P (2022) A-vit: adaptive tokens for efficient vision transformer. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 10809\u201310818","DOI":"10.1109\/CVPR52688.2022.01054"},{"key":"4978_CR12","first-page":"13937","volume":"34","author":"Y Rao","year":"2021","unstructured":"Rao Y, Zhao W, Liu B, Lu J, Zhou J, Hsieh C-J (2021) Dynamicvit: efficient vision transformers with dynamic token sparsification. Advances in neural information processing systems 34:13937\u201313949","journal-title":"Advances in neural information processing systems"},{"key":"4978_CR13","doi-asserted-by":"crossref","unstructured":"Ahn D, Kim S, Hong H, Ko BC (2023) Star-transformer: a spatio-temporal cross attention transformer for human action recognition. In: Proceedings of the IEEE\/CVF winter conference on applications of computer vision, pp 3330\u20133339","DOI":"10.1109\/WACV56688.2023.00333"},{"key":"4978_CR14","unstructured":"Zhu J, Zou W, Xu L, Hu Y, Zhu Z, Chang M, Huang J, Huang G, Du D (2018) Action machine: rethinking action recognition in trimmed videos. arXiv:1812.05770"},{"key":"4978_CR15","doi-asserted-by":"crossref","unstructured":"Baradel F, Wolf C, Mille J, Taylor GW (2018) Glimpse clouds: human activity recognition from unstructured feature points. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 469\u2013478","DOI":"10.1109\/CVPR.2018.00056"},{"key":"4978_CR16","doi-asserted-by":"crossref","unstructured":"Wang Z, She Q, Smolic A (2021) Action-net: multipath excitation for action recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 13214\u201313223","DOI":"10.1109\/CVPR46437.2021.01301"},{"key":"4978_CR17","doi-asserted-by":"crossref","unstructured":"Liu X, Pintea SL, Nejadasl FK, Booij O, Van Gemert JC (2021) No frame left behind: full video action recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 14892\u201314901","DOI":"10.1109\/CVPR46437.2021.01465"},{"key":"4978_CR18","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C (2020) X3d: expanding architectures for efficient video recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 203\u2013213","DOI":"10.1109\/CVPR42600.2020.00028"},{"key":"4978_CR19","doi-asserted-by":"crossref","unstructured":"Tran D, Wang H, Torresani L, Ray J, LeCun Y, Paluri M (2018) A closer look at spatiotemporal convolutions for action recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6450\u20136459","DOI":"10.1109\/CVPR.2018.00675"},{"key":"4978_CR20","doi-asserted-by":"crossref","unstructured":"Neimark D, Bar O, Zohar M, Asselmann D (2021) Video transformer network. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 3163\u20133172","DOI":"10.1109\/ICCVW54120.2021.00355"},{"key":"4978_CR21","first-page":"1086","volume":"34","author":"M Xu","year":"2021","unstructured":"Xu M, Xiong Y, Chen H, Li X, Xia W, Tu Z, Soatto S (2021) Long short-term transformer for online action detection. Adv Neural Inf Process Syst 34:1086\u20131099","journal-title":"Adv Neural Inf Process Syst"},{"key":"4978_CR22","doi-asserted-by":"crossref","unstructured":"Yan S, Xiong X, Arnab A, Lu Z, Zhang M, Sun C, Schmid C (2022) Multiview transformers for video recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 3333\u20133343","DOI":"10.1109\/CVPR52688.2022.00333"},{"key":"4978_CR23","doi-asserted-by":"crossref","unstructured":"Yu B, Yin H, Zhu Z (2017) Spatio-temporal graph convolutional networks: a deep learning framework for traffic forecasting. arXiv:1709.04875","DOI":"10.24963\/ijcai.2018\/505"},{"key":"4978_CR24","doi-asserted-by":"crossref","unstructured":"Zhang C, Li Q, Song D (2019) Aspect-based sentiment classification with aspect-specific graph convolutional networks. arXiv:1909.03477","DOI":"10.18653\/v1\/D19-1464"},{"key":"4978_CR25","doi-asserted-by":"crossref","unstructured":"Cheng K, Zhang Y, He X, Chen W, Cheng J, Lu H (2020) Skeleton-based action recognition with shift graph convolutional network. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 183\u2013192","DOI":"10.1109\/CVPR42600.2020.00026"},{"key":"4978_CR26","doi-asserted-by":"crossref","unstructured":"Chen Y, Zhang Z, Yuan C, Li B, Deng Y, Hu W (2021) Channel-wise topology refinement graph convolution for skeleton-based action recognition. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 13359\u201313368","DOI":"10.1109\/ICCV48922.2021.01311"},{"key":"4978_CR27","doi-asserted-by":"crossref","unstructured":"Chi H-g, Ha MH, Chi S, Lee SW, Huang Q, Ramani K (2022) Infogcn: representation learning for human skeleton-based action recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 20186\u201320196","DOI":"10.1109\/CVPR52688.2022.01955"},{"key":"4978_CR28","unstructured":"Yang D, Wang Y, Dantcheva A, Garattoni L, Francesca G, Bremond F (2021) Unik: a unified framework for real-world skeleton-based action recognition. arXiv:2107.08580"},{"key":"4978_CR29","doi-asserted-by":"crossref","unstructured":"Das S, Sharma S, Dai R, Bremond F, Thonnat M (2020) Vpn: learning video-pose embedding for activities of daily living. In: Computer vision\u2013ECCV 2020: 16th European conference, Glasgow, UK, August 23\u201328, 2020, proceedings, part IX 16, pp 72\u201390. Springer","DOI":"10.1007\/978-3-030-58545-7_5"},{"key":"4978_CR30","doi-asserted-by":"crossref","unstructured":"Duan H, Zhao Y, Chen K, Lin D, Dai B (2022) Revisiting skeleton-based action recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 2969\u20132978","DOI":"10.1109\/CVPR52688.2022.00298"},{"key":"4978_CR31","unstructured":"Joze HRV, Shaban A, Iuzzolino ML, Koishida K (2020) Mmtm: multimodal transfer module for cnn fusion. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 13289\u201313299"},{"key":"4978_CR32","doi-asserted-by":"crossref","unstructured":"Munro J, Damen D (2020) Multi-modal domain adaptation for fine-grained action recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 122\u2013132","DOI":"10.1109\/CVPR42600.2020.00020"},{"key":"4978_CR33","doi-asserted-by":"crossref","unstructured":"Gao R, Oh T-H, Grauman K, Torresani L (2020) Listen to look: action recognition by previewing audio. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 10457\u201310467","DOI":"10.1109\/CVPR42600.2020.01047"},{"key":"4978_CR34","doi-asserted-by":"crossref","unstructured":"Alamri H, Cartillier V, Das A, Wang J, Cherian A, Essa I, Batra D, Marks TK, Hori C, Anderson P et al (2019) Audio visual scene-aware dialog. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 7558\u20137567","DOI":"10.1109\/CVPR.2019.00774"},{"key":"4978_CR35","unstructured":"Goyal P, Sahu S, Ghosh S, Lee C (2020) Cross-modal learning for multi-modal video categorization. arXiv:2003.03501"},{"key":"4978_CR36","doi-asserted-by":"crossref","unstructured":"Zhang B, Wang L, Wang Z, Qiao Y, Wang H (2016) Real-time action recognition with enhanced motion vector cnns. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 2718\u20132726","DOI":"10.1109\/CVPR.2016.297"},{"key":"4978_CR37","doi-asserted-by":"crossref","unstructured":"Yang L, Huang Y, Sugano Y, Sato Y (2022) Interact before align: leveraging cross-modal knowledge for domain adaptive action recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 14722\u201314732","DOI":"10.1109\/CVPR52688.2022.01431"},{"key":"4978_CR38","doi-asserted-by":"crossref","unstructured":"Alfasly S, Lu J, Xu C, Zou Y (2022) Learnable irrelevant modality dropout for multimodal action recognition on modality-specific annotated videos. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 20208\u201320217","DOI":"10.1109\/CVPR52688.2022.01957"},{"key":"4978_CR39","doi-asserted-by":"crossref","unstructured":"Shi Z, Liang J, Li Q, Zheng H, Gu Z, Dong J, Zheng B (2021) Multi-modal multi-action video recognition. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 13678\u201313687","DOI":"10.1109\/ICCV48922.2021.01342"},{"key":"4978_CR40","unstructured":"Miech A, Laptev I, Sivic J (2018) Learning a text-video embedding from incomplete and heterogeneous data. arXiv:1804.02516"},{"key":"4978_CR41","doi-asserted-by":"crossref","unstructured":"Ijaz M, Diaz R, Chen C (2022) Multimodal transformer for nursing activity recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 2065\u20132074","DOI":"10.1109\/CVPRW56347.2022.00224"},{"key":"4978_CR42","doi-asserted-by":"crossref","unstructured":"Liu Z, Lin Y, Cao Y, Hu H, Wei Y, Zhang Z, Lin S, Guo B (2021) Swin transformer: hierarchical vision transformer using shifted windows. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 10012\u201310022","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"4978_CR43","unstructured":"Jaderberg M, Simonyan K, Zisserman A et al (2015) Spatial transformer networks. Adv Neural Inf Process Syst 28"},{"key":"4978_CR44","unstructured":"Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X, Unterthiner T, Dehghani M, Minderer M, Heigold G, Gelly S et al (2020) An image is worth 16x16 words: transformers for image recognition at scale. arXiv:2010.11929"},{"key":"4978_CR45","first-page":"12116","volume":"34","author":"M Raghu","year":"2021","unstructured":"Raghu M, Unterthiner T, Kornblith S, Zhang C, Dosovitskiy A (2021) Do vision transformers see like convolutional neural networks? Adv Neural Inf Process Syst 34:12116\u201312128","journal-title":"Adv Neural Inf Process Syst"},{"key":"4978_CR46","unstructured":"Si C, Yu W, Zhou P, Zhou Y, Wang X, Yan S (2022) Inception transformer. arXiv:2205.12956"},{"key":"4978_CR47","doi-asserted-by":"crossref","unstructured":"Zhang W, Zhu M, Derpanis KG (2013) From actemes to action: a strongly-supervised representation for detailed action understanding. In: Proceedings of the IEEE international conference on computer vision, pp 2248\u20132255","DOI":"10.1109\/ICCV.2013.280"},{"key":"4978_CR48","doi-asserted-by":"crossref","unstructured":"Shahroudy A, Liu J, Ng T-T, Wang G (2016) Ntu rgb+ d: a large scale dataset for 3d human activity analysis. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1010\u20131019","DOI":"10.1109\/CVPR.2016.115"},{"issue":"10","key":"4978_CR49","doi-asserted-by":"publisher","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","volume":"42","author":"J Liu","year":"2019","unstructured":"Liu J, Shahroudy A, Perez M, Wang G, Duan L-Y, Kot AC (2019) Ntu rgb+ d 120: a large-scale benchmark for 3d human activity understanding. IEEE Trans Pattern Anal Mach Intell 42(10):2684\u20132701","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"4978_CR50","unstructured":"Soomro K, Zamir AR, Shah M (2012) Ucf101: A dataset of 101 human actions classes from videos in the wild. arXiv:1212.0402"},{"key":"4978_CR51","doi-asserted-by":"crossref","unstructured":"Kuehne H, Jhuang H, Garrote E, Poggio T, Serre T (2011) Hmdb: a large video database for human motion recognition. In: 2011 international conference on computer vision, pp 2556\u20132563. IEEE","DOI":"10.1109\/ICCV.2011.6126543"},{"key":"4978_CR52","unstructured":"Kay W, Carreira J, Simonyan K, Zhang B, Hillier C, Vijayanarasimhan S, Viola F, Green T, Back T, Natsev P et al (2017) The kinetics human action video dataset. arXiv:1705.06950"},{"key":"4978_CR53","doi-asserted-by":"crossref","unstructured":"Guo T, Liu H, Chen Z, Liu M, Wang T, Ding R (2022) Contrastive learning from extremely augmented skeleton sequences for self-supervised action recognition. Proceedings of the AAAI conference on artificial intelligence 36:762\u2013770","DOI":"10.1609\/aaai.v36i1.19957"},{"key":"4978_CR54","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2022.108146","volume":"240","author":"Y Liu","year":"2022","unstructured":"Liu Y, Zhang H, Xu D, He K (2022) Graph transformer network with temporal kernel attention for skeleton-based action recognition. Knowl-Based Syst 240:108146","journal-title":"Knowl-Based Syst"},{"key":"4978_CR55","doi-asserted-by":"crossref","unstructured":"Zeng A, Sun X, Yang L, Zhao N, Liu M, Xu Q (2021) Learning skeletal graph neural networks for hard 3d pose estimation. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 11436\u201311445","DOI":"10.1109\/ICCV48922.2021.01124"},{"key":"4978_CR56","doi-asserted-by":"crossref","unstructured":"Liu M, Yuan J (2018) Recognizing human actions as the evolution of pose estimation maps. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1159\u20131168","DOI":"10.1109\/CVPR.2018.00127"},{"key":"4978_CR57","doi-asserted-by":"crossref","unstructured":"Chen T, Zhou D, Wang J, Wang S, Guan Y, He X, Ding E (2021) Learning multi-granular spatio-temporal graph network for skeleton-based action recognition. In: Proceedings of the 29th ACM international conference on multimedia, pp 4334\u20134342","DOI":"10.1145\/3474085.3475574"},{"key":"4978_CR58","doi-asserted-by":"publisher","first-page":"3199","DOI":"10.1609\/aaai.v35i4.16430","volume":"35","author":"X Bruce","year":"2021","unstructured":"Bruce X, Liu Y, Chan KC (2021) Multimodal fusion via teacher-student network for indoor action recognition. Proceedings of the AAAI Conference on Artificial Intelligence 35:3199\u20133207","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"3","key":"4978_CR59","doi-asserted-by":"publisher","first-page":"1095","DOI":"10.1109\/TCYB.2017.2756840","volume":"48","author":"C Cao","year":"2017","unstructured":"Cao C, Zhang Y, Zhang C, Lu H (2017) Body joint guided 3-d deep convolutional descriptors for action recognition. IEEE Trans Cybernet 48(3):1095\u20131108","journal-title":"IEEE Trans Cybernet"},{"key":"4978_CR60","doi-asserted-by":"crossref","unstructured":"Luvizon DC, Picard D, Tabia H (2018) 2d\/3d pose estimation and action recognition using multitask deep learning. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 5137\u20135146","DOI":"10.1109\/CVPR.2018.00539"},{"key":"4978_CR61","doi-asserted-by":"crossref","unstructured":"Zhao R, Xu W, Su H, Ji Q (2019) Bayesian hierarchical dynamic model for human action recognition. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 7733\u20137742","DOI":"10.1109\/CVPR.2019.00792"},{"key":"4978_CR62","doi-asserted-by":"crossref","unstructured":"Sun JJ, Zhao J, Chen L-C, Schroff F, Adam H, Liu T (2020) View-invariant probabilistic embedding for human pose. In: Computer vision\u2013ECCV 2020: 16th European conference, Glasgow, UK, August 23\u201328, 2020, proceedings, part V 16, pp 53\u201370. Springer","DOI":"10.1007\/978-3-030-58558-7_4"},{"key":"4978_CR63","doi-asserted-by":"crossref","unstructured":"Hachiuma R, Sato F, Sekii T (2023) Unified keypoint-based action recognition framework via structured keypoint pooling. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 22962\u201322971","DOI":"10.1109\/CVPR52729.2023.02199"},{"key":"4978_CR64","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Fan H, Malik J, He K (2019) Slowfast networks for video recognition. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 6202\u20136211","DOI":"10.1109\/ICCV.2019.00630"},{"key":"4978_CR65","doi-asserted-by":"crossref","unstructured":"Duan H, Zhao Y, Xiong Y, Liu W, Lin D (2020) Omni-sourced webly-supervised learning for video recognition. In: European conference on computer vision, pp 670\u2013688. Springer","DOI":"10.1007\/978-3-030-58555-6_40"},{"key":"4978_CR66","doi-asserted-by":"crossref","unstructured":"Sun K, Xiao B, Liu D, Wang J (2019) Deep high-resolution representation learning for human pose estimation. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 5693\u20135703","DOI":"10.1109\/CVPR.2019.00584"},{"key":"4978_CR67","unstructured":"Bruce X, Liu Y, Zhang X, Zhong S-h, Chan KC (2022) Mmnet: a model-based multimodal network for human action recognition in rgb-d videos. IEEE Trans Pattern Anal Mach Intell"}],"container-title":["Applied Intelligence"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-023-04978-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10489-023-04978-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10489-023-04978-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,11,29]],"date-time":"2023-11-29T14:15:21Z","timestamp":1701267321000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10489-023-04978-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,5]]},"references-count":67,"journal-issue":{"issue":"23","published-print":{"date-parts":[[2023,12]]}},"alternative-id":["4978"],"URL":"https:\/\/doi.org\/10.1007\/s10489-023-04978-7","relation":{},"ISSN":["0924-669X","1573-7497"],"issn-type":[{"value":"0924-669X","type":"print"},{"value":"1573-7497","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,10,5]]},"assertion":[{"value":"19 August 2023","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 October 2023","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflicts of interest"}},{"value":"Not applicable","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical approval"}},{"value":"Not applicable","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent to participate"}},{"value":"Not applicable","order":5,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for publication"}}]}}