{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,26]],"date-time":"2026-02-26T15:24:25Z","timestamp":1772119465667,"version":"3.50.1"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62277009"],"award-info":[{"award-number":["62277009"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2025,6]]},"DOI":"10.1007\/s00530-025-01762-0","type":"journal-article","created":{"date-parts":[[2025,4,3]],"date-time":"2025-04-03T21:24:25Z","timestamp":1743715465000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["A three-stream fusion network for 3D skeleton-based action recognition"],"prefix":"10.1007","volume":"31","author":[{"given":"Ming","family":"Fang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qi","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianping","family":"Ren","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jie","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinning","family":"Du","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuhua","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,1]]},"reference":[{"key":"1762_CR1","doi-asserted-by":"crossref","unstructured":"Caetano: Skelemotion: a new representation of skeleton joint sequences based on motion information for 3d action recognition. In: 2019 16th IEEE International Conference on Advanced Video and Signal Based Surveillance (AVSS), pp. 1\u20138 (2019). IEEE","DOI":"10.1109\/AVSS.2019.8909840"},{"key":"1762_CR2","doi-asserted-by":"crossref","unstructured":"Caetano, C., Br\u00e9mond, F., Schwartz, W.R.: Skeleton image representation for 3d action recognition based on tree structure and reference joints. In: 2019 32nd SIBGRAPI Conference on Graphics, Patterns and Images (SIBGRAPI), pp. 16\u201323 (2019). IEEE","DOI":"10.1109\/SIBGRAPI.2019.00011"},{"key":"1762_CR3","doi-asserted-by":"crossref","unstructured":"Ke, Q., Bennamoun, M., An, S., Sohel, F., Boussaid, F.: A new representation of skeleton sequences for 3d action recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3288\u20133297 (2017)","DOI":"10.1109\/CVPR.2017.486"},{"issue":"8","key":"1762_CR4","doi-asserted-by":"publisher","first-page":"2405","DOI":"10.1109\/TCSVT.2018.2864148","volume":"29","author":"Z Yang","year":"2018","unstructured":"Yang, Z., Li, Y., Yang, J., Luo, J.: Action recognition with spatio-temporal visual attention on skeleton image sequences. IEEE Trans. Circuits Syst. Video Technol. 29(8), 2405\u20132415 (2018)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1762_CR5","doi-asserted-by":"crossref","unstructured":"Yan, S., Xiong, Y., Lin, D.: Spatial temporal graph convolutional networks for skeleton-based action recognition. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 32 (2018)","DOI":"10.1609\/aaai.v32i1.12328"},{"issue":"6","key":"1762_CR6","doi-asserted-by":"publisher","first-page":"2825","DOI":"10.1109\/TIP.2019.2891104","volume":"28","author":"H Chen","year":"2019","unstructured":"Chen, H., Li, Y.: Three-stream attention-aware network for rgb-d salient object detection. IEEE Trans. Image Process. 28(6), 2825\u20132835 (2019)","journal-title":"IEEE Trans. Image Process."},{"key":"1762_CR7","doi-asserted-by":"crossref","unstructured":"Liang, D., Fan, G., Lin, G., Chen, W., Pan, X., Zhu, H.: Three-stream convolutional neural network with multi-task and ensemble learning for 3d action recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, pp. 0\u20130 (2019)","DOI":"10.1109\/CVPRW.2019.00123"},{"issue":"2","key":"1762_CR8","doi-asserted-by":"publisher","first-page":"652","DOI":"10.1109\/TPAMI.2019.2938758","volume":"43","author":"S-H Gao","year":"2019","unstructured":"Gao, S.-H., Cheng, M.-M., Zhao, K., Zhang, X.-Y., Yang, M.-H., Torr, P.: Res2net: A new multi-scale backbone architecture. IEEE Trans. Pattern Anal. Mach. Intell. 43(2), 652\u2013662 (2019)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1762_CR9","doi-asserted-by":"crossref","unstructured":"Li, Y., Ji, B., Shi, X., Zhang, J., Kang, B., Wang, L.: Tea: Temporal excitation and aggregation for action recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 909\u2013918 (2020)","DOI":"10.1109\/CVPR42600.2020.00099"},{"key":"1762_CR10","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2022.104403","volume":"120","author":"G Goyal","year":"2022","unstructured":"Goyal, G., Noceti, N., Odone, F.: Cross-view action recognition with small-scale datasets. Image Vis. Comput. 120, 104403 (2022)","journal-title":"Image Vis. Comput."},{"key":"1762_CR11","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2021.104141","volume":"109","author":"N Sun","year":"2021","unstructured":"Sun, N., Leng, L., Liu, J., Han, G.: Multi-stream slowfast graph convolutional networks for skeleton-based action recognition. Image Vis. Comput. 109, 104141 (2021)","journal-title":"Image Vis. Comput."},{"key":"1762_CR12","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109455","volume":"139","author":"K Gedamu","year":"2023","unstructured":"Gedamu, K., Ji, Y., Gao, L., Yang, Y., Shen, H.T.: Relation-mining self-attention network for skeleton-based human action recognition. Pattern Recogn. 139, 109455 (2023)","journal-title":"Pattern Recogn."},{"key":"1762_CR13","doi-asserted-by":"crossref","unstructured":"Xiang, W., Li, C., Zhou, Y., Wang, B., Zhang, L.: Generative action description prompts for skeleton-based action recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 10276\u201310285 (2023)","DOI":"10.1109\/ICCV51070.2023.00943"},{"key":"1762_CR14","doi-asserted-by":"crossref","unstructured":"Zhou, H., Liu, Q., Wang, Y.: Learning discriminative representations for skeleton based action recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10608\u201310617 (2023)","DOI":"10.1109\/CVPR52729.2023.01022"},{"key":"1762_CR15","doi-asserted-by":"crossref","unstructured":"Wang, H., Wang, L.: Modeling temporal dynamics and spatial configurations of actions using two-stream recurrent neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 499\u2013508 (2017)","DOI":"10.1109\/CVPR.2017.387"},{"issue":"12","key":"1762_CR16","doi-asserted-by":"publisher","first-page":"3007","DOI":"10.1109\/TPAMI.2017.2771306","volume":"40","author":"J Liu","year":"2017","unstructured":"Liu, J., Shahroudy, A., Xu, D., Kot, A.C., Wang, G.: Skeleton-based action recognition using spatio-temporal lstm network with trust gates. IEEE Trans. Pattern Anal. Mach. Intell. 40(12), 3007\u20133021 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1762_CR17","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2021.104333","volume":"116","author":"Z Liu","year":"2021","unstructured":"Liu, Z., Yin, Z., Wu, Y.: Mlrmv: Multi-layer representation for multi-view action recognition. Image Vis. Comput. 116, 104333 (2021)","journal-title":"Image Vis. Comput."},{"key":"1762_CR18","doi-asserted-by":"crossref","unstructured":"Li, Y., Xia, R., Liu, X., Huang, Q.: Learning shape-motion representations from geometric algebra spatio-temporal model for skeleton-based action recognition. In: 2019 IEEE International Conference on Multimedia and Expo (ICME), pp. 1066\u20131071 (2019). IEEE","DOI":"10.1109\/ICME.2019.00187"},{"key":"1762_CR19","unstructured":"Dosovitskiy, A., Beyer, L., Kolesnikov, A., Weissenborn, D., Zhai, X., Unterthiner, T., Dehghani, M., Minderer, M., Heigold, G., Gelly, S., et al.: An image is worth 16x16 words: Transformers for image recognition at scale (2020). arXiv preprint arXiv:2010.11929"},{"issue":"16","key":"1762_CR20","doi-asserted-by":"publisher","first-page":"5339","DOI":"10.3390\/s21165339","volume":"21","author":"Y Sun","year":"2021","unstructured":"Sun, Y., Shen, Y., Ma, L.: Msst-rt: multi-stream spatial-temporal relative transformer for skeleton-based action recognition. Sensors 21(16), 5339 (2021)","journal-title":"Sensors"},{"key":"1762_CR21","doi-asserted-by":"crossref","unstructured":"Ijaz, M., Diaz, R., Chen, C.: Multimodal transformer for nursing activity recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2065\u20132074 (2022)","DOI":"10.1109\/CVPRW56347.2022.00224"},{"key":"1762_CR22","doi-asserted-by":"crossref","unstructured":"Wang, Q., Shi, S., He, J., Peng, J., Liu, T., Weng, R.: Iip-transformer: Intra-inter-part transformer for skeleton-based action recognition. In: 2023 IEEE International Conference on Big Data (BigData), pp. 936\u2013945 (2023). IEEE","DOI":"10.1109\/BigData59044.2023.10386970"},{"key":"1762_CR23","doi-asserted-by":"crossref","unstructured":"Zhang, H., Geng, H., Yang, G.: Two-stream transformer encoders for skeleton-based action recognition. In: International Conference on Computing, Control and Industrial Engineering, pp. 272\u2013281 (2021). Springer","DOI":"10.1007\/978-981-19-3927-3_26"},{"key":"1762_CR24","doi-asserted-by":"crossref","unstructured":"Plizzari, C., Cannici, M., Matteucci, M.: Spatial temporal transformer network for skeleton-based action recognition. In: Pattern Recognition. ICPR International Workshops and Challenges: Virtual Event, January 10\u201315, 2021, Proceedings, Part III, pp. 694\u2013701 (2021). Springer","DOI":"10.1007\/978-3-030-68796-0_50"},{"key":"1762_CR25","doi-asserted-by":"crossref","unstructured":"Peng, W., Hong, X., Chen, H., Zhao, G.: Learning graph convolutional network for skeleton-based human action recognition by neural searching. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 34, pp. 2669\u20132676 (2020)","DOI":"10.1609\/aaai.v34i03.5652"},{"key":"1762_CR26","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.109231","volume":"136","author":"L Wu","year":"2023","unstructured":"Wu, L., Zhang, C., Zou, Y.: Spatiotemporal focus for skeleton-based action recognition. Pattern Recogn. 136, 109231 (2023)","journal-title":"Pattern Recogn."},{"key":"1762_CR27","doi-asserted-by":"crossref","unstructured":"Shi, L., Zhang, Y., Cheng, J., Lu, H.: Two-stream adaptive graph convolutional networks for skeleton-based action recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 12026\u201312035 (2019)","DOI":"10.1109\/CVPR.2019.01230"},{"issue":"2","key":"1762_CR28","doi-asserted-by":"publisher","first-page":"1544","DOI":"10.1007\/s10489-021-02517-w","volume":"52","author":"S Liu","year":"2022","unstructured":"Liu, S., Bai, X., Fang, M., Li, L., Hung, C.-C.: Mixed graph convolution and residual transformation network for skeleton-based action recognition. Appl. Intell. 52(2), 1544\u20131555 (2022)","journal-title":"Appl. Intell."},{"key":"1762_CR29","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos (2014). arXiv:abs\/1406.2199"},{"issue":"3","key":"1762_CR30","doi-asserted-by":"publisher","first-page":"3522","DOI":"10.1109\/TPAMI.2022.3177813","volume":"45","author":"B Yu","year":"2023","unstructured":"Yu, B., Liu, Y., Zhang, X., Zhong, S.-H., Chan, K.: Mmnet: a model-based multimodal network for human action recognition in rgb-d videos. IEEE Trans. Pattern Anal. Mach. Intell. 45(3), 3522\u20133538 (2023). https:\/\/doi.org\/10.1109\/TPAMI.2022.3177813","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1762_CR31","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.122314","volume":"239","author":"Z Hu","year":"2023","unstructured":"Hu, Z., Xiao, J., Li, L., Liu, C., Ji, G.: Human-centric multimodal fusion network for robust action recognition. Expert Syst. Appl. 239, 122314 (2023)","journal-title":"Expert Syst. Appl."},{"key":"1762_CR32","doi-asserted-by":"publisher","first-page":"369","DOI":"10.1007\/s00530-024-01566-8","volume":"30","author":"J Wang","year":"2024","unstructured":"Wang, J., Li, Z., Liu, B., Cai, H., Saada, M., Meng, Q.: Mgsan: multimodal graph self-attention network for skeleton-based action recognition. Multim. Syst. 30, 369 (2024)","journal-title":"Multim. Syst."},{"key":"1762_CR33","doi-asserted-by":"crossref","unstructured":"Li, C., Zhong, Q., Xie, D., Pu, S.: Co-occurrence feature learning from skeleton data for action recognition and detection with hierarchical aggregation (2018). arXiv preprint arXiv:1804.06055","DOI":"10.24963\/ijcai.2018\/109"},{"key":"1762_CR34","doi-asserted-by":"crossref","unstructured":"Xie, S., Girshick, R., Doll\u00e1r, P., Tu, Z., He, K.: Aggregated residual transformations for deep neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1492\u20131500 (2017)","DOI":"10.1109\/CVPR.2017.634"},{"key":"1762_CR35","doi-asserted-by":"crossref","unstructured":"Shahroudy, A., Liu, J., Ng, T.-T., Wang, G.: Ntu rgb+ d: a large scale dataset for 3d human activity analysis. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1010\u20131019 (2016)","DOI":"10.1109\/CVPR.2016.115"},{"issue":"10","key":"1762_CR36","doi-asserted-by":"publisher","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","volume":"42","author":"J Liu","year":"2019","unstructured":"Liu, J., Shahroudy, A., Perez, M., Wang, G., Duan, L.-Y., Kot, A.C.: Ntu rgb+ d 120: a large-scale benchmark for 3d human activity understanding. IEEE Trans. Pattern Anal. Mach. Intell. 42(10), 2684\u20132701 (2019)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"1762_CR37","doi-asserted-by":"crossref","unstructured":"Wang, L., Koniusz, P.: 3mformer: multi-order multi-mode transformer for skeletal action recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5620\u20135631 (2023)","DOI":"10.1109\/CVPR52729.2023.00544"},{"issue":"12","key":"1762_CR38","doi-asserted-by":"publisher","first-page":"9703","DOI":"10.1109\/TPAMI.2021.3127885","volume":"44","author":"S Das","year":"2021","unstructured":"Das, S., Dai, R., Yang, D., Bremond, F.: Vpn++: rethinking video-pose embeddings for understanding activities of daily living. IEEE Trans. Pattern Anal. Mach. Intell. 44(12), 9703\u20139717 (2021)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"5","key":"1762_CR39","doi-asserted-by":"publisher","first-page":"1915","DOI":"10.1109\/TCSVT.2020.3015051","volume":"31","author":"Y-F Song","year":"2020","unstructured":"Song, Y.-F., Zhang, Z., Shan, C., Wang, L.: Richly activated graph convolutional network for robust skeleton-based action recognition. IEEE Trans. Circuits Syst. Video Technol. 31(5), 1915\u20131925 (2020)","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"1762_CR40","doi-asserted-by":"crossref","unstructured":"Cheng, K., Zhang, Y., Cao, C., Shi, L., Cheng, J., Lu, H.: Decoupling gcn with dropgraph module for skeleton-based action recognition. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XXIV 16, pp. 536\u2013553 (2020). Springer","DOI":"10.1007\/978-3-030-58586-0_32"},{"key":"1762_CR41","doi-asserted-by":"crossref","unstructured":"Shi, L., Zhang, Y., Cheng, J., Lu, H.: Decoupled spatial-temporal attention network for skeleton-based action-gesture recognition. In: Proceedings of the Asian Conference on Computer Vision (2020)","DOI":"10.1007\/978-3-030-69541-5_3"},{"key":"1762_CR42","doi-asserted-by":"crossref","unstructured":"Cai, J., Jiang, N., Han, X., Jia, K., Lu, J.: Jolo-gcn: mining joint-centered light-weight information for skeleton-based action recognition. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 2735\u20132744 (2021)","DOI":"10.1109\/WACV48630.2021.00278"},{"key":"1762_CR43","doi-asserted-by":"crossref","unstructured":"Gao, Z., Wang, P., Lv, P., Jiang, X., Liu, Q., Wang, P., Xu, M., Li, W.: Focal and global spatial-temporal transformer for skeleton-based action recognition. In: Proceedings of the Asian Conference on Computer Vision, pp. 382\u2013398 (2022)","DOI":"10.1007\/978-3-031-26316-3_10"},{"key":"1762_CR44","doi-asserted-by":"crossref","unstructured":"Hang, R., Li, M.: Spatial-temporal adaptive graph convolutional network for skeleton-based action recognition. In: Proceedings of the Asian Conference on Computer Vision, pp. 1265\u20131281 (2022)","DOI":"10.1007\/978-3-031-26316-3_11"},{"key":"1762_CR45","doi-asserted-by":"crossref","unstructured":"Chi, H.-g., Ha, M.H., Chi, S., Lee, S.W., Huang, Q., Ramani, K.: Infogcn: Representation learning for human skeleton-based action recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 20186\u201320196 (2022)","DOI":"10.1109\/CVPR52688.2022.01955"},{"key":"1762_CR46","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109455","volume":"139","author":"K Gedamu","year":"2023","unstructured":"Gedamu, K., Ji, Y., Gao, L., Yang, Y., Shen, H.T.: Relation-mining self-attention network for skeleton-based human action recognition. Pattern Recogn. 139, 109455 (2023)","journal-title":"Pattern Recogn."}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-025-01762-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-025-01762-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-025-01762-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,4]],"date-time":"2025-09-04T15:06:09Z","timestamp":1756998369000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-025-01762-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,1]]},"references-count":46,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2025,6]]}},"alternative-id":["1762"],"URL":"https:\/\/doi.org\/10.1007\/s00530-025-01762-0","relation":{"has-preprint":[{"id-type":"doi","id":"10.21203\/rs.3.rs-4131227\/v1","asserted-by":"object"}]},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4,1]]},"assertion":[{"value":"19 March 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 March 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 April 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"176"}}