{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,22]],"date-time":"2026-03-22T22:54:07Z","timestamp":1774220047206,"version":"3.50.1"},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1007\/s11760-026-05219-3","type":"journal-article","created":{"date-parts":[[2026,3,10]],"date-time":"2026-03-10T19:11:50Z","timestamp":1773169910000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["HML-STN: High-Middle-Low spatio-temporal network for RGB-D based human action recognition"],"prefix":"10.1007","volume":"20","author":[{"given":"Yumin","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bo","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yanyong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,3,10]]},"reference":[{"key":"5219_CR1","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? a new model and the kinetics dataset. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4724\u20134733 (2017). IEEE","DOI":"10.1109\/CVPR.2017.502"},{"key":"5219_CR2","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., Van Gool, L.: Temporal segment networks: Towards good practices for deep action recognition. In: European Conference on Computer Vision (2016)","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"5219_CR3","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Fan, H., Malik, J., He, K.: Slowfast networks for video recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 6202\u20136211 (2019)","DOI":"10.1109\/ICCV.2019.00630"},{"key":"5219_CR4","doi-asserted-by":"crossref","unstructured":"Ma, N., Zhang, X., Zheng, H.-T., Sun, J.: Shufflenet v2: Practical guidelines for efficient cnn architecture design. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 116\u2013131 (2018)","DOI":"10.1007\/978-3-030-01264-9_8"},{"key":"5219_CR5","doi-asserted-by":"crossref","unstructured":"Narayana, P., Beveridge, R., Draper, B.A.: Gesture recognition: Focus on the hands. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5235\u20135244 (2018)","DOI":"10.1109\/CVPR.2018.00549"},{"key":"5219_CR6","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2024.127882","volume":"594","author":"D Liu","year":"2024","unstructured":"Liu, D., Meng, F., Xia, Q., Ma, Z., Mi, J., Gan, Y., Ye, M., Zhang, J.: Temporal cues enhanced multimodal learning for action recognition in rgb-d videos. Neurocomputing 594, 127882 (2024)","journal-title":"Neurocomputing"},{"key":"5219_CR7","doi-asserted-by":"publisher","DOI":"10.1016\/j.jvcir.2021.103371","volume":"82","author":"A Barkoky","year":"2022","unstructured":"Barkoky, A., Charkari, N.M.: Complex network-based features extraction in rgb-d human action recognition. J. Vis. Commun. Image Represent. 82, 103371 (2022)","journal-title":"J. Vis. Commun. Image Represent."},{"key":"5219_CR8","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2025.129781","volume":"633","author":"A Abdelkawy","year":"2025","unstructured":"Abdelkawy, A., Ali, A., Farag, A.: Epam-net: An efficient pose-driven attention-guided multimodal network for video action recognition. Neurocomputing 633, 129781 (2025)","journal-title":"Neurocomputing"},{"issue":"1","key":"5219_CR9","doi-asserted-by":"publisher","first-page":"5494","DOI":"10.1038\/s41598-022-09293-8","volume":"12","author":"H Basak","year":"2022","unstructured":"Basak, H., Kundu, R., Singh, P.K., Ijaz, M.F., Wo\u017aniak, M., Sarkar, R.: A union of deep learning and swarm-based optimization for 3d human action recognition. Sci. Rep. 12(1), 5494 (2022)","journal-title":"Sci. Rep."},{"key":"5219_CR10","doi-asserted-by":"publisher","first-page":"1489","DOI":"10.1109\/TMM.2023.3235300","volume":"25","author":"K Peng","year":"2023","unstructured":"Peng, K., Roitberg, A., Yang, K., Zhang, J., Stiefelhagen, R.: Delving deep into one-shot skeleton-based action recognition with diverse occlusions. IEEE Trans. Multimedia 25, 1489\u20131504 (2023)","journal-title":"IEEE Trans. Multimedia"},{"issue":"5","key":"5219_CR11","first-page":"4487","volume":"38","author":"K Peng","year":"2024","unstructured":"Peng, K., Yin, C., Zheng, J., Liu, R., Schneider, D., Zhang, J., Yang, K., Sarfraz, M.S., Stiefelhagen, R., Roitberg, A.: Navigating open set scenarios for skeleton-based action recognition. In: Proceedings of the AAAI Conference on Artificial Intelligence 38(5), 4487\u20134496 (2024)","journal-title":"In: Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"5219_CR12","doi-asserted-by":"crossref","unstructured":"Peng, K., Fu, J., Yang, K., Wen, D., Chen, Y., Liu, R., Zheng, J., Zhang, J., Sarfraz, M.S., Stiefelhagen, R., et al., Referring atomic video action recognition. In: European Conference on Computer Vision, pp. 166\u2013185 (2024). Springer","DOI":"10.1007\/978-3-031-72655-2_10"},{"key":"5219_CR13","doi-asserted-by":"crossref","unstructured":"Shi, L., Zhang, Y., Cheng, J., Lu, H.: Decoupled spatial-temporal attention network for skeleton-based action-gesture recognition. In: Proceedings of the Asian Conference on Computer Vision (2020)","DOI":"10.1007\/978-3-030-69541-5_3"},{"key":"5219_CR14","unstructured":"Peng, K., Huang, J., Huang, X., Wen, D., Zheng, J., Chen, Y., Yang, K., Wu, J., Hao, C., Stiefelhagen, R.: Hopadiff: Holistic-partial aware fourier conditioned diffusion for referring human action segmentation in multi-person scenarios. arXiv preprint arXiv:2506.09650 (2025)"},{"key":"5219_CR15","unstructured":"Wen, D., Peng, K., Yang, K., Chen, Y., Liu, R., Zheng, J., Roitberg, A., Paudel, D.P., Van Gool, L., Stiefelhagen, R.: Rohoi: Robustness benchmark for human-object interaction detection. arXiv preprint arXiv:2507.09111 (2025)"},{"key":"5219_CR16","doi-asserted-by":"crossref","unstructured":"Woo, S., Park, J., Lee, J.-Y., Kweon, I.S.: Cbam: Convolutional block attention module. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 3\u201319 (2018)","DOI":"10.1007\/978-3-030-01234-2_1"},{"key":"5219_CR17","doi-asserted-by":"crossref","unstructured":"Wang, X., Girshick, R., Gupta, A., He, K.: Non-local neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 7794\u20137803 (2018)","DOI":"10.1109\/CVPR.2018.00813"},{"key":"5219_CR18","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TIM.2024.3379075","volume":"73","author":"NK Mehta","year":"2024","unstructured":"Mehta, N.K., Prasad, S.S., Saurav, S., Saini, R., Singh, S.: Iar-net: A human-object context guided action recognition network for industrial environment monitoring. IEEE Trans. Instrum. Meas. 73, 1\u20138 (2024)","journal-title":"IEEE Trans. Instrum. Meas."},{"key":"5219_CR19","doi-asserted-by":"crossref","unstructured":"Liu, C., Hu, Y., Li, Y., Song, S., Liu, J.: Pku-mmd: A large scale benchmark for continuous multi-modal human action understanding. arXiv preprint arXiv:1703.07475 (2017)","DOI":"10.1145\/3132734.3132739"},{"key":"5219_CR20","doi-asserted-by":"crossref","unstructured":"Molchanov, P., Yang, X., Gupta, S., Kim, K., Tyree, S., Kautz, J.: Online detection and classification of dynamic hand gestures with recurrent 3d convolutional neural network. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4207\u20134215 (2016)","DOI":"10.1109\/CVPR.2016.456"},{"key":"5219_CR21","doi-asserted-by":"crossref","unstructured":"Vyas, S., Rawat, Y.S., Shah, M.: Multi-view action recognition using cross-view video prediction. In: European Conference on Computer Vision, pp. 427\u2013444 (2020). Springer","DOI":"10.1007\/978-3-030-58583-9_26"},{"key":"5219_CR22","unstructured":"Loshchilov, I., Hutter, F.: Sgdr: Stochastic gradient descent with warm restarts. arXiv preprint arXiv:1608.03983 (2016)"},{"key":"5219_CR23","doi-asserted-by":"crossref","unstructured":"Shahroudy, A., Liu, J., Ng, T.-T., Wang, G.: Ntu rgb+ d: A large scale dataset for 3d human activity analysis. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1010\u20131019 (2016)","DOI":"10.1109\/CVPR.2016.115"},{"key":"5219_CR24","unstructured":"Zhang, H., Cisse, M., Dauphin, Y.N., Lopez-Paz, D.: mixup: Beyond empirical risk minimization. arXiv preprint arXiv:1710.09412 (2017)"},{"key":"5219_CR25","first-page":"4873","volume":"38","author":"N Siddiqui","year":"2024","unstructured":"Siddiqui, N., Tirupattur, P., Shah, M.: Dvanet: Disentangling view and action features for multi-view action recognition. In: Proceedings of the AAAI Conference on Artificial Intelligence 38, 4873\u20134881 (2024)","journal-title":"In: Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"5219_CR26","doi-asserted-by":"publisher","first-page":"104190","DOI":"10.1109\/ACCESS.2022.3201227","volume":"10","author":"Q Cheng","year":"2022","unstructured":"Cheng, Q., Liu, Z., Ren, Z., Cheng, J., Liu, J.: Spatial-temporal information aggregation and cross-modality interactive learning for rgb-d-based human action recognition. IEEE Access 10, 104190\u2013104201 (2022)","journal-title":"IEEE Access"},{"key":"5219_CR27","doi-asserted-by":"crossref","unstructured":"Lin, J., Gan, C., Han, S.: Tsm: Temporal shift module for efficient video understanding. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 7083\u20137093 (2019)","DOI":"10.1109\/ICCV.2019.00718"},{"key":"5219_CR28","doi-asserted-by":"crossref","unstructured":"Wang, D., Ouyang, W., Li, W., Xu, D.: Dividing and aggregating network for multi-view action recognition. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 451\u2013467 (2018)","DOI":"10.1007\/978-3-030-01240-3_28"},{"key":"5219_CR29","doi-asserted-by":"crossref","unstructured":"Rahmani, H., Mian, A.S.: 3d action recognition from novel viewpoints. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 1506\u20131515 (2016). IEEE","DOI":"10.1109\/CVPR.2016.167"},{"key":"5219_CR30","doi-asserted-by":"crossref","unstructured":"Ghosh, S.K., M, R., Mohan, B.R., Guddeti, R.M.R.: Deep learning-based multi-view 3d-human action recognition using skeleton and depth data. Multimedia Tools and Applications 82(13), 19829\u201319851 (2023)","DOI":"10.1007\/s11042-022-14214-y"},{"issue":"3","key":"5219_CR31","doi-asserted-by":"publisher","first-page":"1303","DOI":"10.1007\/s10044-023-01156-w","volume":"26","author":"Q Cheng","year":"2023","unstructured":"Cheng, Q., Cheng, J., Ren, Z., Zhang, Q., Liu, J.: Multi-scale spatial-temporal convolutional neural network for skeleton-based action recognition. Pattern Anal. Appl. 26(3), 1303\u20131315 (2023)","journal-title":"Pattern Anal. Appl."},{"key":"5219_CR32","doi-asserted-by":"crossref","unstructured":"Das, S., Sharma, S., Dai, R., Bremond, F., Thonnat, M.: Vpn: Learning video-pose embedding for activities of daily living. In: European Conference on Computer Vision, pp. 72\u201390 (2020). Springer","DOI":"10.1007\/978-3-030-58545-7_5"},{"issue":"3","key":"5219_CR33","doi-asserted-by":"publisher","first-page":"3522","DOI":"10.1109\/TPAMI.2022.3177813","volume":"45","author":"BXB Yu","year":"2023","unstructured":"Yu, B.X.B., Liu, Y., Zhang, X., Zhong, S.-H., Chan, K.C.C.: Mmnet: A model-based multimodal network for human action recognition in rgb-d videos. IEEE Trans. Pattern Anal. Mach. Intell. 45(3), 3522\u20133538 (2023)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"5219_CR34","doi-asserted-by":"crossref","unstructured":"Davoodikakhki, M., Yin, K.: Hierarchical action classification with network pruning. In: International Symposium on Visual Computing, pp. 291\u2013305 (2020). Springer","DOI":"10.1007\/978-3-030-64556-4_23"},{"key":"5219_CR35","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.123061","volume":"244","author":"Q Cheng","year":"2024","unstructured":"Cheng, Q., Cheng, J., Liu, Z., Ren, Z., Liu, J.: A dense-sparse complementary network for human action recognition based on rgb and skeleton modalities. Expert Syst. Appl. 244, 123061 (2024)","journal-title":"Expert Syst. Appl."},{"key":"5219_CR36","doi-asserted-by":"crossref","unstructured":"Yang, X., Molchanov, P., Kautz, J.: Making convolutional networks recurrent for visual sequence learning. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6469\u20136478 (2018)","DOI":"10.1109\/CVPR.2018.00677"},{"key":"5219_CR37","doi-asserted-by":"crossref","unstructured":"D Eusanio, A., Simoni, A., Pini, S., Borghi, G., Vezzani, R., Cucchiara, R.: A transformer-based network for dynamic hand gesture recognition. In: 2020 International Conference on 3D Vision (3DV), pp. 623\u2013632 (2020). IEEE","DOI":"10.1109\/3DV50981.2020.00072"},{"key":"5219_CR38","doi-asserted-by":"crossref","unstructured":"Garg, M., Ghosh, D., Pradhan, P.M.: Mvtn: A multiscale video transformer network for hand gesture recognition. In: European Conference on Computer Vision, pp. 15\u201333 (2024). Springer","DOI":"10.1007\/978-3-031-92089-9_2"},{"key":"5219_CR39","doi-asserted-by":"crossref","unstructured":"Garg, M., Ghosh, D., Pradhan, P.M.: Multiscaled multi-head attention-based video transformer network for hand gesture recognition. IEEE Signal Process. Lett. 30, 80\u201384 (2023)","DOI":"10.1109\/LSP.2023.3241857"},{"key":"5219_CR40","unstructured":"Joze, H.R.V., Shaban, A., Iuzzolino, M.L., Koishida, K.: Mmtm: Multimodal transfer module for cnn fusion. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13289\u201313299 (2020)"},{"key":"5219_CR41","doi-asserted-by":"crossref","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., Batra, D.: Grad-cam: Visual explanations from deep networks via gradient-based localization. In: 2017 IEEE International Conference on Computer Vision (ICCV), pp. 618\u2013626 (2017)","DOI":"10.1109\/ICCV.2017.74"}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-026-05219-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-026-05219-3","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-026-05219-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,22]],"date-time":"2026-03-22T22:15:18Z","timestamp":1774217718000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-026-05219-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3]]},"references-count":41,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2026,3]]}},"alternative-id":["5219"],"URL":"https:\/\/doi.org\/10.1007\/s11760-026-05219-3","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3]]},"assertion":[{"value":"8 September 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 November 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 February 2026","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 March 2026","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"179"}}