{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T07:21:26Z","timestamp":1780384886122,"version":"3.54.1"},"reference-count":55,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2023,7,20]],"date-time":"2023-07-20T00:00:00Z","timestamp":1689811200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2023,7,20]],"date-time":"2023-07-20T00:00:00Z","timestamp":1689811200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Nature Science Foundation of China","doi-asserted-by":"crossref","award":["12175194"],"award-info":[{"award-number":["12175194"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Nature Science Foundation of China","doi-asserted-by":"crossref","award":["11974304"],"award-info":[{"award-number":["11974304"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Intell Syst"],"abstract":"<jats:title>Abstract<\/jats:title><jats:p>In this paper, we propose VT-BPAN, a novel approach that combines the capabilities of Vision Transformer (VT), bilinear pooling, and attention network fusion for effective human action recognition (HAR). The proposed methodology significantly enhances the accuracy of activity recognition through the following advancements: (1) The introduction of an effective two-stream feature pooling and fusion mechanism that combines RGB frames and skeleton data to augment the spatial\u2013temporal feature representation. (2) The development of a spatial lightweight vision transformer that mitigates computational costs. The evaluation of this framework encompasses three widely employed video action datasets, demonstrating that the proposed approach achieves performance on par with state-of-the-art methods.<\/jats:p>","DOI":"10.1007\/s44196-023-00292-9","type":"journal-article","created":{"date-parts":[[2023,7,20]],"date-time":"2023-07-20T12:01:55Z","timestamp":1689854515000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["Integrating Vision Transformer-Based Bilinear Pooling and Attention Network Fusion of RGB and Skeleton Features for Human Action Recognition"],"prefix":"10.1007","volume":"16","author":[{"given":"Yaohui","family":"Sun","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weiyao","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaoyi","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ju","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ting","family":"Xia","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2023,7,20]]},"reference":[{"key":"292_CR1","doi-asserted-by":"publisher","unstructured":"Lin, W., Sun, M.T., Poovandran, R., Zhang, Z.: Human activity recognition for video surveillance. Proc IEEE Int Symp Circuits Syst. 2737\u20132740 (2008). https:\/\/doi.org\/10.1109\/ISCAS.2008.4542023","DOI":"10.1109\/ISCAS.2008.4542023"},{"issue":"4","key":"292_CR2","doi-asserted-by":"publisher","first-page":"1100","DOI":"10.1007\/s10489-019-01603-4","volume":"50","author":"M Lu","year":"2020","unstructured":"Lu, M., Hu, Y., Lu, X.: Driver action recognition using deformable and dilated faster R-CNN with optimized region proposals. Appl. Intell. 50(4), 1100\u20131111 (2020). https:\/\/doi.org\/10.1007\/s10489-019-01603-4","journal-title":"Appl. Intell."},{"issue":"2","key":"292_CR3","doi-asserted-by":"publisher","first-page":"255","DOI":"10.1109\/titb.2009.2036168","volume":"14","author":"YM Kuo","year":"2010","unstructured":"Kuo, Y.M., Lee, J.S., Chung, P.C.: A visual Context-Awareness Based sleeping-respiration measurement system. IEEE Trans. Inf. Technol. Biomed. 14(2), 255\u2013265 (2010). https:\/\/doi.org\/10.1109\/titb.2009.2036168","journal-title":"IEEE Trans. Inf. Technol. Biomed."},{"issue":"9","key":"292_CR4","doi-asserted-by":"publisher","first-page":"3436","DOI":"10.1007\/s10489-019-01459-8","volume":"49","author":"J Liu","year":"2019","unstructured":"Liu, J., Sun, C., Xu, X., et al.: A spatial and temporal features mixture model with body parts for video-based person re-identification. Appl. Intell. 49(9), 3436\u20133446 (2019). https:\/\/doi.org\/10.1007\/s10489-019-01459-8","journal-title":"Appl. Intell."},{"issue":"6","key":"292_CR5","doi-asserted-by":"publisher","first-page":"976","DOI":"10.1016\/j.imavis.2009.11.014","volume":"28","author":"R Poppe","year":"2010","unstructured":"Poppe, R.: A survey on vision-based human action recognition. Image Vis. Comput. 28(6), 976\u2013990 (2010). https:\/\/doi.org\/10.1016\/j.imavis.2009.11.014","journal-title":"Image Vis. Comput."},{"key":"292_CR6","doi-asserted-by":"publisher","unstructured":"Donahue, J., Hen, L.A., Saenko, K.: Long-term recurrent convolutional networks for visual recognition and description. Proc. IEEE Conf. Comput. Vis. Pattern Recognit (CVPR): 2625\u20132634 (2015). https:\/\/doi.org\/10.1109\/CVPR.2015.7298878","DOI":"10.1109\/CVPR.2015.7298878"},{"issue":"6","key":"292_CR7","doi-asserted-by":"publisher","first-page":"1453","DOI":"10.1109\/TPAMI.2019.2898954","volume":"42","author":"J Liu","year":"2020","unstructured":"Liu, J., Shahroudy, A., Wang, G., Duan, L.Y., Kot, A.C.: Skeletonbased online action prediction using scale selection network. IEEE Trans. Pattern Anal. Mach. Intell. 42(6), 1453\u20131467 (2020). https:\/\/doi.org\/10.1109\/TPAMI.2019.2898954","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"292_CR8","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-023-08480-6","author":"S Al-Janabi","year":"2023","unstructured":"Al-Janabi, S., Al-Janabi, Z.: Development of deep learning method for predicting DC power based on renewable solar energy and multi-parameters function. Neural Comput. Appl. (2023). https:\/\/doi.org\/10.1007\/s00521-023-08480-6","journal-title":"Neural Comput. Appl."},{"key":"292_CR9","doi-asserted-by":"publisher","unstructured":"Wang, Y., et al.: 3DV: 3D dynamic voxel for action recognition in depth video. Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR): 511\u2013520 (2020). https:\/\/doi.org\/10.1109\/CVPR42600.2020.00059","DOI":"10.1109\/CVPR42600.2020.00059"},{"key":"292_CR10","doi-asserted-by":"publisher","first-page":"7831","DOI":"10.1007\/s00500-023-07953-z","volume":"27","author":"S Al-Janabi","year":"2023","unstructured":"Al-Janabi, S., Al-Barmani, Z.: Intelligent multi-level analytics of soft computing approach to predict water quality index (IM$$^{12}$$CP-WQI). Soft Comput. 27, 7831\u20137861 (2023). https:\/\/doi.org\/10.1007\/s00500-023-07953-z","journal-title":"Soft Comput."},{"key":"292_CR11","doi-asserted-by":"publisher","DOI":"10.1016\/j.rineng.2022.100847","volume":"17","author":"Z Kadhuim","year":"2022","unstructured":"Kadhuim, Z., Al-Janabi, S.: Codon-mRNA prediction using deep optimal neurocomputing technique (DLSTM-DSN-WOA) and multivariate analysis. Results Eng. 17, 100847 (2022). https:\/\/doi.org\/10.1016\/j.rineng.2022.100847","journal-title":"Results Eng."},{"key":"292_CR12","doi-asserted-by":"publisher","first-page":"14199","DOI":"10.1007\/s00521-021-06067-7","volume":"33","author":"S Al-Janabi","year":"2021","unstructured":"Al-Janabi, S., Alkaim, A., Al-Janabi, E., et al.: Intelligent forecaster of concentrations (PM2.5, PM10, NO2, CO, O3, SO2) caused air pollution (IFCsAP). Neural Comput. Appl. 33, 14199\u201314229 (2021). https:\/\/doi.org\/10.1007\/s00521-021-06067-7","journal-title":"Neural Comput. Appl."},{"key":"292_CR13","unstructured":"Wang, F., Song, Y., Zhang, J., Han., J., Huang, D.: Temporal unet: sample level human action recognition using wifi (2019). arXiv preprint arXiv:1904.11953 [Online]"},{"key":"292_CR14","doi-asserted-by":"publisher","unstructured":"Zhao, R., Ali, H., Vander, Smagt P.: Two-stream RNN\/CNN for action recognition in 3D videos Proc. IEEE\/RSJ Int. Conf. Intell. Robots Syst. (IROS), 4260\u20134267 (2017). https:\/\/doi.org\/10.1109\/IROS.2017.8206288","DOI":"10.1109\/IROS.2017.8206288"},{"key":"292_CR15","doi-asserted-by":"publisher","unstructured":"Song, S., Lan, C., Xing, J., Zeng, W., Liu, J.: Skeleton-indexed deep multi-modal feature learning for high performance human action recognition. Proc. IEEE Int. Conf. Multimedia Expo (ICME): 1\u20136 (2018). https:\/\/doi.org\/10.1109\/ICME.2018.8486486","DOI":"10.1109\/ICME.2018.8486486"},{"key":"292_CR16","doi-asserted-by":"publisher","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., Polosukhin, I.: Attention is all you need.Proc. Adv. Neural Inf. Process. Syst., 5998\u20136008 (2017). https:\/\/doi.org\/10.48550\/arXiv.1706.03762","DOI":"10.48550\/arXiv.1706.03762"},{"key":"292_CR17","doi-asserted-by":"publisher","unstructured":"Chen, J., Ho, C.M. : MM-ViT: multi-modal video transformer for compressed video action recognition. Proc. IEEE\/CVF Win880 ter Conf. Appl. Comput. Vis. (WACV), 786\u2013797 (2022). https:\/\/doi.org\/10.1109\/WACV51458.2022.00086","DOI":"10.1109\/WACV51458.2022.00086"},{"key":"292_CR18","doi-asserted-by":"publisher","unstructured":"Chen, H., Wang, Y., Guo, T., Xu, C., Deng, Y., Liu, Z., Ma, S., Xu, C., Gao, W.: Pre-trained image processing transformer. Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 12299\u201312310 (2021). https:\/\/doi.org\/10.48550\/arXiv.2012.00364","DOI":"10.48550\/arXiv.2012.00364"},{"key":"292_CR19","unstructured":"Parmar, N., et al. Image transformer (2018). arXiv preprint arXiv:1802.05751 [Online]"},{"key":"292_CR20","doi-asserted-by":"publisher","unstructured":"Zhou, L., et al.: End-to-end dense video captioning with masked transformer. Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 8739\u20138748 (2018). https:\/\/doi.org\/10.1109\/CVPR.2018.00911","DOI":"10.1109\/CVPR.2018.00911"},{"key":"292_CR21","doi-asserted-by":"crossref","unstructured":"Zeng, Y., et al.: Learning joint spatial-temporal transformations for video inpainting. Proc. Eur. Conf. Comput. Vis. (ECCV), 528\u2013543 (2020). arXiv:2007.10247. [Online]","DOI":"10.1007\/978-3-030-58517-4_31"},{"key":"292_CR22","doi-asserted-by":"publisher","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. Proc. Adv. Neural Inf. Process. Syst. 568\u2013576 (2014). https:\/\/doi.org\/10.1002\/14651858.CD001941.pub3","DOI":"10.1002\/14651858.CD001941.pub3"},{"key":"292_CR23","doi-asserted-by":"publisher","unstructured":"Diba, A., Sharma, V., Van Gool, L.: Deep temporal linear encoding networks. Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR), 2329\u20132338 (2017). https:\/\/doi.org\/10.1109\/CVPR.2017.168","DOI":"10.1109\/CVPR.2017.168"},{"key":"292_CR24","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., Van Gool, L.: Temporal segment networks: towards good practices for deep action recognition (2016). arXiv preprint arXiv:1608.00859. [Online]","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"292_CR25","doi-asserted-by":"publisher","unstructured":"Yan, S., Xiong, Y., Lin, D.: Spatial temporal graph convolutional networks for skeleton-based action recognition. Proc. 32nd AAAI Conf. Artif. Intell.: 1\u20139 (2018). https:\/\/doi.org\/10.48550\/arXiv.1801.07455","DOI":"10.48550\/arXiv.1801.07455"},{"key":"292_CR26","doi-asserted-by":"publisher","unstructured":"Shi, L., Zhang, Y., Cheng, J., Lu, H.: Two-stream adaptive graph convolutional networks for skeleton-based action recognition. Proc. IEEE Conf. Comput. Vis. Pattern Recognit. (CVPR): 12026\u201312035 (2019). https:\/\/doi.org\/10.48550\/arXiv.1805.07694","DOI":"10.48550\/arXiv.1805.07694"},{"key":"292_CR27","doi-asserted-by":"publisher","unstructured":"Chi, H.-G, Ha, M.H., Chi, S., Lee, S.W., Huang, Q., Ramani, K.: Infogcn: representation learning for human skeleton-based action recognition. Proc. IEEE Conf. Comput. Vis. Pattern Recognit (CVPR), 20154-20164 (2022). https:\/\/doi.org\/10.1109\/CVPR52688.2022.01955","DOI":"10.1109\/CVPR52688.2022.01955"},{"key":"292_CR28","doi-asserted-by":"publisher","unstructured":"Zhang, Y., Wu, B., Li, W., Duan, L., Gan, C.: Stst: spatial-temporal specialized transformer for skeleton-based action recognition. Proc. 29th ACM Int. Conf. Multimedia, 3220\u20133228 (2021). https:\/\/doi.org\/10.1145\/3474085.3475473","DOI":"10.1145\/3474085.3475473"},{"issue":"10","key":"292_CR29","doi-asserted-by":"publisher","first-page":"100426","DOI":"10.1002\/14651858.CD001941.pub3","volume":"2022","author":"X Li","year":"2022","unstructured":"Li, X., Zhang, J., Wang, S., et al.: Two-stream spatial graphormer networks for skeleton-based action recognition. IEEE Access 2022(10), 100426\u2013100437 (2022). https:\/\/doi.org\/10.1002\/14651858.CD001941.pub3","journal-title":"IEEE Access"},{"key":"292_CR30","unstructured":"Mehta, S., et al.: DeLighT: deep and light-weight transformer (2021). arXiv preprint arXiv:2008.00623 [Online]"},{"key":"292_CR31","doi-asserted-by":"crossref","unstructured":"Qiu, H., Hou, B., Ren, B., Zhang, X.: Spatio-temporal tuples transformer for skeleton-based action recognition (2022). arXiv preprint arXiv:2201.02849 [Online]","DOI":"10.1016\/j.neucom.2022.10.084"},{"key":"292_CR32","doi-asserted-by":"publisher","unstructured":"Zolfaghari, M., G. Oliveira, L., Sedaghat, N., Brox, T.: Chained multistream networks exploiting pose, motion, and appearance for action classification and detection. Proc. IEEE Int. Conf. Comput. Vis. (ICCV), 2904\u20132913. https:\/\/doi.org\/10.1109\/iccv.2017.316","DOI":"10.1109\/iccv.2017.316"},{"issue":"9","key":"292_CR33","doi-asserted-by":"publisher","first-page":"2667","DOI":"10.1109\/TCSVT.2018.2799968","volume":"29","author":"J Liu","year":"2019","unstructured":"Liu, J., Li, Y., Song, S., Xing, J., Lan, C., Zeng, W.: Multi-modality multi-task recurrent neural network for online action detection. IEEE Trans. Circuits Syst. Video Technol. 29(9), 2667\u20132682 (2019). https:\/\/doi.org\/10.1109\/TCSVT.2018.2799968","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"292_CR34","doi-asserted-by":"publisher","unstructured":"Li, J., Xie, X., Pan, Q., Cao, Y., Zhao, Z., Shi, G.: SGM-Net: skeletonguided multimodal network for action recognition. Pattern Recognit. Art. 107356 (2020). https:\/\/doi.org\/10.1016\/j.patcog.2020.107356","DOI":"10.1016\/j.patcog.2020.107356"},{"issue":"17","key":"292_CR35","doi-asserted-by":"publisher","first-page":"19157","DOI":"10.1109\/JSEN.2021.3089705","volume":"21","author":"W Xu","year":"2021","unstructured":"Xu, W., Wu, M., Zhao, M., Xia, T.: Fusion of skeleton and RGB features for RGB-D human action recognition. IEEE Sens. J. 21(17), 19157\u201319164 (2021). https:\/\/doi.org\/10.1109\/JSEN.2021.3089705","journal-title":"IEEE Sens. J."},{"key":"292_CR36","doi-asserted-by":"publisher","unstructured":"Tran, D., Wang, H., Torresani, L., Ray, J., LeCun, Y., Paluri, M.: A closer look at spatiotemporal convolutions for action recognition. Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit., 6450\u20136459 (2018). https:\/\/doi.org\/10.48550\/arXiv.1711.11248","DOI":"10.48550\/arXiv.1711.11248"},{"issue":"2","key":"292_CR37","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1109\/MMUL.2012.24","volume":"19","author":"Z Zhang","year":"2012","unstructured":"Zhang, Z.: Microsoft Kinect sensor and its effect. IEEE MultiMedia Mag. 19(2), 4\u201310 (2012). https:\/\/doi.org\/10.1109\/MMUL.2012.24","journal-title":"IEEE MultiMedia Mag."},{"key":"292_CR38","doi-asserted-by":"publisher","unstructured":"Hu, J.F., Zheng, W.S., Pan, J., Lai, J., Zhang, J.: Deep bilinear learning for RGB-D action recognition. Proc. Eur. Conf. Comput. Vis. (ECCV), 335\u2013351 (2018). https:\/\/doi.org\/10.1007\/978-3-030-01234-2_21","DOI":"10.1007\/978-3-030-01234-2_21"},{"key":"292_CR39","doi-asserted-by":"publisher","unstructured":"Wang, Q., Wu, B., Zhu, P., Li, P., Zuo, W., Hu, Q.: ECA-Net: Efficient channel attention for deep convolutional neural networks, Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit (CVPR), 11531\u201311539 (2020). https:\/\/doi.org\/10.1109\/CVPR42600.2020.01155","DOI":"10.1109\/CVPR42600.2020.01155"},{"key":"292_CR40","doi-asserted-by":"publisher","unstructured":"Gao, Y., Beijbom, O., Zhang, N., Darrell, T.: Compact bilinear pooling. Proc. IEEE Conf. Comput. Vis. Pattern Recognit (CVPR), 317\u2013326 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.41","DOI":"10.1109\/CVPR.2016.41"},{"key":"292_CR41","doi-asserted-by":"publisher","unstructured":"Shahroudy, A., Liu, J., Ng, T.T., Wang, G.: NTU RGB+D: A large scale dataset for 3D human activity analysis. Proc. Comput. Vis. Pattern Recognit (CVPR), 1010\u20131019 (2016). https:\/\/doi.org\/10.48550\/arXiv.1604.02808","DOI":"10.48550\/arXiv.1604.02808"},{"issue":"10","key":"292_CR42","doi-asserted-by":"publisher","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","volume":"42","author":"J Liu","year":"2019","unstructured":"Liu, J., Shahroudy, A., Perez, M.L., Wang, G., Duan, L.-Y., Chichung, A.K.: NTU RGB+D 120: a large-scale benchmark for 3D human activity understanding. IEEE Trans. Pattern Anal. Mach. Intell. 42(10), 2684\u20132701 (2019). https:\/\/doi.org\/10.1109\/TPAMI.2019.2916873","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"292_CR43","doi-asserted-by":"publisher","unstructured":"Chen, C., Jafari, R., Kehtarnavaz, N.: UTD-MHAD: a multimodal dataset for human action recognition utilizing a depth camera and a wearable inertial sensor. Proc. IEEE Int. Conf. Image Process. (ICIP), 168\u2013172 (2015). https:\/\/doi.org\/10.1109\/ICIP.2015.7350781","DOI":"10.1109\/ICIP.2015.7350781"},{"key":"292_CR44","doi-asserted-by":"publisher","unstructured":"Liu, G., Qian, J., Wen, F., Zhu, X., Ying, R., Liu, P.: Action recognition based on 3D skeleton and RGB frame fusion. Proc. IEEE\/RSJ Int. Conf. Intell. Robots Syst. (IROS), 258\u2013264 (2019). https:\/\/doi.org\/10.1109\/IROS40897.2019.8967570","DOI":"10.1109\/IROS40897.2019.8967570"},{"key":"292_CR45","doi-asserted-by":"publisher","unstructured":"De Boissiere, A.M., Noumeir, R.: Infrared and 3D skeleton feature fusion for RGB-D action recognition. IEEE Access., 168297\u2013168308 (2020). https:\/\/doi.org\/10.1109\/ACCESS.2020.3023599","DOI":"10.1109\/ACCESS.2020.3023599"},{"key":"292_CR46","unstructured":"Su, L., Hu, C., Li, G., Cao, D.: MSAF: Multimodal split attention fusion (2020). arXiv:2012.07175 [Online]"},{"key":"292_CR47","doi-asserted-by":"publisher","unstructured":"Joze, H.R.V., Shaban, A., Iuzzolino, M.L., Koishida, K.: MMTM: Multimodal transfer module for CNN fusion. Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit. (CVPR), 13289\u201313299 (2020). https:\/\/doi.org\/10.48550\/arXiv.1911.08670","DOI":"10.48550\/arXiv.1911.08670"},{"key":"292_CR48","doi-asserted-by":"publisher","unstructured":"Das, S., Sharma, S., Dai, R., Bremond, F., Thonnat, M.: VPN: Learning video-pose embedding for activities of daily living. Proc. Eur. Conf. Comput. Vis., 72\u201390 (2020). https:\/\/doi.org\/10.1007\/978-3-030-58545-7_5","DOI":"10.1007\/978-3-030-58545-7_5"},{"key":"292_CR49","doi-asserted-by":"publisher","unstructured":"Liu, J., Shahroudy, A., Dong, X., Gang, W.: Spatio-temporal LSTM with trust gates for 3D human action recognition. Proc. Eur. Conf. Comput. Vis., 816\u2013833 (2016). https:\/\/doi.org\/10.1007\/978-3-319-46487-9_50","DOI":"10.1007\/978-3-319-46487-9_50"},{"key":"292_CR50","doi-asserted-by":"publisher","unstructured":"Liu, M., Yuan, J.: Recognizing human actions as the evolution of pose estimation maps. Proc. IEEE\/CVF Conf. Comput. Vis. Pattern Recognit., 1159\u20131168 (2018). https:\/\/doi.org\/10.1109\/CVPR.2018.00127","DOI":"10.1109\/CVPR.2018.00127"},{"key":"292_CR51","doi-asserted-by":"publisher","unstructured":"Das, S., Dai, R., Koperski, M., Minciullo, L., Garattoni, L., Bremond, F., Francesca, G.: Toyota smarthome: Real-world activities of daily living. Proc. IEEE Int. Conf. Comput. Vis.(ICCV), 833\u2013842 (2019). https:\/\/doi.org\/10.1109\/ICCV.2019.00092","DOI":"10.1109\/ICCV.2019.00092"},{"issue":"6","key":"292_CR52","doi-asserted-by":"publisher","first-page":"671","DOI":"10.1007\/s00530-020-00677-2","volume":"26","author":"P Verma","year":"2020","unstructured":"Verma, P., Sah, A., Srivastava, R.: Deep learning-based multimodal approach using RGB and skeleton sequences for human activity recognition. Multimed. Syst. 26(6), 671\u2013685 (2020). https:\/\/doi.org\/10.1007\/s00530-020-00677-2","journal-title":"Multimed. Syst."},{"key":"292_CR53","doi-asserted-by":"publisher","unstructured":"Li, C., Hou, Y., Wang, P., Li, W.: Joint distance maps based action recognition with convolutional neural networks. IEEE Signal Process. Lett. 24(5), 624\u2013628 (2017). https:\/\/doi.org\/10.1109\/LSP.2017.2678539","DOI":"10.1109\/LSP.2017.2678539"},{"issue":"5","key":"292_CR54","doi-asserted-by":"publisher","first-page":"1862","DOI":"10.1109\/JSEN.2018.2884443","volume":"19","author":"T Liu","year":"2019","unstructured":"Liu, T., Kong, J., Jiang, M.: RGB-D action recognition using multimodal correlative representation learning model. IEEE Sens. J. 19(5), 1862\u20131872 (2019). https:\/\/doi.org\/10.1109\/JSEN.2018.2884443","journal-title":"IEEE Sens. J."},{"key":"292_CR55","doi-asserted-by":"publisher","unstructured":"Islam, M.M., Iqbal, T.: HAMLET: A hierarchical multimodal attention-based human activity recognition algorithm. Proc. IEEE\/RSJ Int. Conf. Intell. Robots Syst. (IROS), 1\u20138. 406\u2013413 (2020). https:\/\/doi.org\/10.1109\/IROS45743.2020.9340987","DOI":"10.1109\/IROS45743.2020.9340987"}],"container-title":["International Journal of Computational Intelligence Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s44196-023-00292-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s44196-023-00292-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s44196-023-00292-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,7,20]],"date-time":"2023-07-20T13:13:59Z","timestamp":1689858839000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s44196-023-00292-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,7,20]]},"references-count":55,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2023,12]]}},"alternative-id":["292"],"URL":"https:\/\/doi.org\/10.1007\/s44196-023-00292-9","relation":{},"ISSN":["1875-6883"],"issn-type":[{"value":"1875-6883","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,7,20]]},"assertion":[{"value":"19 April 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"21 June 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 July 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"This manuscript has not been partially or entirely published or presented elsewhere, and is not under consideration by other journals. The authors declare that there are no conflicts of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of Interest"}}],"article-number":"116"}}