{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,19]],"date-time":"2026-01-19T06:53:04Z","timestamp":1768805584027,"version":"3.49.0"},"reference-count":48,"publisher":"Springer Science and Business Media LLC","issue":"29","license":[{"start":{"date-parts":[[2023,12,11]],"date-time":"2023-12-11T00:00:00Z","timestamp":1702252800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,12,11]],"date-time":"2023-12-11T00:00:00Z","timestamp":1702252800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/100014718","name":"Innovative Research Group Project of the National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["(No.11974304 and No.12175194)"],"award-info":[{"award-number":["(No.11974304 and No.12175194)"]}],"id":[{"id":"10.13039\/100014718","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"DOI":"10.1007\/s11042-023-17788-3","type":"journal-article","created":{"date-parts":[[2023,12,11]],"date-time":"2023-12-11T06:02:06Z","timestamp":1702274526000},"page":"73391-73405","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["VT-BPAN: vision transformer-based bilinear pooling and attention network fusion of RGB and skeleton features for human action recognition"],"prefix":"10.1007","volume":"83","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0078-6459","authenticated-orcid":false,"given":"Yaohui","family":"Sun","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weiyao","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoyi","family":"Yu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ju","family":"Gao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,12,11]]},"reference":[{"key":"17788_CR1","doi-asserted-by":"crossref","unstructured":"Diskin Y, Nair B, Braun A, Duning S, Asari V K (2013) Vision-based navigation system for obstacle avoidance in complex environments. In 2013 IEEE applied imagery pattern recognition workshop (AIPR) (pp. 1-8). IEEE","DOI":"10.1109\/AIPR.2013.6749314"},{"key":"17788_CR2","unstructured":"Lin W, Sun MT, Poovandran R, Zhang Z (2008) Human activity recognition for video surveillance. Proc IEEE Int Symp Circuits Syst 2737\u20132740"},{"key":"17788_CR3","doi-asserted-by":"crossref","unstructured":"Othman NA, Aydin I (2021) Challenges and Limitations in Human Action Recognition on Unmanned Aerial Vehicles: A Comprehensive Survey. Trait Signal 38(5)","DOI":"10.18280\/ts.380515"},{"key":"17788_CR4","doi-asserted-by":"crossref","unstructured":"Adewopo V, Elsayed N, ElSayed Z, Ozer M, Abdelgawad A, Bayoumi M (2022) Review on action recognition for accident detection in smart city transportation systems. arXiv:2208.09588","DOI":"10.1186\/s43067-023-00124-y"},{"key":"17788_CR5","doi-asserted-by":"crossref","unstructured":"Zhao R, Ali H, Vander Smagt P (2017) Two-stream RNN\/CNN for action recognition in 3D videos Proc IEEE\/RSJ Int Conf Intell Robots Syst (IROS): 4260\u20134267","DOI":"10.1109\/IROS.2017.8206288"},{"key":"17788_CR6","doi-asserted-by":"crossref","unstructured":"Song S, Lan C, Xing J, Zeng W, Liu J (2018) Skeleton-indexed deep multi-modal feature learning for high performance human action recognition. Proc IEEE Int Conf Multimedia Expo (ICME): 1\u20136","DOI":"10.1109\/ICME.2018.8486486"},{"key":"17788_CR7","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez A N, Kaiser \u0141, Polosukhin I (2017) Attention is all you need. Proc Adv Neural Inf Process Syst: 5998\u20136008"},{"key":"17788_CR8","doi-asserted-by":"crossref","unstructured":"Chen J, Ho CM (2022) MM-ViT: Multi-modal video transformer for compressed video action recognition. Proc IEEE\/CVF Winter Conf Appl Comput Vis (WACV): 786\u2013797","DOI":"10.1109\/WACV51458.2022.00086"},{"key":"17788_CR9","doi-asserted-by":"crossref","unstructured":"Chen H, Wang Y, Guo T, Xu C, Deng Y, Liu Z, Ma S, Xu C, Gao W (2021). Pre-trained image processing transformer. Proc IEEE\/CVF Conf Comput Vis Pattern Recognit (CVPR): 12299\u201312310","DOI":"10.1109\/CVPR46437.2021.01212"},{"key":"17788_CR10","unstructured":"Parmar N et al (2018) Image transformer. [Online]. Available: arXiv:1802.05751"},{"key":"17788_CR11","doi-asserted-by":"crossref","unstructured":"Zhou L et al (2018) End-to-end dense video captioning with masked transformer. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR): 8739\u20138748","DOI":"10.1109\/CVPR.2018.00911"},{"key":"17788_CR12","doi-asserted-by":"crossref","unstructured":"Zeng Y et al (2020) Learning joint spatial-temporal transformations for video inpainting. Proc Eur Conf Comput Vis (ECCV): 528\u2013543","DOI":"10.1007\/978-3-030-58517-4_31"},{"key":"17788_CR13","unstructured":"Dosovitskiy A, Beyer L, Kolesnikov A, Weissenborn D, Zhai X, Unterthiner T, Houlsby N (2020) An image is worth 16x16 words: transformers for image recognition at scale. arXiv:2010.11929"},{"key":"17788_CR14","unstructured":"Beal J, Kim E, Tzeng E, Park D H, Zhai A, Kislyuk D (2020) Toward transformer-based object detection. arXiv:2012.09958"},{"key":"17788_CR15","doi-asserted-by":"crossref","unstructured":"Yu Q, Wang H, Kim D, Qiao S, Collins M, Zhu Y, Chen LC (2022). Cmt-deeplab: Clustering mask transformers for panoptic segmentation. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 2560\u20132570)","DOI":"10.1109\/CVPR52688.2022.00259"},{"key":"17788_CR16","doi-asserted-by":"crossref","unstructured":"Lin K, Wang L, Liu Z (2021) End-to-end human pose and mesh reconstruction with transformers. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 1954\u20131963)","DOI":"10.1109\/CVPR46437.2021.00199"},{"key":"17788_CR17","unstructured":"Chen J, Lu, Y, Yu Q, Luo X, Adeli E, Wang Y, Zhou Y (2021). Transunet: transformers make strong encoders for medical image segmentation. arXiv:2102.04306"},{"key":"17788_CR18","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. Proc Adv Neural Inf Process Syst: 568-576"},{"key":"17788_CR19","doi-asserted-by":"crossref","unstructured":"Donahue J, Hen LA, Saenko K (2015) Long-term recurrent convolutional networks for visual recognition and description. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR): 2625-2634","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"17788_CR20","doi-asserted-by":"crossref","unstructured":"Yan S, Xiong Y, Lin D (2018) Spatial temporal graph convolutional networks for skeleton-based action recognition. Proc 32nd AAAI Conf Artif Intell: 1-9","DOI":"10.1609\/aaai.v32i1.12328"},{"key":"17788_CR21","doi-asserted-by":"crossref","unstructured":"Shi L, Zhang Y, Cheng J, Lu H (2019) Two-stream adaptive graph convolutional networks for skeleton-based action recognition. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR): 12026-12035","DOI":"10.1109\/CVPR.2019.01230"},{"key":"17788_CR22","doi-asserted-by":"crossref","unstructured":"Chi H-g, Ha M H, Chi S, Lee SW, Huang Q, Ramani K (2022) Infogcn: Representation learning for human skeleton-based action recognition.\u201d Proc IEEE Conf Comput Vis Pattern Recognit (CVPR): 20154\u201320164","DOI":"10.1109\/CVPR52688.2022.01955"},{"key":"17788_CR23","doi-asserted-by":"crossref","unstructured":"Qiu H, Hou B, Ren B, Zhang X (2022) Spatio-temporal tuples transformer for skeleton-based action recognition. [Online]. Available: arXiv:2201.02849","DOI":"10.1016\/j.neucom.2022.10.084"},{"key":"17788_CR24","first-page":"103219","volume-title":"Skeleton-based action recognition via spatial and temporal transformer networks","author":"C Plizzari","year":"2021","unstructured":"Plizzari C, Cannici M, Matteucci M (2021) Skeleton-based action recognition via spatial and temporal transformer networks. Comput, Vis. Image Understand. Art. no, p 103219"},{"key":"17788_CR25","doi-asserted-by":"crossref","unstructured":"Fan H, Xiong B, Mangalam K, Li Y, Yan Z, Malik J, Feichtenhofer C (2021) Multiscale vision transformers. In Proceedings of the IEEE\/CVF international conference on computer vision (pp. 6824\u20136835)","DOI":"10.1109\/ICCV48922.2021.00675"},{"key":"17788_CR26","doi-asserted-by":"crossref","unstructured":"Zolfaghari M, G. Oliveira L, Sedaghat N, Brox T (2017) Chained multistream networks exploiting pose, motion, and appearance for action classification and detection. Proc IEEE Int Conf Comput Vis (ICCV):2904\u20132913","DOI":"10.1109\/ICCV.2017.316"},{"key":"17788_CR27","first-page":"107356","volume-title":"SGM-Net: Skeletonguided multimodal network for action recognition","author":"J Li","year":"2020","unstructured":"Li J, Xie X, Pan Q, Cao Y, Zhao Z, Shi G (2020) SGM-Net: Skeletonguided multimodal network for action recognition. Pattern Recognit, Art. no, p 107356"},{"key":"17788_CR28","doi-asserted-by":"crossref","unstructured":"Das S , Dai R, Koperski M, Minciullo L, Garattoni L, Bremond F, Francesca G (2019) Toyota smarthome: Real-world activities of daily living. Proc IEEE Int Conf Comput Vis (ICCV):833\u2013842","DOI":"10.1109\/ICCV.2019.00092"},{"issue":"17","key":"17788_CR29","doi-asserted-by":"publisher","first-page":"19157","DOI":"10.1109\/JSEN.2021.3089705","volume":"21","author":"W Xu","year":"2021","unstructured":"Xu W, Wu M, Zhao M, Xia T (2021) Fusion of skeleton and RGB features for RGB-D human action recognition. IEEE Sens J 21(17):19157\u201319164","journal-title":"IEEE Sens J"},{"key":"17788_CR30","doi-asserted-by":"crossref","unstructured":"Tran D , Wang H, Torresani L, Ray J, LeCun Y, Paluri M (2018) A closer look at spatiotemporal convolutions for action recognition. Proc IEEE\/CVF Conf Comput Vis Pattern Recognit: 6450\u20136459","DOI":"10.1109\/CVPR.2018.00675"},{"issue":"2","key":"17788_CR31","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1109\/MMUL.2012.24","volume":"19","author":"Z Zhang","year":"2012","unstructured":"Zhang Z (2012) Microsoft Kinect sensor and its effect. IEEE MultiMedia Mag 19(2):4\u201310","journal-title":"IEEE MultiMedia Mag"},{"key":"17788_CR32","doi-asserted-by":"crossref","unstructured":"Hu JF, Zheng WS, Pan J, Lai J, Zhang J (2018) Deep bilinear learning for RGB-D action recognition. Proc Eur Conf Comput Vis (ECCV):335\u2013351","DOI":"10.1007\/978-3-030-01234-2_21"},{"key":"17788_CR33","doi-asserted-by":"crossref","unstructured":"Gao Y, Beijbom O, Zhang N, Darrell T (2016) Compact bilinear pooling. Proc IEEE Conf Comput Vis Pattern Recognit (CVPR): 317\u2013326","DOI":"10.1109\/CVPR.2016.41"},{"key":"17788_CR34","unstructured":"Mehta S et al (2021) DeLighT: Deep and Light-weight Transformer. [Online]. Available: arXiv:2008.00623"},{"key":"17788_CR35","doi-asserted-by":"crossref","unstructured":"Wang Q , Wu B, Zhu P, Li P, Zuo W, Hu Q (2020) ECA-Net: Efficient channel attention for deep convolutional neural networks. Proc IEEE\/CVF Conf Comput Vis Pattern Recognit (CVPR):11531\u201311539","DOI":"10.1109\/CVPR42600.2020.01155"},{"key":"17788_CR36","doi-asserted-by":"crossref","unstructured":"Shahroudy A, Liu J, Ng T. T, Wang, G (2016) NTU RGB+D: A large scale dataset for 3D human activity analysis. Proc Comput Vis Pattern Recognit (CVPR):1010\u20131019","DOI":"10.1109\/CVPR.2016.115"},{"issue":"5","key":"17788_CR37","doi-asserted-by":"publisher","first-page":"914","DOI":"10.1109\/TPAMI.2013.198","volume":"36","author":"J Wang","year":"2014","unstructured":"Wang J, Liu Z, Wu Y, Yuan J (2014) Learning actionlet ensemble for 3D human action recognition. IEEE Trans Pattern Anal Mach Intell 36(5):914\u2013927","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"10","key":"17788_CR38","doi-asserted-by":"publisher","first-page":"2684","DOI":"10.1109\/TPAMI.2019.2916873","volume":"42","author":"J Liu","year":"2019","unstructured":"Liu J, Shahroudy A, Perez ML, Wang G, Duan L-Y, Chichung AK (2019) NTU RGB+D 120: A large-scale benchmark for 3D human activity understanding. IEEE Trans Pattern Anal Mach Intell 42(10):2684\u20132701","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"17788_CR39","doi-asserted-by":"crossref","unstructured":"Liu G, Qian J, Wen F, Zhu X , Ying R, Liu P,(2019) Action recognition based on 3D skeleton and RGB frame fusion. Proc IEEE\/RSJ Int Conf Intell Robots Syst (IROS): 258\u2013264","DOI":"10.1109\/IROS40897.2019.8967570"},{"key":"17788_CR40","doi-asserted-by":"crossref","unstructured":"De Boissiere A M, Noumeir R (2020) Infrared and 3D skeleton feature fusion for RGB-D action recognition. IEEE Access: 168297\u2013168308","DOI":"10.1109\/ACCESS.2020.3023599"},{"key":"17788_CR41","unstructured":"Su L, Hu C, Li G, Cao D (2020) MSAF: Multimodal split attention fusion. [Online]. Available: arXiv:2012.07175"},{"key":"17788_CR42","unstructured":"Joze HRV, Shaban A ,Iuzzolino ML, Koishida K (2020) MMTM: Multimodal transfer module for CNN fusion. Proc. IEEE\/CVF Conf Comput Vis Pattern Recognit (CVPR): 13289\u201313299"},{"key":"17788_CR43","doi-asserted-by":"crossref","unstructured":"Das S, Sharma S, Dai R, Bremond F, Thonnat M (2020) VPN: Learning video-pose embedding for activities of daily living. Proc Eur Conf Comput Vis: 72-90","DOI":"10.1007\/978-3-030-58545-7_5"},{"issue":"5","key":"17788_CR44","doi-asserted-by":"publisher","first-page":"1045","DOI":"10.1109\/TPAMI.2017.2691321","volume":"40","author":"A Shahroudy","year":"2018","unstructured":"Shahroudy A, Ng T, Gong Y, Wang G (2018) Deep multimodal feature analysis for action recognition in RGB+D videos. IEEE Trans Pattern Anal Mach Intell 40(5):1045\u20131058","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"5","key":"17788_CR45","doi-asserted-by":"publisher","first-page":"1862","DOI":"10.1109\/JSEN.2018.2884443","volume":"19","author":"T Liu","year":"2019","unstructured":"Liu T, Kong J, Jiang M (2019) RGB-D action recognition using multimodal correlative representation learning model. IEEE Sensors J 19(5):1862\u20131872","journal-title":"IEEE Sensors J"},{"key":"17788_CR46","doi-asserted-by":"crossref","unstructured":"Das S , Dai R, Koperski M, Minciullo L, Garattoni L, Bremond F, Francesca G (2019) Toyota smarthome: Real-world activities of daily living. Proc IEEE Int Conf Comput Vis (ICCV): 833\u2013842","DOI":"10.1109\/ICCV.2019.00092"},{"issue":"6","key":"17788_CR47","doi-asserted-by":"publisher","first-page":"671","DOI":"10.1007\/s00530-020-00677-2","volume":"26","author":"P Verma","year":"2020","unstructured":"Verma P, Sah A, Srivastava R (2020) Deep learning-based multimodal approach using RGB and skeleton sequences for human activity recognition. Multimed Syst 26(6):671\u2013685","journal-title":"Multimed Syst"},{"key":"17788_CR48","doi-asserted-by":"crossref","unstructured":"Islam MM, Iqbal T(2020) HAMLET: A hierarchical multimodal attention-based human activity recognition algorithm. Proc IEEE\/RSJ Int Conf Intell Robots Syst (IROS): 1-8. 406\u2013413","DOI":"10.1109\/IROS45743.2020.9340987"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17788-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-023-17788-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-023-17788-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,2]],"date-time":"2024-09-02T13:18:55Z","timestamp":1725283135000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-023-17788-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12,11]]},"references-count":48,"journal-issue":{"issue":"29","published-online":{"date-parts":[[2024,9]]}},"alternative-id":["17788"],"URL":"https:\/\/doi.org\/10.1007\/s11042-023-17788-3","relation":{},"ISSN":["1573-7721"],"issn-type":[{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,12,11]]},"assertion":[{"value":"7 March 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 September 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 November 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 December 2023","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}