{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,9]],"date-time":"2026-01-09T21:47:40Z","timestamp":1767995260456,"version":"3.49.0"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"24","license":[{"start":{"date-parts":[[2021,8,20]],"date-time":"2021-08-20T00:00:00Z","timestamp":1629417600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,8,20]],"date-time":"2021-08-20T00:00:00Z","timestamp":1629417600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2021,10]]},"DOI":"10.1007\/s11042-021-11415-9","type":"journal-article","created":{"date-parts":[[2021,8,20]],"date-time":"2021-08-20T05:02:22Z","timestamp":1629435742000},"page":"33505-33525","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":13,"title":["A deep multimodal network based on bottleneck layer features fusion for action recognition"],"prefix":"10.1007","volume":"80","author":[{"given":"Tej","family":"Singh","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1026-0047","authenticated-orcid":false,"given":"Dinesh Kumar","family":"Vishwakarma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2021,8,20]]},"reference":[{"key":"11415_CR1","doi-asserted-by":"crossref","unstructured":"Aggarwal J, Xia L (2013) Human activity recognition from 3D data: A review. Pattern Recognit Lett 48","DOI":"10.1016\/j.patrec.2014.04.011"},{"issue":"1","key":"11415_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TPAMI.2015.2439257","volume":"38","author":"BB Amor","year":"2016","unstructured":"Amor BB, Su J, Srivastava A (2016) Action Recognition Using Rate-Invariant Analysis of Skeletal Shape Trajectories. IEEE Trans Pattern Anal Mach Intell 38(1):1\u201313","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"11415_CR3","doi-asserted-by":"publisher","first-page":"5919","DOI":"10.1007\/s11042-018-6875-7","volume":"78","author":"D Avola","year":"2019","unstructured":"Avola D, Bernardi M, Foresti GL (2019) Fusing depth and colour information for human action recognition. Multimed Tools Appl 78:5919\u20135939","journal-title":"Multimedia Tools and Applications"},{"key":"11415_CR4","doi-asserted-by":"crossref","unstructured":"Blank M, Gorelick L, Shechtman E, Irani M, Basri R (2005) Actions as space-time shapes. In 10th IEEE Int Conf Comput Vis (ICCV'05) Beijing","DOI":"10.1109\/ICCV.2005.28"},{"issue":"3","key":"11415_CR5","doi-asserted-by":"publisher","first-page":"257","DOI":"10.1109\/34.910878","volume":"23","author":"AF Bobick","year":"2001","unstructured":"Bobick AF, Davis JW (2001) The recognition of human movement using temporal templates. IEEE Trans Pattern Anal Mach Intell 23(3):257\u2013267","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"3","key":"11415_CR6","first-page":"273","volume":"20","author":"C Cortes","year":"1995","unstructured":"Cortes C, Vapnik V (1995) Support-vector networks. Mach Learn 20(3):273\u2013297","journal-title":"Machine Learning"},{"key":"11415_CR7","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B, Schmid C (2006) Human detection using oriented histograms of flow and appearance. In Proc Eur Conf Comput Vis","DOI":"10.1007\/11744047_33"},{"issue":"7","key":"11415_CR8","doi-asserted-by":"publisher","first-page":"1340","DOI":"10.1109\/TCYB.2014.2350774","volume":"45","author":"M Devanne","year":"2015","unstructured":"Devanne M, Wannous H, Berretti S, Pala PD, Bimbo AD (2015) 3-D Human Action Recognition by Shape Analysis of Motion Trajectories on Riemannian Manifold. IEEE Trans Cybern 45(7):1340\u20131352","journal-title":"IEEE Transactions on Cybernetics"},{"key":"11415_CR9","doi-asserted-by":"crossref","unstructured":"Feng J, Zhang S, Xiao J (2017) Explorations of skeleton features for LSTM-based action recognition. Multimed Tools Appl 1\u201313","DOI":"10.1007\/s11042-017-5290-9"},{"key":"11415_CR10","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1016\/j.patrec.2020.01.010","volume":"131","author":"A Franco","year":"2020","unstructured":"Franco A, Magnani A, Maio D (2020) A multimodal approach for human activity recognition based on skeleton and RGB data. Pattern Recognit Lett 131:293\u2013299","journal-title":"Pattern Recognition Letters"},{"key":"11415_CR11","doi-asserted-by":"publisher","first-page":"729","DOI":"10.1016\/j.jvcir.2018.08.001","volume":"55","author":"S Ghodsi","year":"2018","unstructured":"Ghodsi S, Mohammadzade H, Korki E (2018) Simultaneous joint and object trajectory templates for human activity recognition from 3-D data. J Vis Commun Image Ranging 55:729\u2013741","journal-title":"J. Vis. Commun. Image Ranging"},{"issue":"9","key":"11415_CR12","doi-asserted-by":"publisher","first-page":"1984","DOI":"10.1109\/TIFS.2016.2569061","volume":"11","author":"M Haghighat","year":"2016","unstructured":"Haghighat M, Mottaleb MA, Alhalabi W (2016) Discriminant Correlation Analysis: Real-Time Feature Level Fusion for Multimodal Biometric Recognition. IEEE Trans Inf Foren Secur 11(9):1984\u20131996","journal-title":"IEEE Transactions on Information Forensics and Security"},{"key":"11415_CR13","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2015) Deep residual learning for image recognition. arXiv preprint arXiv:1512.03385","DOI":"10.1109\/CVPR.2016.90"},{"key":"11415_CR14","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1016\/j.ins.2018.02.042","volume":"444","author":"T-T Huynh","year":"2018","unstructured":"Huynh T-T, Hua C-H, Tu NA, Hur T, Bang J, Kim D, Amin MB, Kang BH, Seung H, Shin S-Y, Kim E-S, Lee S (2018) Hierarchical topic modeling with pose-transition feature for action recognition using 3D skeleton data. Inf Sci 444:20\u201335","journal-title":"Information Sciences"},{"key":"11415_CR15","doi-asserted-by":"publisher","first-page":"504","DOI":"10.1016\/j.patcog.2017.07.013","volume":"72","author":"EP Ijjina","year":"2017","unstructured":"Ijjina EP, Chalavadi KM (2017) Human action recognition in RGB-D videos using motion sequence information and deep learning. Pattern Recognit 72:504\u2013516","journal-title":"Pattern Recognition"},{"issue":"1","key":"11415_CR16","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2013","unstructured":"Ji S, Xu W, Yang M, Yu K (2013) 3D convolutional neural networks for human action recognition. IEEE Trans Pattern Anal Mach Intell 35(1):221\u2013231","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"11415_CR17","doi-asserted-by":"publisher","first-page":"56","DOI":"10.1016\/j.sigpro.2017.08.016","volume":"143","author":"X Ji","year":"2017","unstructured":"Ji X, Cheng J, Feng W, Tao D (2017) Skeleton embedded motion body partition for human action recognition using depth sequences. Signal Process 143:56\u201368","journal-title":"Signal Processing"},{"key":"11415_CR18","doi-asserted-by":"publisher","first-page":"364","DOI":"10.1016\/j.sigpro.2017.06.001","volume":"143","author":"Y Ji","year":"2018","unstructured":"Ji Y, Yang Y, Xu X, Shen HT (2018) One-shot learning based pattern transition map for action early recognition. Signal Process 143:364\u2013370","journal-title":"Signal Processing"},{"key":"11415_CR19","doi-asserted-by":"publisher","first-page":"1197","DOI":"10.1007\/s11760-018-1271-3","volume":"12","author":"AS Ke\u00e7eli","year":"2018","unstructured":"Ke\u00e7eli AS, Kaya A, Can AB (2018) Combining 2D and 3D deep models for action recognition with depth information. Signal Image Vid Process 12:1197\u20131205","journal-title":"Signal, Image and Video Processing"},{"key":"11415_CR20","first-page":"1","volume":"000","author":"P Khaire","year":"2018","unstructured":"Khaire P, Kumar P, Imran J (2018) Combining CNN streams of RGB-D and skeletal data for human activity recognition. Pattern Recognit Lett 000:1\u201310","journal-title":"Pattern Recognition Letters"},{"key":"11415_CR21","doi-asserted-by":"publisher","first-page":"537","DOI":"10.1016\/j.jvcir.2019.02.013","volume":"59","author":"J Kong","year":"2019","unstructured":"Kong J, Liu T, Jiang M (2019) Collaborative multimodal feature learning for RGB-D action recognition. J Vis Commun Image Ranging 59:537\u2013549","journal-title":"J. Vis. Commun. Image Ranging"},{"issue":"2\u20133","key":"11415_CR22","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1007\/s11263-005-1838-7","volume":"64","author":"I Laptev","year":"2005","unstructured":"Laptev I (2005) On Space-Time Interest Points. Int J Comput Vis 64(2\u20133):107\u2013123","journal-title":"International Journal of Computer Vision"},{"key":"11415_CR23","first-page":"265","volume":"68","author":"Q Li","year":"2018","unstructured":"Li Q, Lin W, Li J (2018) Human activity recognition using dynamic representation and matching of skeleton feature sequences from RGB-D images. Signal Process Image Commun 68:265\u2013272","journal-title":"Signal Processing: Image Communication"},{"key":"11415_CR24","doi-asserted-by":"crossref","unstructured":"Li R, Fu H, Lo W-L, Chi Z, Song Z, Wen D (2019) Skeleton-Based Action Recognition With Key-Segment Descriptor and Temporal Step Matrix Model. IEEE Access 7","DOI":"10.1109\/ACCESS.2019.2954744"},{"key":"11415_CR25","doi-asserted-by":"publisher","first-page":"219","DOI":"10.1007\/s12369-018-0498-z","volume":"11","author":"T Liu","year":"2019","unstructured":"Liu T, Wang J, Hutchinson S, Meng MQ-H (2019) Skeleton-Based Human Action Recognition by Pose Specificity and Weighted Voting. Int J Soc Robot 11:219\u2013234","journal-title":"International Journal of Social Robotics"},{"key":"11415_CR26","doi-asserted-by":"publisher","first-page":"321","DOI":"10.1007\/s00138-018-0989-9","volume":"30","author":"XS Nguyen","year":"2019","unstructured":"Nguyen XS, Mouaddib AI, Nguyen TP (2019) Hierarchical Gaussian descriptor based on local pooling for action recognition. Mach Vis Appl 30:321\u2013343","journal-title":"Machine Vision and Applications"},{"issue":"2","key":"11415_CR27","doi-asserted-by":"publisher","first-page":"243","DOI":"10.1109\/TCE.2019.2908986","volume":"65","author":"CN Phyo","year":"2019","unstructured":"Phyo CN, Zin TT, Tin P (2019) Deep Learning for Recognizing Human Activities Using Motions of Skeletal Joints. IEEE Trans Consum Electron 65(2):243\u2013252","journal-title":"IEEE Transaction on Consumer Electronics"},{"issue":"4","key":"11415_CR28","doi-asserted-by":"publisher","first-page":"861","DOI":"10.1016\/S0031-3203(01)00103-0","volume":"35","author":"S Prabhakar","year":"2002","unstructured":"Prabhakar S, Jain A (2002) Decision-level fusion in fingerprint verification. Pattern Recognit 35(4):861\u2013874","journal-title":"Pattern Recognition"},{"key":"11415_CR29","doi-asserted-by":"publisher","first-page":"163","DOI":"10.1016\/j.neucom.2016.03.024","volume":"19","author":"N Raman","year":"2016","unstructured":"Raman N, Maybank S (2016) Activity recognition using a supervised non-parametric hierarchical HMM. Neurocomputing 19:163\u2013177","journal-title":"Neurocomputing"},{"key":"11415_CR30","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1016\/j.patrec.2016.05.032","volume":"83","author":"AAA Salih","year":"2016","unstructured":"Salih AAA, Youssef C (2016) Spatiotemporal representation of 3D skeleton joints-based action recognition using modified spherical harmonics. Pattern Recognit Lett 83:32\u201341","journal-title":"Pattern Recognition Letters"},{"key":"11415_CR31","doi-asserted-by":"crossref","unstructured":"Seidenari L, Varano V, Berretti S, Bimbo A, Pala P (2013) Recognizing Actions from Depth Cameras as Weakly Aligned Multi-Part Bag-of-Poses. In 3rd International Workshop on Human Activity Understanding from 3D data, Portland, Oregon","DOI":"10.1109\/CVPRW.2013.77"},{"key":"11415_CR32","doi-asserted-by":"publisher","first-page":"31319","DOI":"10.1007\/s11042-019-7740-z","volume":"78","author":"E Shabaninia","year":"2019","unstructured":"Shabaninia E, Nilchi ARN, Kasaei S (2019) A weighting scheme for mining key skeletal joints for human action recognition. Multimed Tools Appl 78:31319\u201331345","journal-title":"Multimedia Tools and Applications"},{"key":"11415_CR33","doi-asserted-by":"publisher","first-page":"12349","DOI":"10.1007\/s11042-019-08587-w","volume":"79","author":"Q She","year":"2020","unstructured":"She Q, Mu G, Gan H, Fan Y (2020) Spatio-temporal SRU with global context-aware attention for 3D human action recognition. Multimed Tools Appl 79:12349\u201312371","journal-title":"Multimedia Tools and Applications"},{"key":"11415_CR34","unstructured":"Simonyan K, Zisserman A (2014a) Two-stream convolutional networks for action recognition in videos. In Proc Adv Neural Inf Process Syst"},{"key":"11415_CR35","unstructured":"Simonyan K, Zisserman A (2014b) Very deep convolutional networks for large-scale image recognition.\u00a0arXiv:arXiv:1409.1556"},{"key":"11415_CR36","doi-asserted-by":"crossref","unstructured":"Singh T, Vishwakarma DK (2020) A Deeply Coupled ConvNet for Human Activity Recognition using Dynamic and RGB Images. Neural Comput Appl","DOI":"10.1007\/s00521-020-05018-y"},{"issue":"2","key":"11415_CR37","doi-asserted-by":"publisher","first-page":"1107","DOI":"10.1007\/s10462-018-9651-1","volume":"52","author":"T Singh","year":"2018","unstructured":"Singh T, Vishwakarma DK (2018) Video benchmarks of human action datasets: a review. Artif Intell Rev 52(2):1107\u20131154","journal-title":"Artificial Intelligence Review"},{"issue":"12","key":"11415_CR38","doi-asserted-by":"publisher","first-page":"2437","DOI":"10.1016\/j.patcog.2004.12.013","volume":"38","author":"Q-S Sun","year":"2005","unstructured":"Sun Q-S, Zeng S-G, Liu Y, Heng P-A, Xia D-S (2005) A new method of feature fusion and its application in image recognition. Pattern Recognit 38(12):2437\u20132448","journal-title":"Pattern Recognition"},{"key":"11415_CR39","unstructured":"Sung J, Ponce C, Selman B, Saxena A (2012) Unstructured human activity detection from RGBD images. In IEEE Int Conf Robot Autom Saint Paul MN"},{"key":"11415_CR40","doi-asserted-by":"crossref","unstructured":"Szegedy C, Liu W, Jia Y, Sermanet P, Reed S, Anguelov D, Erhan D, Vanhoucke V, Rabinovich A (2015) Going deeper with convolutions. In IEEE Conf Comput Vis Pattern Recognit","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"11415_CR41","doi-asserted-by":"crossref","unstructured":"Szegedy C, Ioffe S, Vanhoucke V, Alemi A (2016) Inception-v4, Inception-ResNet and the Impact of Residual Connections on Learning.\u00a0arXiv:1602.07261v2 [cs.CV]","DOI":"10.1609\/aaai.v31i1.11231"},{"key":"11415_CR42","doi-asserted-by":"crossref","unstructured":"Vemulapalli R, Arrate F, Chellappa R (2014) Human Action Recognition by Representing 3D Skeletons as Points in a Lie Group. In IEEE Conf CVPR Columbus OH","DOI":"10.1109\/CVPR.2014.82"},{"key":"11415_CR43","doi-asserted-by":"publisher","first-page":"157","DOI":"10.1016\/j.aeue.2019.05.023","volume":"107","author":"DK Vishwakarma","year":"2019","unstructured":"Vishwakarma DK, Singh T (2019) A visual cognizance based multi-resolution descriptor for human action recognition using key pose. AEU Int J Electron Commun 107:157\u2013169","journal-title":"AEU - International Journal of Electronics and Communications"},{"key":"11415_CR44","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In Proc Int Conf Comput Vis (ICCV)","DOI":"10.1109\/ICCV.2013.441"},{"key":"11415_CR45","doi-asserted-by":"crossref","unstructured":"Wang H, Klaeser A, Schmid C, Liu CL (2013) Dense trajectories and motion boundary descriptors for action recognition. IJCV","DOI":"10.1007\/s11263-012-0594-8"},{"key":"11415_CR46","doi-asserted-by":"crossref","unstructured":"Xia L, Chen C, Aggarwal J (2012) View Invariant Human Action Recognition Using Histograms of 3D Joints. In Comput Vis Pattern Recognit Workshops (CVPRW)","DOI":"10.1109\/CVPRW.2012.6239233"},{"issue":"2","key":"11415_CR47","first-page":"439","volume":"47","author":"Y Yang","year":"2017","unstructured":"Yang Y, Deng C, Tao D, Zhang S, Liu W, Gao X (2017) Latent Max-Margin Multitask Learning With Skelets for 3-D Action Recognition. IEEE Trans Cybern 47(2):439\u2013448","journal-title":"IEEE Transactions on Cybernetics"},{"key":"11415_CR48","doi-asserted-by":"crossref","unstructured":"Yun K, Honorio J, Chattopadhyay D, Berg TL, Samaras D (2012) Two-person Interaction Detection Using Body-Pose Features and Multiple Instance Learning. In Comput Vis Pattern Recognit Workshops (CVPRW) Rhode Island","DOI":"10.1109\/CVPRW.2012.6239234"},{"key":"11415_CR49","doi-asserted-by":"crossref","unstructured":"Zhang S, Liu X, Xiao J (2017) On Geometric Features for Skeleton-Based Action Recognition Using Multilayer LSTM Networks. In IEEE Winter Conf Appl Comput Vis (WACV) Santa Rosa CA","DOI":"10.1109\/WACV.2017.24"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11415-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-021-11415-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-021-11415-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,7]],"date-time":"2023-01-07T17:49:08Z","timestamp":1673113748000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-021-11415-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,8,20]]},"references-count":49,"journal-issue":{"issue":"24","published-print":{"date-parts":[[2021,10]]}},"alternative-id":["11415"],"URL":"https:\/\/doi.org\/10.1007\/s11042-021-11415-9","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,8,20]]},"assertion":[{"value":"13 September 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 January 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 August 2021","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 August 2021","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}