{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,19]],"date-time":"2026-05-19T06:57:27Z","timestamp":1779173847634,"version":"3.51.4"},"reference-count":36,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2020,7,25]],"date-time":"2020-07-25T00:00:00Z","timestamp":1595635200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,7,25]],"date-time":"2020-07-25T00:00:00Z","timestamp":1595635200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2020,12]]},"DOI":"10.1007\/s00530-020-00677-2","type":"journal-article","created":{"date-parts":[[2020,7,25]],"date-time":"2020-07-25T12:02:33Z","timestamp":1595678553000},"page":"671-685","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":49,"title":["Deep learning-based multi-modal approach using RGB and skeleton sequences for human activity recognition"],"prefix":"10.1007","volume":"26","author":[{"given":"Pratishtha","family":"Verma","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Animesh","family":"Sah","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rajeev","family":"Srivastava","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,7,25]]},"reference":[{"issue":"6","key":"677_CR1","doi-asserted-by":"publisher","first-page":"1510","DOI":"10.1109\/TPAMI.2017.2712608","volume":"40","author":"G Varol","year":"2017","unstructured":"Varol, G., Laptev, I., Schmid, C.: Long-term temporal convolutions for action recognition. IEEE Trans. Pattern Anal. Mach. Intell. 40(6), 1510\u20131517 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"677_CR2","doi-asserted-by":"crossref","unstructured":"Song, S., Lan, C., Xing, J., Zeng, W., Liu, J.: An end-to-end spatio-temporal attention model for human action recognition from skeleton data. In: Thirty-First AAAI Conference on Artificial Intelligence, pp. 4263\u20134270 (2017)","DOI":"10.1609\/aaai.v31i1.11212"},{"key":"677_CR3","doi-asserted-by":"crossref","unstructured":"Yun, K., Honorio, J., Chattopadhyay, D., Berg, T.L., Samaras, D.: Two-person interaction detection using body-pose features and multiple instance learning. In: 2012 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, pp. 28\u201335. IEEE, New York (2012)","DOI":"10.1109\/CVPRW.2012.6239234"},{"key":"677_CR4","unstructured":"Sung, J., Ponce, C., Selman, B., Saxena, A.: Unstructured human activity detection from RGBD images. In: 2012 IEEE International Conference on Robotics and Automation, pp. 842\u2013849. IEEE, New York (2012)"},{"key":"677_CR5","doi-asserted-by":"crossref","unstructured":"Li, W., Zhang, Z., Liu, Z.: Action recognition based on a bag of 3D points. In: 2010 IEEE Computer Society Conference on Computer Vision and Pattern Recognition-Workshops, pp. 9\u201314. IEEE, New York (2010)","DOI":"10.1109\/CVPRW.2010.5543273"},{"key":"677_CR6","doi-asserted-by":"crossref","unstructured":"Chen, C., Jafari, R., Kehtarnavaz, N.: UTD-MHAD: a multimodal dataset for human action recognition utilizing a depth camera and a wearable inertial sensor. IEEE International Conference on Image Processing, pp. 168\u2013172 (2015)","DOI":"10.1109\/ICIP.2015.7350781"},{"key":"677_CR7","doi-asserted-by":"crossref","unstructured":"Ofli, F., Chaudhry, R., Kurillo, G., Vidal, R., Bajcsy, R.: Berkeley MHAD: a comprehensive multimodal human action database. In: 2013 IEEE Workshop on Applications of Computer Vision (WACV), pp. 53\u201360. IEEE, New York (2013)","DOI":"10.1109\/WACV.2013.6474999"},{"key":"677_CR8","doi-asserted-by":"crossref","unstructured":"Liu, J., Shahroudy, A., Perez, M.L., Wang, G., Duan, L.-Y., Chichung, A.K.: NTU RGB+D 120: a large-scale benchmark for 3D human activity understanding. IEEE Trans. Pattern Anal. Mach. Intell. (2019)","DOI":"10.1109\/TPAMI.2019.2916873"},{"key":"677_CR9","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1016\/j.patrec.2018.04.035","volume":"115","author":"P Khaire","year":"2018","unstructured":"Khaire, P., Kumar, P., Imran, J.: Combining CNN streams of RGB-D and skeletal data for human activity recognition. Pattern Recognit. Lett. 115, 107\u2013116 (2018)","journal-title":"Pattern Recognit. Lett."},{"issue":"4","key":"677_CR10","doi-asserted-by":"publisher","first-page":"3385","DOI":"10.3233\/JIFS-181136","volume":"36","author":"MF Bulbul","year":"2019","unstructured":"Bulbul, M.F., Islam, S., Ali, H.: Human action recognition using MHI and SHI based GLAC features and collaborative representation classifier. J. Intell. Fuzzy Syst. 36(4), 3385\u20133401 (2019)","journal-title":"J. Intell. Fuzzy Syst."},{"issue":"12","key":"677_CR11","doi-asserted-by":"publisher","first-page":"1769","DOI":"10.1007\/s00371-018-1572-0","volume":"35","author":"MR e Souza","year":"2019","unstructured":"e Souza, M.R., Pedrini, H.: Motion energy image for evaluation of video stabilization. Vis. Comput. 35(12), 1769\u20131781 (2019)","journal-title":"Vis. Comput."},{"key":"677_CR12","doi-asserted-by":"crossref","unstructured":"Jiang, F., Zhang, S., Wu, S., Gao, Y., Zhao, D.: Multi-layered gesture recognition with kinect. In: Gesture Recognition, pp. 387\u2013416. Springer, Cham (2017)","DOI":"10.1007\/978-3-319-57021-1_13"},{"key":"677_CR13","doi-asserted-by":"crossref","unstructured":"Yao, L., Kusakunniran, W., Wu, Q., Zhang, J., Tang, Z.: Robust CNN-based gait verification and identification using skeleton gait energy image. In: 2018 Digital Image Computing: Techniques and Applications (DICTA), pp. 1\u20137. IEEE, New York (2018)","DOI":"10.1109\/DICTA.2018.8615802"},{"key":"677_CR14","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Advances in Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"677_CR15","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances in Neural Information Processing Systems, pp. 568\u2013576 (2014)"},{"key":"677_CR16","doi-asserted-by":"crossref","unstructured":"Graves, A., Mohamed, A.-R., Hinton, G.: Speech recognition with deep recurrent neural networks. In: 2013 IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 6645\u20136649. IEEE, New York (2013)","DOI":"10.1109\/ICASSP.2013.6638947"},{"key":"677_CR17","doi-asserted-by":"publisher","first-page":"1155","DOI":"10.1109\/ACCESS.2017.2778011","volume":"6","author":"A Ullah","year":"2017","unstructured":"Ullah, A., Ahmad, J., Muhammad, K., Sajjad, M., Baik, S.W.: Action recognition in video sequences using deep bi-directional LSTM with CNN features. IEEE Access 6, 1155\u20131166 (2017)","journal-title":"IEEE Access"},{"key":"677_CR18","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1725\u20131732 (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"677_CR19","doi-asserted-by":"crossref","unstructured":"Chen, C., Jafari, R., Kehtarnavaz, N..: Fusion of depth, skeleton, and inertial data for human action recognition. In: IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 2712\u20132716 (2016)","DOI":"10.1109\/ICASSP.2016.7472170"},{"key":"677_CR20","doi-asserted-by":"crossref","unstructured":"Escobedo, E., Camara, G.: A new approach for dynamic gesture recognition using skeleton trajectory representation and histograms of cumulative magnitudes. In: 29th SIBGRAPI Conference on Graphics, Patterns and Images, pp. 209\u2013216 (2016)","DOI":"10.1109\/SIBGRAPI.2016.037"},{"issue":"5","key":"677_CR21","doi-asserted-by":"publisher","first-page":"586","DOI":"10.1109\/THMS.2014.2377111","volume":"45","author":"S Gaglio","year":"2014","unstructured":"Gaglio, S., Re, G.L., Morana, M.: Human activity recognition process using 3-D posture data. IEEE Trans. Hum. Mach. Syst. 45(5), 586\u2013597 (2014)","journal-title":"IEEE Trans. Hum. Mach. Syst."},{"key":"677_CR22","doi-asserted-by":"crossref","unstructured":"Cippitelli, E., Gambi, E., Spinsante, S., Fl\u00f3rez-Revuelta, F.: Evaluation of a skeleton-based method for human activity recognition on a large-scale RGB-D dataset. In: 2nd IET International Conference on Technologies for Active and Assisted Living, pp. 1\u20136 (2016)","DOI":"10.1049\/ic.2016.0063"},{"key":"677_CR23","unstructured":"Huang, G., Li, Y., Pleiss, G., Liu, Z., Hopcroft, J.E., Weinberger, K.Q.: Snapshot ensembles: train 1, get m for free. arXiv preprint arXiv:1704.00109 (2017)"},{"issue":"6","key":"677_CR24","doi-asserted-by":"publisher","first-page":"3","DOI":"10.5755\/j01.eee.122.6.1810","volume":"122","author":"EK Zavadskas","year":"2012","unstructured":"Zavadskas, E.K., Turskis, Z., Antucheviciene, J., Zakarevicius, A.: Optimization of weighted aggregated sum product assessment. Elektronika ir elektrotechnika 122(6), 3\u20136 (2012)","journal-title":"Elektronika ir elektrotechnika"},{"issue":"2","key":"677_CR25","first-page":"56","volume":"10","author":"M Velasquez","year":"2013","unstructured":"Velasquez, M., Hester, P.T.: An analysis of multi-criteria decision making methods. Int. J. Oper. Res. 10(2), 56\u201366 (2013)","journal-title":"Int. J. Oper. Res."},{"key":"677_CR26","doi-asserted-by":"publisher","first-page":"152","DOI":"10.1016\/j.jairtraman.2017.09.005","volume":"68","author":"VSV Dhanisetty","year":"2018","unstructured":"Dhanisetty, V.S.V., Verhagen, W.J.C., Curran, R.: Multi-criteria weighted decision making for operational maintenance processes. J. Air Transp. Manag. 68, 152\u2013164 (2018)","journal-title":"J. Air Transp. Manag."},{"key":"677_CR27","doi-asserted-by":"crossref","unstructured":"Caetano, C., Sena, J., Br\u00e9mond, F., Dos Santos, J.A., Schwartz, W.R.: SkeleMotion: a new representation of skeleton joint sequences based on motion information for 3D action recognition. In: 2019 16th IEEE International Conference on Advanced Video and Signal Based Surveillance (AVSS), pp. 1\u20138. IEEE, New York (2019)","DOI":"10.1109\/AVSS.2019.8909840"},{"key":"677_CR28","unstructured":"Annadani, Y., Rakshith, D.L., Soma Biswas, S.: Sliding dictionary based sparse representation for action recognition (2016). arXiv preprint. arXiv:1611.00218"},{"issue":"4","key":"677_CR29","doi-asserted-by":"publisher","first-page":"23","DOI":"10.4018\/IJMDEM.2015100102","volume":"6","author":"MF Bulbul","year":"2015","unstructured":"Bulbul, M.F., Jiang, Y., Ma, J.: DMMs-based multiple features fusion for human action recognition. Int. J. Multimed. Data Eng. Manag. 6(4), 23\u201339 (2015)","journal-title":"Int. J. Multimed. Data Eng. Manag."},{"key":"677_CR30","unstructured":"Elmadany, N.E.D., He, Y., Guan, L.: Human gesture recognition via bag of angles for 3D virtual city planning in CAVE environment. In: IEEE 18th International Workshop on Multimedia Signal Processing, pp. 1\u20135 (2016)"},{"issue":"8","key":"677_CR31","doi-asserted-by":"publisher","first-page":"453","DOI":"10.1016\/j.imavis.2014.04.005","volume":"32","author":"Y Zhu","year":"2014","unstructured":"Zhu, Y., Chen, W., Guo, G.: Evaluating spatiotemporal interest point features for depth-based action recognition. Image Vis. Comput. 32(8), 453\u2013464 (2014)","journal-title":"Image Vis. Comput."},{"key":"677_CR32","doi-asserted-by":"publisher","first-page":"3","DOI":"10.3389\/fnbot.2015.00003","volume":"9","author":"GI Parisi","year":"2015","unstructured":"Parisi, G.I., Weber, C., Wermter, S.: Self-organizing neural integration of pose-motion features for human action recognition. Front. Neurorobot. 9, 3 (2015)","journal-title":"Front. Neurorobot."},{"issue":"12","key":"677_CR33","doi-asserted-by":"publisher","first-page":"3007","DOI":"10.1109\/TPAMI.2017.2771306","volume":"40","author":"J Liu","year":"2017","unstructured":"Liu, J., Shahroudy, A., Xu, D., Kot, A.C., Wang, G.: Skeleton-based action recognition using spatio-temporal LSTM network with trust gates. IEEE Trans. Pattern Anal. Mach. Intell. 40(12), 3007\u20133021 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"677_CR34","unstructured":"Yang, H., Yan, D., Zhang, L., Li, D., Sun, Y.D., You, S.D., Maybank, S.J.: Feedback graph convolutional network for skeleton-based action recognition (2020). arXiv preprint. arXiv:2003.07564"},{"key":"677_CR35","doi-asserted-by":"crossref","unstructured":"Ke, Q., Bennamoun, M., An, S., Sohel, F., Boussaid, F.: A new representation of skeleton sequences for 3D action recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3288\u20133297 (2017)","DOI":"10.1109\/CVPR.2017.486"},{"issue":"6","key":"677_CR36","doi-asserted-by":"publisher","first-page":"2842","DOI":"10.1109\/TIP.2018.2812099","volume":"27","author":"Q Ke","year":"2018","unstructured":"Ke, Q., Bennamoun, M., An, S., Sohel, F., Boussaid, F.: Learning clip representations for skeleton-based 3D action recognition. IEEE Trans. Image Process. 27(6), 2842\u20132855 (2018)","journal-title":"IEEE Trans. Image Process."}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-020-00677-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-020-00677-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-020-00677-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,4]],"date-time":"2022-11-04T13:27:36Z","timestamp":1667568456000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-020-00677-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,7,25]]},"references-count":36,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2020,12]]}},"alternative-id":["677"],"URL":"https:\/\/doi.org\/10.1007\/s00530-020-00677-2","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,7,25]]},"assertion":[{"value":"23 January 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 July 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 July 2020","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}