{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T16:13:09Z","timestamp":1784218389445,"version":"3.55.0"},"reference-count":82,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2019,2,12]],"date-time":"2019-02-12T00:00:00Z","timestamp":1549929600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Ambient Intell Human Comput"],"published-print":{"date-parts":[[2020,1]]},"DOI":"10.1007\/s12652-019-01239-9","type":"journal-article","created":{"date-parts":[[2019,2,12]],"date-time":"2019-02-12T08:55:13Z","timestamp":1549961713000},"page":"189-208","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":73,"title":["Evaluating fusion of RGB-D and inertial sensors for multimodal human action recognition"],"prefix":"10.1007","volume":"11","author":[{"given":"Javed","family":"Imran","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Balasubramanian","family":"Raman","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2019,2,12]]},"reference":[{"key":"1239_CR1","doi-asserted-by":"crossref","unstructured":"Alahi A, Goel K, Ramanathan V, Robicquet A, Fei-Fei L, Savarese S (2016) Social lstm: human trajectory prediction in crowded spaces. In: IEEE conference on computer vision and pattern recognition, pp 961\u2013971","DOI":"10.1109\/CVPR.2016.110"},{"key":"1239_CR2","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1007\/978-3-642-14715-9_5","volume-title":"Human Behavior Understanding","author":"Kerem Altun","year":"2010","unstructured":"Altun K, Barshan B (2010) Human activity recognition using inertial\/magnetic sensor units. In: Springer international workshop on human behavior understanding, pp 38\u201351"},{"key":"1239_CR3","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s00371-018-1519-5","volume":"34","author":"L Bi","year":"2018","unstructured":"Bi L, Feng D, Kim J (2018) Dual-path adversarial learning for fully convolutional network (FCN)-based medical image segmentation. Vis Comput 34:1\u201310","journal-title":"Vis Comput"},{"key":"1239_CR4","doi-asserted-by":"crossref","unstructured":"Bilen H, Fernando B, Gavves E, Vedaldi A, Gould S (2016) Dynamic image networks for action recognition. In: IEEE conference on computer vision and pattern recognition, pp 3034\u20133042","DOI":"10.1109\/CVPR.2016.331"},{"key":"1239_CR5","doi-asserted-by":"crossref","unstructured":"Brox T, Bruhn A, Papenberg N, Weickert J (2004) High accuracy optical flow estimation based on a theory for warping. In: Springer European conference on computer vision, pp 25\u201336","DOI":"10.1007\/978-3-540-24673-2_3"},{"key":"1239_CR6","unstructured":"Caba\u00a0Heilbron F, Escorcia V, Ghanem B, Carlos\u00a0Niebles J (2015) Activitynet: a large-scale video benchmark for human activity understanding. In: IEEE conference on computer vision and pattern recognition, pp 961\u2013970"},{"key":"1239_CR7","unstructured":"Chambers J, Cleveland W, Tukey P, Kleiner B (1983) Graphical methods for data analysis. Wadsworth statistics\/probability series"},{"key":"1239_CR8","doi-asserted-by":"crossref","unstructured":"Chen C, Jafari R, Kehtarnavaz N (2015) Utd-mhad: a multimodal dataset for human action recognition utilizing a depth camera and a wearable inertial sensor. In: IEEE international conference on image processing, pp 168\u2013172","DOI":"10.1109\/ICIP.2015.7350781"},{"key":"1239_CR9","doi-asserted-by":"crossref","unstructured":"Chen C, Jafari R, Kehtarnavaz N (2016) Fusion of depth, skeleton, and inertial data for human action recognition. In: IEEE international conference on acoustics, speech and signal processing, pp 2712\u20132716","DOI":"10.1109\/ICASSP.2016.7472170"},{"issue":"6","key":"1239_CR10","doi-asserted-by":"publisher","first-page":"957","DOI":"10.1007\/s12652-016-0415-y","volume":"8","author":"B Chikhaoui","year":"2017","unstructured":"Chikhaoui B, Ye B, Mihailidis A (2017) Feature-level combination of skeleton joints and body parts for accurate aggressive and agitated behavior recognition. J Ambient Intell Hum Comput 8(6):957\u2013976","journal-title":"J Ambient Intell Hum Comput"},{"issue":"5","key":"1239_CR11","doi-asserted-by":"publisher","first-page":"1375","DOI":"10.1007\/s12652-017-0537-x","volume":"9","author":"B Chikhaoui","year":"2018","unstructured":"Chikhaoui B, Ye B, Mihailidis A (2018) Aggressive and agitated behavior recognition from accelerometer data using non-negative matrix factorization. J Ambient Intell Hum Comput 9(5):1375\u20131389","journal-title":"J Ambient Intell Hum Comput"},{"key":"1239_CR12","doi-asserted-by":"crossref","unstructured":"Cho K, Van\u00a0Merri\u00ebnboer B, Gulcehre C, Bahdanau D, Bougares F, Schwenk H, Bengio Y (2014) Learning phrase representations using rnn encoder-decoder for statistical machine translation. In: Conference on empirical methods in natural language processing, pp 1724\u20131734","DOI":"10.3115\/v1\/D14-1179"},{"key":"1239_CR13","unstructured":"Chollet F (2015) Keras (online). https:\/\/github.com\/keras-team\/keras . Accessed 10 Oct 2018"},{"key":"1239_CR14","doi-asserted-by":"crossref","unstructured":"Chollet F (2017) Xception: deep learning with depthwise separable convolutions. In: 2017 IEEE conference on computer vision and pattern recognition, pp 1800\u20131807","DOI":"10.1109\/CVPR.2017.195"},{"key":"1239_CR15","unstructured":"Delachaux B, Rebetez J, Perez-Uribe A, Mejia HFS (2013) Indoor activity recognition by combining one-vs.-all neural network classifiers exploiting wearable and depth sensors. In: Springer international work-conference on artificial neural networks, pp 216\u2013223"},{"key":"1239_CR16","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li LJ, Li K, Fei-Fei L (2009) Imagenet: a large-scale hierarchical image database. In: IEEE conference on computer vision and pattern recognition, pp 248\u2013255","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"1239_CR17","doi-asserted-by":"crossref","unstructured":"Deng Z, Vahdat A, Hu H, Mori G (2016) Structure inference machines: recurrent neural networks for analyzing relations in group activity recognition. In: IEEE conference on computer vision and pattern recognition, pp 4772\u20134781","DOI":"10.1109\/CVPR.2016.516"},{"key":"1239_CR18","doi-asserted-by":"crossref","unstructured":"Donahue J, Anne\u00a0Hendricks L, Guadarrama S, Rohrbach M, Venugopalan S, Saenko K, Darrell T (2015) Long-term recurrent convolutional networks for visual recognition and description. In: IEEE conference on computer vision and pattern recognition, pp 2625\u20132634","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"1239_CR19","unstructured":"Du Y, Wang W, Wang L (2015) Hierarchical recurrent neural network for skeleton based action recognition. In: IEEE conference on computer vision and pattern recognition, pp 1110\u20131118"},{"key":"1239_CR20","doi-asserted-by":"crossref","unstructured":"El\u00a0Madany NED, He Y, Guan L (2016) Human action recognition via multiview discriminative analysis of canonical correlations. In: IEEE international conference on image processing, pp 4170\u20134174","DOI":"10.1109\/ICIP.2016.7533145"},{"issue":"1","key":"1239_CR21","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1109\/TITB.2007.899496","volume":"12","author":"M Ermes","year":"2008","unstructured":"Ermes M, P\u00e4rkk\u00e4 J, M\u00e4ntyj\u00e4rvi J, Korhonen I (2008) Detection of daily activities and sports with wearable sensors in controlled and uncontrolled conditions. IEEE Trans Inf Technol Biomed 12(1):20\u201326","journal-title":"IEEE Trans Inf Technol Biomed"},{"key":"1239_CR22","doi-asserted-by":"publisher","first-page":"363","DOI":"10.1007\/3-540-45103-X_50","volume-title":"Image Analysis","author":"Gunnar Farneb\u00e4ck","year":"2003","unstructured":"Farneb\u00e4ck G (2003) Two-frame motion estimation based on polynomial expansion. In: Springer scandinavian conference on image analysis, pp 363\u2013370"},{"key":"1239_CR23","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Zisserman (2016) Convolutional two-stream network fusion for video action recognition. In: IEEE conference on computer vision and pattern recognition, pp 1933\u20131941","DOI":"10.1109\/CVPR.2016.213"},{"key":"1239_CR24","doi-asserted-by":"crossref","unstructured":"Gasparrini S, Cippitelli E, Gambi E, Spinsante S, W\u00e5hsl\u00e9n J, Orhan I, Lindh T (2016) Proposal and experimental evaluation of fall detection solution based on wearable and depth data fusion. In: ICT innovations 2015, Springer, pp 99\u2013108","DOI":"10.1007\/978-3-319-25733-4_11"},{"key":"1239_CR25","doi-asserted-by":"crossref","unstructured":"Girshick R, Donahue J, Darrell T, Malik J (2014) Rich feature hierarchies for accurate object detection and semantic segmentation. In: IEEE conference on computer vision and pattern recognition, pp 580\u2013587","DOI":"10.1109\/CVPR.2014.81"},{"key":"1239_CR26","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-018-1585-8","author":"I Gogi\u0107","year":"2018","unstructured":"Gogi\u0107 I, Manhart M, Pand\u017ei\u0107 IS, Ahlberg J (2018) Fast facial expression recognition using local binary features and shallow neural networks. Vis Comput. https:\/\/doi.org\/10.1007\/s00371-018-1585-8","journal-title":"Vis Comput"},{"issue":"9","key":"1239_CR27","doi-asserted-by":"publisher","first-page":"1984","DOI":"10.1109\/TIFS.2016.2569061","volume":"11","author":"M Haghighat","year":"2016","unstructured":"Haghighat M, Abdel-Mottaleb M, Alhalabi W (2016) Discriminant correlation analysis: real-time feature level fusion for multimodal biometric recognition. IEEE Trans Inf Forensics Secur 11(9):1984\u20131996","journal-title":"IEEE Trans Inf Forensics Secur"},{"key":"1239_CR28","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"1239_CR29","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"issue":"3","key":"1239_CR30","doi-asserted-by":"publisher","first-page":"807","DOI":"10.1109\/TCSVT.2016.2628339","volume":"28","author":"Y Hou","year":"2018","unstructured":"Hou Y, Li Z, Wang P, Li W (2018) Skeleton optical spectra-based action recognition using convolutional neural networks. IEEE Trans Circuits Syst Video Technol 28(3):807\u2013811","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"1239_CR31","unstructured":"Howard AG, Zhu M, Chen B, Kalenichenko D, Wang W, Weyand T, Andreetto M, Adam H (2017) Mobilenets: efficient convolutional neural networks for mobile vision applications. arXiv:170404861"},{"key":"1239_CR32","first-page":"2466","volume":"13","author":"ME Hussein","year":"2013","unstructured":"Hussein ME, Torki M, Gowayyed MA, El-Saban M (2013) Human action recognition using a temporal hierarchy of covariance descriptors on 3d joint locations. Int Jt Conf Artif Intell 13:2466\u20132472","journal-title":"Int Jt Conf Artif Intell"},{"key":"1239_CR33","doi-asserted-by":"crossref","unstructured":"Imran J, Kumar P (2016) Human action recognition using rgb-d sensor and deep convolutional neural networks. In: IEEE international conference on advances in computing, communications and informatics, pp 144\u2013148","DOI":"10.1109\/ICACCI.2016.7732038"},{"key":"1239_CR34","unstructured":"Ioffe S, Szegedy C (2015) Batch normalization: accelerating deep network training by reducing internal covariate shift. In: International conference on machine learning, pp 448\u2013456"},{"key":"1239_CR35","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-018-1565-z","author":"T Jiang","year":"2018","unstructured":"Jiang T, Zhang Z, Yang Y (2018) Modeling coverage with semantic embedding for image caption generation. Vis Comput. https:\/\/doi.org\/10.1007\/s00371-018-1565-z","journal-title":"Vis Comput"},{"key":"1239_CR36","doi-asserted-by":"crossref","unstructured":"Karpathy A, Toderici G, Shetty S, Leung T, Sukthankar R, Fei-Fei L (2014) Large-scale video classification with convolutional neural networks. In: IEEE conference on computer vision and pattern recognition, pp 1725\u20131732","DOI":"10.1109\/CVPR.2014.223"},{"key":"1239_CR37","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1016\/j.patrec.2018.04.035","volume":"115","author":"Pushpajit Khaire","year":"2018","unstructured":"Khaire P, Kumar P, Imran J (2018) Combining CNN streams of RGB-D and skeletal data for human activity recognition. Pattern Recognit Lett 107\u2013116","journal-title":"Pattern Recognition Letters"},{"issue":"3","key":"1239_CR38","doi-asserted-by":"publisher","first-page":"226","DOI":"10.1109\/34.667881","volume":"20","author":"J Kittler","year":"1998","unstructured":"Kittler J, Hatef M, Duin RP, Matas J (1998) On combining classifiers. IEEE Trans Pattern Anal Mach Intell 20(3):226\u2013239","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"1239_CR39","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Neural information processing systems, pp 1097\u20131105"},{"key":"1239_CR40","doi-asserted-by":"crossref","unstructured":"Lefebvre G, Berlemont S, Mamalet F, Garcia C (2013) BLSTM-RNN based 3d gesture classification. In: Springer international conference on artificial neural networks, pp 381\u2013388","DOI":"10.1007\/978-3-642-40728-4_48"},{"key":"1239_CR42","doi-asserted-by":"crossref","unstructured":"Li Q, Stankovic JA, Hanson MA, Barth AT, Lach J, Zhou G (2009) Accurate, fast fall detection using gyroscopes and accelerometer-derived posture information. In: IEEE sixth international workshop on wearable and implantable body sensor networks, pp 138\u2013143","DOI":"10.1109\/BSN.2009.46"},{"key":"1239_CR43","doi-asserted-by":"crossref","unstructured":"Li Q, Qiu Z, Yao T, Mei T, Rui Y, Luo J (2016) Action recognition by learning deep multi-granular spatio-temporal video representation. In: ACM international conference on multimedia retrieval, pp 159\u2013166","DOI":"10.1145\/2911996.2912001"},{"key":"1239_CR41","doi-asserted-by":"publisher","first-page":"276","DOI":"10.1016\/j.patcog.2017.12.023","volume":"77","author":"C Li","year":"2018","unstructured":"Li C, Xie C, Zhang B, Chen C, Han J (2018a) Deep fisher discriminant learning for mobile hand gesture recognition. Pattern Recognit 77:276\u2013276","journal-title":"Pattern Recognit"},{"key":"1239_CR44","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-018-1582-y","author":"X Li","year":"2018","unstructured":"Li X, Huang H, Zhao H, Wang Y, Hu M (2018b) Learning a convolutional neural network for propagation-based stereo image segmentation. Vis Comput. https:\/\/doi.org\/10.1007\/s00371-018-1582-y","journal-title":"Vis Comput"},{"key":"1239_CR45","doi-asserted-by":"crossref","unstructured":"Liu J, Shahroudy A, Xu D, Wang G (2016) Spatio-temporal lstm with trust gates for 3d human action recognition. In: Springer European conference on computer vision, pp 816\u2013833","DOI":"10.1007\/978-3-319-46487-9_50"},{"issue":"6","key":"1239_CR46","doi-asserted-by":"publisher","first-page":"1898","DOI":"10.1109\/JSEN.2014.2306094","volume":"14","author":"K Liu","year":"2014","unstructured":"Liu K, Chen C, Jafari R, Kehtarnavaz N (2014) Fusion of inertial and depth sensor data for robust hand gesture recognition. IEEE Sens J 14(6):1898\u20131903","journal-title":"IEEE Sens J"},{"key":"1239_CR47","doi-asserted-by":"crossref","unstructured":"Long J, Shelhamer E, Darrell T (2015) Fully convolutional networks for semantic segmentation. In: IEEE conference on computer vision and pattern recognition, pp 3431\u20133440","DOI":"10.1109\/CVPR.2015.7298965"},{"issue":"6\u20138","key":"1239_CR48","doi-asserted-by":"publisher","first-page":"1053","DOI":"10.1007\/s00371-018-1556-0","volume":"34","author":"C Ma","year":"2018","unstructured":"Ma C, Wang A, Chen G, Xu C (2018) Hand joints-based gesture recognition for noisy dataset using nested interval unscented kalman filter with LSTM network. Vis Comput 34(6\u20138):1053\u20131063","journal-title":"Vis Comput"},{"issue":"1","key":"1239_CR49","doi-asserted-by":"publisher","first-page":"115","DOI":"10.3390\/s16010115","volume":"16","author":"FJ Ord\u00f3\u00f1ez","year":"2016","unstructured":"Ord\u00f3\u00f1ez FJ, Roggen D (2016) Deep convolutional and lstm recurrent neural networks for multimodal wearable activity recognition. Sensors 16(1):115","journal-title":"Sensors"},{"issue":"1","key":"1239_CR50","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s12652-015-0294-7","volume":"7","author":"N Roy","year":"2016","unstructured":"Roy N, Misra A, Cook D (2016) Ambient and smartphone sensor assisted adl recognition in multi-inhabitant smart environments. J Ambient Intell Humanz Comput 7(1):1\u201319","journal-title":"J Ambient Intell Humanz Comput"},{"key":"1239_CR51","first-page":"1","volume":"10","author":"P Sarcevic","year":"2017","unstructured":"Sarcevic P, Kincses Z, Pletl S (2017) Online human movement classification using wrist-worn wireless sensors. J Ambient Intell Humaniz Comput 10:1\u201318","journal-title":"J Ambient Intell Humanz Comput"},{"issue":"1","key":"1239_CR52","doi-asserted-by":"publisher","first-page":"110","DOI":"10.3390\/app7010110","volume":"7","author":"AB Sargano","year":"2017","unstructured":"Sargano AB, Angelov P, Habib Z (2017) A comprehensive review on handcrafted and learning-based action representation approaches for human activity recognition. Appl Sci 7(1):110","journal-title":"Appl Sci"},{"key":"1239_CR53","doi-asserted-by":"publisher","DOI":"10.1007\/s12652-018-1136-1","author":"S Satyamurthi","year":"2018","unstructured":"Satyamurthi S, Tian J, Chua MCH (2018) Action recognition using multi-directional projected depth motion maps. J Ambient Intell Humaniz Comput. https:\/\/doi.org\/10.1007\/s12652-018-1136-1","journal-title":"J Ambient Intell Humaniz Comput"},{"key":"1239_CR54","doi-asserted-by":"crossref","unstructured":"Shahroudy A, Liu J, Ng TT, Wang G (2016) NTU RGB+ D: a large scale dataset for 3d human activity analysis. In: IEEE conference on computer vision and pattern recognition, pp 1010\u20131019","DOI":"10.1109\/CVPR.2016.115"},{"key":"1239_CR55","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. In: Advances in neural information processing systems, pp 568\u2013576"},{"key":"1239_CR56","unstructured":"Soomro K, Zamir AR, Shah M (2012) Ucf101: a dataset of 101 human actions classes from videos in the wild. arXiv:12120402"},{"issue":"12","key":"1239_CR57","doi-asserted-by":"publisher","first-page":"2437","DOI":"10.1016\/j.patcog.2004.12.013","volume":"38","author":"QS Sun","year":"2005","unstructured":"Sun QS, Zeng SG, Liu Y, Heng PA, Xia DS (2005) A new method of feature fusion and its application in image recognition. Pattern Recognit 38(12):2437\u20132448","journal-title":"Pattern Recognit"},{"key":"1239_CR58","unstructured":"Sutskever I, Vinyals O, Le QV (2014) Sequence to sequence learning with neural networks. In: Advances in neural information processing systems, pp 3104\u20133112"},{"key":"1239_CR59","doi-asserted-by":"crossref","unstructured":"Szegedy C, Vanhoucke V, Ioffe S, Shlens J, Wojna Z (2016) Rethinking the inception architecture for computer vision. In: IEEE conference on computer vision and pattern recognition, pp 2818\u20132826","DOI":"10.1109\/CVPR.2016.308"},{"key":"1239_CR60","first-page":"12","volume":"4","author":"C Szegedy","year":"2017","unstructured":"Szegedy C, Ioffe S, Vanhoucke V, Alemi AA (2017) Inception-v4, inception-resnet and the impact of residual connections on learning. AAAI Conf Artif Intell 4:12","journal-title":"AAAI Conf Artif Intell"},{"key":"1239_CR61","doi-asserted-by":"crossref","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3d convolutional networks. In: IEEE international conference on computer vision, pp 4489\u20134497","DOI":"10.1109\/ICCV.2015.510"},{"issue":"6","key":"1239_CR62","doi-asserted-by":"publisher","first-page":"1510","DOI":"10.1109\/TPAMI.2017.2712608","volume":"40","author":"G Varol","year":"2018","unstructured":"Varol G, Laptev I, Schmid C (2018) Long-term temporal convolutions for action recognition. IEEE Trans Pattern Anal Mach Intell 40(6):1510\u20131517","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"1239_CR63","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show and tell: a neural image caption generator. In: IEEE conference on computer vision and pattern recognition, pp 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"1239_CR64","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In: IEEE international conference on computer vision, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"1239_CR65","doi-asserted-by":"crossref","unstructured":"Wang H, Wang L (2017) Modeling temporal dynamics and spatial configurations of actions using two-stream recurrent neural networks. In: IEEE conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2017.387"},{"key":"1239_CR66","doi-asserted-by":"crossref","unstructured":"Wang H, Kl\u00e4ser A, Schmid C, Liu CL (2011) Action recognition by dense trajectories. In: IEEE conference on computer vision and pattern recognition, pp 3169\u20133176","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"1239_CR67","unstructured":"Wang L (2017) OpenCV implementation of different optical flow algorithms (online). https:\/\/github.com\/wanglimin\/dense_flow . Accessed 10 Oct 2018"},{"key":"1239_CR68","doi-asserted-by":"crossref","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y, Lin D, Tang X, Van\u00a0Gool L (2016a) Temporal segment networks: towards good practices for deep action recognition. In: Springer European conference on computer vision, pp 20\u201336","DOI":"10.1007\/978-3-319-46484-8_2"},{"issue":"4","key":"1239_CR69","doi-asserted-by":"publisher","first-page":"498","DOI":"10.1109\/THMS.2015.2504550","volume":"46","author":"P Wang","year":"2016","unstructured":"Wang P, Li W, Gao Z, Zhang J, Tang C, Ogunbona PO (2016b) Action recognition from depth maps using deep convolutional neural networks. IEEE Trans Hum Mach Syst 46(4):498\u2013509","journal-title":"IEEE Trans Hum Mach Syst"},{"key":"1239_CR70","doi-asserted-by":"crossref","unstructured":"Wang P, Li Z, Hou Y, Li W (2016c) Action recognition based on joint trajectory maps using convolutional neural networks. In: ACM multimedia conference, pp 102\u2013106","DOI":"10.1145\/2964284.2967191"},{"key":"1239_CR71","doi-asserted-by":"crossref","unstructured":"Wang P, Wang S, Gao Z, Hou Y, Li W (2017) Structured images for RGB-D action recognition. In: IEEE international conference on computer vision, pp 1005\u20131014","DOI":"10.1109\/ICCVW.2017.123"},{"key":"1239_CR72","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: neural image caption generation with visual attention. In: International conference on machine learning, pp 2048\u20132057"},{"key":"1239_CR73","doi-asserted-by":"crossref","unstructured":"Yan C, Li L, Zhang C, Liu B, Zhang Y, Zhang Y, Dai Q (2018a) A fast UYGHUR text detector for complex background images. IEEE Trans Multimed","DOI":"10.1109\/TMM.2018.2838320"},{"key":"1239_CR74","doi-asserted-by":"crossref","unstructured":"Yan C, Xie H, Chen J, Zhang Y, Dai Q (2018b) Cross-modality bridging and knowledge transferring for image understanding. IEEE Trans Multimed","DOI":"10.1109\/TMM.2019.2903448"},{"key":"1239_CR75","first-page":"1","volume":"34","author":"Z Yu","year":"2017","unstructured":"Yu Z, Liu Q, Liu G (2017) Deeper cascaded peak-piloted network for weak expression recognition. Vis Comput 34:1\u20139","journal-title":"Vis Comput"},{"key":"1239_CR76","doi-asserted-by":"crossref","unstructured":"Zach C, Pock T, Bischof H (2007) A duality based approach for realtime TV-L1 optical flow. In: Springer joint pattern recognition symposium, pp 214\u2013223","DOI":"10.1007\/978-3-540-74936-3_22"},{"key":"1239_CR77","doi-asserted-by":"crossref","unstructured":"Zhang B, Wang L, Wang Z, Qiao Y, Wang H (2016) Real-time action recognition with enhanced motion vector CNNS. In: IEEE conference on computer vision and pattern recognition, pp 2718\u20132726","DOI":"10.1109\/CVPR.2016.297"},{"key":"1239_CR78","doi-asserted-by":"crossref","unstructured":"Zhang S, Liu X, Xiao J (2017) On geometric features for skeleton-based action recognition using multilayer LSTM networks. In: IEEE winter conference on applications of computer vision, pp 148\u2013157","DOI":"10.1109\/WACV.2017.24"},{"key":"1239_CR79","doi-asserted-by":"publisher","DOI":"10.1007\/s12652-018-0989-7","author":"Z Zhang","year":"2018","unstructured":"Zhang Z, Tian Z, Zhou M (2018) Handsense: smart multimodal hand gesture recognition based on deep neural networks. J Ambient Intell Humaniz Comput. https:\/\/doi.org\/10.1007\/s12652-018-0989-7","journal-title":"J Ambient Intell Humaniz Comput"},{"key":"1239_CR80","doi-asserted-by":"crossref","unstructured":"Zhao R, Ali H, van\u00a0der Smagt P (2017) Two-stream RNN\/CNN for action recognition in 3d videos. In: IEEE international conference on intelligent robots and systems, pp 4260\u20134267","DOI":"10.1109\/IROS.2017.8206288"},{"key":"1239_CR81","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-018-1559-x","author":"F Zhou","year":"2018","unstructured":"Zhou F, Hu Y, Shen X (2018) Msanet: multimodal self-augmentation and adversarial network for RGB-D object recognition. Vis Comput. https:\/\/doi.org\/10.1007\/s00371-018-1559-x","journal-title":"Vis Comput"},{"key":"1239_CR82","first-page":"8","volume":"2","author":"W Zhu","year":"2016","unstructured":"Zhu W, Lan C, Xing J, Zeng W, Li Y, Shen L, Xie X (2016) Co-occurrence feature learning for skeleton based action recognition using regularized deep LSTM networks. AAAI Conf Artif Intell 2:8","journal-title":"AAAI Conf Artif Intell"}],"container-title":["Journal of Ambient Intelligence and Humanized Computing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s12652-019-01239-9\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s12652-019-01239-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s12652-019-01239-9.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,9,11]],"date-time":"2022-09-11T19:28:14Z","timestamp":1662924494000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s12652-019-01239-9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,2,12]]},"references-count":82,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2020,1]]}},"alternative-id":["1239"],"URL":"https:\/\/doi.org\/10.1007\/s12652-019-01239-9","relation":{},"ISSN":["1868-5137","1868-5145"],"issn-type":[{"value":"1868-5137","type":"print"},{"value":"1868-5145","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,2,12]]},"assertion":[{"value":"22 November 2018","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 February 2019","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 February 2019","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Compliance with ethical standards"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}