{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T04:09:26Z","timestamp":1783570166568,"version":"3.55.0"},"reference-count":68,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2021,2,15]],"date-time":"2021-02-15T00:00:00Z","timestamp":1613347200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2021,2,15]],"date-time":"2021-02-15T00:00:00Z","timestamp":1613347200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2022,3]]},"DOI":"10.1007\/s00371-021-02064-y","type":"journal-article","created":{"date-parts":[[2021,2,18]],"date-time":"2021-02-18T19:09:25Z","timestamp":1613675365000},"page":"993-1013","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":30,"title":["DTR-HAR: deep temporal residual representation for human activity recognition"],"prefix":"10.1007","volume":"38","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2632-8544","authenticated-orcid":false,"given":"Hend","family":"Basly","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wael","family":"Ouarda","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fatma Ezahra","family":"Sayadi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bouraoui","family":"Ouni","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Adel M.","family":"Alimi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,2,15]]},"reference":[{"key":"2064_CR1","doi-asserted-by":"crossref","unstructured":"Zhou, T., Wang, W., Qi, S., Ling, H., Shen, J.: Cascaded human\u2013object interaction recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 4263\u20134272. IEEE (2020)","DOI":"10.1109\/CVPR42600.2020.00432"},{"key":"2064_CR2","doi-asserted-by":"crossref","unstructured":"Wang, W., Zhu, H., Dai, J., Pang, Y., Shen, J., Shao, L.: Hierarchical human parsing with typed part-relation reasoning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8929\u20138939. IEEE (2020)","DOI":"10.1109\/CVPR42600.2020.00895"},{"key":"2064_CR3","doi-asserted-by":"crossref","unstructured":"Li, T., Liang, Z., Zhao, S., Gong, J., Shen, J.: Self-learning with rectification strategy for human parsing. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 9263\u20139272. IEEE (2020)","DOI":"10.1109\/CVPR42600.2020.00928"},{"key":"2064_CR4","doi-asserted-by":"crossref","unstructured":"Qi, S., Wang, W., Jia, B., Shen, J.,Zhu, S.C.: Learning human\u2013object interactions by graph parsing neural networks. In: Proceedings of the European Conference on Computer Vision (ECCV), pp. 401\u2013417. Springer (2018)","DOI":"10.1007\/978-3-030-01240-3_25"},{"key":"2064_CR5","doi-asserted-by":"crossref","unstructured":"Yilmaz, A., Shah, M.: Actions sketch: a novel action representation. In: IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR\u201905), pp. 984\u2013989. IEEE (2005)","DOI":"10.1109\/CVPR.2005.58"},{"key":"2064_CR6","doi-asserted-by":"crossref","unstructured":"Blank, M., Gorelick, L., Shechtman, E., Irani, M., Basri, R.: Actions as space-time shapes. In: Tenth IEEE International Conference on Computer Vision (ICCV\u201905), pp. 1395\u20131402. IEEE (2005)","DOI":"10.1109\/ICCV.2005.28"},{"key":"2064_CR7","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778. IEEE, Las Vegas, NV (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"2064_CR8","unstructured":"Krizhevsky, A., Sutskever, I., Hinton, G.E.: Imagenet classification with deep convolutional neural networks. In: Advances in Neural Information Processing Systems, pp. 1097\u20131105 (2012)"},{"key":"2064_CR9","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., $$\\ldots $$ , Rabinovich, A.: Going deeper with convolutions. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1\u20139 (2015)","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"2064_CR10","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition (2014). arXiv preprint arXiv:1409.1556"},{"key":"2064_CR11","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1725\u20131732. IEEE, Columbus, OH (2014)","DOI":"10.1109\/CVPR.2014.223"},{"key":"2064_CR12","doi-asserted-by":"crossref","unstructured":"Scovanner, P., Ali, S., Shah, M.: A 3-dimensional sift descriptor and its application to action recognition. In: 15th ACM International Conference on Multimedia, pp. 357\u2013360. ACM, Augsburg, Germany (2007)","DOI":"10.1145\/1291233.1291311"},{"key":"2064_CR13","doi-asserted-by":"crossref","unstructured":"Klaser, A., Marsza\u0142ek, M., Schmid, C.: A spatio-temporal descriptor based on 3D-gradients. In: 19th British Machine Vision Conference (BMVC), pp. 1\u201310. Leeds, United Kingdom (2008)","DOI":"10.5244\/C.22.99"},{"key":"2064_CR14","doi-asserted-by":"crossref","unstructured":"Oreifej, O., Liu, Z.: Hon4d: histogram of oriented 4D normals for activity recognition from depth sequences. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 716\u2013723. IEEE, Portland, OR (2013)","DOI":"10.1109\/CVPR.2013.98"},{"issue":"11","key":"2064_CR15","doi-asserted-by":"publisher","first-page":"14115","DOI":"10.1007\/s11042-017-5017-y","volume":"77","author":"M Asadi-Aghbolaghi","year":"2018","unstructured":"Asadi-Aghbolaghi, M., Kasaei, S.: Supervised spatio-temporal kernel descriptor for human action recognition from RGB-depth videos. Multimed. Tools Appl. 77(11), 14115\u201314135 (2018). https:\/\/doi.org\/10.1007\/s11042-017-5017-y","journal-title":"Multimed. Tools Appl."},{"issue":"2","key":"2064_CR16","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D.G.: Distinctive image features from scale-invariant keypoints. Int. J. Comput. Vis. 60(2), 91\u2013110 (2004). https:\/\/doi.org\/10.1023\/B:VISI.0000029664.99615.94","journal-title":"Int. J. Comput. Vis."},{"issue":"3","key":"2064_CR17","doi-asserted-by":"publisher","first-page":"346","DOI":"10.1016\/j.cviu.2007.09.014","volume":"110","author":"H Bay","year":"2008","unstructured":"Bay, H., Ess, A., Tuytelaars, T., Van Gool, L.: Speeded-up robust features (SURF). Comput. Vis. Image Underst. 110(3), 346\u2013359 (2008). https:\/\/doi.org\/10.1016\/j.cviu.2007.09.014","journal-title":"Comput. Vis. Image Underst."},{"key":"2064_CR18","doi-asserted-by":"crossref","unstructured":"Willems, G., Tuytelaars, T., Van Gool, L.: An efficient dense and scale-invariant spatio-temporal interest point detector. In: European Conference on Computer Vision, pp. 650\u2013663. Springer, Berlin, Heidelberg (2008)","DOI":"10.1007\/978-3-540-88688-4_48"},{"key":"2064_CR19","unstructured":"Hu, Y., Cao, L., Lv, F., Yan, S., Gong, Y., Huang, T.S.: Action detection in complex scenes with spatial and temporal ambiguities. In: 12th International Conference on Computer Vision, pp. 128\u2013135. IEEE, Kyoto (2009)"},{"issue":"3","key":"2064_CR20","doi-asserted-by":"publisher","first-page":"553","DOI":"10.1109\/JBHI.2013.2253613","volume":"17","author":"M Zhang","year":"2013","unstructured":"Zhang, M., Sawchuk, A.A.: Human daily activity recognition with sparse representation using wearable sensors. IEEE J. Biomed. Health. Inf. 17(3), 553\u2013560 (2013). https:\/\/doi.org\/10.1109\/JBHI.2013.2253613","journal-title":"IEEE J. Biomed. Health. Inf."},{"key":"2064_CR21","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-020-01868-8","author":"C Liu","year":"2020","unstructured":"Liu, C., Ying, J., Yang, H., Hu, X., Liu, J.: Improved human action recognition approach based on two-stream convolutional neural network model. Vis. Comput. (2020). https:\/\/doi.org\/10.1007\/s00371-020-01868-8","journal-title":"Vis. Comput."},{"issue":"11","key":"2064_CR22","doi-asserted-by":"publisher","first-page":"7086","DOI":"10.1109\/TGRS.2014.2307354","volume":"52","author":"X Li","year":"2014","unstructured":"Li, X., Shen, H., Zhang, L., Zhang, H., Yuan, Q., Yang, G.: Recovering quantitative remote sensing products contaminated by thick clouds and shadows using multitemporal dictionary learning. IEEE Trans. Geosci. Remote Sens. 52(11), 7086\u20137098 (2014). https:\/\/doi.org\/10.1109\/TGRS.2014.2307354","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"issue":"7","key":"2064_CR23","doi-asserted-by":"publisher","first-page":"3516","DOI":"10.1109\/TIP.2019.2898567","volume":"28","author":"X Dong","year":"2019","unstructured":"Dong, X., Shen, J., Wu, D., Guo, K., Jin, X., Porikli, F.: Quadruplet network with one-shot learning for fast visual object tracking. IEEE Trans. Image Process. 28(7), 3516\u20133527 (2019). https:\/\/doi.org\/10.1109\/TIP.2019.2898567","journal-title":"IEEE Trans. Image Process."},{"key":"2064_CR24","doi-asserted-by":"publisher","first-page":"3351","DOI":"10.1109\/TIP.2019.2959256","volume":"29","author":"Z Liang","year":"2019","unstructured":"Liang, Z., Shen, J.: Local semantic Siamese networks for fast tracking. IEEE Trans. Image Process. 29, 3351\u20133364 (2019). https:\/\/doi.org\/10.1109\/TIP.2019.2959256","journal-title":"IEEE Trans. Image Process."},{"issue":"1","key":"2064_CR25","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1109\/TIP.2017.2754941","volume":"27","author":"W Wang","year":"2017","unstructured":"Wang, W., Shen, J., Shao, L.: Video salient object detection via fully convolutional networks. IEEE Trans. Image Process. 27(1), 38\u201349 (2017). https:\/\/doi.org\/10.1109\/TIP.2017.2754941","journal-title":"IEEE Trans. Image Process."},{"key":"2064_CR26","doi-asserted-by":"publisher","first-page":"1113","DOI":"10.1109\/TIP.2019.2936112","volume":"29","author":"Q Lai","year":"2019","unstructured":"Lai, Q., Wang, W., Sun, H., Shen, J.: Video saliency prediction using spatiotemporal residual attentive networks. IEEE Trans. Image Process. 29, 1113\u20131126 (2019). https:\/\/doi.org\/10.1109\/TIP.2019.2936112","journal-title":"IEEE Trans. Image Process."},{"issue":"7","key":"2064_CR27","doi-asserted-by":"publisher","first-page":"1531","DOI":"10.1109\/TPAMI.2018.2840724","volume":"41","author":"W Wang","year":"2018","unstructured":"Wang, W., Shen, J., Ling, H.: A deep network solution for attention and aesthetics aware photo cropping. IEEE Trans. Pattern Anal. Mach. Intell. 41(7), 1531\u20131544 (2018). https:\/\/doi.org\/10.1109\/TPAMI.2018.2840724","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2064_CR28","doi-asserted-by":"crossref","unstructured":"Kuanar, S., Athitsos, V., Pradhan, N., Mishra, A., Rao, K.R.: Cognitive analysis of working memory load from EEG, by a deep recurrent neural network. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 2576\u20132580. IEEE SigPort (2018)","DOI":"10.1109\/ICASSP.2018.8462243"},{"key":"2064_CR29","doi-asserted-by":"crossref","unstructured":"Kuanar, S., Athitsos, V., Mahapatra, D., Rao, K.R., Akhtar, Z., Dasgupta, D.: Low dose abdominal CT image reconstruction: an unsupervised learning based approach. In: IEEE International Conference on Image Processing (ICIP), pp. 1351\u20131355. IEEE (2019)","DOI":"10.1109\/ICIP.2019.8803037"},{"issue":"1","key":"2064_CR30","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2012","unstructured":"Ji, S., Xu, W., Yang, M., Yu, K.: 3D convolutional neural networks for human action recognition. IEEE Trans. Pattern Anal. Mach. Intell. 35(1), 221\u2013231 (2012)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"2064_CR31","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances in Neural Information Processing Systems, pp. 568\u2013576. MIT Press, Cambridge, MA (2014)"},{"key":"2064_CR32","doi-asserted-by":"crossref","unstructured":"Tran, D., Bourdev, L., Fergus, R., Torresani, L., Paluri, M.: Learning spatiotemporal features with 3D convolutional networks. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4489\u20134497. IEEE Computer Society, USA (2015)","DOI":"10.1109\/ICCV.2015.510"},{"key":"2064_CR33","doi-asserted-by":"publisher","first-page":"242","DOI":"10.1016\/j.pmcj.2014.05.006","volume":"15","author":"S Bhattacharya","year":"2014","unstructured":"Bhattacharya, S., Nurmi, P., Hammerla, N., Pl\u00f6tz, T.: Using unlabeled data in a sparse-coding framework for human activity recognition. Pervasive Mob. Comput. 15, 242\u2013262 (2014). https:\/\/doi.org\/10.1016\/j.pmcj.2014.05.006","journal-title":"Pervasive Mob. Comput."},{"key":"2064_CR34","unstructured":"Zaremba, W., Sutskever, I., Vinyals, O.: Recurrent neural network regularization (2014). arXiv preprint arXiv:1409.2329"},{"key":"2064_CR35","doi-asserted-by":"crossref","unstructured":"Donahue, J., Anne Hendricks, L., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., Darrell, T.: Long-term recurrent convolutional networks for visual recognition and description. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 2625\u20132634 (2015)","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"2064_CR36","doi-asserted-by":"crossref","unstructured":". Veeriah, V., Zhuang, N., Qi, G.J.: Differential recurrent neural networks for action recognition. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4041\u20134049. IEEE Computer Society, USA (2015)","DOI":"10.1109\/ICCV.2015.460"},{"key":"2064_CR37","doi-asserted-by":"crossref","unstructured":"Yue-Hei Ng, J., Hausknecht, M., Vijayanarasimhan, S., Vinyals, O., Monga, R., Toderici, G.: Beyond short snippets: deep networks for video classification. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 4694\u20134702. Boston, MA (2015)","DOI":"10.1109\/CVPR.2015.7299101"},{"key":"2064_CR38","doi-asserted-by":"crossref","unstructured":"Wu, Z., Wang, X., Jiang, Y.G., Ye, H., Xue, X.: Modeling spatial-temporal clues in a hybrid deep learning framework for video classification. In: Proceedings of the 23rd ACM International Conference on Multimedia, pp. 461\u2013470. ACM, New York, NY (2015)","DOI":"10.1145\/2733373.2806222"},{"key":"2064_CR39","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1016\/j.displa.2018.08.001","volume":"55","author":"JH Kim","year":"2018","unstructured":"Kim, J.H., Hong, G.S., Kim, B.G., Dogra, D.P.: deepGesture: deep learning-based gesture recognition scheme using motion sensors. Displays 55, 38\u201345 (2018). https:\/\/doi.org\/10.1016\/j.displa.2018.08.001","journal-title":"Displays"},{"key":"2064_CR40","doi-asserted-by":"publisher","DOI":"10.1007\/s00371-020-01864-y","author":"D Madhuranga","year":"2020","unstructured":"Madhuranga, D., Madushan, R., Siriwardane, C., Gunasekera, K.: Real-time multimodal ADL recognition using convolution neural networks. Vis. Comput. (2020). https:\/\/doi.org\/10.1007\/s00371-020-01864-y","journal-title":"Vis. Comput."},{"key":"2064_CR41","unstructured":"Srivastava, N., Mansimov, E., Salakhudinov, R.: Unsupervised learning of video representations using LSTMs. In: International Conference on Machine Learning, pp. 843\u2013852. JMLR.org (2015)"},{"key":"2064_CR42","doi-asserted-by":"crossref","unstructured":"Ercolano, G., Riccio, D., Rossi, S.: Two deep approaches for ADL recognition: a multi-scale LSTM and a CNN-LSTM with a 3D matrix skeleton representation. In: 26th IEEE International Symposium on Robot and Human Interactive Communication (RO-MAN), pp. 877-882. IEEE, Lisbon (2017)","DOI":"10.1109\/ROMAN.2017.8172406"},{"key":"2064_CR43","doi-asserted-by":"publisher","first-page":"1155","DOI":"10.1109\/ACCESS.2017.2778011","volume":"6","author":"A Ullah","year":"2017","unstructured":"Ullah, A., Ahmad, J., Muhammad, K., Sajjad, M., Baik, S.W.: Action recognition in video sequences using deep bi-directional LSTM with CNN features. IEEE Access 6, 1155\u20131166 (2017). https:\/\/doi.org\/10.1109\/ACCESS.2017.2778011","journal-title":"IEEE Access"},{"key":"2064_CR44","doi-asserted-by":"publisher","first-page":"76","DOI":"10.1016\/j.image.2018.09.003","volume":"71","author":"CY Ma","year":"2019","unstructured":"Ma, C.Y., Chen, M.H., Kira, Z., AlRegib, G.: TS-LSTM and temporal-inception: exploiting spatiotemporal dynamics for activity recognition. Signal Process. Image Commun. 71, 76\u201387 (2019). https:\/\/doi.org\/10.1016\/j.image.2018.09.003","journal-title":"Signal Process. Image Commun."},{"key":"2064_CR45","doi-asserted-by":"crossref","unstructured":"Zhao, R., Ali, H., Van der Smagt, P.: Two-stream RNN\/CNN for action recognition in 3D videos. In: IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), pp. 4260\u20134267. IEEE, Vancouver, BC (2017)","DOI":"10.1109\/IROS.2017.8206288"},{"key":"2064_CR46","doi-asserted-by":"publisher","first-page":"118","DOI":"10.1016\/j.autcon.2017.11.002","volume":"86","author":"L Ding","year":"2018","unstructured":"Ding, L., Fang, W., Luo, H., Love, P.E., Zhong, B., Ouyang, X.: A deep hybrid learning model to detect unsafe behavior: integrating convolution neural networks and long short-term memory. Autom. Constr. 86, 118\u2013124 (2018). https:\/\/doi.org\/10.1016\/j.autcon.2017.11.002","journal-title":"Autom. Constr."},{"key":"2064_CR47","unstructured":"Baradel, F., Wolf, C., Mille, J.: Human activity recognition with pose-driven attention to RGB. In: 29th British Machine Vision Conference, pp. 1\u201314. Newcastle, United Kingdom (2018)"},{"issue":"2","key":"2064_CR48","doi-asserted-by":"publisher","first-page":"42","DOI":"10.3390\/fi11020042","volume":"11","author":"S Arif","year":"2019","unstructured":"Arif, S., Wang, J., Ul Hassan, T., Fei, Z.: 3D-CNN-based fused feature maps with LSTM applied to action recognition. Future Internet 11(2), 42 (2019). https:\/\/doi.org\/10.3390\/fi11020042","journal-title":"Future Internet"},{"key":"2064_CR49","doi-asserted-by":"crossref","unstructured":"Das, S., Koperski, M., Bremond, F., Francesca, G.: Deep-temporal LSTM for daily living action recognition. In: 15th IEEE International Conference on Advanced Video and Signal Based Surveillance (AVSS), pp. 1\u20136. IEEE, Auckland, New Zealand (2018)","DOI":"10.1109\/AVSS.2018.8639122"},{"issue":"3","key":"2064_CR50","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., Berg, A.C.: Imagenet large scale visual recognition challenge. Int. J. Comput. Vis. 115(3), 211\u2013252 (2015). https:\/\/doi.org\/10.1007\/s11263-015-0816-y","journal-title":"Int. J. Comput. Vis."},{"key":"2064_CR51","unstructured":"Pascanu, R., Mikolov, T., Bengio, Y.: On the difficulty of training recurrent neural networks. In: International Conference on Machine Learning, pp. 1310\u20131318. JMLR.org, Atlanta, GA (2013)"},{"key":"2064_CR52","unstructured":"Sung, J., Ponce, C., Selman, B., Saxena, A.: Unstructured human activity detection from RGBD images. In: IEEE International Conference on Robotics and Automation, pp. 842\u2013849. IEEE, Saint Paul, MN (2012)"},{"key":"2064_CR53","unstructured":"Wang, J., Liu, Z., Wu, Y., Yuan, J.: Mining actionlet ensemble for action recognition with depth cameras. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 1290\u20131297. IEEE, USA (2012)"},{"key":"2064_CR54","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1016\/j.patrec.2018.04.035","volume":"115","author":"P Khaire","year":"2018","unstructured":"Khaire, P., Kumar, P., Imran, J.: Combining CNN streams of RGB-D and skeletal data for human activity recognition. Pattern Recognit. Lett. 115, 107\u2013116 (2018). https:\/\/doi.org\/10.1016\/j.patrec.2018.04.035","journal-title":"Pattern Recognit. Lett."},{"issue":"8","key":"2064_CR55","doi-asserted-by":"publisher","first-page":"453","DOI":"10.1016\/j.imavis.2014.04.005","volume":"32","author":"Y Zhu","year":"2014","unstructured":"Zhu, Y., Chen, W., Guo, G.: Evaluating spatiotemporal interest point features for depth-based action recognition. Image Vis. Comput. 32(8), 453\u2013464 (2014). https:\/\/doi.org\/10.1016\/j.imavis.2014.04.005","journal-title":"Image Vis. Comput."},{"issue":"5","key":"2064_CR56","doi-asserted-by":"publisher","first-page":"1383","DOI":"10.1109\/TCYB.2013.2276433","volume":"43","author":"B Ni","year":"2013","unstructured":"Ni, B., Pei, Y., Moulin, P., Yan, S.: Multilevel depth and image fusion for human activity detection. IEEE Trans. Cybern. 43(5), 1383\u20131394 (2013). https:\/\/doi.org\/10.1109\/TCYB.2013.2276433","journal-title":"IEEE Trans. Cybern."},{"issue":"8","key":"2064_CR57","doi-asserted-by":"publisher","first-page":"951","DOI":"10.1177\/0278364913478446","volume":"32","author":"HS Koppula","year":"2013","unstructured":"Koppula, H.S., Gupta, R., Saxena, A.: Learning human activities and object affordances from RGB-D videos. Int. J. Robot. Res. 32(8), 951\u2013970 (2013). https:\/\/doi.org\/10.1177\/0278364913478446","journal-title":"Int. J. Robot. Res."},{"key":"2064_CR58","doi-asserted-by":"crossref","unstructured":"Koperski, M., Bremond, F.: Modeling spatial layout of features for real world scenario RGB-D action recognition. In: 13th IEEE International Conference on Advanced Video and Signal Based Surveillance (AVSS), pp. 44\u201350. IEEE (2016)","DOI":"10.1109\/AVSS.2016.7738023"},{"key":"2064_CR59","doi-asserted-by":"crossref","unstructured":"Hu, J.F., Zheng, W.S., Lai, J., Zhang, J.: Jointly learning heterogeneous features for RGB-D activity recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5344\u20135352. IEEE (2015)","DOI":"10.1109\/CVPR.2015.7299172"},{"key":"2064_CR60","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-019-08588-9","author":"D Srihari","year":"2020","unstructured":"Srihari, D., Kishore, P.V.V., Kumar, E.K., Kumar, D.A., Kumar, M.T.K., Prasad, M.V.D., Prasad, C.R.: A four-stream ConvNet based on spatial and depth flow for human action classification using RGB-D data. Multimed. Tools Appl. (2020). https:\/\/doi.org\/10.1007\/s11042-019-08588-9","journal-title":"Multimed. Tools Appl."},{"key":"2064_CR61","doi-asserted-by":"publisher","first-page":"80","DOI":"10.1016\/J.PATCOG.2017.10.033","volume":"76","author":"JC Nunez","year":"2018","unstructured":"Nunez, J.C., Cabido, R., Pantrigo, J.J., Montemayor, A.S., Velez, J.F.: Convolutional neural networks and long short-term memory for skeleton-based human activity and hand gesture recognition. Pattern Recognit. 76, 80\u201394 (2018). https:\/\/doi.org\/10.1016\/J.PATCOG.2017.10.033","journal-title":"Pattern Recognit."},{"key":"2064_CR62","doi-asserted-by":"publisher","first-page":"139","DOI":"10.1016\/j.patrec.2014.03.024","volume":"50","author":"J Luo","year":"2014","unstructured":"Luo, J., Wang, W., Qi, H.: Spatio-temporal feature extraction and representation for RGB-D human action recognition. Pattern Recognit. Lett. 50, 139\u2013148 (2014). https:\/\/doi.org\/10.1016\/j.patrec.2014.03.024","journal-title":"Pattern Recognit. Lett."},{"key":"2064_CR63","unstructured":"Baradel, F., Wolf, C., Mille, J.: Human activity recognition with pose-driven attention to RGB. In: 29th British Machine Vision Conference, pp. 1\u201314. Newcastle, United Kingdom (2018)"},{"key":"2064_CR64","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Ni, B., Hong, R., Wang, M., Tian, Q.: Interaction part mining: a mid-level approach for fine-grained action recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3323\u20133331. IEEE (2015)","DOI":"10.1109\/CVPR.2015.7298953"},{"key":"2064_CR65","doi-asserted-by":"crossref","unstructured":"Wang, L., Xiong, Y., Wang, Z., Qiao, Y., Lin, D., Tang, X., Van Gool, L.: Temporal segment networks: towards good practices for deep action recognition. In: European Conference on Computer Vision, pp. 20\u201336. Springer, Cham (2016)","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"2064_CR66","doi-asserted-by":"crossref","unstructured":"Das, S., Koperski, M., Bremond, F., Francesca, G.: Action recognition based on a mixture of RGB and depth based skeleton. In: 14th IEEE International Conference on Advanced Video and Signal Based Surveillance (AVSS), pp. 1\u20136. IEEE, Lecce (2017)","DOI":"10.1109\/AVSS.2017.8078548"},{"key":"2064_CR67","unstructured":"Liu, L., Shao, L.: Learning discriminative representations from RGB-D video data. In: International Joint Conference on Artificial Intelligence (2013)"},{"key":"2064_CR68","doi-asserted-by":"crossref","unstructured":"Kong, Y., Fu, Y.: Bilinear heterogeneous information machine for RGB-D action recognition. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 1054\u20131062 (2015)","DOI":"10.1109\/CVPR.2015.7298708"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-021-02064-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-021-02064-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-021-02064-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,24]],"date-time":"2024-08-24T12:06:50Z","timestamp":1724501210000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-021-02064-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,2,15]]},"references-count":68,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2022,3]]}},"alternative-id":["2064"],"URL":"https:\/\/doi.org\/10.1007\/s00371-021-02064-y","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,2,15]]},"assertion":[{"value":"5 January 2021","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 February 2021","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Compliance with ethical standards"}},{"value":"Hend Basly, Wael Ouarda, Fatma Ezahra Sayadi, Bouraoui Ouni and Adel M. Alimi declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}