{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,9]],"date-time":"2026-03-09T21:27:04Z","timestamp":1773091624175,"version":"3.50.1"},"reference-count":36,"publisher":"Springer Science and Business Media LLC","issue":"45-46","license":[{"start":{"date-parts":[[2020,5,29]],"date-time":"2020-05-29T00:00:00Z","timestamp":1590710400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,5,29]],"date-time":"2020-05-29T00:00:00Z","timestamp":1590710400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Basic Research Program of China","doi-asserted-by":"publisher","award":["2017YFB1400301"],"award-info":[{"award-number":["2017YFB1400301"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2020,12]]},"DOI":"10.1007\/s11042-020-08998-0","type":"journal-article","created":{"date-parts":[[2020,5,29]],"date-time":"2020-05-29T08:03:59Z","timestamp":1590739439000},"page":"34665-34683","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Multi modal human action recognition for video content matching"],"prefix":"10.1007","volume":"79","author":[{"given":"Jun","family":"Guo","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Bai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhanyong","family":"Tang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pengfei","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Daguang","family":"Gan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Baoying","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,5,29]]},"reference":[{"issue":"2","key":"8998_CR1","first-page":"170","volume":"2003","author":"W Adams","year":"2003","unstructured":"Adams W, Iyengar G, Lin C, Naphade M, Neti C, Nock H, Smith J (2003) Semantic indexing of multimedia content using visual, audio, and text cues. EURASIP J Appl Signal Process 2003(2):170\u2013185","journal-title":"EURASIP J Appl Signal Process"},{"key":"8998_CR2","doi-asserted-by":"crossref","unstructured":"Adib F, Katabi D (2013) See through walls with wifi! In Proc.ACM SIGCOMM Conf. SIGCOMM, pp. 75\u201386","DOI":"10.1145\/2534169.2486039"},{"key":"8998_CR3","unstructured":"Adib F, Kabelac Z, Katabi D, Miller RC (2014) 3d tracking via body radio reflections. In Proc. 11th USENIX Conf. Netw. Syst. Des. Implementation, vol. 14, pp. 317\u2013329."},{"key":"8998_CR4","unstructured":"Adib F, Kabelac Z, Katabi D (2015) Multi-person localization via RF body reflections. In Proc. 12th USENIX Conf. Netw. Syst. Des. Implementation, pp. 279\u2013292."},{"key":"8998_CR5","doi-asserted-by":"publisher","first-page":"146","DOI":"10.1007\/s10776-018-0389-0","volume":"25","author":"S Duan","year":"2018","unstructured":"Duan S, Yu T, He J (2018) WiDriver: driver activity recognition system based on WiFi CSI. Int J Wireless Inf Networks 25:146\u2013156","journal-title":"Int J Wireless Inf Networks"},{"key":"8998_CR6","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Wildes R (2016) Spatiotemporal residual networks for video action recognition. In Proceedings of Advances in Neural Information Processing Systems, pages 3468\u20133476, Barcelona, SPAIN","DOI":"10.1109\/CVPR.2017.787"},{"key":"8998_CR7","doi-asserted-by":"crossref","unstructured":"Feichtenhofer C, Pinz A, Zisserman A (2016) Convolutional two-stream network fusion for video action recognition. In Proceedings of Conference on Computer Vision and Pattern Recognition, pages 1933\u20131941, Las Vegas, NV, United States","DOI":"10.1109\/CVPR.2016.213"},{"key":"8998_CR8","doi-asserted-by":"crossref","unstructured":"Gu Y, Quan L, Ren F (2014) Wifi-assisted human activity recognition. In Wireless and Mobile, 2014 IEEE Asia Pacific Conference on. IEEE, pp. 60\u201365","DOI":"10.1109\/APWiMob.2014.6920266"},{"issue":"6","key":"8998_CR9","doi-asserted-by":"publisher","first-page":"2479","DOI":"10.1109\/TIP.2013.2252622","volume":"22","author":"K Guo","year":"2013","unstructured":"Guo K, Ishwar P, Konrad J (2013) Action recognition from video using feature covariance matrices. IEEE Trans Image Process 22(6):2479\u20132494","journal-title":"IEEE Trans Image Process"},{"key":"8998_CR10","doi-asserted-by":"crossref","unstructured":"Hara K , Kataoka H , Satoh Y (2017) Learning Spatio-temporal features with 3D Residual Networks for Action Recognition[J]. arXiv:1708.07632v1","DOI":"10.1109\/ICCVW.2017.373"},{"key":"8998_CR11","doi-asserted-by":"crossref","unstructured":"Ilg E, Mayer N, Saikia T, Keuper M, Dosovitskiy A, and T. Brox (2017) Flownet 2.0: Evolution of optical flow estimation with deep networks. In 2017 IEEE Conference on Computer Vision and Pattern Recognition, pages 1647-1655, Honolulu, HI, USA, IEEE Computer Society.","DOI":"10.1109\/CVPR.2017.179"},{"issue":"1","key":"8998_CR12","doi-asserted-by":"publisher","first-page":"221","DOI":"10.1109\/TPAMI.2012.59","volume":"35","author":"S Ji","year":"2013","unstructured":"Ji S, Xu W, Yang M, Yu K (2013) 3d convolutional neural networks for human action recognition. IEEE Trans Pattern Anal Mach Intell 35(1):221\u2013231","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"8998_CR13","unstructured":"Joshi KR, Bharadia D, Kotaru M, Sachin Katti (2015) WiDeo: Fine-grained device-free motion tracing using RF back scatter. In Proceedings of the USENIX Conference on Networked Systems Design and Implementation (NSDI). Pages 189\u2013204"},{"key":"8998_CR14","doi-asserted-by":"crossref","unstructured":"Kar A, Rai N, Sikka K, Sharma G (2017) Adascan: adaptive scan pooling in deep convolutional neural networks for human action recognition in videos. In Conference on Computer Vision and Pattern Recognition, pages 5699-5678, Honolulu, Hawaii, USA, IEEE","DOI":"10.1109\/CVPR.2017.604"},{"key":"8998_CR15","doi-asserted-by":"crossref","unstructured":"Karpathy A, Toderici G, Shetty S, Leung T, Sukthankar R, Fei-Fei L (2014) Large-scale video classification with convolutional neural networks. In Proceedings of IEEE Conference on Computer Vision and Pattern Recognition, pages 1725\u20131732,Columbus, OH, USA","DOI":"10.1109\/CVPR.2014.223"},{"key":"8998_CR16","doi-asserted-by":"crossref","unstructured":"Laptev I, Marszalek M, Schmid C, Rozenfeld B (2008) Learning realistic human actions from movies. In IEEE Conference on Computer Vision and Pattern Recognition, pages 1\u20138, Anchorage, AK, USA, IEEE","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"8998_CR17","doi-asserted-by":"crossref","unstructured":"Li Y, Kuai Y (2012) Action recognition based on spatio-temporal interest points. In Biomedical Engineering and Informatics (BMEI), 2012 5thInternational Conference on. IEEE, pp. 181\u2013185.","DOI":"10.1109\/BMEI.2012.6512972"},{"key":"8998_CR18","unstructured":"Liu J, Shah M (2008) Learning human actions via information maximization. In IEEE Conference on Computer Vision and Pattern Recognition, pages 1\u20138, Anchorage, AK, USA, IEEE"},{"key":"8998_CR19","unstructured":"Liu H, Tu J , Liu M (2017) Two-stream 3D convolutional neural network for skeleton-based action recognition. arXiv:1705.08106"},{"key":"8998_CR20","doi-asserted-by":"crossref","unstructured":"Melgarejo P, Zhang X, Ramanathan P, Chu D (2014) Leveraging directional antenna capabilities for fine grained gesture recognition. In Proceedings of the ACM International Joint Conference on Pervasive and Ubiquitous Computing, pages 541\u2013551","DOI":"10.1145\/2632048.2632095"},{"key":"8998_CR21","doi-asserted-by":"crossref","unstructured":"Peng X, Schmid C (2016) Multi-region two-stream r-cnn for action detection. In European Conference on Computer Vision, pages 744\u2013759. Springer","DOI":"10.1007\/978-3-319-46493-0_45"},{"key":"8998_CR22","doi-asserted-by":"crossref","unstructured":"Pu Q, Gupta S, Gollakota S, Patel S (2013) Whole-home gesture recognition using wireless signals. In Proceedings of the 19th Annual International Conference on Mobile Computing &Networking ,pages 27\u201338, (MobiCom2013). ACM,","DOI":"10.1145\/2500423.2500436"},{"key":"8998_CR23","doi-asserted-by":"crossref","unstructured":"Ranjan A, Black MJ (2016) Optical flow estimation using a spatial pyramid network. arXiv preprint arXiv:1611.00850","DOI":"10.1109\/CVPR.2017.291"},{"key":"8998_CR24","unstructured":"Simonyan K, Zisserman A (2014) Two-stream convolutional networks for action recognition in videos. In Proceedings of Advances in Neural Information Processing Systems, pages 568\u2013576"},{"key":"8998_CR25","doi-asserted-by":"crossref","unstructured":"Singh B, Marks TK, Jones M, Tuzel O, Shao M (2016) A Multi-stream Bi-directional Recurrent Neural Network for Fine-Grained Action Detection. Proceedings of Conference on Computer Vision and Pattern Recognition, pages 1961\u20131970,Las Vegas, NV, United States, IEEE","DOI":"10.1109\/CVPR.2016.216"},{"key":"8998_CR26","doi-asserted-by":"crossref","unstructured":"Snoek CGM, Worring M, Smeulders AWM (2005) Early versus late fusion in semantic video analysis. In ACM International Conference on Multimedia, pp. 399\u2013402. Singapore","DOI":"10.1145\/1101149.1101236"},{"key":"8998_CR27","doi-asserted-by":"crossref","unstructured":"Tadas B, Chaitanya A, Louis-Philippe M (2019) Multimodal machine learning: a survey and taxonomy. IEEE Trans Pattern Ana Match Intell 41(2):423\u2013443","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"8998_CR28","doi-asserted-by":"crossref","unstructured":"Tran A, Cheong LF (2017) Two-stream flow-guided convolutional attention networks for action recognition. IEEE International Conference on Computer Vision Workshop. Pages 3110-3119, Venice, Italy, IEEE Computer Society","DOI":"10.1109\/ICCVW.2017.368"},{"key":"8998_CR29","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y (2015) Towards good practices for very deep two-stream convnets. arXiv preprint arXiv:1507.02159"},{"key":"8998_CR30","doi-asserted-by":"crossref","unstructured":"Wang W, Liu AX, Shahzad M (2016) Gait recognition using WiFi signals. In Proceedings of the 2016 ACM International Joint Conference on Pervasive and Ubiquitous Computing, pages 363\u2013373, Heidelberg, Germany, ACM","DOI":"10.1145\/2971648.2971670"},{"issue":"2","key":"8998_CR31","doi-asserted-by":"publisher","first-page":"581","DOI":"10.1109\/TMC.2016.2557792","volume":"16","author":"Y Wang","year":"2017","unstructured":"Wang Y, Wu K, Ni LM (2017) Wifall: device-free fall detection by wireless networks. IEEE Trans Mob Comput 16(2):581\u2013594","journal-title":"IEEE Trans Mob Comput"},{"issue":"1","key":"8998_CR32","doi-asserted-by":"publisher","first-page":"48","DOI":"10.1109\/MC.2017.7","volume":"50","author":"D Zhang","year":"2017","unstructured":"Zhang D, Wang H, Wu D (2017) Toward centimeter-scale human activity sensing with Wi-Fi signals. Computer 50(1):48\u201357","journal-title":"Computer"},{"key":"8998_CR33","unstructured":"Zhao M, Yue S, Katabi D, Jaakkola TS, Bianchi MT (2017) Learning sleep stages from radio signals: A conditional adversarial architecture. In International Conference on Machine Learning (ICML), Sydney, Australia"},{"key":"8998_CR34","doi-asserted-by":"crossref","unstructured":"Zhao M,Li T, Alsheikh MA, Tian Y, Zhao H, Torralba A, Katabi D (2018) Through wall human pose estimation using radio signals. pages 7356\u20137365,Proceedings of Conference on Computer Vision and Pattern Recognition, Salt Lake City, UTAL, United States, IEEE.","DOI":"10.1109\/CVPR.2018.00768"},{"key":"8998_CR35","doi-asserted-by":"crossref","unstructured":"Zhao M, Tian Y, Zhao H, Alsheikh MA, Li T, Hristov R, Kabelac Z, Katabi D, Torralba A (2018) RF-based 3D skeletons. SIGCOMM\u201918, pages 267-282, Budapest, Hungary. ACM","DOI":"10.1145\/3230543.3230579"},{"key":"8998_CR36","unstructured":"Zhu Y, Lan Z, Newsam S, Hauptmann AG (2017) Hidden two-stream convolutional networks for action recognition. arXiv preprint arXiv:1704.00389"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-08998-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-08998-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-08998-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,5,29]],"date-time":"2021-05-29T00:05:52Z","timestamp":1622246752000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-08998-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,5,29]]},"references-count":36,"journal-issue":{"issue":"45-46","published-print":{"date-parts":[[2020,12]]}},"alternative-id":["8998"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-08998-0","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,5,29]]},"assertion":[{"value":"15 July 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 February 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 April 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 May 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}