{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,28]],"date-time":"2025-10-28T14:59:18Z","timestamp":1761663558173,"version":"3.37.3"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"18","license":[{"start":{"date-parts":[[2017,2,10]],"date-time":"2017-02-10T00:00:00Z","timestamp":1486684800000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61472281"],"award-info":[{"award-number":["61472281"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2017,9]]},"DOI":"10.1007\/s11042-017-4416-4","type":"journal-article","created":{"date-parts":[[2017,2,9]],"date-time":"2017-02-09T23:35:16Z","timestamp":1486683316000},"page":"18891-18913","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Learning correlations for human action recognition in videos"],"prefix":"10.1007","volume":"76","author":[{"given":"Yun","family":"Yi","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hanli","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bowen","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,2,10]]},"reference":[{"issue":"3","key":"4416_CR1","doi-asserted-by":"crossref","first-page":"175","DOI":"10.1080\/00031305.1992.10475879","volume":"46","author":"NS Altman","year":"1992","unstructured":"Altman NS (1992) An introduction to kernel and nearest-neighbor nonparametric regression. Am Stat 46(3):175\u2013185","journal-title":"Am Stat"},{"issue":"4","key":"4416_CR2","doi-asserted-by":"crossref","first-page":"1234","DOI":"10.1109\/TMM.2012.2191268","volume":"14","author":"L Ballan","year":"2012","unstructured":"Ballan L, Bertini M, Del Bimbo A, Seidenari L (2012) Effective codebooks for human action representation and classification in unconstrained videos. IEEE Trans Multimed 14(4):1234\u20131245","journal-title":"IEEE Trans Multimed"},{"issue":"2","key":"4416_CR3","doi-asserted-by":"crossref","first-page":"253","DOI":"10.1007\/s11042-012-1022-3","volume":"69","author":"R Benmokhtar","year":"2014","unstructured":"Benmokhtar R (2014) Robust human action recognition scheme based on high-level feature fusion. Multimed Tools Appl 69(2):253\u2013275","journal-title":"Multimed Tools Appl"},{"issue":"11","key":"4416_CR4","doi-asserted-by":"crossref","first-page":"1993","DOI":"10.1109\/TCSVT.2013.2270402","volume":"23","author":"PVK Borges","year":"2013","unstructured":"Borges PVK, Conci N, Cavallaro A (2013) Video-based human behavior understanding: a survey. IEEE Trans Circ Syst Vid Technol 23(11):1993\u20132008","journal-title":"IEEE Trans Circ Syst Vid Technol"},{"issue":"3","key":"4416_CR5","doi-asserted-by":"crossref","first-page":"27:1","DOI":"10.1145\/1961189.1961199","volume":"2","author":"CC Chang","year":"2011","unstructured":"Chang CC, Lin CJ (2011) LIBSVM: a library for support vector machines. ACM Trans Intell Syst Technol 2(3):27:1\u201327:27","journal-title":"ACM Trans Intell Syst Technol"},{"issue":"1","key":"4416_CR6","doi-asserted-by":"crossref","first-page":"51","DOI":"10.1109\/THMS.2014.2362520","volume":"45","author":"C Chen","year":"2015","unstructured":"Chen C, Jafari R, Kehtarnavaz N (2015) Improving human action recognition using fusion of depth camera and inertial sensors. IEEE Trans Human-Mach Syst 45 (1):51\u201361","journal-title":"IEEE Trans Human-Mach Syst"},{"issue":"17","key":"4416_CR7","doi-asserted-by":"crossref","first-page":"10:335","DOI":"10.1007\/s11042-015-3008-4","volume":"75","author":"M Chen","year":"2016","unstructured":"Chen M, Gong L, Wang T, Liu F, Feng Q (2016) Modeling spatio-temporal layout with lie algebrized gaussians for action recognition. Multimed Tools Appl 75 (17):10:335\u201310:355","journal-title":"Multimed Tools Appl"},{"key":"4416_CR8","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B (2005) Histograms of oriented gradients for human detection. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 886\u2013893","DOI":"10.1109\/CVPR.2005.177"},{"key":"4416_CR9","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B, Schmid C (2006) Human detection using oriented histograms of flow and appearance. In: European Conference on Computer Vision, pp 428\u2013441","DOI":"10.1007\/11744047_33"},{"key":"4416_CR10","first-page":"1871","volume":"9","author":"RE Fan","year":"2008","unstructured":"Fan RE, Chang KW, Hsieh CJ, Wang XR, Lin CJ (2008) LIBLINEAR: A library for large linear classification. J Mach Learn Res 9:1871\u20131874","journal-title":"J Mach Learn Res"},{"key":"4416_CR11","doi-asserted-by":"crossref","unstructured":"Farneb\u00e4ck G (2003) Two-frame motion estimation based on polynomial expansion. In: Scandinavian conference on Image analysis, pp 363\u2013370","DOI":"10.1007\/3-540-45103-X_50"},{"key":"4416_CR12","unstructured":"Hoai M, Zisserman A (2014) Improving human action recognition using score distribution and ranking. In: Asian Conference on Computer Vision, pp 3\u201320"},{"key":"4416_CR13","doi-asserted-by":"crossref","unstructured":"Jia Y, Shelhamer E, Donahue J, Karayev S, Long J, Girshick R, Guadarrama S, Darrell T (2014) Caffe: Convolutional architecture for fast feature embedding. In: ACM International Conference on Multimedia, pp 675\u2013678","DOI":"10.1145\/2647868.2654889"},{"key":"4416_CR14","doi-asserted-by":"crossref","unstructured":"Karpathy A, Toderici G, Shetty S, Leung T, Sukthankar R, Fei-Fei L (2014) Large-scale video classification with convolutional neural networks. In: IEEE conference on Computer Vision and Pattern Recognition, pp 1725\u20131732","DOI":"10.1109\/CVPR.2014.223"},{"key":"4416_CR15","doi-asserted-by":"crossref","unstructured":"Keerthi SS, Sundararajan S, Chang KW, Hsieh CJ, Lin CJ (2008) A sequential dual method for large scale multi-class linear svms. In: ACM SIGKDD international conference on Knowledge discovery and data mining, pp 408\u2013416","DOI":"10.1145\/1401890.1401942"},{"key":"4416_CR16","doi-asserted-by":"crossref","unstructured":"Krapac J, Verbeek J, Jurie F (2011) Modeling spatial layout with fisher vectors for image categorization. In: IEEE International Conference on Computer Vision, pp 1487\u20131494","DOI":"10.1109\/ICCV.2011.6126406"},{"key":"4416_CR17","doi-asserted-by":"crossref","unstructured":"Kuehne H, Jhuang H, Garrote E, Poggio T, Serre T (2011) HMDB: A large video database for human motion recognition. In: IEEE International Conference on Computer Vision, pp 2556\u20132563","DOI":"10.1109\/ICCV.2011.6126543"},{"issue":"9","key":"4416_CR18","doi-asserted-by":"crossref","first-page":"2772","DOI":"10.1109\/TIP.2015.2423560","volume":"24","author":"KT Lai","year":"2015","unstructured":"Lai KT, Liu D, Chang SF, Chen MS (2015) Learning sample specific weights for late fusion. IEEE Trans Image Process 24(9):2772\u20132783","journal-title":"IEEE Trans Image Process"},{"issue":"1","key":"4416_CR19","doi-asserted-by":"crossref","first-page":"333","DOI":"10.1007\/s11042-013-1391-2","volume":"71","author":"Lan Zz","year":"2014","unstructured":"Zz Lan, Bao L, Yu SI, Liu W, Hauptmann AG (2014) Multimedia classification and event detection using double fusion. Multimed Tools Appl 71(1):333\u2013347","journal-title":"Multimed Tools Appl"},{"key":"4416_CR20","doi-asserted-by":"crossref","unstructured":"Laptev I, Marszalek M, Schmid C, Rozenfeld B (2008) Learning realistic human actions from movies. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 1\u20138","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"4416_CR21","doi-asserted-by":"crossref","unstructured":"Lee JH (1997) Analyses of multiple evidence combination. In: ACM SIGIR Forum, pp 267\u2013276","DOI":"10.1145\/258525.258587"},{"key":"4416_CR22","doi-asserted-by":"crossref","unstructured":"Li L, Dai S (2016) Action recognition with spatio-temporal augmented descriptor and fusion method. Multimedia Tools and Applications (in press)","DOI":"10.1007\/s11042-016-3889-x"},{"issue":"2","key":"4416_CR23","first-page":"561","volume":"9","author":"CJ Lin","year":"2007","unstructured":"Lin CJ, Weng RC, Keerthi SS (2007) Trust region newton method for large-scale logistic regression. J Mach Learn Res 9(2):561\u2013568","journal-title":"J Mach Learn Res"},{"issue":"21","key":"4416_CR24","first-page":"113,023\u2014","volume":"75","author":"C Liu","year":"2016","unstructured":"Liu C, Xu W, Wu Q, Yang G (2016) Learning motion and content-dependent features with convolutions for action recognition. Multimed Tools Appl 75(21):113,023\u2014-13,039","journal-title":"Multimed Tools Appl"},{"key":"4416_CR25","doi-asserted-by":"crossref","unstructured":"Ma T, Oh S, Perera A, Latecki L (2013) Learning non-linear calibration for score fusion with applications to image and video classification. In: IEEE International Conference on Computer Vision Workshops, pp 323\u2013330","DOI":"10.1109\/ICCVW.2013.50"},{"issue":"15","key":"4416_CR26","doi-asserted-by":"crossref","first-page":"9045","DOI":"10.1007\/s11042-015-2819-7","volume":"75","author":"I Mironic\u0103","year":"2016","unstructured":"Mironic\u0103 I, Du\u0163\u0103 IC, Ionescu B, Sebe N (2016) A modified vector of locally aggregated descriptors approach for fast video classification. Multimed Tools Appl 75(15):9045\u20139072","journal-title":"Multimed Tools Appl"},{"key":"4416_CR27","doi-asserted-by":"crossref","unstructured":"Oneata D, Verbeek J, Schmid C (2013) Action and event recognition with fisher vectors on a compact feature set. In: IEEE International Conference on Computer Vision, pp 1817\u20131824","DOI":"10.1109\/ICCV.2013.228"},{"key":"4416_CR28","doi-asserted-by":"crossref","unstructured":"Park E, Han X, Berg TL, Berg AC (2016) Combining multiple sources of knowledge in deep CNNs for action recognition. In: IEEE Winter Conference on Applications of Computer Vision, pp 1\u20138","DOI":"10.1109\/WACV.2016.7477589"},{"key":"4416_CR29","unstructured":"Simonyan K, Zisserman A (2014a) Two-stream convolutional networks for action recognition in videos. In: Neural Information Processing Systems, pp 568\u2013576"},{"key":"4416_CR30","unstructured":"Simonyan K, Zisserman A (2014b) Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv: http:\/\/arXiv.org\/abs\/14091556"},{"key":"4416_CR31","doi-asserted-by":"crossref","unstructured":"Snoek CG, Worring M, Smeulders AW (2005) Early versus late fusion in semantic video analysis. In: ACM International Conference on Multimedia, pp 399\u2013402","DOI":"10.1145\/1101149.1101236"},{"key":"4416_CR32","unstructured":"Soomro K, Zamir AR, Shah M (2012) UCF101: A dataset of 101 human actions classes from videos in the wild. CRCV-TR-12-01"},{"key":"4416_CR33","doi-asserted-by":"crossref","unstructured":"Tran D, Bourdev L, Fergus R, Torresani L, Paluri M (2015) Learning spatiotemporal features with 3d convolutional networks. In: IEEE International Conference on Computer Vision, pp 4489\u20134497","DOI":"10.1109\/ICCV.2015.510"},{"issue":"3","key":"4416_CR34","doi-asserted-by":"crossref","first-page":"151","DOI":"10.1023\/A:1009980820262","volume":"1","author":"CC Vogt","year":"1999","unstructured":"Vogt CC, Cottrell GW (1999) Fusion via a linear combination of scores. Inf Retr 1(3):151\u2013173","journal-title":"Inf Retr"},{"key":"4416_CR35","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In: IEEE International Conference on Computer Vision, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"4416_CR36","doi-asserted-by":"crossref","unstructured":"Wang H, Kl\u00e4ser A, Schmid C, Liu CL (2011) Action recognition by dense trajectories. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 3169\u20133176","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"4416_CR37","doi-asserted-by":"crossref","unstructured":"Wang H, Yi Y, Wu J (2015a) Human action recognition with trajectory based covariance descriptor in unconstrained videos. In: ACM International Conference on Multimedia, pp 1175\u20131178","DOI":"10.1145\/2733373.2806310"},{"issue":"3","key":"4416_CR38","doi-asserted-by":"crossref","first-page":"219","DOI":"10.1007\/s11263-015-0846-5","volume":"119","author":"H Wang","year":"2016","unstructured":"Wang H, Oneata D, Verbeek J, Schmid C (2016) A robust and efficient video representation for action recognition. Int J Comput Vis 119(3):219\u2013238","journal-title":"Int J Comput Vis"},{"key":"4416_CR39","doi-asserted-by":"crossref","unstructured":"Wang L, Qiao Y, Tang X (2015b) Action recognition with trajectory-pooled deep-convolutional descriptors. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 4305\u20134314","DOI":"10.1109\/CVPR.2015.7299059"},{"key":"4416_CR40","unstructured":"Wang L, Xiong Y, Wang Z, Qiao Y (2015c) Towards good practices for very deep two-stream convnets. arXiv preprint arXiv: 150702159"},{"key":"4416_CR41","doi-asserted-by":"crossref","unstructured":"Wu D, Shao L (2014) Multimodal dynamic networks for gesture recognition. In: ACM International Conference on Multimedia, pp 945\u2013948","DOI":"10.1145\/2647868.2654969"},{"issue":"4","key":"4416_CR42","doi-asserted-by":"crossref","first-page":"413","DOI":"10.1016\/j.ipm.2009.02.003","volume":"45","author":"S Wu","year":"2009","unstructured":"Wu S, Bi Y, Zeng X, Han L (2009) Assigning appropriate weights for the linear combination data fusion method in information retrieval. Inf Process Manag 45 (4):413\u2013426","journal-title":"Inf Process Manag"},{"issue":"10","key":"4416_CR43","doi-asserted-by":"crossref","first-page":"5701","DOI":"10.1007\/s11042-015-2536-2","volume":"75","author":"H Xu","year":"2016","unstructured":"Xu H, Tian Q, Wang Z, Wu J (2016) A survey on aggregating methods for action recognition with dense trajectories. Multimed Tools Appl 75(10):5701\u20135717","journal-title":"Multimed Tools Appl"},{"key":"4416_CR44","unstructured":"Ye G, Liu D, Jhuo IH, Chang SF et al (2012) Robust late fusion with rank minimization. In: IEEE Conference on Computer Vision and Pattern Recognition, pp 3021\u20133028"},{"key":"4416_CR45","doi-asserted-by":"crossref","unstructured":"Zach C, Pock T, Bischof H (2007) A duality based approach for realtime T V \u2212 L 1 optical flow. In: Joint Pattern Recognition Symposium, pp 214\u2013223","DOI":"10.1007\/978-3-540-74936-3_22"},{"key":"4416_CR46","doi-asserted-by":"crossref","unstructured":"Zhou X, Depeursinge A, M\u00fcller H (2010) Information fusion for combining visual and textual image retrieval. In: International Conference on Pattern Recognition, pp 1590\u20131593","DOI":"10.1109\/ICPR.2010.393"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-017-4416-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-4416-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-4416-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,6,22]],"date-time":"2024-06-22T11:44:12Z","timestamp":1719056652000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-017-4416-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,2,10]]},"references-count":46,"journal-issue":{"issue":"18","published-print":{"date-parts":[[2017,9]]}},"alternative-id":["4416"],"URL":"https:\/\/doi.org\/10.1007\/s11042-017-4416-4","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"type":"print","value":"1380-7501"},{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2017,2,10]]}}}