{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T10:24:58Z","timestamp":1778840698452,"version":"3.51.4"},"reference-count":43,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2017,8,10]],"date-time":"2017-08-10T00:00:00Z","timestamp":1502323200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2018,2]]},"DOI":"10.1007\/s11042-017-5058-2","type":"journal-article","created":{"date-parts":[[2017,8,10]],"date-time":"2017-08-10T15:20:54Z","timestamp":1502378454000},"page":"3209-3227","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["Complex event detection via attention-based video representation and classification"],"prefix":"10.1007","volume":"77","author":[{"given":"Zhicheng","family":"Zhao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rui","family":"Xiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fei","family":"Su","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,8,10]]},"reference":[{"key":"5058_CR1","doi-asserted-by":"crossref","unstructured":"Arandjelovic R, Zisserman A (2013) All about VLAD. IEEE Conference on Computer Vision and Pattern Recognition, Portland, pp 1578\u20131585.","DOI":"10.1109\/CVPR.2013.207"},{"key":"5058_CR2","unstructured":"Chang X, Yang Y, Xing EP, Yu Y (2015) Complex event detection using semantic saliency and nearly-isotonic SVM. IEEE Conference on Machine Learning, Lille, pp 1348\u20131357."},{"key":"5058_CR3","doi-asserted-by":"crossref","unstructured":"Chang X, Yu Y, Yang Y, Hauptmann A (2015) Searching persuasively: joint event detection and evidence recounting with limited supervision. ACM Multimedia, Brisbane, pp 581\u2013590.","DOI":"10.1145\/2733373.2806218"},{"key":"5058_CR4","doi-asserted-by":"crossref","unstructured":"Chang X, Yang Y, Long G, Zhang C, Hauptmann A (2016) Dynamic concept composition for zero-example event detection. AAAI International Conference on Artificial Intelligence, Phoenix, pp 3464\u20133470.","DOI":"10.1609\/aaai.v30i1.10474"},{"key":"5058_CR5","doi-asserted-by":"crossref","unstructured":"Chang X, Yu Y, Yang Y, Xing E (2016) They are not equally reliable: semantic event search using differentiated concept classifiers. IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, pp 1884\u20131893.","DOI":"10.1109\/CVPR.2016.208"},{"issue":"8","key":"5058_CR6","doi-asserted-by":"publisher","first-page":"1617","DOI":"10.1109\/TPAMI.2016.2608901","volume":"39","author":"X Chang","year":"2017","unstructured":"Chang X, Yu Y, Yang Y, Xing EP (2017) Semantic pooling for complex event analysis in untrimmed videos. IEEE Trans Pattern Anal Mach Intell 39(8):1617\u20131632","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"5","key":"5058_CR7","doi-asserted-by":"publisher","first-page":"1180","DOI":"10.1109\/TCYB.2016.2539546","volume":"47","author":"X Chang","year":"2017","unstructured":"Chang X, Ma Z, Yang Y, Zeng Z, Hauptmann A (2017) Bi-level semantic representation analysis for multimedia event detection. IEEE Trans Cybern 47(5):1180\u20131197","journal-title":"IEEE Trans Cybern"},{"key":"5058_CR8","unstructured":"Dai J, Li Y, He K, Sun J (2016) R-FCN: object detection via region-based fully convolutional networks. Annual Conference on Neural Information Processing Systems, Barcelona, pp 379\u2013387."},{"key":"5058_CR9","first-page":"1871","volume":"9","author":"R Fan","year":"2008","unstructured":"Fan R, Chang K, Hsieh C, Wang X, Lin C (2008) LIBLINEAR: a library for large linear classification. Int J Mach Learn Res 9:1871\u20131874","journal-title":"Int J Mach Learn Res"},{"issue":"10","key":"5058_CR10","doi-asserted-by":"publisher","first-page":"2451","DOI":"10.1162\/089976600300015015","volume":"12","author":"FA Gers","year":"2000","unstructured":"Gers FA, Schmidhuber J, Cummins FA (2000) Learning to forget: continual prediction with LSTM. Neural Comput 12(10):2451\u20132471","journal-title":"Neural Comput"},{"key":"5058_CR11","doi-asserted-by":"crossref","unstructured":"Gidaris S, Komodakis N (2015) Object detection via a multi-region and semantic segmentation-aware CNN model. IEEE International Conference on Computer Vision, Santiago, pp 1134\u20131142.","DOI":"10.1109\/ICCV.2015.135"},{"key":"5058_CR12","doi-asserted-by":"crossref","unstructured":"Gkalelis N, Mezaris V (2014) Video event detection using generalized subclass discriminant analysis and linear support vector machines. ACM International Conference on Multimedia Retrieval, Glasgow, p 25.","DOI":"10.1145\/2578726.2578745"},{"issue":"9","key":"5058_CR13","doi-asserted-by":"publisher","first-page":"1904","DOI":"10.1109\/TPAMI.2015.2389824","volume":"37","author":"K He","year":"2015","unstructured":"He K, Zhang X, Ren S, Sun J (2015) Spatial pyramid pooling in deep convolutional networks for visual recognition. IEEE Trans Pattern Anal Mach Intell 37(9):1904\u20131916","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"5058_CR14","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, pp 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"5058_CR15","doi-asserted-by":"crossref","unstructured":"Jia Y, Shelhamer E, Donahue J et al (2014) Caffe: convolutional architecture for fast feature embedding. ACM Multimedia, Orlando, pp 675\u2013678.","DOI":"10.1145\/2647868.2654889"},{"key":"5058_CR16","doi-asserted-by":"crossref","unstructured":"Jiang Y, Ye G, Chang S et al (2011) Consumer video understanding: a benchmark database and an evaluation of human and machine performance. ACM International Conference on Multimedia Retrieval, Trento, p 29.","DOI":"10.1145\/1991996.1992025"},{"key":"5058_CR17","doi-asserted-by":"crossref","unstructured":"Karpathy A, Toderici G, Shetty S et al (2014) Large-scale video classification with convolutional neural networks. IEEE Conference on Computer Vision and Pattern Recognition, Columbus, pp 1725\u20131732.","DOI":"10.1109\/CVPR.2014.223"},{"key":"5058_CR18","doi-asserted-by":"crossref","unstructured":"Karthikeyan S, Ngo T, Eckstein M, Manjunath B (2015) Eye tracking assisted extraction of attentionally important objects from videos. IEEE Conference on Computer Vision and Pattern Recognition, Boston, pp 3241\u20133250.","DOI":"10.1109\/CVPR.2015.7298944"},{"key":"5058_CR19","doi-asserted-by":"publisher","first-page":"675","DOI":"10.1007\/978-3-319-10578-9_44","volume-title":"Computer Vision \u2013 ECCV 2014","author":"Kuan-Ting Lai","year":"2014","unstructured":"Lai K, Liu D, Chen M, Chang S (2014) Recognizing complex events in videos by learning key static-dynamic evidences. European Conference on Computer Vision, Zurich, pp 675\u2013688."},{"key":"5058_CR20","doi-asserted-by":"crossref","unstructured":"Li W, Yu Q, Divakaran A, Vasconcelos N (2013) Dynamic pooling for complex event recognition. IEEE International Conference on Computer Vision, Sydney, pp 2728\u20132735.","DOI":"10.1109\/ICCV.2013.339"},{"key":"5058_CR21","doi-asserted-by":"crossref","unstructured":"Liu G, Yan Y, Gao C, Tong W, Hauptmann A, Sebe N (2014) The mystery of faces: investigating face contribution for multimedia event detection. ACM International Conference on Multimedia Retrieval, Glasgow, p 467.","DOI":"10.1145\/2578726.2578795"},{"key":"5058_CR22","unstructured":"Luisier F, Tickoo M, Andrews W, Ye G, Liu D, Chang S et al (2014) BBN VISER TRECVID 2014 multimedia event detection and multimedia event recounting systems. In TRECVID 2014 workshop, Orlando, FL, USA."},{"issue":"9","key":"5058_CR23","doi-asserted-by":"publisher","first-page":"1789","DOI":"10.1109\/TPAMI.2014.2306419","volume":"36","author":"Z Ma","year":"2014","unstructured":"Ma Z, Yang Y, Sebe N, Hauptmann A (2014) Knowledge adaptation with partially shared features for event detection using few exemplars. IEEE Trans Pattern Anal Mach Intell 36(9):1789\u20131802","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"3","key":"5058_CR24","doi-asserted-by":"publisher","first-page":"476","DOI":"10.3758\/BF03198264","volume":"7","author":"M Martin","year":"1979","unstructured":"Martin M (1979) Local and global precessing: the role of sparisty. Mem Cogn 7(3):476\u2013484","journal-title":"Mem Cogn"},{"key":"5058_CR25","doi-asserted-by":"crossref","unstructured":"Mettes P, Koelma D, Snoek C (2016) The ImageNet shuffle: reorganized pre-training for video event detection. ACM International Conference on Multimedia Retrieval, New York, pp 175\u2013182.","DOI":"10.1145\/2911996.2912036"},{"key":"5058_CR26","unstructured":"Ng J, Hausknecht M, Vijayanarasimhan S et al (2015) Beyond short snippets: deep networks for video classification. IEEE Conference on Computer Vision and Pattern Recognition, Boston, pp 4694\u20134702."},{"issue":"4","key":"5058_CR27","first-page":"512","volume":"112","author":"JR Pomerantz","year":"1983","unstructured":"Pomerantz JR (1983) Global and local precedence: selective attention in form and motion perception. Int J Exp Psychol Gen 112(4):512\u2013540","journal-title":"Int J Exp Psychol Gen"},{"key":"5058_CR28","doi-asserted-by":"crossref","unstructured":"Redmon J, Divvala SK, Girshick RB, Farhadi A (2016) You only look once: unified, real-time object detection. IEEE Conference on Computer Vision and Pattern Recognition, Las Vegas, pp 779\u2013788.","DOI":"10.1109\/CVPR.2016.91"},{"key":"5058_CR29","unstructured":"Simonyan K, Zisserman A (2014) Very deep convolutional networks for large-scale image recognition. CoRR abs\/1409.1556."},{"key":"5058_CR30","doi-asserted-by":"crossref","unstructured":"Szegedy C, Liu W, Jia Y, Sermanet P, Reed SE, Anguelov D, Erhan D, Vanhoucke V, Rabinovich A (2015) Going deeper with convolutions. IEEE Conference on Computer Vision and Pattern Recognition, Boston, pp 1\u20139.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"5058_CR31","doi-asserted-by":"crossref","unstructured":"Tang KD, Li F, Koller D (2012) Learning latent temporal structure for complex event detection. IEEE Conference on Computer Vision and Pattern Recognition, Providence, pp 1250\u20131257.","DOI":"10.1109\/CVPR.2012.6247808"},{"issue":"3","key":"5058_CR32","doi-asserted-by":"publisher","first-page":"282","DOI":"10.1037\/h0027242","volume":"76","author":"AM Treisman","year":"1969","unstructured":"Treisman AM (1969) Strategies and models of selective attention. Psychol Rev 76(3):282\u2013299","journal-title":"Psychol Rev"},{"key":"5058_CR33","doi-asserted-by":"publisher","first-page":"575","DOI":"10.1038\/21176","volume":"399","author":"S Treue","year":"1999","unstructured":"Treue S, Martinez T (1999) Feature-based attention influences motion processing gain in macaque visual cortex. Nature 399:575\u2013579","journal-title":"Nature"},{"key":"5058_CR34","doi-asserted-by":"crossref","unstructured":"Vedaldi A, Fulkerson B (2010) Vlfeat: an open and portable library of computer vision algorithms. ACM Multimedia, Firenze, pp 1469\u20131472.","DOI":"10.1145\/1873951.1874249"},{"key":"5058_CR35","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. IEEE International Conference on Computer Vision, Sydney, pp 3551\u20133558.","DOI":"10.1109\/ICCV.2013.441"},{"issue":"1","key":"5058_CR36","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"Wang H, Kl\u00e4ser A, Schmid C (2013) Dense trajectories and motion boundary descriptors for action recognition. Int J Comput Vis 103(1):60\u201379","journal-title":"Int J Comput Vis"},{"key":"5058_CR37","doi-asserted-by":"crossref","unstructured":"Wang L, Qiao Y, Tang X (2015) Action recognition with trajectory-pooled deep-convolutional descriptors. IEEE Conference on Computer Vision and Pattern Recognition, Boston, pp 4305\u20134314.","DOI":"10.1109\/CVPR.2015.7299059"},{"key":"5058_CR38","doi-asserted-by":"crossref","unstructured":"Xu Z, Yang Y, Hauptmann A (2015) A discriminative CNN video representation for event detection. IEEE Conference on Computer Vision and Pattern Recognition, Boston, pp 1798\u20131807.","DOI":"10.1109\/CVPR.2015.7298789"},{"key":"5058_CR39","doi-asserted-by":"crossref","unstructured":"Ye G, Jhuo I, Liu D, Jiang Y, Lee D, Chang S (2012) Joint audio-visual bi-modal codewords for video event detection. ACM International Conference on Multimedia Retrieval, Hong Kong, p 39.","DOI":"10.1145\/2324796.2324843"},{"key":"5058_CR40","doi-asserted-by":"crossref","unstructured":"Ye H, Wu Z, Zhao R, Wang X, Jiang Y, Xue X (2015) Evaluating two-stream CNN for video classification. . ACM International Conference on Multimedia Retrieval, Shanghai, pp 435\u2013442.","DOI":"10.1145\/2671188.2749406"},{"key":"5058_CR41","doi-asserted-by":"crossref","unstructured":"Younessian E, Mitamura T, Hauptmann A (2012) Multimodal knowledge-based analysis in multimedia event detection. ACM International Conference on Multimedia Retrieval, Hong Kong, p 5.","DOI":"10.1145\/2324796.2324855"},{"key":"5058_CR42","doi-asserted-by":"crossref","unstructured":"Yu Q, Liu J, Cheng H, Divakaran A, Sawhney H (2013) Semantic pooling for complex event detection. ACM Multimedia, Barcelona, pp 733\u2013736.","DOI":"10.1145\/2502081.2502191"},{"key":"5058_CR43","doi-asserted-by":"publisher","first-page":"378","DOI":"10.1016\/j.neucom.2016.06.002","volume":"208","author":"Z Zhao","year":"2016","unstructured":"Zhao Z, Song Y, Su F (2016) Specific video identification via joint learning of latent semantic concept, scene and temporal structure. Neurocomputing 208:378\u2013386","journal-title":"Neurocomputing"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-017-5058-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-5058-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-5058-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,1]],"date-time":"2022-08-01T00:31:09Z","timestamp":1659313869000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-017-5058-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,8,10]]},"references-count":43,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2018,2]]}},"alternative-id":["5058"],"URL":"https:\/\/doi.org\/10.1007\/s11042-017-5058-2","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017,8,10]]},"assertion":[{"value":"1 May 2017","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 July 2017","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 July 2017","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 August 2017","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}