{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,24]],"date-time":"2026-02-24T10:58:25Z","timestamp":1771930705489,"version":"3.50.1"},"reference-count":63,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2016,2,25]],"date-time":"2016-02-25T00:00:00Z","timestamp":1456358400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"name":"Vietnam National University Ho Chi Minh City (VNU-HCM) Grant","award":["B2013-26-01"],"award-info":[{"award-number":["B2013-26-01"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2017,3]]},"DOI":"10.1007\/s11042-016-3331-4","type":"journal-article","created":{"date-parts":[[2016,2,25]],"date-time":"2016-02-25T05:17:58Z","timestamp":1456377478000},"page":"7041-7065","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":20,"title":["Evaluation of multiple features for violent scenes detection"],"prefix":"10.1007","volume":"76","author":[{"given":"Vu","family":"Lam","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sang","family":"Phan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Duy-Dinh","family":"Le","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Duc Anh","family":"Duong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shin\u2019ichi","family":"Satoh","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2016,2,25]]},"reference":[{"key":"3331_CR1","unstructured":"Acar E, Albayrak S (2014) Tub-irml at mediaeval 2014 violent scenes detection task: Violence modeling through feature space partitioning"},{"key":"3331_CR2","unstructured":"Aly R, Arandjelovic R, Chatfield K, Douze M, Fernando B, Harchaoui Z, McGuinness K, O\u2019Connor NE, Oneata D, Parkhi OM (2013) The axes submissions at trecvid"},{"key":"3331_CR3","unstructured":"Avila S, Moreira D, Perez M, Moraes D, Cota I, Testoni V, Valle E, Goldenstein S, Rocha A (2014) Recod at mediaeval 2014: Violent scenes detection task"},{"key":"3331_CR4","unstructured":"Bogdan I, Schluter J, Mironica I, Schedl M (2013) A naive mid-level concept-based fusion approach to violence detection in hollywood movies. In: ACM Conference on International Conference on Multimedia Retrieval, pp 215\u2013222"},{"key":"3331_CR5","doi-asserted-by":"crossref","unstructured":"Bosch A, Zisserman A, Mu\u00f1oz X (2006) Scene classification via plsa Computer vision\u2013ECCV 2006. Springer, pp 517\u2013530","DOI":"10.1007\/11744085_40"},{"key":"3331_CR6","doi-asserted-by":"crossref","unstructured":"Bosch A, Zisserman A, Muoz X (2007) Image classification using random forests and ferns. In: IEEE 11th international conference on Computer vision. ICCV 2007, pp 1\u20138. IEEE","DOI":"10.1109\/ICCV.2007.4409066"},{"issue":"1","key":"3331_CR7","doi-asserted-by":"crossref","first-page":"48","DOI":"10.1016\/j.cviu.2008.07.003","volume":"113","author":"GJ Burghouts","year":"2009","unstructured":"Burghouts GJ, Geusebroek JM (2009) Performance evaluation of local colour invariants. Comput Vis Image Underst 113(1):48\u201362","journal-title":"Comput Vis Image Underst"},{"key":"3331_CR8","unstructured":"Clarin C, Dionisio J, Echavez M, Naval PC (2005) Dove: Detection of movie violence using motion intensity analysis on skin and blood. Workshops and Demonstrations - ECCV:150\u2013156"},{"key":"3331_CR9","doi-asserted-by":"crossref","unstructured":"Cast\u00e1n D, Rodr\u00edguez M, Ortega A, Orrite C, Lleida E (2014) Vivolab and cvlab-mediaeval 2014: Violent scenes detection affect task","DOI":"10.1186\/s13636-014-0034-5"},{"key":"3331_CR10","unstructured":"Cdric P, Demarty CH, Gravier G, Gros P (2011) Technicolor and inria\/irisa at mediaeval 2011: Learning temporal modality integration with bayesian networks. In: MediaEval Multimedia Benchmark Workshop"},{"key":"3331_CR11","doi-asserted-by":"crossref","first-page":"27:1","DOI":"10.1145\/1961189.1961199","volume":"2","author":"CC Chang","year":"2011","unstructured":"Chang CC, Lin CJ (2011) LIBSVM: A library for support vector machines. ACM Trans Intell Syst Technol 2:27:1\u201327:27. Software available at http:\/\/www.csie.ntu.edu.tw\/~cjlin\/libsvm","journal-title":"ACM Trans Intell Syst Technol"},{"issue":"5","key":"3331_CR12","doi-asserted-by":"crossref","first-page":"1155","DOI":"10.1162\/neco.2007.19.5.1155","volume":"19","author":"O Chapelle","year":"2007","unstructured":"Chapelle O (2007) Training a support vector machine in the primal. Neural Comput 19(5):1155\u20131178","journal-title":"Neural Comput"},{"key":"3331_CR13","unstructured":"Csurka G, Dance C, Fan L, Willamowski J, Bray C (2004) Visual categorization with bags of keypoints. In: Workshop on statistical learning in computer vision, ECCV, vol 1, pp 1\u20132"},{"key":"3331_CR14","unstructured":"Dai Q, Tu J, Shi Z, Jiang YG, Xue X (2013) Fudan at mediaeval 2013: Violent scenes detection using motion features and part-level attributes. In: Mediaeval"},{"key":"3331_CR15","unstructured":"Dai Q, Wu Z, Jiang YG, Xue X, Tang J (2014) Fudan-njust at mediaeval 2014: Violent scenes detection using deep neural networks"},{"key":"3331_CR16","doi-asserted-by":"crossref","unstructured":"Demarty CH, Ionescu B, Jiang YG, Quang VL, Schedl M, Penet C (2014) Benchmarking violent scenes detection in movies. In: Content-based multimedia indexing (CBMI), 2014 12th international workshop on. IEEE, pp 1\u20136","DOI":"10.1109\/CBMI.2014.6849827"},{"key":"3331_CR17","unstructured":"Demarty CH, Penet C, Soleymani M, Gravier G (2014) Vsd, a public dataset for the detection of violent scenes in movies: design, annotation, analysis and evaluation. Multimedia Tools and Applications :1\u201326"},{"key":"3331_CR18","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li LJ, Li K, Fei-Fei L (2009) Imagenet: a large-scale hierarchical image database. In: IEEE conference on Computer vision and pattern recognition, 2009. CVPR 2009, pp 248\u2013255. IEEE","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"3331_CR19","unstructured":"Derbas N, Safadi B, Qu\u00e9not G, et al. (2013) Lig at mediaeval 2013 affect task: Use of a generic method and joint audio-visual words. In: Mediaeval. Citeseer"},{"key":"3331_CR20","unstructured":"Donahue J, Jia Y, Vinyals O, Hoffman J, Zhang N, Tzeng E, Darrell T (2013). Decaf: A deep convolutional activation feature for generic visual recognition. arXiv preprint arXiv: 1310.1531"},{"key":"3331_CR21","doi-asserted-by":"crossref","unstructured":"Harris ZS (1954) Distributional structure. Word","DOI":"10.1080\/00437956.1954.11659520"},{"issue":"5","key":"3331_CR22","doi-asserted-by":"publisher","first-page":"958","DOI":"10.1109\/TMM.2007.900150","volume":"9","author":"A Hauptmann","year":"2007","unstructured":"Hauptmann A, Yan R, Lin WH, Christel M, Wactlar H (2007) Can high-level concepts fill the semantic gap in video retrieval? a case study with broadcast news. IEEE Trans Multimedia 9(5):958\u2013966. doi: 10.1109\/TMM.2007.900150","journal-title":"IEEE Trans Multimedia"},{"issue":"6","key":"3331_CR23","first-page":"1088","volume":"6","author":"MH Hung","year":"2015","unstructured":"Hung MH, Pan JS (2015) A real-time action detection system for surveillance videos using template matching. Journal of Information Hiding and Multimedia Signal Processing 6(6):1088\u20131099","journal-title":"Journal of Information Hiding and Multimedia Signal Processing"},{"key":"3331_CR24","unstructured":"Jaakkola T, Haussler D et al. (1999) Exploiting generative models in discriminative classifiers. Advances in neural information processing systems:487\u2013493"},{"key":"3331_CR25","doi-asserted-by":"crossref","unstructured":"Jia Y, Shelhamer E, Donahue J, Karayev S, Long J, Girshick R, Guadarrama S, Darrell T (2014) Caffe: Convolutional architecture for fast feature embedding. In: Proceedings of the ACM international conference on multimedia. ACM, pp 675\u2013678","DOI":"10.1145\/2647868.2654889"},{"key":"3331_CR26","unstructured":"Jian L, Wang W (2009) Weakly-supervised violence detection in movies with audio and video based co-training. Advances in Multimedia Information Processing-PCM, pp 930\u2013935"},{"key":"3331_CR27","doi-asserted-by":"crossref","unstructured":"Jiang YG, Ngo CW, Yang J (2007) Towards optimal bag-of-features for object categorization and semantic video retrieval. In: Proceedings of the 6th ACM international conference on image and video retrieval. ACM, pp 494\u2013501","DOI":"10.1145\/1282280.1282352"},{"issue":"1","key":"3331_CR28","doi-asserted-by":"crossref","first-page":"42","DOI":"10.1109\/TMM.2009.2036235","volume":"12","author":"YG Jiang","year":"2010","unstructured":"Jiang YG, Yang J, Ngo CW, Hauptmann AG (2010) Representations of keypoint-based semantic concept detection: a comprehensive study. IEEE Trans Multimedia 12(1):42\u201353","journal-title":"IEEE Trans Multimedia"},{"key":"3331_CR29","unstructured":"Jiang YG, Zeng X, Ye G, Ellis D, Chang SF, Bhattacharya S, Shah M (2010) Columbia-ucf trecvid2010 multimedia event detection: Combining multiple modalities, contextual concepts, and temporal matching. In: TRECVID"},{"key":"3331_CR30","unstructured":"Jingen L, Kuipers B, Savarese S (2011) Recognizing human actions by attributes. IEEE Conf Comput Vis Pattern Recognit (CVPR):3337\u20133344"},{"key":"3331_CR31","unstructured":"Krizhevsky A, Sutskever I, Hinton GE (2012) Imagenet classification with deep convolutional neural networks. In: Advances in neural information processing systems, pp 1097\u20131105"},{"key":"3331_CR32","doi-asserted-by":"crossref","unstructured":"Lai PS, Cheng SS, Sun SY, Huang T, Su J, Xu YY, Chen Y, Chuang SC, Tseng C, Hsieh C (2005) Automated information mining on multimedia tv news archives. In: Knowledge-based intelligent information and engineering systems. Springer, pp 1238\u20131244","DOI":"10.1007\/11552451_171"},{"key":"3331_CR33","unstructured":"Lam V, Le DD, Le SP, Satoh S, Duong DA (2012) Nii, Japan at mediaeval 2012 violent scenes detection affect task. In: Mediaeval Citeseer"},{"key":"3331_CR34","unstructured":"Lam V, Le D, Phan S, Satoh S, Duong DA (2014) NII-UIT at mediaeval 2014 violent scenes detection affect task"},{"key":"3331_CR35","doi-asserted-by":"crossref","unstructured":"Lazebnik S, Schmid C, Ponce J (2006) Beyond bags of features: Spatial pyramid matching for recognizing natural scene categories. In: IEEE computer society conference on Computer vision and pattern recognition, 2006, vol 2, pp 2169\u20132178. IEEE","DOI":"10.1109\/CVPR.2006.68"},{"key":"3331_CR36","unstructured":"Li-Jia L, Su H, Fei-Fei L, Xing EP (2010) Object bank: a high-level image representation for scene classification & semantic feature sparsification. Advances in Neural Information Processing Systems:1378\u20131386"},{"key":"3331_CR37","unstructured":"Liang-Hua C, Hsu HW, Wang LY, Su CW (2011) Violence detection in movies. Computer Graphics Imaging and Visualization (CGIV):119\u2013124"},{"issue":"4","key":"3331_CR38","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1023\/B:BTTJ.0000047600.45421.6d","volume":"22","author":"H Liu","year":"2004","unstructured":"Liu H, Singh P (2004) Conceptneta practical commonsense reasoning tool-kit. BT technology journal 22(4):211\u2013226","journal-title":"BT technology journal"},{"issue":"5","key":"3331_CR39","first-page":"977","volume":"6","author":"XF Liu","year":"2015","unstructured":"Liu XF, Zhu XX (2015) Parallel feature extraction through preserving global and discriminative property for kernel-based image classification. Journal of Information Hiding and Multimedia Signal Processing 6(5):977\u2013986","journal-title":"Journal of Information Hiding and Multimedia Signal Processing"},{"issue":"2","key":"3331_CR40","doi-asserted-by":"crossref","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe DG (2004) Distinctive image features from scale-invariant keypoints. Int J Comput Vis 60(2):91\u2013110","journal-title":"Int J Comput Vis"},{"key":"3331_CR41","doi-asserted-by":"publisher","unstructured":"Ma Z, Yang Y, Cai Y, Sebe N, Hauptmann AG (2012) Knowledge adaptation for ad hoc multimedia event detection with few exemplars. In: Proceedings of the 20th ACM International Conference on Multimedia, MM \u201912 , pp 469\u2013478. doi: 10.1145\/2393347.2393414","DOI":"10.1145\/2393347.2393414"},{"issue":"1","key":"3331_CR42","doi-asserted-by":"crossref","first-page":"88","DOI":"10.1109\/TMM.2011.2168948","volume":"14","author":"M Merler","year":"2012","unstructured":"Merler M, Huang B, Xie L, Hua G, Natsev A (2012) Semantic model vectors for complex video event recognition. IEEE Trans Multimedia 14(1):88\u2013101","journal-title":"IEEE Trans Multimedia"},{"key":"3331_CR43","doi-asserted-by":"crossref","unstructured":"Mikolajczyk K, Schmid C (2002) An affine invariant interest point detector. In: Computer VisionECCV 2002. Springer, pp 128\u2013142","DOI":"10.1007\/3-540-47969-4_9"},{"issue":"1","key":"3331_CR44","doi-asserted-by":"crossref","first-page":"17","DOI":"10.1007\/s00138-013-0527-8","volume":"25","author":"GK Myers","year":"2014","unstructured":"Myers GK, Nallapati R, van Hout J, Pancoast S, Nevatia R, Sun C, Habibian A, Koelma DC, van de Sande KE, Smeulders AW (2014) Evaluating multimedia features and fusion for example-based event detection. Mach Vis Appl 25 (1):17\u201332","journal-title":"Mach Vis Appl"},{"key":"3331_CR45","doi-asserted-by":"crossref","unstructured":"Nam J, Alghoniemy M, Tewfik AH (1998) Audio-visual content-based violent scene characterization. In: Image processing, 1998. ICIP 98. Proceedings. 1998 international conference on. IEEE, vol 1, pp 353\u2013357","DOI":"10.1109\/ICIP.1998.723496"},{"key":"3331_CR46","unstructured":"Nascimento do, Teixeira B (2014) Mtm at mediaeval 2014 violence detection task"},{"key":"3331_CR47","doi-asserted-by":"crossref","unstructured":"Oh S, McCloskey S, Kim I, Vahdat A, Cannons KJ, Hajimirsadeghi H, Mori G, Perera AA, Pandey M, Corso JJ (2014) Multimedia event detection with multimodal feature fusion and temporal concept localization. Mach Vis Appl 25 (1):49\u201369","DOI":"10.1007\/s00138-013-0525-x"},{"key":"3331_CR48","unstructured":"Oneata D, Verbeek J, Schmid C (2014) The lear submission at thumos"},{"key":"3331_CR49","unstructured":"Penet C, Demarty CH, Gravier G, Gros P, et al. (2013) Technicolor\/inria team at the mediaeval 2013 violent scenes detection task. In: MediaEval 2013 Working Notes"},{"key":"3331_CR50","doi-asserted-by":"crossref","unstructured":"Perronnin F, S\u00e1nchez J, Mensink T (2010) Improving the fisher kernel for large-scale image classification. In: Computer vision\u2013ECCV 2010. Springer, pp 143\u2013156","DOI":"10.1007\/978-3-642-15561-1_11"},{"issue":"1","key":"3331_CR51","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1561\/2000000001","volume":"1","author":"LR Rabiner","year":"2007","unstructured":"Rabiner LR, Schafer RW (2007) Introduction to digital speech processing. Foundations and trends in signal processing 1(1):1\u2013194","journal-title":"Foundations and trends in signal processing"},{"key":"3331_CR52","doi-asserted-by":"crossref","unstructured":"Sadanand S, Corso JJ (2012) Action bank: a high-level representation of activity in video. In: Computer vision and pattern recognition (CVPR), 2012 IEEE conference on. IEEE, pp 1234\u20131241","DOI":"10.1109\/CVPR.2012.6247806"},{"issue":"3","key":"3331_CR53","doi-asserted-by":"crossref","first-page":"222","DOI":"10.1007\/s11263-013-0636-x","volume":"105","author":"J S\u00e1nchez","year":"2013","unstructured":"S\u00e1nchez J, Perronnin F, Mensink T, Verbeek J (2013) Image classification with the fisher vector: Theory and practice. Int J Comput Vis 105(3):222\u2013245","journal-title":"Int J Comput Vis"},{"issue":"4","key":"3331_CR54","doi-asserted-by":"crossref","first-page":"591","DOI":"10.1109\/TPAMI.2008.111","volume":"31","author":"J Sivic","year":"2009","unstructured":"Sivic J, Zisserman A (2009) Efficient visual search of videos cast as text retrieval. IEEE Trans Pattern Anal Mach Intell 31(4):591\u2013606","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"3331_CR55","unstructured":"Sj\u00f6berg M, Schl\u00fcter J, Ionescu B, Schedl M (2013) Far at mediaeval 2013 violent scenes detection: Concept-based violent scenes detection in movies. In: Mediaeval"},{"key":"3331_CR56","unstructured":"Sj\u00f6berg M, Mironica I, Schedl M, Ionescu B (2014) Far at mediaeval 2014 violent scenes detection: A concept-based fusion approach"},{"key":"3331_CR57","doi-asserted-by":"crossref","unstructured":"Snoek CG, Worring M, Smeulders AW (2005) Early versus late fusion in semantic video analysis. In: Proceedings of the 13th annual ACM international conference on multimedia. ACM, pp 399\u2013402","DOI":"10.1145\/1101149.1101236"},{"key":"3331_CR58","doi-asserted-by":"crossref","unstructured":"Sun C, Nevatia R (2013) Large-scale web video event classification by use of fisher vectors. In: Applications of computer vision (WACV), 2013 IEEE workshop on. IEEE, pp 15\u201322","DOI":"10.1109\/WACV.2013.6474994"},{"key":"3331_CR59","unstructured":"Tan CC, Ngo CW (2013) The vireo team at mediaeval 2013: Violent scenes detection by mid-level concepts learnt from youtube. In: Mediaeval"},{"key":"3331_CR60","unstructured":"Tv and movie violence (2010) Why watching it is harmful to children. http:\/\/www.ocd.pitt.edu\/Files\/PDF\/Parenting\/TvAndMovieViolence.pdf . Accessed 10 Jan 2015"},{"key":"3331_CR61","doi-asserted-by":"crossref","unstructured":"Wang H, Schmid C (2013) Action recognition with improved trajectories. In: Computer vision (ICCV), 2013 IEEE international conference on. IEEE, pp 3551\u20133558","DOI":"10.1109\/ICCV.2013.441"},{"key":"3331_CR62","unstructured":"Yu G, Wang W, Jiang S, Huang Q, Gao W (2008) Detecting violent scenes in movies by auditory and visual cues. Advances in Multimedia Information Processing-PCM:317\u2013326"},{"key":"3331_CR63","unstructured":"Zhang B, Yi Y, Wang H, Yu J (2014) Mic-tju at mediaeval violent scenes detection (vsd) 2014"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-016-3331-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-016-3331-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-016-3331-4","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-016-3331-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,9,4]],"date-time":"2019-09-04T23:50:58Z","timestamp":1567641058000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-016-3331-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,2,25]]},"references-count":63,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2017,3]]}},"alternative-id":["3331"],"URL":"https:\/\/doi.org\/10.1007\/s11042-016-3331-4","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,2,25]]}}}