{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,4]],"date-time":"2026-04-04T06:15:04Z","timestamp":1775283304886,"version":"3.50.1"},"reference-count":169,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2014,10,5]],"date-time":"2014-10-05T00:00:00Z","timestamp":1412467200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2016,1]]},"DOI":"10.1007\/s11042-014-2292-8","type":"journal-article","created":{"date-parts":[[2014,10,4]],"date-time":"2014-10-04T04:07:02Z","timestamp":1412395622000},"page":"297-331","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":17,"title":["Towards large-scale multimedia retrieval enriched by knowledge about human interpretation"],"prefix":"10.1007","volume":"75","author":[{"given":"Kimiaki","family":"Shirahama","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Marcin","family":"Grzegorzek","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2014,10,5]]},"reference":[{"key":"2292_CR1","doi-asserted-by":"crossref","unstructured":"Adams B, Dorai C, Venkatesh S (2000) Novel approach to determining tempo and dramatic story sections in motion pictures. In: Proceedings of ICIP 2000, pp 283\u2013286","DOI":"10.1109\/ICIP.2000.899358"},{"issue":"7","key":"2292_CR2","doi-asserted-by":"crossref","first-page":"2801","DOI":"10.1016\/j.camwa.2011.07.046","volume":"62","author":"NK Alham","year":"2011","unstructured":"Alham NK, Li M, Liu Y, Hammoud S (2011) A Map Reduce-based distributed SVM algorithm for automatic image annotation. Comput Math Appl 62(7):2801\u20132811","journal-title":"Comput Math Appl"},{"issue":"1","key":"2292_CR3","first-page":"7","volume":"28","author":"ML Anderson","year":"2007","unstructured":"Anderson ML, Oates T (2007) A review of recent research in metareasoning and metalearning. AI Mag 28(1):7\u201316","journal-title":"AI Mag"},{"key":"2292_CR4","doi-asserted-by":"crossref","unstructured":"Ando R, Shinoda K, Furui S, Mochizuki T (2006) Robust scene recognition using language models for scene contexts. In: Proceedings of MIR 2006, pp 99\u2013106","DOI":"10.1145\/1178677.1178693"},{"key":"2292_CR5","doi-asserted-by":"crossref","unstructured":"Arandjelovic R, Zisserman A (2013) All about VLAD. In: Proceedings of CVPR 2013, pp 1578\u20131585","DOI":"10.1109\/CVPR.2013.207"},{"key":"2292_CR6","doi-asserted-by":"crossref","unstructured":"Ayache S, Qu\u00e9not G (2008) Video corpus annotation using active learning. In: Proceedings of ECIR 2008, pp 187\u2013198","DOI":"10.1007\/978-3-540-78646-7_19"},{"key":"2292_CR7","doi-asserted-by":"crossref","unstructured":"Barrett S, Chang R, Qi X (2009) A fuzzy combined learning approach to content-based image retrieval. In: Proceedings of ICME 2009, pp 838\u2013841","DOI":"10.1109\/ICME.2009.5202625"},{"key":"2292_CR8","doi-asserted-by":"crossref","unstructured":"Barrington L, O\u2019Malley D, Turnbull D, Lanckriet G (2009) User-centered design of a social game to tag music. In: Proceedings of HCOMP 2009, pp 7\u201310","DOI":"10.1145\/1600150.1600152"},{"key":"2292_CR9","doi-asserted-by":"crossref","unstructured":"Bay H, Tuytelaars T, Gool L (2006) SURF: speeded up robust features. In: Proceedings of ECCV 2006, pp 404\u2013417","DOI":"10.1007\/11744023_32"},{"key":"2292_CR10","doi-asserted-by":"crossref","unstructured":"Bell M, Reeves S, Brown B, Sherwood S, MacMillan D, Ferguson J, Chalmers M (2009) EyeSpy: supporting navigation through play. In: Proceedings of CHI 2009, pp 123\u2013132","DOI":"10.1145\/1518701.1518723"},{"issue":"1","key":"2292_CR11","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1561\/2200000006","volume":"2","author":"Y Bengio","year":"2009","unstructured":"Bengio Y (2009) Learning deep architectures for AI. Found Trends Mach Learn 2(1):1\u2013127","journal-title":"Found Trends Mach Learn"},{"key":"2292_CR12","doi-asserted-by":"crossref","unstructured":"Bengio Y, Louradour J, Collobert R, Weston J (2009) Curriculum learning. In: Proceedings of ICML 2009, pp 41\u201348","DOI":"10.1145\/1553374.1553380"},{"issue":"8","key":"2292_CR13","doi-asserted-by":"crossref","first-page":"1798","DOI":"10.1109\/TPAMI.2013.50","volume":"35","author":"Y Bengio","year":"2013","unstructured":"Bengio Y, Courville A, Vincent P (2013) Representation learning: a review and new perspectives. IEEE Trans Pattern Anal Mach Intell 35(8):1798\u20131828","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2292_CR14","unstructured":"Bensusan H, Giraud-Carrier CG, Kennedy CJ (2000) A higher-order approach to meta-learning. In: Proceedings of ILP 2000"},{"issue":"1","key":"2292_CR15","doi-asserted-by":"crossref","first-page":"35","DOI":"10.1007\/s11042-010-0645-5","volume":"51","author":"C Bhatt","year":"2011","unstructured":"Bhatt C, Kankanhalli M (2011) Multimedia data mining: state of the art and challenges. Multimed Tools Appl 51(1):35\u201376","journal-title":"Multimed Tools Appl"},{"key":"2292_CR16","doi-asserted-by":"crossref","unstructured":"Biswas A, Parikh D (2013) Simultaneous active learning of classifiers & attributes via relative feedback. In: Proceedings of CVPR 2013, pp 644\u2013651","DOI":"10.1109\/CVPR.2013.89"},{"key":"2292_CR17","doi-asserted-by":"crossref","unstructured":"Borth D, Ji R, Chen T, Breuel T, Chang SF (2013) Large-scale visual sentiment ontology and detectors using adjective noun pairs. In: Proceedings of MM 2013, pp 223\u2013232","DOI":"10.1145\/2502081.2502282"},{"key":"2292_CR18","doi-asserted-by":"crossref","unstructured":"Catanzaro B, Sundaram N, Keutzer K (2008) Fast support vector machine training and classification on graphics processors. In: Proceedings of ICML 2008, pp 104\u2013111","DOI":"10.1145\/1390156.1390170"},{"key":"2292_CR19","doi-asserted-by":"crossref","unstructured":"Chai Y, Lempitsky V, Zisserman A (2013) Symbiotic segmentation and part localization for fine-grained categorization. In: Proceedings of ICCV 2013, pp 321\u2013328","DOI":"10.1109\/ICCV.2013.47"},{"key":"2292_CR20","doi-asserted-by":"crossref","unstructured":"Chen N, Zhou Q-Y, Prasanna V (2012) Understanding web images by object relation network.. In: Proceedings of WWW 2012, pp 291\u2013300","DOI":"10.1145\/2187836.2187876"},{"key":"2292_CR21","doi-asserted-by":"crossref","unstructured":"Chen X, Shrivastava A, Gupta A (2013) NEIL: extracting visual knowledge from web data. In: Proceedings of ICCV 2013, pp 1409\u20131416","DOI":"10.1109\/ICCV.2013.178"},{"key":"2292_CR22","first-page":"281","volume-title":"NIPS 19","author":"C Chu","year":"2007","unstructured":"Chu C, et al. (2007) Map-Reduce for machine learning on multicore. In: Sch\u00f6lkopf B, Platt J, Hoffman T (eds) NIPS 19. Birkha\u00fcser, Cambridge, pp 281\u2013288"},{"key":"2292_CR23","unstructured":"Csurka G, Bray C, Dance C, Fan L (2004) Visual categorization with bags of keypoints. In: Proceedings of ECCV 2004 SLCV, pp 1\u201322"},{"issue":"2","key":"2292_CR24","doi-asserted-by":"crossref","first-page":"5:1","DOI":"10.1145\/1348246.1348248","volume":"40","author":"R Datta","year":"2008","unstructured":"Datta R, Joshi D, Li J, Wang JZ (2008) Image retrieval: ideas, influences, and trends of the new age. ACM Comput Surv 40(2):5:1\u20135:60","journal-title":"ACM Comput Surv"},{"key":"2292_CR25","doi-asserted-by":"crossref","unstructured":"Deng J, Dong W, Socher R, Li LJ, Li K, Fei-Fei L (2009) ImageNet: a large-scale hierarchical image database. In: Proceedings of CVPR 2009, pp 248\u2013255","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"2292_CR26","doi-asserted-by":"crossref","unstructured":"Deng J, Berg A, Li FF (2011) Hierarchical semantic indexing for large scale image retrieval. In: Proceedings of CVPR 2011, pp 785\u2013792","DOI":"10.1109\/CVPR.2011.5995516"},{"issue":"1","key":"2292_CR27","doi-asserted-by":"crossref","first-page":"119","DOI":"10.1109\/TKDE.2011.201","volume":"25","author":"T Denoeux","year":"2013","unstructured":"Denoeux T (2013) Maximum likelihood estimation from uncertain data in the belief function framework. IEEE Trans Knowl Data Eng 25(1):119\u2013130","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"2292_CR28","unstructured":"Djordjevic D, Izquierdo E, Grzegorzek M (2007) User driven systems to bridge the semantic gap. In: Proceedings of EUSIPCO 2007, pp 718\u2013722"},{"key":"2292_CR29","first-page":"1889","volume":"6","author":"RE Fan","year":"2005","unstructured":"Fan RE, Chen PH, Lin CJ (2005) Working set selection using second order information for training support vector machines. J Mach Learn Res 6:1889\u20131918","journal-title":"J Mach Learn Res"},{"key":"2292_CR30","doi-asserted-by":"crossref","unstructured":"Farhadi A, Endres I, Hoiem D, Forsyth D (2009) Describing objects by their attributes. In: Proceedings of CVPR 2009, pp 1778\u20131785","DOI":"10.1109\/CVPR.2009.5206772"},{"key":"2292_CR31","doi-asserted-by":"crossref","unstructured":"Fellbaum C (ed) (1998) WordNet: an electronic lexical database. MIT Press, Cambridge","DOI":"10.7551\/mitpress\/7287.001.0001"},{"issue":"9","key":"2292_CR32","doi-asserted-by":"crossref","first-page":"1627","DOI":"10.1109\/TPAMI.2009.167","volume":"32","author":"P Felzenszwalb","year":"2010","unstructured":"Felzenszwalb P, Girshick R, McAllester D, Ramanan D (2010) Object detection with discriminatively trained part-based models. IEEE Trans Pattern Anal Mach Intell 32(9):1627\u20131645","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"4","key":"2292_CR33","doi-asserted-by":"crossref","first-page":"76","DOI":"10.1109\/MMUL.2005.87","volume":"12","author":"A Fran\u00e7ois","year":"2005","unstructured":"Fran\u00e7ois A, Nevatia R, Hobbs J, Bolles R, Smith J (2005) VERL: an ontology framework for representing and annotating video events. IEEE Multimed 12(4):76\u201386","journal-title":"IEEE Multimed"},{"key":"2292_CR34","doi-asserted-by":"crossref","first-page":"6:1","DOI":"10.1145\/1658349.1658355","volume":"7","author":"S Frintrop","year":"2010","unstructured":"Frintrop S, Rome E, Christensen HI (2010) Computational visual attention systems and their cognitive foundations: a survey. ACM Trans Appl Percept 7:6:1\u20136:39","journal-title":"ACM Trans Appl Percept"},{"key":"2292_CR35","unstructured":"Gao T, Koller D (2011) Discriminative learning of relaxed hierarchy for large-scale visual recognition. In: Proceedings of ICCV 2011, pp 2072\u20132079"},{"issue":"5","key":"2292_CR36","doi-asserted-by":"crossref","first-page":"40","DOI":"10.1109\/2.384117","volume":"28","author":"D Gemmell","year":"1995","unstructured":"Gemmell D, Vin H, Kandlur D, Venkat Rangan P, Rowe L (1995) Multimedia storage servers: a tutorial. IEEE Comput 28(5):40\u201349","journal-title":"IEEE Comput"},{"key":"2292_CR37","doi-asserted-by":"crossref","unstructured":"Guadarrama S, et al. (2013) YouTube2Text: recognizing and describing arbitrary activities using semantic hierarchies and zero-shot recognition. In: Proceedings of ICCV 2013, pp 2712\u20132719","DOI":"10.1109\/ICCV.2013.337"},{"issue":"1","key":"2292_CR38","doi-asserted-by":"crossref","first-page":"58","DOI":"10.1145\/1882471.1882480","volume":"12","author":"M Gupta","year":"2010","unstructured":"Gupta M, Li R, Yin Z, Han J (2010) Survey on social tagging techniques. SIGKDD Explor 12(1):58\u201372","journal-title":"SIGKDD Explor"},{"issue":"2","key":"2292_CR39","doi-asserted-by":"crossref","first-page":"429","DOI":"10.1007\/s11042-012-1340-5","volume":"68","author":"A Hamzaoui","year":"2014","unstructured":"Hamzaoui A, Letessier P, Joly A, Buisson O, Boujemaa N (2014) Object-based visual query suggestion. Multimed Tools Appl 68(2):429\u2013454","journal-title":"Multimed Tools Appl"},{"issue":"5","key":"2292_CR40","doi-asserted-by":"crossref","first-page":"1318","DOI":"10.1109\/TCYB.2013.2265378","volume":"43","author":"J Han","year":"2013","unstructured":"Han J, Shao L, Xu D, Shotton J (2013) Enhanced computer vision with microsoft kinect sensor: a review. IEEE Trans Cybern 43(5):1318\u20131334","journal-title":"IEEE Trans Cybern"},{"key":"2292_CR41","unstructured":"Horridge M, Knublauch H, Rector A, Stevens R, Wroe C (2004) A practical guide to building OWL ontologies with the protege-OWL plugin, 1st edn. University of Manchester. http:\/\/home.skku.edu\/samoh\/class\/sw\/ProtegeOWLTutorial.pdf"},{"key":"2292_CR42","doi-asserted-by":"crossref","unstructured":"Hsieh CJ, Chang KW, Lin CJ, Keerthi SS, Sundararajan S (2008) A dual coordinate descent method for large-scale linear svm. In: Proceedings of ICML 2008, pp 408\u2013415","DOI":"10.1145\/1390156.1390208"},{"key":"2292_CR43","unstructured":"ImageNet Large Scale Visual Recognition Challenge (2012) (ILSVRC 2012). http:\/\/image-net.org\/challenges\/LSVRC\/2012\/index#workshop"},{"issue":"4","key":"2292_CR44","doi-asserted-by":"crossref","first-page":"1196","DOI":"10.1109\/TMM.2012.2191395","volume":"14","author":"N Inoue","year":"2012","unstructured":"Inoue N, Shinoda K (2012) A fast and accurate video semantic-indexing system using fast MAP adaptation and GMM supervectors. IEEE Trans Multimed 14(4):1196\u20131205","journal-title":"IEEE Trans Multimed"},{"key":"2292_CR45","doi-asserted-by":"crossref","unstructured":"Izquierdo E, Chandramouli K, Grzegorzek M, Piatrik T (2007) K-space content management and retrieval system. In: Proceedings of ICIAPW 2007, pp 131\u2013136","DOI":"10.1109\/ICIAPW.2007.32"},{"issue":"5","key":"2292_CR46","doi-asserted-by":"crossref","first-page":"369","DOI":"10.1007\/s005300050139","volume":"7","author":"AK Jain","year":"1999","unstructured":"Jain AK, Vailaya A, Wei X (1999) Query by video clip. Multimed Syst 7(5):369\u2013384","journal-title":"Multimed Syst"},{"issue":"9","key":"2292_CR47","doi-asserted-by":"crossref","first-page":"1704","DOI":"10.1109\/TPAMI.2011.235","volume":"34","author":"H J\u00e9gou","year":"2012","unstructured":"J\u00e9gou H, Perronnin F, Douze M, S\u00e1nchez J, Perez P, Schmid C (2012) Aggregating local image descriptors into compact codes. IEEE Trans Pattern Anal Mach Intell 34(9):1704\u20131716","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2292_CR48","unstructured":"Jiang YG, Wang J, Chang SF, Ngo CW (2009) Domain adaptive semantic diffusion for large scale context-based video annotation. In: Proceedings of ICCV 2009, pp 1420\u20131427"},{"issue":"1","key":"2292_CR49","doi-asserted-by":"crossref","first-page":"42","DOI":"10.1109\/TMM.2009.2036235","volume":"12","author":"YG Jiang","year":"2010","unstructured":"Jiang YG, Yang J, Ngo CW, Hauptmann A (2010) Representations of keypoint-based semantic concept detection: a comprehensive study. IEEE Trans Multimed 12(1):42\u201353","journal-title":"IEEE Trans Multimed"},{"issue":"2","key":"2292_CR50","doi-asserted-by":"crossref","first-page":"73","DOI":"10.1007\/s13735-012-0024-2","volume":"2","author":"YG Jiang","year":"2013","unstructured":"Jiang YG, Bhattacharya S, Chang SF, Shah M (2013) High-level event recognition in unconstrained videos. Int J Multimed Inf Retr 2(2):73\u2013101","journal-title":"Int J Multimed Inf Retr"},{"key":"2292_CR51","doi-asserted-by":"crossref","unstructured":"Juneja M, Vedaldi A, Jawahar C, Zisserman A (2013) Blocks that shout: distinctive parts for scene classification. In: Proceedings of CVPR 2013, pp 923\u2013930","DOI":"10.1109\/CVPR.2013.124"},{"key":"2292_CR52","doi-asserted-by":"crossref","unstructured":"Karsch K, Liu C, Kang S (2012) Depth extraction from video using non-parametric sampling. In: Proceedings of ECCV 2012, pp 775\u2013788","DOI":"10.1007\/978-3-642-33715-4_56"},{"issue":"3","key":"2292_CR53","doi-asserted-by":"crossref","first-page":"348","DOI":"10.1109\/TMM.2003.813281","volume":"5","author":"K Kashino","year":"2003","unstructured":"Kashino K, Kurozumi T, Murase H (2003) A quick search method for audio and video signals based on histogram pruning. IEEE Trans Multimed 5(3):348\u2013357","journal-title":"IEEE Trans Multimed"},{"key":"2292_CR54","unstructured":"Kim YT, Chua TS (2005) Retrieval of news video using video sequence matching. In: Proceedings of MMM 2005, pp 68\u201375"},{"key":"2292_CR55","doi-asserted-by":"crossref","unstructured":"Kittur A, Chi EH, Suh B (2008) Crowdsourcing user studies with mechanical turk. In: Proceedings of CHI 2008, pp 453\u2013456","DOI":"10.1145\/1357054.1357127"},{"key":"2292_CR56","unstructured":"Krizhevsky A, Sutskever I, Hinton G (2012) ImageNet classification with deep convolutional neural networks. In: Bartlett P, Pereira F, Burges C, Bottou L, Weinberger K (eds) NIPS 25, pp 1106\u20131114"},{"issue":"8","key":"2292_CR57","doi-asserted-by":"crossref","first-page":"1847","DOI":"10.1109\/TPAMI.2012.272","volume":"35","author":"N Kr\u00fcger","year":"2013","unstructured":"Kr\u00fcger N et al (2013) Deep hierarchies in the primate visual cortex: what can we learn for computer vision? IEEE Trans Pattern Anal Mach Intell 35(8):1847\u20131871","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2292_CR58","unstructured":"Kumar MP, Packer B, Koller D (2010) Self-paced learning for latent variable models. In: Lafferty J, Williams CKI, Shawe-Taylor J, Zemel R, Culotta A (eds) NIPS 23, pp 1189\u20131197"},{"key":"2292_CR59","doi-asserted-by":"crossref","unstructured":"Lampert CH, Nickisch H, Harmeling S (2009) Learning to detect unseen object classes by between-class attribute transfer. In: Proceedings of CVPR 2009, pp 951\u2013958","DOI":"10.1109\/CVPR.2009.5206594"},{"key":"2292_CR60","doi-asserted-by":"crossref","unstructured":"Lan T, Raptis M, Sigal L, Mori G (2013) From subcategories to visual composites: a multi-level framework for object detection. In: Proceedings of ICCV 2013, pp 369\u2013376","DOI":"10.1109\/ICCV.2013.53"},{"key":"2292_CR61","unstructured":"Le Q, Ranzato M, Monga R, Devin M, Chen K, Corrado G, Dean J, Ng A (2012) Building high-level features using large scale unsupervised learning. In: Proceedings of ICML 2012"},{"issue":"1","key":"2292_CR62","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/1126004.1126005","volume":"2","author":"MS Lew","year":"2006","unstructured":"Lew MS, Sebe N, Djeraba C, Jain R (2006) Content-based multimedia information retrieval: state of the art and challenges. ACM Trans Multimed Comput Commun Appl 2(1):1\u201319","journal-title":"ACM Trans Multimed Comput Commun Appl"},{"key":"2292_CR63","doi-asserted-by":"crossref","unstructured":"Li X, Wang D, Li J, Zhang B (2007) Video search in concept subspace: a text-like paradigm. In: Proceedings of CIVR 2007, pp 603\u2013610","DOI":"10.1145\/1282280.1282366"},{"issue":"2","key":"2292_CR64","doi-asserted-by":"crossref","first-page":"150","DOI":"10.1007\/s11263-010-0354-6","volume":"90","author":"J Li","year":"2010","unstructured":"Li J, Tian Y, Huang T, Gao W (2010) Probabilistic multi-task learning for visual saliency estimation in video. Int J Comput Vis 90(2):150\u2013165","journal-title":"Int J Comput Vis"},{"key":"2292_CR65","unstructured":"Lin CY, Tseng BL, Smith JR (2003) Video collaborative annotation forum: establishing ground-truth labels on large multimedia datasets. In: Proceedings of TRECVID 2003"},{"key":"2292_CR66","doi-asserted-by":"crossref","unstructured":"Litayem S, Joly A, Boujemaa N (2012) Hash-based support vector machines approximation for large scale prediction. In: Proceedings of BMVC 2012, pp 86.1\u201386.11","DOI":"10.5244\/C.26.86"},{"key":"2292_CR67","doi-asserted-by":"crossref","unstructured":"Liu X, Zhuang Y, Pan Y (1999) A new approach to retrieve video by example video clip. In: Proceedings of MM 1999, pp 41\u201344","DOI":"10.1145\/319878.319889"},{"issue":"1","key":"2292_CR68","doi-asserted-by":"crossref","first-page":"262","DOI":"10.1016\/j.patcog.2006.04.045","volume":"40","author":"Y Liu","year":"2007","unstructured":"Liu Y, Zhang D, Lu G, Ma W (2007) A survey of content-based image retrieval with high-level semantics. Pattern Recognit 40(1):262\u2013282","journal-title":"Pattern Recognit"},{"key":"2292_CR69","doi-asserted-by":"crossref","unstructured":"Lowe D (1999) Object recognition from local scale-invariant features. In: Proceedings of ICCV 1999, pp 1150\u20131157","DOI":"10.1109\/ICCV.1999.790410"},{"key":"2292_CR70","doi-asserted-by":"crossref","unstructured":"Lu Z, Grauman K (2013) Story-driven summarization for egocentric video. In: Proceedings of CVPR 2013, pp 2714\u20132721","DOI":"10.1109\/CVPR.2013.350"},{"key":"2292_CR71","doi-asserted-by":"crossref","unstructured":"Ma Z, Yang Y, Xu Z, Sebe N, Hauptmann AG (2013) We are not equally negative: fine-grained labeling for multimedia event detection. In: Proceedings of MM 2013, pp 293\u2013302","DOI":"10.1145\/2502081.2502119"},{"issue":"1\u20132","key":"2292_CR72","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1007\/s11263-014-0716-6","volume":"108","author":"S Maji","year":"2014","unstructured":"Maji S, Shakhnarovich G (2014) Part and attribute discovery from relative annotations. Int J Comput Vis 108(1\u20132):82\u201396","journal-title":"Int J Comput Vis"},{"key":"2292_CR73","doi-asserted-by":"crossref","unstructured":"Maji S, Berg A, Malik J (2008) Classification using intersection kernel support vector machines is efficient. In: Proceedings of CVPR 2008, pp 1\u20138","DOI":"10.1109\/CVPR.2008.4587630"},{"key":"2292_CR74","doi-asserted-by":"crossref","unstructured":"Marszalek M, Schmid C (2007) Semantic hierarchies for visual object recognition. In: Proceedings of CVPR 2007, pp 1\u20137","DOI":"10.1109\/CVPR.2007.383272"},{"key":"2292_CR75","doi-asserted-by":"crossref","unstructured":"Mazloom M, Habibian A, Snoek CG (2013) Querying for video events by semantic signatures from few examples. In: Proceedings of MM 2013, pp 609\u2013612","DOI":"10.1145\/2502081.2502160"},{"issue":"1","key":"2292_CR76","doi-asserted-by":"crossref","first-page":"88","DOI":"10.1109\/TMM.2011.2168948","volume":"14","author":"M Merler","year":"2012","unstructured":"Merler M, Huang B, Xie L, Hua G, Natsev A (2012) Semantic model vectors for complex video event recognition. IEEE Trans Multimed 14(1):88\u2013101","journal-title":"IEEE Trans Multimed"},{"key":"2292_CR77","volume-title":"How to read a film","author":"J Monaco","year":"1981","unstructured":"Monaco J (1981) How to read a film. Oxford University Press, Oxford"},{"key":"2292_CR78","doi-asserted-by":"crossref","unstructured":"Nam J, Alghoniemy M, Tewfik A (1998) Audio-visual content-based violent scene characterization. In: Proceedings of ICIP 98, pp 353\u2013357","DOI":"10.1109\/ICIP.1998.723496"},{"key":"2292_CR79","doi-asserted-by":"crossref","unstructured":"Naphade MR, Smith JR (2004) On the detection of semantic concepts at TRECVID. In: Proceedings of MM 2004, pp 660\u2013667","DOI":"10.1145\/1027527.1027680"},{"issue":"3","key":"2292_CR80","doi-asserted-by":"crossref","first-page":"86","DOI":"10.1109\/MMUL.2006.63","volume":"13","author":"M Naphade","year":"2006","unstructured":"Naphade M, Smith J, Tesic J, Chang SF, Hsu W, Kennedy L, Hauptmann A, Curtis J (2006) Large-scale concept ontology for multimedia. IEEE Multimed 13(3):86\u201391","journal-title":"IEEE Multimed"},{"key":"2292_CR81","doi-asserted-by":"crossref","unstructured":"Natsev AP, Naphade MR, Te\u0161i\u0107 J (2005) Learning the semantics of multimedia queries and concepts from a small number of examples. In: Proceedings of MM 2005, pp 598\u2013607","DOI":"10.1145\/1101149.1101288"},{"key":"2292_CR82","doi-asserted-by":"crossref","unstructured":"Natsev AP, Haubold A, Te\u0161i\u0107 J, Xie L, Yan R (2007) Semantic concept-based query expansion and re-ranking for multimedia retrieval. In: Proceedings of MM 2007, pp 991\u20131000","DOI":"10.1145\/1291233.1291448"},{"key":"2292_CR83","unstructured":"Ngo C, et al. (2009) VIREO\/DVM at TRECVID 2009: high-level feature extraction, automatic video search and content-based copy detection. In: Proceedings of TRECVID 2009 , pp 415\u2013432"},{"key":"2292_CR84","doi-asserted-by":"crossref","unstructured":"Nowak E, Jurie F, Triggs B (2006) Sampling strategies for bag-of-features image classification. In: Proceedings of ECCV 2006, pp 490\u2013503","DOI":"10.1007\/11744085_38"},{"key":"2292_CR85","doi-asserted-by":"crossref","unstructured":"Ogiela M, Tadeusiewicz R (2010) Towards new classes of cognitive vision systems. In: Proceedings of CISIS 2010, pp 851\u2013855","DOI":"10.1109\/CISIS.2010.49"},{"key":"2292_CR86","unstructured":"Oh J, Bandi B (2002) Multimedia data mining framework for raw video sequences. In: Proceedings MDM\/KDD 2002, pp 23\u201326"},{"issue":"4","key":"2292_CR87","doi-asserted-by":"crossref","first-page":"629","DOI":"10.1109\/69.234775","volume":"5","author":"E Oomoto","year":"1993","unstructured":"Oomoto E, Tanaka K (1993) OVID: design and implementation of a video-object database system. IEEE Trans Knowl Data Eng 5(4):629\u2013643","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"2292_CR88","doi-asserted-by":"crossref","unstructured":"Pan JY, Faloutsos C (2001) VideoGraph: a new tool for video mining and classification. In: Proceedings of JCDL 2001, pp 116\u2013117","DOI":"10.1145\/379437.379462"},{"key":"2292_CR89","doi-asserted-by":"crossref","unstructured":"Parkash A, Parikh D (2012) Attributes for classifier feedback. In: Proceedings of ECCV 2012, pp 354\u2013368","DOI":"10.1007\/978-3-642-33712-3_26"},{"key":"2292_CR90","unstructured":"PASCAL Visual Object Classes. http:\/\/pascallin.ecs.soton.ac.uk\/challenges\/VOC\/"},{"key":"2292_CR91","doi-asserted-by":"crossref","unstructured":"Pattanasri N, Chatvichienchai S, Tanaka K (2005) Towards a unified framework for context-preserving video retrieval and summarization. In: Proceedings of ICADL 2005, pp 119\u2013128","DOI":"10.1007\/11599517_14"},{"key":"2292_CR92","doi-asserted-by":"crossref","unstructured":"Peng Y, Ngo CW (2005) EMD-based video clip retrieval by many-to-many matching. In: Proceedings of CIVR 2005, pp 71\u201381","DOI":"10.1007\/11526346_11"},{"key":"2292_CR93","doi-asserted-by":"crossref","unstructured":"Perronnin F, Dance C (2007) Fisher kernels on visual vocabularies for image categorization. In: Proceedings of CVPR 2007, pp 1\u20138","DOI":"10.1109\/CVPR.2007.383266"},{"key":"2292_CR94","volume-title":"Content-based video retrieval: a database perspective","author":"M Petkovic","year":"2002","unstructured":"Petkovic M, Jonker W (2002) Content-based video retrieval: a database perspective. Kluwer Academic Publishers, Norwell"},{"key":"2292_CR95","doi-asserted-by":"crossref","unstructured":"Quinn AJ, Bederson BB (2011) Human computation: a survey and taxonomy of a growing field. In: Proceedings of CHI 2011, pp 1403\u20131412","DOI":"10.1145\/1978942.1979148"},{"issue":"5","key":"2292_CR96","doi-asserted-by":"crossref","first-page":"923","DOI":"10.1109\/TMM.2007.900138","volume":"9","author":"N Rasiwasia","year":"2007","unstructured":"Rasiwasia N, Moreno P, Vasconcelos N (2007) Bridging the gap: query by semantic example. IEEE Trans Multimed 9(5):923\u2013938","journal-title":"IEEE Trans Multimed"},{"key":"2292_CR97","unstructured":"Ren X, Bo L, Fox D (2012) RGB-(D) scene labeling: features and algorithms. In: Proceedings of CVPR 2012, pp 2759\u20132766"},{"issue":"5","key":"2292_CR98","doi-asserted-by":"crossref","first-page":"644","DOI":"10.1109\/76.718510","volume":"8","author":"Y Rui","year":"1998","unstructured":"Rui Y, Huang T, Ortega M, Mehrotra S (1998) Relevance feedback: a power tool for interactive content-based image retrieval. IEEE Trans Circuits Syst Video Technol 8(5):644\u2013655","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"issue":"1-3","key":"2292_CR99","doi-asserted-by":"crossref","first-page":"157","DOI":"10.1007\/s11263-007-0090-8","volume":"77","author":"BC Russell","year":"2008","unstructured":"Russell BC, Torralba A, Murphy KP, Freeman WT (2008) LabelMe: a database and web-based tool for image annotation. Int J Comput Vis 77(1-3):157\u2013173","journal-title":"Int J Comput Vis"},{"issue":"5","key":"2292_CR100","doi-asserted-by":"crossref","first-page":"824","DOI":"10.1109\/TPAMI.2008.132","volume":"31","author":"A Saxena","year":"2009","unstructured":"Saxena A, Sun M, Ng AY (2009) Make3D: learning 3D scene structure from a single still image. IEEE Trans Pattern Anal Mach Intell 31(5):824\u2013840","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"1","key":"2292_CR101","doi-asserted-by":"crossref","first-page":"7","DOI":"10.1007\/s11042-013-1427-7","volume":"70","author":"A Scherp","year":"2014","unstructured":"Scherp A, Mezaris V (2014) Survey on modeling and indexing events in multimedia. Multimed Tools Appl 70(1):7\u201323","journal-title":"Multimed Tools Appl"},{"issue":"5","key":"2292_CR102","doi-asserted-by":"crossref","first-page":"530","DOI":"10.1109\/34.589215","volume":"19","author":"C Schmid","year":"1997","unstructured":"Schmid C, Mohr R (1997) Local grayvalue invariants for image retrieval. IEEE Trans Pattern Anal Mach Intell 19(5):530\u2013535","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"2","key":"2292_CR103","first-page":"113","volume":"3","author":"K Schoeffmann","year":"2014","unstructured":"Schoeffmann K, et al. (2014) The video browser showdown: a live evaluation of interactive video search tools. Int J Multimed Inf Retr 3(2):113\u2013127","journal-title":"Int J Multimed Inf Retr"},{"issue":"3","key":"2292_CR104","first-page":"21","volume":"1","author":"K Shirahama","year":"2008","unstructured":"Shirahama K, Uehara K (2008) A novel topic extraction method based on bursts in video streams. Int J Hybrid Inf Technol 1(3):21\u201332","journal-title":"Int J Hybrid Inf Technol"},{"key":"2292_CR105","unstructured":"Shirahama K, Uehara K (2012) Kobe university and Muroran institute of technology at TRECVID 2012 semantic indexing task. In: Proceedings of TRECVID 2012, pp 239\u2013247"},{"key":"2292_CR106","doi-asserted-by":"crossref","first-page":"404","DOI":"10.1007\/978-1-84628-799-2_20","volume-title":"Multimedia data mining and knowledge discovery","author":"K Shirahama","year":"2007","unstructured":"Shirahama K, Ideno K, Uehara K (2007) A time-constrained sequential pattern mining for extracting semantic events in videos. In: Petrushin V, Khan L (eds) Multimedia data mining and knowledge discovery. Springer, London, pp 404\u2013426"},{"issue":"1","key":"2292_CR107","doi-asserted-by":"crossref","first-page":"145","DOI":"10.1007\/s11042-011-0727-z","volume":"57","author":"K Shirahama","year":"2012","unstructured":"Shirahama K, Matsuoka Y, Uehara K (2012) Event retrieval in video archives using rough set theory and partially supervised learning. Multimed Tools Appl 57(1):145\u2013173","journal-title":"Multimed Tools Appl"},{"key":"2292_CR108","unstructured":"Shirahama K, Kumabuchi K, Uehara K (2013) Video retrieval by learning uncertainties in concept detection from imbalanced annotation data. In: Proceedings of MMEDIA 2013 , pp 19\u201324"},{"key":"2292_CR109","doi-asserted-by":"crossref","unstructured":"Shirahama K, Grzegorzek M, Uehara K (2014) Multimedia event detection using hidden conditional random fields. In: Proceedings of ICMR 2014, pp 9:9\u20139:16","DOI":"10.1145\/2578726.2578742"},{"key":"2292_CR110","doi-asserted-by":"crossref","unstructured":"Shirahama K, Kumabuchi K, Grzegorzek M, Uehara K (2014) Video retrieval based on uncertain concept detection using dempster-shafer theory. In: Baughman AK, Gao J, Pan JY, Petrushin V (eds) Multimedia data mining and analytics: disruptive innovation. Springer, London","DOI":"10.1007\/978-3-319-14998-1_12"},{"key":"2292_CR111","doi-asserted-by":"crossref","unstructured":"Smeaton AF, Over P, Kraaij W (2006) Evaluation campaigns and TRECVid. In: Proceedings of MIR 2006, pp 321\u2013330","DOI":"10.1145\/1178677.1178722"},{"issue":"2\u20133","key":"2292_CR112","doi-asserted-by":"crossref","first-page":"195","DOI":"10.1002\/ima.20150","volume":"18","author":"AF Smeaton","year":"2008","unstructured":"Smeaton AF, Wilkins P, Worring M, de Rooij O, Chua TS, Luan H (2008) Content-based video retrieval: three example systems from TRECVid. Int J Imaging Syst Technol 18 (2\u20133):195\u2013201","journal-title":"Int J Imaging Syst Technol"},{"issue":"12","key":"2292_CR113","doi-asserted-by":"crossref","first-page":"1349","DOI":"10.1109\/34.895972","volume":"22","author":"A Smeulders","year":"2000","unstructured":"Smeulders A, Worring M, Santini S, Gupta A, Jain R (2000) Content-based image retrieval at the end of the early years. IEEE Trans Pattern Anal Mach Intell 22(12):1349\u20131380","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"4","key":"2292_CR114","doi-asserted-by":"crossref","first-page":"215","DOI":"10.1561\/1500000014","volume":"2","author":"CGM Snoek","year":"2009","unstructured":"Snoek CGM, Worring M (2009) Concept-based video retrieval. Found Trends Inf Retr 2(4):215\u2013322","journal-title":"Found Trends Inf Retr"},{"key":"2292_CR115","doi-asserted-by":"crossref","unstructured":"Snoek CGM, Worring M, Geusebroek JM, Koelma D, Seinstra F (2005) On the surplus value of semantic video analysis beyond the key frame. In: Proceedings of ICME 2005, pp 386\u2013389","DOI":"10.1109\/ICME.2005.1521441"},{"key":"2292_CR116","unstructured":"Snoek C, et al. (2009) The MediaMill TRECVID 2009 semantic video search engine. In: Proceedings of TRECVID 2009, pp 226\u2013238"},{"key":"2292_CR117","doi-asserted-by":"crossref","first-page":"125","DOI":"10.1007\/978-3-540-85658-0_4","volume-title":"Reasoning web, chap 4","author":"S Staab","year":"2008","unstructured":"Staab S, Scherp A, Arndt R, Troncy R, Grzegorzek M, Saathoff C, Schenk S, Hardman L (2008) Semantic multimedia. In: Baroglio C, Bonatti PA, Maluszynski J, Marchiori M, Polleres A, Schaffert S (eds) Reasoning web, chap 4. Springer LNCS 5224, San Servolo, pp 125\u2013170"},{"issue":"5","key":"2292_CR118","doi-asserted-by":"crossref","first-page":"367","DOI":"10.1007\/s00530-010-0220-y","volume":"17","author":"J Steggink","year":"2011","unstructured":"Steggink J, Snoek C (2011) Adding semantics to image-region annotations with the name-it-game. Multimed Syst 17(5):367\u2013378","journal-title":"Multimed Syst"},{"issue":"2","key":"2292_CR119","doi-asserted-by":"crossref","first-page":"10:1","DOI":"10.1145\/2465780.2465784","volume":"10","author":"Y Sugano","year":"2013","unstructured":"Sugano Y, Matsushita Y, Sato Y (2013) Graph-based joint clustering of fixations and visual entities. ACM Trans Appl Percept 10(2):10:1\u201310:16","journal-title":"ACM Trans Appl Percept"},{"key":"2292_CR120","doi-asserted-by":"crossref","unstructured":"Sun C, Nevatia R (2013) ACTIVE: activity concept transitions in video event classification. In: Proceedings of ICCV 2013, pp 913\u2013920","DOI":"10.1109\/ICCV.2013.453"},{"key":"2292_CR121","doi-asserted-by":"crossref","unstructured":"Tadeusiewicz R (2007) Intelligent web mining for semantically adequate images. In: Proceedings of AWIC 2007, pp 3\u201310","DOI":"10.1007\/978-3-540-72575-6_1"},{"key":"2292_CR122","doi-asserted-by":"crossref","unstructured":"Tadeusiewicz R (2007) What does it means automatic understanding of the images?. In: Proceedings of IST 2007, pp 1\u20133","DOI":"10.1109\/IST.2007.379566"},{"issue":"1","key":"2292_CR123","first-page":"34","volume":"82","author":"K Tanaka","year":"1999","unstructured":"Tanaka K, Ariki Y, Uehara K (1999) Organization and retrieval of video data (special issue on new generation database technologies). IEICE Trans Inf Syst 82(1):34\u201344","journal-title":"IEICE Trans Inf Syst"},{"key":"2292_CR124","doi-asserted-by":"crossref","unstructured":"Tang K, Fei-Fei L, Koller D (2012) Learning latent temporal structure for complex event detection. In: Proceedings of CVPR 2012, pp 1250\u20131257","DOI":"10.1109\/CVPR.2012.6247808"},{"issue":"7","key":"2292_CR125","doi-asserted-by":"crossref","first-page":"1088","DOI":"10.1109\/TPAMI.2006.134","volume":"28","author":"D Tao","year":"2006","unstructured":"Tao D, Tang X, Li X, Wu X (2006) Asymmetric bagging and random subspace for support vector machines-based relevance feedback in image retrieval. IEEE Trans Pattern Anal Mach Intell 28(7):1088\u20131099","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2292_CR126","doi-asserted-by":"crossref","unstructured":"Te\u0161ic\u0300 J, Natsev AP, Smith JR (2007) Cluster-based data modeling for semantic video search. In: Proceedings of CIVR 2007, pp 595\u2013602","DOI":"10.1145\/1282280.1282365"},{"key":"2292_CR127","unstructured":"Thagard P (2007) Cognitive science. Stanford Encyclopedia of Philosophy. http:\/\/plato.stanford.edu\/archives\/fall2008\/entries\/cognitive-science\/"},{"key":"2292_CR128","doi-asserted-by":"crossref","unstructured":"Tong S, Chang E (2001) Support vector machine active learning for image retrieval. In: Proceedings of MM 2001, pp 107\u2013118","DOI":"10.1145\/500141.500159"},{"issue":"11","key":"2292_CR129","doi-asserted-by":"crossref","first-page":"1958","DOI":"10.1109\/TPAMI.2008.128","volume":"30","author":"A Torralba","year":"2008","unstructured":"Torralba A., Fergus R., Freeman W. (2008) 80 million tiny images: a large data set for nonparametric object and scene recognition. IEEE Trans Pattern Anal Mach Intell 30(11):1958\u20131970","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2292_CR130","unstructured":"Uehara K, Oe M, Maehara K (1996) Knowledge representation, concept acquisition and retrieval of video data. In: Proceedings of CODAS 1996, pp 527\u2013534"},{"key":"2292_CR131","doi-asserted-by":"crossref","unstructured":"Vahdat A, Cannons K, Mori G, Oh S, Kim I (2013) Compositional models for video event detection: a multiple kernel learning latent variable approach. In: Proceedings of ICCV 2013, pp 1185\u20131192","DOI":"10.1109\/ICCV.2013.463"},{"issue":"9","key":"2292_CR132","doi-asserted-by":"crossref","first-page":"1582","DOI":"10.1109\/TPAMI.2009.154","volume":"32","author":"KEA van de Sande","year":"2010","unstructured":"van de Sande KEA, Gevers T, Snoek CGM (2010) Evaluating color descriptors for object and scene recognition. IEEE Trans Pattern Anal Mach Intell 32(9):1582\u20131596","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"1","key":"2292_CR133","doi-asserted-by":"crossref","first-page":"60","DOI":"10.1109\/TMM.2010.2091400","volume":"13","author":"KEA van de Sande","year":"2011","unstructured":"van de Sande KEA, Gevers T, Snoek CGM (2011) Empowering visual categorization with the GPU. IEEE Trans Multimed 13(1):60\u201370","journal-title":"IEEE Trans Multimed"},{"key":"2292_CR134","unstructured":"Vapnik V (1998) Statistical learning theory. Wiley-Interscience"},{"key":"2292_CR135","doi-asserted-by":"crossref","unstructured":"Volkmer T, Smith JR, Natsev AP (2005) A web-based system for collaborative annotation of large image and video collections: an evaluation and user study. In: Proceedings of MM 2005, pp 892\u2013901","DOI":"10.1145\/1101149.1101341"},{"key":"2292_CR136","doi-asserted-by":"crossref","unstructured":"von Ahn L, Dabbish L (2004) Labeling images with a computer game. In: Proceedings of CHI 2004, pp 319\u2013326","DOI":"10.1145\/985692.985733"},{"issue":"8","key":"2292_CR137","doi-asserted-by":"crossref","first-page":"58","DOI":"10.1145\/1378704.1378719","volume":"51","author":"L von Ahn","year":"2008","unstructured":"von Ahn L, Dabbish L (2008) Designing games with a purpose. Commun ACM 51(8):58\u201367","journal-title":"Commun ACM"},{"key":"2292_CR138","doi-asserted-by":"crossref","unstructured":"von Ahn L, Liu R, Blum M (2006) Peekaboom: a game for locating objects in images. In: Proceedings of CHI 2006, pp 55\u201364","DOI":"10.1145\/1124772.1124782"},{"issue":"2","key":"2292_CR139","doi-asserted-by":"crossref","first-page":"10:1","DOI":"10.1145\/1899412.1899414","volume":"2","author":"M Wang","year":"2011","unstructured":"Wang M, Hua XS (2011) Active learning in multimedia annotation and retrieval: a survey. ACM Trans Intell Syst Technol 2(2):10:1\u201310:21","journal-title":"ACM Trans Intell Syst Technol"},{"key":"2292_CR140","doi-asserted-by":"crossref","unstructured":"Wang XJ, Zhang L, Liu M, Li Y, Ma WY (2010) ARISTA\u2014image search to annotation on billions of web photos. In: Proceedings of CVPR 2010, pp 2987\u20132994","DOI":"10.1109\/CVPR.2010.5540046"},{"key":"2292_CR141","doi-asserted-by":"crossref","unstructured":"Wang H, Klaser A, Schmid C, Liu CL (2011) Action recognition by dense trajectories. In: Proceedings of CVPR 2011, pp 3169\u20133176","DOI":"10.1109\/CVPR.2011.5995407"},{"issue":"1","key":"2292_CR142","doi-asserted-by":"crossref","first-page":"62","DOI":"10.1109\/TCSVT.2011.2105597","volume":"21","author":"XY Wei","year":"2011","unstructured":"Wei XY, Jiang YG, Ngo CW (2011) Concept-driven multi-modality fusion for video search. IEEE Trans Circuits Syst Video Technol 21(1):62\u201373","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"2292_CR143","doi-asserted-by":"crossref","unstructured":"Weiss R, Duda A, Gifford D (1994) Content-based access to algebraic video. In: Proceedings of ICMCS 1994, pp 140\u2013151","DOI":"10.1109\/MMCS.1994.292446"},{"issue":"1","key":"2292_CR144","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1109\/MMUL.2007.23","volume":"14","author":"U Westermann","year":"2007","unstructured":"Westermann U, Jain R (2007) Toward a common event model for multimedia applications. IEEE Multimed 14(1):19\u201329","journal-title":"IEEE Multimed"},{"key":"2292_CR145","unstructured":"Wilkins P, et al. (2007) K-space at TRECVid 2007. In: Proceedings of TRECVID 2007"},{"key":"2292_CR146","doi-asserted-by":"crossref","unstructured":"Woelk D, Kim W, Luther W (1986) An object-oriented approach to multimedia databases. In: Proceedings of SIGMOD 1986, pp 311\u2013325","DOI":"10.1145\/16856.16885"},{"key":"2292_CR147","unstructured":"Wu Y, Zhang A (2003) An adaptive classification method for multimedia retrieval. In: Proceedings of ICME 2003, pp 757\u2013760"},{"key":"2292_CR148","unstructured":"Wu Y, Zhang A (2003) Adaptive pattern discovery for interactive multimedia retrieval. In: Proceedings of CVPR 2003, pp 649\u2013655"},{"key":"2292_CR149","unstructured":"Wu Y, Zhang A (2004) PatternQuest: learning patterns of interest using relevance feedback in multimedia information retrieval. In: Proceedings of ICME 2004, pp 261\u2013264"},{"key":"2292_CR150","doi-asserted-by":"crossref","unstructured":"Yan R, Fleury MO, Merler M, Natsev A, Smith JR (2009) Large-scale multimedia semantic concept modeling using robust subspace bagging and mapreduce. In: Proceedings LS-MMRM 2009, pp 35\u201342","DOI":"10.1145\/1631058.1631067"},{"key":"2292_CR151","unstructured":"Yang J, Yu K, Gong Y, Huang T (2009) Linear spatial pyramid matching using sparse coding for image classification. In: Proceedings of CVPR 2009, pp 1794\u20131801"},{"key":"2292_CR152","unstructured":"Yap KH, Wu K (2003) Fuzzy relevance feedback in content-based image retrieval. In: Proceedings of ICICS-PCM 2003, pp 1595\u20131599"},{"issue":"6","key":"2292_CR153","doi-asserted-by":"crossref","first-page":"1400","DOI":"10.1109\/TMM.2013.2250266","volume":"15","author":"J Yi","year":"2013","unstructured":"Yi J, Peng Y, Xiao J (2013) Exploiting semantic and visual context for effective video annotation. IEEE Trans Multimed 15(6):1400\u20131414","journal-title":"IEEE Trans Multimed"},{"key":"2292_CR154","doi-asserted-by":"crossref","unstructured":"Yoshitaka A, Ishii T, Hirakawa M, Ichikawa T (1997) Content-based retrieval of video data by the grammar of film. In: Proceedings of VL 1997, pp 310\u2013317","DOI":"10.1109\/VL.1997.626599"},{"key":"2292_CR155","unstructured":"Yu K, Zhang T, Gong Y (2009) Nonlinear learning using local coordinate coding. In: Bengio Y, Schuurmans D, Lafferty J, Williams CKI, Culotta A (eds) NIPS 22, pp 2223\u20132231"},{"key":"2292_CR156","unstructured":"Yuan J, Tian Q, Ranganath S (2004) Fast and robust search method for short video clips from large video collection. In: Proceedings of ICPR 2004, pp 866\u2013869"},{"key":"2292_CR157","doi-asserted-by":"crossref","unstructured":"Yuan J, Wu Y, Yang M (2007) Discovery of collocation patterns: from visual words to visual phrases. In: Proceedings of CVPR 2007, pp 1\u20138","DOI":"10.1109\/CVPR.2007.383222"},{"key":"2292_CR158","doi-asserted-by":"crossref","unstructured":"Zettsu K, Uehara K, Tanaka K, Kimura N (1997) A time-stamped authoring graph for video databases. In: Proceedings of DEXA 1997, pp 192\u2013201","DOI":"10.1007\/BFb0022031"},{"issue":"3","key":"2292_CR159","first-page":"13:1","volume":"6","author":"ZJ Zha","year":"2010","unstructured":"Zha ZJ, Yang L, Mei T, Wang M, Wang Z, Chua TS, Hua XS (2010) Visual query suggestion: towards capturing user intent in internet image search. ACM Trans Multimed Comput Commun Appl 6(3):13:1\u201313:19","journal-title":"ACM Trans Multimed Comput Commun Appl"},{"key":"2292_CR160","doi-asserted-by":"crossref","unstructured":"Zhai Y, Rasheed Z, Shah M (2004) A framework for semantic classification of scenes using finite state machines. In: Proceedings of CIVR 2004, pp 279\u2013288","DOI":"10.1007\/978-3-540-27814-6_35"},{"key":"2292_CR161","doi-asserted-by":"crossref","unstructured":"Zhai Y, Yilmaz A, Shah M (2005) Story segmentation in news videos using visual and text cues. In: Proceedings of CIVR 2005, pp 92\u2013102","DOI":"10.1007\/11526346_13"},{"key":"2292_CR162","unstructured":"Zhang H, Gong Y, Smoliar S, Yeo Tan S (1994) Automatic parsing of news video. In: Proceedings of ICMCS 1994, pp 45\u201354"},{"issue":"2","key":"2292_CR163","doi-asserted-by":"crossref","first-page":"213","DOI":"10.1007\/s11263-006-9794-4","volume":"73","author":"J Zhang","year":"2007","unstructured":"Zhang J, Marszalek M, Lazebnik S, Schmid C (2007) Local features and kernels for classification of texture and object categories: a comprehensive study. Int J Comput Vis 73(2):213\u2013238","journal-title":"Int J Comput Vis"},{"key":"2292_CR164","doi-asserted-by":"crossref","unstructured":"Zhong D, Chang SF (2001) Structure analysis of sports video using domain models. In: Proceedings of ICME 2001, pp 713\u2013716","DOI":"10.1109\/ICME.2001.1237820"},{"issue":"6","key":"2292_CR165","doi-asserted-by":"crossref","first-page":"536","DOI":"10.1007\/s00530-002-0070-3","volume":"8","author":"XS Zhou","year":"2003","unstructured":"Zhou XS, Huang TS (2003) Relevance feedback in image retrieval: a comprehensive review. Multimed Syst 8(6):536\u2013544","journal-title":"Multimed Syst"},{"key":"2292_CR166","unstructured":"Zhou H, Kimber D (2006) Unusual event detection via multi-camera video mining. In: Proceedings ICPR 2006, pp 1161\u20131166"},{"issue":"5","key":"2292_CR167","doi-asserted-by":"crossref","first-page":"665","DOI":"10.1109\/TKDE.2005.83","volume":"17","author":"X Zhu","year":"2005","unstructured":"Zhu X, Wu X, Elmagarmid AK, Feng Z, Wu L (2005) Video data mining: semantic indexing and event detection from the association perspective. IEEE Trans Knowl Data Eng 17(5):665\u2013677","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"2292_CR168","doi-asserted-by":"crossref","unstructured":"Zhu S, Wei XY, Ngo CW (2013) Error recovered hierarchical classification. In: Proceedings of MM 2013, pp 697\u2013700","DOI":"10.1145\/2502081.2502182"},{"key":"2292_CR169","unstructured":"Zwol RV, Garcia L, Ramirez G, Sigurbjornsson B, Labad M (2008) Video tag game. In: Proceedings of WWW 2008"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-014-2292-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-014-2292-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-014-2292-8","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,8,15]],"date-time":"2019-08-15T21:15:10Z","timestamp":1565903710000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-014-2292-8"}},"subtitle":["Retrospective survey"],"short-title":[],"issued":{"date-parts":[[2014,10,5]]},"references-count":169,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2016,1]]}},"alternative-id":["2292"],"URL":"https:\/\/doi.org\/10.1007\/s11042-014-2292-8","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2014,10,5]]}}}