{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:28:30Z","timestamp":1740122910453,"version":"3.37.3"},"reference-count":61,"publisher":"Springer Science and Business Media LLC","issue":"21","license":[{"start":{"date-parts":[[2017,5,23]],"date-time":"2017-05-23T00:00:00Z","timestamp":1495497600000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2017,11]]},"DOI":"10.1007\/s11042-017-4730-x","type":"journal-article","created":{"date-parts":[[2017,5,23]],"date-time":"2017-05-23T04:38:15Z","timestamp":1495514295000},"page":"22547-22567","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Multimodal person discovery in broadcast TV: lessons learned from MediaEval 2015"],"prefix":"10.1007","volume":"76","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4326-4212","authenticated-orcid":false,"given":"Johann","family":"Poignant","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Herv\u00e9","family":"Bredin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Claude","family":"Barras","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,5,23]]},"reference":[{"key":"4730_CR1","doi-asserted-by":"crossref","unstructured":"Bechet F, Bendris M, Charlet D, Damnati G, Favre B, Rouvier M, Auguste R, Bigot B, Dufour R, Fredouille C, Linar\u00e8s G, Martinet J, Senay G, Tirilly P (2014) Multimodal understanding for person recognition in video broadcasts INTERSPEECH","DOI":"10.21437\/Interspeech.2014-146"},{"key":"4730_CR2","doi-asserted-by":"crossref","unstructured":"Bechet F, Bendris M, Charlet D, Damnati G, Favre B, Rouvier M, Auguste R, Bigot B, Dufour R, Fredouille C et al (2014) Multimodal understanding for person recognition in video broadcasts INTERSPEECH, pp 607\u2013611","DOI":"10.21437\/Interspeech.2014-146"},{"key":"4730_CR3","unstructured":"Bendris M, Charlet D, Senay G, Kim M, Favre B, Rouvier M, Bechet F, Damnati G (2015) Percolatte : a multimodal person discovery system in tv broadcast for the medieval 2015 evaluation campaign MediaEval"},{"key":"4730_CR4","doi-asserted-by":"crossref","unstructured":"Bendris M, Favre B, Charlet D, Damnati G, Auguste R, Martinet J, Senay G (2013) Unsupervised face identification in tv content using audio-visual sources CBMI","DOI":"10.1109\/CBMI.2013.6576591"},{"key":"4730_CR5","unstructured":"Bernard G, Galibert O, Kahn J (2013) The first official REPERE evaluation SLAM-INTERSPEECH"},{"key":"4730_CR6","doi-asserted-by":"crossref","unstructured":"Bredin H, Laurent A, Sarkar A, Le VB, Rosset S, Barras C (2014) Person instance graphs for named speaker identification in TV broadcast Odyssey","DOI":"10.21437\/Odyssey.2014-28"},{"key":"4730_CR7","doi-asserted-by":"crossref","unstructured":"Bredin H, Poignant J (2013) Integer linear programming for speaker diarization and Cross-Modal identification in TV broadcast INTERSPEECH","DOI":"10.21437\/Interspeech.2013-381"},{"key":"4730_CR8","unstructured":"Bredin H, Poignant J, Fortier G, Tapaswi M, Le VB, Sarkar A, Barras C, Rosset S, Roy A, Yang Q, Gao H, Mignon A, Verbeek J, Besacier L, Qu\u00e9not G, Ekenel HK, Stiefelhagen R (2013) QCompere at REPERE 2013 SLAM-INTERSPEECH"},{"key":"4730_CR9","doi-asserted-by":"crossref","unstructured":"Bredin H, Poignant J, Tapaswi M, Fortier G, Le VB, Napoleon T, Gao H, Barras C, Rosset S, Besacier L, Verbeek J, Qu\u00e9not G, Jurie F, Ekenel H (2012) Fusion of speech, faces and text for person identification in TV broadcast ECCV-IFCVCR","DOI":"10.1007\/978-3-642-33885-4_39"},{"key":"4730_CR10","doi-asserted-by":"crossref","unstructured":"Bredin H, Roy A, Le VB, Barras C (2014) Person instance graphs for mono-, cross- and multi-modal person recognition in multimedia data: application to speaker identification in TV broadcast IJMIR","DOI":"10.1007\/s13735-014-0055-y"},{"issue":"1","key":"4730_CR11","doi-asserted-by":"crossref","first-page":"5","DOI":"10.1023\/A:1010933404324","volume":"45","author":"L Breiman","year":"2001","unstructured":"Breiman L (2001) Random forests. Mach Learn 45(1):5\u201332","journal-title":"Mach Learn"},{"key":"4730_CR12","unstructured":"Budnik M, Safadi B, Besacier L, Qu\u00e9not G, Khodabakhsh A, Demiroglu C (2015) Lig at mediaeval 2015 multimodal person discovery in broadcast tv task Mediaeval"},{"key":"4730_CR13","doi-asserted-by":"crossref","unstructured":"Canseco L, Lamel L, Gauvain J (2005) A comparative study using manual and automatic transcriptions for diarization ASRU","DOI":"10.1109\/ASRU.2005.1566507"},{"key":"4730_CR14","unstructured":"Canseco-Rodriguez L, Lamel L, Gauvain J (2004) Speaker diarization from speech transcripts. In: The 5th annual conference of the international speech communication association, INTERSPEECH"},{"key":"4730_CR15","unstructured":"Chen S, Gopalakrishnan P (1998) Speaker, environment and channel change detection and clustering via the bayesian information criterion. In: DARPA broadcast news trans. and under. workshop"},{"key":"4730_CR16","unstructured":"Dalal N, Triggs B (2005) Histograms of oriented gradients for human detection CVPR"},{"key":"4730_CR17","doi-asserted-by":"crossref","unstructured":"Damnati G, Charlet D (2011) Robust speaker turn role labeling of tv broadcast news shows. In: 2011 IEEE international conference on acoustics, speech and signal processing (ICASSP), pp 5684\u20135687","DOI":"10.1109\/ICASSP.2011.5947650"},{"key":"4730_CR18","unstructured":"Dinarelli M, Rosset S (2011) Models cascade for tree-structured named entity detection. In: IJCNLP"},{"key":"4730_CR19","unstructured":"dos Santos CE Jr, Gravier G, Schwartz W (2015) Ssig and irisa at multimodal person discovery MediaEval"},{"key":"4730_CR20","doi-asserted-by":"crossref","unstructured":"Est\u00e8ve Y, Meignier S, Del\u00e9glise P, Mauclair J (2007) Extracting true speaker identities from transcriptions INTERSPEECH","DOI":"10.21437\/Interspeech.2007-586"},{"key":"4730_CR21","unstructured":"Favre B, Damnati G, B\u00e9chet F., Bendris M, Charlet D, Auguste R, Ayache S, Bigot B, Delteil A, Dufour R, Fredouille C, Linares G, Martinet J, Senay G, Tirilly P (2013) PERCOLI: a person identification system for the 2013 REPERE challenge SLAM-INTERSPEECH"},{"key":"4730_CR22","doi-asserted-by":"crossref","unstructured":"Gay P, Dupuy G, Lailler C, Odobez JM, Meignier S, Del\u00e9glise P (2014) Comparison of two methods for unsupervised person identification in tv shows CBMI","DOI":"10.1109\/CBMI.2014.6849828"},{"key":"4730_CR23","unstructured":"Giraudel A, Carr\u00e9 M, Mapelli V, Kahn J, Galibert O, Quintard L (2012) The REPERE corpus : a multimodal corpus for person recognition LREC"},{"key":"4730_CR24","doi-asserted-by":"crossref","unstructured":"Guillaumin M, Mensink T, Verbeek J, Schmid C (2012) Face recognition from caption-based supervision. IJCV","DOI":"10.1007\/s11263-011-0447-x"},{"key":"4730_CR25","doi-asserted-by":"crossref","unstructured":"Houghton R (1999) Named faces: Putting names to faces. IEEE Intell Syst:14","DOI":"10.1109\/5254.796089"},{"key":"4730_CR26","unstructured":"India M, Varas D, Vilaplana V, Morros J, Hernando J (2015) Upc system for the 2015 mediaeval multimodal person discovery in broadcast tv task Mediaeval"},{"key":"4730_CR27","doi-asserted-by":"crossref","unstructured":"Jousse V, Petit-Renaud S, Meignier S, Est\u00e8ve Y, Jacquin C (2009) Automatic named identification of speakers using diarization and ASR systems. In: The 34th IEEE international conference on acoustics, speech and signal processing, ICASSP pp 4557\u20134560","DOI":"10.1109\/ICASSP.2009.4960644"},{"key":"4730_CR28","doi-asserted-by":"crossref","unstructured":"Kahn J, Galibert O, Quintard L, Carr\u00e9 M, Giraudel A, Joly P (2012) A presentation of the REPERE challenge CBMI","DOI":"10.1109\/CBMI.2012.6269851"},{"key":"4730_CR29","unstructured":"Khoury E, S\u00e9nac C., Joly P (2012) Audiovisual diarization of people in video content. MTAP"},{"key":"4730_CR30","unstructured":"Lamel L, Courcinous S, Despres J, Gauvain J, Josse Y, Kilgour K, Kraft F, Le VB, Ney H, Nussbaum-Thom M, Oparin I, Schlippe T, Schl\u00ebter R, Schultz T, da Silva TF, St\u00fcker S, Sundermeyer M, Vieru B, Vu N, Waibel A, Woehrling C (2011) Speech recognition for machine translation in Quaero IWSLT"},{"key":"4730_CR31","unstructured":"Le N, Wu D, Meignier S, Odobez JM (2015) Eumssi team at the mediaeval person discovery challenge Mediaeval"},{"key":"4730_CR32","unstructured":"Lopez-Otero P, Barros R, Docio-Fernandez L, Gonz\u00e1lez-Agulla E, Alba-Castro J, Garcia-Mateo C (2015) Gtm-uvigo systems for person discovery task at mediaeval 2015 Mediaeval"},{"key":"4730_CR33","doi-asserted-by":"crossref","unstructured":"Mauclair J, Meignier S, Est\u00e8ve Y (2006) Speaker diarization: about whom the speaker is talking? IEEE Odyssey 2006 - the speaker and language recognition workshop","DOI":"10.1109\/ODYSSEY.2006.248114"},{"key":"4730_CR34","unstructured":"Nishi F, Inoue N, Shinoda K (2015) Combining audio features and visual i-vector at mediaeval 2015 multimodal person discovery in broadcast tv Mediaeval"},{"key":"4730_CR35","unstructured":"Over P, Awad G, Fiscus J, Antonishek B, Michel M, Smeaton A, Kraaij W, Qu\u00e9not G (2011) Trecvid 2010\u2013an overview of the goals, tasks, data, evaluation mechanisms and metrics"},{"key":"4730_CR36","doi-asserted-by":"crossref","unstructured":"Petit-Renaud S, Jousse V, Meignier S, Est\u00e8ve Y (2010) Identification of speakers by name using belief functions IPMU","DOI":"10.1007\/978-3-642-14055-6_19"},{"key":"4730_CR37","doi-asserted-by":"crossref","unstructured":"Pham P, Moens MF, Tuytelaars T (2010) Naming persons in news video with label propagation ICME","DOI":"10.1109\/ICME.2010.5583271"},{"key":"4730_CR38","doi-asserted-by":"crossref","unstructured":"Pham P, Tuytelaars T, Moens MF (2011) Naming people in news videos with label propagation. IEEE MultiMedia","DOI":"10.1109\/MMUL.2011.22"},{"key":"4730_CR39","doi-asserted-by":"crossref","unstructured":"Poignant J, Besacier L, Le V, Rosset S, Qu\u00e9not G (2013) Unsupervised aming of speakers in broadcast TV: using written names pronounced names or both?","DOI":"10.21437\/Interspeech.2013-380"},{"key":"4730_CR40","doi-asserted-by":"crossref","unstructured":"Poignant J, Besacier L, Qu\u00e9not G (2014) Nommage non-supervis\u00e9 des personnes dans les \u00e9missions de t\u00e9l\u00e9vision: utilisation des noms \u00e9crits, des noms prononc\u00e9s ou des deux? Documents num\u00e9riques","DOI":"10.3166\/dn.17.1.37-60"},{"key":"4730_CR41","doi-asserted-by":"crossref","unstructured":"Poignant J, Besacier L, Qu\u00e9not G (2015) Unsupervised speaker identification in tv broadcast based on written names. ASLP","DOI":"10.1109\/TASLP.2014.2367822"},{"key":"4730_CR42","doi-asserted-by":"crossref","unstructured":"Poignant J, Besacier L, Qu\u00e9not G, Thollard F (2012) From text detection in videos to person identification ICME","DOI":"10.1109\/ICME.2012.119"},{"key":"4730_CR43","unstructured":"Poignant J, Besacier L, Qu\u00e9not G (2013) Nommage non-supervis\u00e9 des personnes dans les \u00e9missions de t\u00e9l\u00e9vision: une revue du potentiel de chaque modalit\u00e9 CORIA"},{"key":"4730_CR44","unstructured":"Poignant J, Bredin H, Barras C (2015) Limsi at mediaeval 2015: Person discovery in broadcast tv task Mediaeval"},{"key":"4730_CR45","unstructured":"Poignant J, Bredin H, Barras C, Stefas M, Bruneau P, Tamisier T (2016) Benchmarking multimedia technologies with the CAMOMILE platform: the case of Multimodal Person Discovery at MediaEval 2015 LREC"},{"key":"4730_CR46","unstructured":"Poignant J, Bredin H, Besacier L, Qu\u00e9not G, Barras C (2013) Towards a better integration of written names for unsupervised speakers identification in videos SLAM-INTERSPEECH"},{"key":"4730_CR47","doi-asserted-by":"crossref","unstructured":"Poignant J, Bredin H, Le V, Besacier L, Barras C, Qu\u00e9not G (2012) Unsupervised speaker identification using overlaid texts in TV broadcast INTERSPEECH","DOI":"10.21437\/Interspeech.2012-344"},{"key":"4730_CR48","unstructured":"Poignant J, Budnik M, Bredin H, Barras C, Stefas M, Bruneau P, Adda G, Besacier L, Ekenel H, Francopoulo G, Hernando J, Mariani J, Morros R, Qu\u00e9not G, Rosset S, Tamisier T (2016) The CAMOMILE collaborative annotation platform for multi-modal, multi-lingual and multi-media documents LREC"},{"key":"4730_CR49","doi-asserted-by":"crossref","unstructured":"Poignant J, Fortier G, Besacier L, Qu\u00e9not G. (2015) Naming multi-modal clusters to identify persons in TV broadcast. MTAP","DOI":"10.1007\/s11042-015-2723-1"},{"key":"4730_CR50","doi-asserted-by":"crossref","unstructured":"Rouvier M, Dupuy G, Gay P, Khoury E, Merlin T, Meignier S (2013) An open-source state-of-the-art toolbox for broadcast news diarization INTERSPEECH","DOI":"10.21437\/Interspeech.2013-383"},{"key":"4730_CR51","doi-asserted-by":"crossref","unstructured":"Rouvier M, Favre B, Bendris M, Charlet D, Damnati G (2014) Scene understanding for identifying persons in TV shows: beyond face authentication CBMI","DOI":"10.1109\/CBMI.2014.6849829"},{"key":"4730_CR52","doi-asserted-by":"crossref","unstructured":"Sato T, Kanade T, Hughes T, Smith M, Satoh S (1999) Video ocr: Indexing digital news libraries by recognition of superimposed caption. In: ACM Multimedia systems","DOI":"10.1007\/s005300050140"},{"key":"4730_CR53","doi-asserted-by":"crossref","unstructured":"Satoh S, Nakamura Y, Kanade T (1999) Name-It: Naming and detecting faces in news videos. IEEE Multimedia 6","DOI":"10.1109\/93.752960"},{"key":"4730_CR54","doi-asserted-by":"crossref","unstructured":"Smeaton A, Over P, Kraaij W (2009) High-level feature detection from video in TRECVid: a 5-Year retrospective of achievements multimedia content analysis, theory and applications, pp 151\u2013174","DOI":"10.1007\/978-0-387-76569-3_6"},{"key":"4730_CR55","unstructured":"Tranter SE (2006) Who really spoke when? Finding speaker turns and identities in broadcast news audio ICASSP"},{"key":"4730_CR56","doi-asserted-by":"crossref","unstructured":"Ur\u0307i\u010ba\u0307r\u0307 M., Franc V, Hlava\u0307\u010b V. (2012) Detector of facial landmarks learned by the structured output SVM VISAPP","DOI":"10.1007\/978-3-642-38241-3_26"},{"issue":"3","key":"4730_CR57","doi-asserted-by":"crossref","first-page":"509","DOI":"10.1109\/TMM.2012.2233724","volume":"15","author":"F Vallet","year":"2013","unstructured":"Vallet F, Essid S, Carrive J (2013) A multimodal approach to speaker diarization on tv talk-shows. IEEE Trans Multimedia 15(3):509\u2013520","journal-title":"IEEE Transactions on Multimedia"},{"key":"4730_CR58","unstructured":"Xiong W, Droppo J, Huang X, Seide F, Seltzer M, Stolcke A, Yu D, Zweig G (2016) Achieving human parity in conversational speech recognition. arXiv: 1610.05256"},{"key":"4730_CR59","doi-asserted-by":"crossref","unstructured":"Yang J, Hauptmann A (2004) Naming every individual in news video monologues ACM Multimedia","DOI":"10.1145\/1027527.1027666"},{"key":"4730_CR60","doi-asserted-by":"crossref","unstructured":"Yang J, Yan R, Hauptmann A (2005) Multiple instance learning for labeling faces in broadcasting news video. In: ACM multimedia","DOI":"10.1145\/1101149.1101155"},{"key":"4730_CR61","doi-asserted-by":"crossref","unstructured":"Yilmaz E, Aslam J (2006) Estimating average precision with incomplete and imperfect judgments. In: 15th ACM international conference on information and knowledge management","DOI":"10.1145\/1183614.1183633"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-017-4730-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-4730-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-017-4730-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,28]],"date-time":"2022-07-28T20:09:29Z","timestamp":1659038969000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-017-4730-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,5,23]]},"references-count":61,"journal-issue":{"issue":"21","published-print":{"date-parts":[[2017,11]]}},"alternative-id":["4730"],"URL":"https:\/\/doi.org\/10.1007\/s11042-017-4730-x","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"type":"print","value":"1380-7501"},{"type":"electronic","value":"1573-7721"}],"subject":[],"published":{"date-parts":[[2017,5,23]]}}}