{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,3]],"date-time":"2026-03-03T17:07:20Z","timestamp":1772557640847,"version":"3.50.1"},"reference-count":40,"publisher":"Springer Science and Business Media LLC","issue":"1-2","license":[{"start":{"date-parts":[[2012,9,7]],"date-time":"2012-09-07T00:00:00Z","timestamp":1346976000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["J Multimodal User Interfaces"],"published-print":{"date-parts":[[2013,3]]},"DOI":"10.1007\/s12193-012-0111-y","type":"journal-article","created":{"date-parts":[[2012,9,6]],"date-time":"2012-09-06T10:34:10Z","timestamp":1346927650000},"page":"79-91","source":"Crossref","is-referenced-by-count":19,"title":["RAVEL: an annotated corpus for training robots with audiovisual abilities"],"prefix":"10.1007","volume":"7","author":[{"given":"Xavier","family":"Alameda-Pineda","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jordi","family":"Sanchez-Riera","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Johannes","family":"Wienke","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vojt\u011bch","family":"Franc","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jan","family":"\u010cech","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kaustubh","family":"Kulkarni","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Antoine","family":"Deleforge","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Radu","family":"Horaud","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2012,9,7]]},"reference":[{"key":"111_CR1","doi-asserted-by":"crossref","unstructured":"Alameda-Pineda X, Khalidov V, Horaud R, Forbes F (2011) Finding audio-visual events in informal social gatherings. In: Proceedings of the ACM\/IEEE international conference on multimodal interaction","DOI":"10.1145\/2070481.2070527"},{"key":"111_CR2","doi-asserted-by":"crossref","unstructured":"Arnaud E, Christensen H, Lu Y-C, Barker J, Khalidov V, Hansard M, Holveck B, Mathieu H, Narasimha R, Taillant E, Forbes F, Horaud RP (2008) The CAVA corpus: synchronised stereoscopic and binaural datasets with head movements. In: Proceedings of the ACM\/IEEE international conference on multimodal interfaces. http:\/\/perception.inrialpes.fr\/CAVA_Dataset\/","DOI":"10.1145\/1452392.1452414"},{"key":"111_CR3","doi-asserted-by":"crossref","unstructured":"Bailly-Baillire E, Bengio S, Bimbot F, Hamouz M, Kittler J, Mari\u00e9thoz J, Matas J, Messer K, Por\u00e9e F, Ruiz B (2003) The BANCA database and evaluation protocol. In: Proceedings of the international conference on audio and video-based biometric person authentication. Springer, Berlin, pp 625\u2013638 (2003)","DOI":"10.1007\/3-540-44887-X_74"},{"key":"111_CR4","unstructured":"Bouguet J-Y (2008) Camera calibration toolbox for Matlab. http:\/\/www.vision.caltech.edu\/bouguetj\/calib_doc\/"},{"key":"111_CR5","unstructured":"Brookes M. Voicebox: speech processing toolbox for matlab. http:\/\/www.ee.ic.ac.uk\/hp\/staff\/dmb\/voicebox\/voicebox.html"},{"key":"111_CR6","unstructured":"Brugman H, Russel A, Nijmegen X (2004) Annotating multi-media\/multimodal resources with ELAN. In: Proceedings of the international conference on language resources and evaluation, pp 2065\u20132068"},{"key":"111_CR7","doi-asserted-by":"crossref","unstructured":"Cech J, Sanchez-Riera J, Horaud RP (2011) Scene flow estimation by growing correspondence seeds. In: Proceedings of the IEEE international conference on computer vision and pattern recognition (2011)","DOI":"10.1109\/CVPR.2011.5995442"},{"issue":"5","key":"111_CR8","doi-asserted-by":"crossref","first-page":"975","DOI":"10.1121\/1.1907229","volume":"25","author":"EC Cherry","year":"1953","unstructured":"Cherry EC (1953) Some experiments on the recognition of speech, with one and with two ears. J Acoust Soc Am 25(5):975\u2013979","journal-title":"J Acoust Soc Am"},{"issue":"5","key":"111_CR9","doi-asserted-by":"crossref","first-page":"384","DOI":"10.1016\/j.specom.2006.11.002","volume":"49","author":"M Cooke","year":"2007","unstructured":"Cooke M, Barker J, Cunningham S, Shao X (2007) An audio-visual corpus for speech perception and automatic speech recognition (l). Speech Commun 49(5):384\u2013401","journal-title":"Speech Commun"},{"key":"111_CR10","doi-asserted-by":"crossref","unstructured":"Dalal N, Triggs B (2005) Histograms of oriented gradients for human detection. In: Proceedings of the IEEE international conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2005.177"},{"key":"111_CR11","doi-asserted-by":"crossref","unstructured":"Gorelick L, Blank M, Shechtman E, Irani M, Basri R (2007) Actions as space-time shapes. IEEE Trans Pattern Anal Mach Intell 29(12):2247\u20132253. http:\/\/www.wisdom.weizmann.ac.il\/vision\/SpaceTimeActions.html","DOI":"10.1109\/TPAMI.2007.70711"},{"issue":"9","key":"111_CR12","doi-asserted-by":"crossref","first-page":"2357","DOI":"10.1364\/JOSAA.25.002357","volume":"25","author":"M Hansard","year":"2008","unstructured":"Hansard M, Horaud RP (2008) Cyclopean geometry of binocular vision. J Opt Soc Am 25(9):2357\u20132369","journal-title":"J Opt Soc Am"},{"key":"111_CR13","doi-asserted-by":"crossref","unstructured":"Hartley RI, Zisserman A (2004) Multiple view geometry in computer vision, 2nd edn. Cambridge University Press, Cambridge. ISBN:0521540518","DOI":"10.1017\/CBO9780511811685"},{"key":"111_CR14","doi-asserted-by":"crossref","first-page":"1875","DOI":"10.1162\/0899766054322964","volume":"17","author":"S Haykin","year":"2005","unstructured":"Haykin S, Chen Z (2005) The cocktail party problem. J Neural Comput 17:1875\u20131902","journal-title":"J Neural Comput"},{"key":"111_CR15","doi-asserted-by":"crossref","unstructured":"Hazen TJ, Saenko K, La C-H, Glass JR (2004) A segment-based audio-visual speech recognizer: data collection, development, and initial experiments. In: Proceedings of the ACM international conference on multimodal interfaces, ICMI \u201904. ACM, New York, pp 235\u2013242 (2004)","DOI":"10.1145\/1027933.1027972"},{"key":"111_CR16","doi-asserted-by":"crossref","unstructured":"Hoai M, Zhong Lan Z, De la Torre F (2011) Joint segmentation and classification of human actions in video. In: Proceedings of the IEEE international conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2011.5995470"},{"issue":"7","key":"111_CR17","doi-asserted-by":"crossref","first-page":"1409","DOI":"10.1109\/TPAMI.2011.239","volume":"34","author":"Z Kalal","year":"2012","unstructured":"Kalal Z, Mikolajczyk K, Matas J (2012) Tracking-learning-detection. IEEE Trans Pattern Anal Mach Intell 34(7):1409\u20131422","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"2","key":"111_CR18","doi-asserted-by":"crossref","first-page":"517","DOI":"10.1162\/NECO_a_00074","volume":"23","author":"V Khalidov","year":"2011","unstructured":"Khalidov V, Forbes F, Horaud R (2011) Conjugate mixture models for clustering multimodal data. J Neural Comput 23(2):517\u2013557","journal-title":"J Neural Comput"},{"issue":"1","key":"111_CR19","first-page":"61","volume":"5","author":"HD Kim","year":"2007","unstructured":"Kim HD, Suk Choi J, Kim M (2007) Human-robot interaction in real environments by audio-visual integration. Int J Control Autom Syst 5(1):61\u201369","journal-title":"Int J Control Autom Syst"},{"key":"111_CR20","doi-asserted-by":"crossref","unstructured":"Laptev I (2005) On space-time interest points. Int J Comput Vis 64(2\u20133):107\u2013123","DOI":"10.1007\/s11263-005-1838-7"},{"key":"111_CR21","doi-asserted-by":"crossref","unstructured":"Laptev I, Marszalek M, Schmid C, Rozenfeld B (2008) Learning realistic human actions from movies. In: Proceedings of the IEEE international conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"111_CR22","doi-asserted-by":"crossref","unstructured":"Lathoud G, Odobez J, Gatica-P\u00e9rez D (2005) AV16.3: an audio-visual corpus for speaker localization and tracking. In: Proceedings of the workshop on machine learning and multimodal interaction. Springer, Berlin (2005)","DOI":"10.1007\/978-3-540-30568-2_16"},{"key":"111_CR23","doi-asserted-by":"crossref","unstructured":"Liu J, Luo J, Shah M (2009) Recognizing realistic actions from videos \u201cin the wild\u201d. In: Proceedings of the IEEE international conference on computer vision and, pattern recognition","DOI":"10.1109\/CVPR.2009.5206744"},{"issue":"5","key":"111_CR24","doi-asserted-by":"crossref","first-page":"901","DOI":"10.1109\/21.44007","volume":"19","author":"R Luo","year":"1989","unstructured":"Luo R, Kay M (1989) Multisensor integration and fusion in intelligent systems. IEEE Trans Syst Man Cybern 19(5):901\u2013931","journal-title":"IEEE Trans Syst Man Cybern"},{"key":"111_CR25","unstructured":"Marcel S, McCool C, Matejka P, Ahonen T, Cernocky J (2010) Mobile biometry (MOBIO) face and speaker verification evaluation. Idiap-RR Idiap-RR-09-2010, Idiap"},{"key":"111_CR26","doi-asserted-by":"crossref","unstructured":"Marszalek M, Laptev I, Schmid C (2009) Actions in context. In: Proceedings of the IEEE international conference on computer vision and pattern recognition","DOI":"10.1109\/CVPR.2009.5206557"},{"key":"111_CR27","unstructured":"Messer K, Matas J, Kittler J, Jonsson K (1999) XM2VTSDB: the extended M2VTS database. In: Proceedings of the international conference on audio and video-based biometric person authentication, pp 72\u201377"},{"key":"111_CR28","doi-asserted-by":"crossref","unstructured":"Messing R, Pal C, Kautz H (2009) Activity recognition using the velocity histories of tracked keypoints. In: Proceedings of the IEEE international conference on computer vision. IEEE Computer Society, Washington","DOI":"10.1109\/ICCV.2009.5459154"},{"key":"111_CR29","doi-asserted-by":"crossref","unstructured":"Mohammad Y, Xu Y, Matsumura K, Nishida T (2008) The H3R explanation corpus human-human and base human-robot interaction dataset. In: International conference on intelligent sensors, sensor networks and information processing, pp 201\u2013206","DOI":"10.1109\/ISSNIP.2008.4761987"},{"key":"111_CR30","doi-asserted-by":"crossref","unstructured":"Patterson EK, Gurbuz S, Tufekci Z, Gowdy JN (2002) CUAVE: a new audio-visual database for multimodal human-computer interface research. In: Proceedings of the IEEE international conference on acoustics speech and signal processing, pp 2017\u20132020","DOI":"10.1109\/ICASSP.2002.5745028"},{"key":"111_CR31","unstructured":"Pigeon S (1996) M2vts database. http:\/\/www.tele.ucl.ac.be\/PROJECTS\/M2VTS\/"},{"key":"111_CR32","doi-asserted-by":"crossref","unstructured":"Rybok L, Friedberger S, Hanebeck UD, Stiefelhagen R (2011) The KIT Robo-Kitchen data set for the evaluation of view-based activity recognition systems. In: Proceedings of the IEEE-RAS international conference on humanoid robots","DOI":"10.1109\/Humanoids.2011.6100854"},{"key":"111_CR33","doi-asserted-by":"crossref","unstructured":"Sch\u00fcldt C, Laptev I, Caputo B (2004) Recognizing human actions: a local svm approach. In: Proceedings of the international conference on pattern recognition, pp 32\u201336","DOI":"10.1109\/ICPR.2004.1334462"},{"issue":"1","key":"111_CR34","doi-asserted-by":"crossref","first-page":"22","DOI":"10.1007\/s11263-010-0384-0","volume":"93","author":"Q Shi","year":"2011","unstructured":"Shi Q, Wang L, Cheng L, Smola A (2011) Discriminative human action segmentation and recognition using SMMs. Int J Comput Vis 93(1):22\u201332","journal-title":"Int J Comput Vis"},{"key":"111_CR35","unstructured":"T. O Project (2011) http:\/\/www.opportunity-project.eu\/"},{"key":"111_CR36","doi-asserted-by":"crossref","unstructured":"Tenorth M, Bandouch J, Beetz M (2009) The TUM Kitchen Data Set of everyday manipulation activities for motion tracking and action recognition. In: Proceedings of the IEEE international workshop on tracking humans for the evaluation of their motion in image sequences in conjunction with the international conference on computer vision","DOI":"10.1109\/ICCVW.2009.5457583"},{"issue":"3","key":"111_CR37","doi-asserted-by":"crossref","first-page":"475","DOI":"10.1109\/TPAMI.2005.63","volume":"27","author":"S Vedula","year":"2005","unstructured":"Vedula S, Baker S, Rander P, Collins R (2005) Kanade T (2005) Three-dimensional scene flow. IEEE Trans Pattern Anal Mach Intell 27(3):475\u2013480","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"111_CR38","doi-asserted-by":"crossref","unstructured":"Weinland D, Ronfard R, Boyer E (2006) Free viewpoint action recognition using motion history volumes. J Comput Vis Image Understanding 104(2):249\u2013257. http:\/\/4drepository.inrialpes.fr\/public\/viewgroup\/6","DOI":"10.1016\/j.cviu.2006.07.013"},{"key":"111_CR39","doi-asserted-by":"crossref","unstructured":"Willems G, Becker JH, Tuytelaars T (2009) Exemplar-based action recognition in video. In: Proceedings of the British machine vision conference","DOI":"10.5244\/C.23.90"},{"issue":"2","key":"111_CR40","doi-asserted-by":"crossref","first-page":"501","DOI":"10.1109\/TRO.2008.918046","volume":"24","author":"Z Zivkovic","year":"2008","unstructured":"Zivkovic Z, Booij O, Krose B, Topp E, Christensen H (2008) From sensors to human spatial concepts: an annotated data set. IEEE Trans Rob 24(2):501\u2013505","journal-title":"IEEE Trans Rob"}],"container-title":["Journal on Multimodal User Interfaces"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s12193-012-0111-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s12193-012-0111-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s12193-012-0111-y","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,7,3]],"date-time":"2019-07-03T13:54:12Z","timestamp":1562162052000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s12193-012-0111-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,9,7]]},"references-count":40,"journal-issue":{"issue":"1-2","published-print":{"date-parts":[[2013,3]]}},"alternative-id":["111"],"URL":"https:\/\/doi.org\/10.1007\/s12193-012-0111-y","relation":{},"ISSN":["1783-7677","1783-8738"],"issn-type":[{"value":"1783-7677","type":"print"},{"value":"1783-8738","type":"electronic"}],"subject":[],"published":{"date-parts":[[2012,9,7]]}}}