{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T14:38:13Z","timestamp":1780411093660,"version":"3.54.1"},"reference-count":26,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"11","license":[{"start":{"date-parts":[[2008,11,1]],"date-time":"2008-11-01T00:00:00Z","timestamp":1225497600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Circuits Syst. Video Technol."],"published-print":{"date-parts":[[2008,11]]},"DOI":"10.1109\/tcsvt.2008.2005602","type":"journal-article","created":{"date-parts":[[2008,9,29]],"date-time":"2008-09-29T20:06:35Z","timestamp":1222718795000},"page":"1608-1617","source":"Crossref","is-referenced-by-count":18,"title":["Exploring Co-Occurence Between Speech and Body Movement for Audio-Guided Video Localization"],"prefix":"10.1109","volume":"18","author":[{"given":"H.","family":"Vajaria","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"S.","family":"Sarkar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"R.","family":"Kasturi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref10","first-page":"813","article-title":"audio vision: using audiovisual synchrony to locate sounds","author":"hershey","year":"1999","journal-title":"Adv Neural Inf Process Syst"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1002\/ima.10045"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2005.274"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1016\/j.sigpro.2006.02.044"},{"key":"ref14","first-page":"488","article-title":"speaker localization using audio-visual synchrony: an empirical study","author":"nock","year":"2003","journal-title":"Proc ACM Int Conf Multimedia"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2007.1077"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1155\/S1110865702206101"},{"key":"ref17","first-page":"110","article-title":"vision-based speaker detection using bayesian networks","author":"regh","year":"1999","journal-title":"Comput Vis Pattern Recognit"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1006\/dspr.1999.0361"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2006.262663"},{"key":"ref4","doi-asserted-by":"crossref","DOI":"10.21437\/Eurospeech.2003-329","article-title":"a sequential metric-based audio segmentation using bayesian information criterion","author":"cheng","year":"2003","journal-title":"Eurospeech"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2005.1415605"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/641007.641112"},{"key":"ref5","doi-asserted-by":"crossref","first-page":"1589","DOI":"10.1109\/ICME.2000.871073","article-title":"look who's talking: speaker detection using video and audio correlation","author":"cutler","year":"2000","journal-title":"Proc IEEE Int Conf Multimedia"},{"key":"ref8","first-page":"592","article-title":"probabalistic models and informative subspaces for audiovisual correspondence","volume":"3","author":"fisher","year":"2002","journal-title":"Proc European Conf Computer Vision"},{"key":"ref7","author":"fiscus","year":"2007","journal-title":"Rich Transcription 2005 Spring Meeting Recognition Evaluation"},{"key":"ref2","first-page":"2329","article-title":"speaker diarization using bottom-up clustering based on a parameter-derived distance between adapted gmms","author":"ben","year":"2004","journal-title":"Proc Int Conf Spoken Language Processing"},{"key":"ref9","article-title":"the nist meeting room pilot corpus","author":"garofolo","year":"2004","journal-title":"Proc 1st Int Conf Language Resources and Evaluation"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2007.383344"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/34.857006"},{"key":"ref22","first-page":"1","article-title":"the clear 2006 evaluation","author":"stiefelhagen","year":"2006","journal-title":"Springer Lecture Notes on Computer Science 829"},{"key":"ref21","first-page":"814","article-title":"facesync: a linear operator for measuring synchronization of video facial images and audio tracks","volume":"14","author":"slaney","year":"2000","journal-title":"Adv Neural Inf Process Syst"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2006.283"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.878256"},{"key":"ref26","article-title":"towards robust speaker segmentation: the icsi-sri fall 2004 diarization system","author":"wooters","year":"2004","journal-title":"Proc Rich Transcription Workshop"},{"key":"ref25","first-page":"1330","article-title":"multimodal signal analysis of prosody and hand motion: temporal correlation of speech and gestures","author":"valbonesi","year":"2002","journal-title":"Proc Eur Signal Processing Conf"}],"container-title":["IEEE Transactions on Circuits and Systems for Video Technology"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/76\/4660349\/04633640.pdf?arnumber=4633640","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,1]],"date-time":"2025-02-01T08:27:13Z","timestamp":1738398433000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/4633640\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2008,11]]},"references-count":26,"journal-issue":{"issue":"11"},"URL":"https:\/\/doi.org\/10.1109\/tcsvt.2008.2005602","relation":{},"ISSN":["1051-8215","1558-2205"],"issn-type":[{"value":"1051-8215","type":"print"},{"value":"1558-2205","type":"electronic"}],"subject":[],"published":{"date-parts":[[2008,11]]}}}