{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,10]],"date-time":"2026-04-10T10:01:04Z","timestamp":1775815264240,"version":"3.50.1"},"reference-count":37,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2008,12,1]],"date-time":"2008-12-01T00:00:00Z","timestamp":1228089600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Multimedia"],"published-print":{"date-parts":[[2008,12]]},"DOI":"10.1109\/tmm.2008.2007344","type":"journal-article","created":{"date-parts":[[2008,12,17]],"date-time":"2008-12-17T20:13:00Z","timestamp":1229544780000},"page":"1541-1552","source":"Crossref","is-referenced-by-count":30,"title":["Boosting-Based Multimodal Speaker Detection for Distributed Meeting Videos"],"prefix":"10.1109","volume":"10","author":[{"given":"Cha","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pei","family":"Yin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yong","family":"Rui","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ross","family":"Cutler","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Paul","family":"Viola","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinding","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Nelson","family":"Pinto","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhengyou","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref33","author":"goodridge","year":"1997","journal-title":"Multimedia Sensor Fusion for Intelligent Camera Control and Human-Computer Interaction"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/34.598236"},{"key":"ref31","author":"collins","year":"2000","journal-title":"?A System for Video Surveillance and Monitoring ? Tech Rep"},{"key":"ref30","article-title":"detecting pedestrians using patterns of motion and appearance","author":"viola","year":"2003","journal-title":"Proc IEEE ICCV"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2005.177"},{"key":"ref36","article-title":"multiple-instance pruning for learning efficient cascade detectors","author":"zhang","year":"2007","journal-title":"NIPS"},{"key":"ref35","article-title":"boosting algorithms as gradient decent","author":"mason","year":"2000","journal-title":"NIPS"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1023\/A:1013912006537"},{"key":"ref10","article-title":"discovery and fusion of salient multi-modal features towards news story segmentation","author":"hsu","year":"2004","journal-title":"SPIE Electronic Imaging"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.1997.609450"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2001.1237704"},{"key":"ref13","article-title":"speaker change detection using joint audio-visual statistics","author":"iyengar","year":"2000","journal-title":"Int RIAO Conf"},{"key":"ref14","author":"besson","year":"2005","journal-title":"?Information Theoretic Optimization of Audio Features for Multimodal Speaker Detection ? Tech Rep"},{"key":"ref15","first-page":"772","article-title":"learning joint statistical models for audio-visual fusion and segregation","author":"fisher","year":"2000","journal-title":"NIPS"},{"key":"ref16","article-title":"audio vision: using audio-visual synchrony to locate sounds","author":"hershey","year":"2000","journal-title":"Advances in neural information processing systems"},{"key":"ref17","article-title":"multimodal speaker detection using error feedback dynamic bayesian networks","author":"pavlovi?","year":"2001","journal-title":"Proc IEEE CVPR"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1155\/S1110865702206058"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2001.937600"},{"key":"ref28","author":"friedman","year":"1998","journal-title":"?Additive Logistic Regression A Statistical View of Boosting ? Tech Rep"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/641007.641100"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1997.599651"},{"key":"ref3","author":"kapralos","year":"2002","journal-title":"?Audio-Visual Localization of Multiple Speakers in a Video Teleconferencing Setting ? Tech Rep"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1997.599595"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1023\/A:1007614523901"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1023\/B:VISI.0000013087.49260.fb"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-662-13015-5_35"},{"key":"ref7","article-title":"sound source localization for circular arrays of directional microphones","author":"rui","year":"2005","journal-title":"Proc IEEE ICASSP"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/641007.641112"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/6046.865479"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2005.1415605"},{"key":"ref20","article-title":"speaker localisation using audio-visual synchrony: an empirical study","author":"nock","year":"2003","journal-title":"Proc CIVR"},{"key":"ref22","article-title":"audio-video sensor fusion with probabilistic graphical models","author":"beal","year":"2002","journal-title":"Proc ECCV"},{"key":"ref21","article-title":"look who's talking: speaker detection using video and audio correlation","author":"cutler","year":"2000","journal-title":"Proc IEEE ICME"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/1088463.1088477"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.823146"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ACSSC.2001.987753"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2007.366632"}],"container-title":["IEEE Transactions on Multimedia"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/6046\/4694844\/04694847.pdf?arnumber=4694847","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,11,29]],"date-time":"2021-11-29T20:49:43Z","timestamp":1638218983000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/4694847\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2008,12]]},"references-count":37,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tmm.2008.2007344","relation":{},"ISSN":["1520-9210"],"issn-type":[{"value":"1520-9210","type":"print"}],"subject":[],"published":{"date-parts":[[2008,12]]}}}