{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,27]],"date-time":"2025-10-27T16:15:48Z","timestamp":1761581748698,"version":"3.28.0"},"reference-count":24,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018,4]]},"DOI":"10.1109\/icassp.2018.8462100","type":"proceedings-article","created":{"date-parts":[[2018,9,21]],"date-time":"2018-09-21T22:24:48Z","timestamp":1537568688000},"page":"6553-6557","source":"Crossref","is-referenced-by-count":11,"title":["Accounting for Room Acoustics in Audio-Visual Multi-Speaker Tracking"],"prefix":"10.1109","author":[{"given":"Yutong","family":"Ban","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaofei","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xavier","family":"Alameda-Pineda","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Laurent","family":"Girin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Radu","family":"Horaud","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"crossref","first-page":"2417","DOI":"10.1109\/TMM.2016.2599150","article-title":"Mean-shift and sparse sampling-based SMC-PHD filtering for audio informed visual speaker tracking","volume":"18","author":"barnard","year":"2016","journal-title":"IEEE Transactions on Multimedia"},{"key":"ref11","doi-asserted-by":"crossref","first-page":"344","DOI":"10.1007\/978-3-319-53547-0_33","article-title":"Particle flow SMC-PHD filter for audiovisual multi-speaker tracking","author":"liu","year":"2017","journal-title":"International Conference on Latent Variable Analysis and Signal Separation"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2014.2377515"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.881678"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952686"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1049\/iet-spr.2011.0124"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0137057"},{"key":"ref17","article-title":"Exploiting the complementarity of audio and visual data in multi-speaker tracking","author":"ban","year":"2017","journal-title":"ICCV Workshop on Computer Vision for Audio-Visual Media"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2598319"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2017.2740001"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2554286"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2647702"},{"key":"ref6","first-page":"52","article-title":"Tracking multiple persons based on a variational bayesian model","author":"ban","year":"2016","journal-title":"ECCV Workshops"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2016.07.006"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1177\/0278364914548050"},{"key":"ref7","article-title":"Tracking a varying number of people with a visually-controlled robotic head","author":"ban","year":"2017","journal-title":"Intelligent Robots and Systems Vancouver Canada"},{"key":"ref2","article-title":"Exploting the intermittency of speech for joint separation and diarization","author":"kounades-bastian","year":"2017","journal-title":"IEEE WASPAA New Paltz USA"},{"key":"ref1","article-title":"An EM algorithm for joint source separation and diarization of multichannel convolutive speech mixtures","author":"kounades-bastian","year":"2017","journal-title":"IEEE ICASSP New Orleans Louisiana USA"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2522425"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.889720"},{"key":"ref22","first-page":"320","article-title":"Estimation of relative transfer function in the presence of stationary noise based on segmental power spectral density matrix subtraction","author":"li","year":"2015","journal-title":"IEEE ICASSP"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.2009576"},{"journal-title":"Mot16 A benchmark for multi-object tracking","year":"2016","author":"milan","key":"ref24"},{"key":"ref23","article-title":"Audio-visual speaker diarization based on spatiotemporal bayesian fusion","volume":"39","author":"gebru","year":"2017","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"}],"event":{"name":"ICASSP 2018 - 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","start":{"date-parts":[[2018,4,15]]},"location":"Calgary, AB","end":{"date-parts":[[2018,4,20]]}},"container-title":["2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8450881\/8461260\/08462100.pdf?arnumber=8462100","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,8,24]],"date-time":"2020-08-24T05:33:26Z","timestamp":1598247206000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8462100\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,4]]},"references-count":24,"URL":"https:\/\/doi.org\/10.1109\/icassp.2018.8462100","relation":{},"subject":[],"published":{"date-parts":[[2018,4]]}}}