{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,9,7]],"date-time":"2024-09-07T16:30:13Z","timestamp":1725726613467},"reference-count":41,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,1,9]],"date-time":"2023-01-09T00:00:00Z","timestamp":1673222400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,1,9]],"date-time":"2023-01-09T00:00:00Z","timestamp":1673222400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,1,9]]},"DOI":"10.1109\/slt54892.2023.10023184","type":"proceedings-article","created":{"date-parts":[[2023,1,27]],"date-time":"2023-01-27T13:54:03Z","timestamp":1674827643000},"page":"605-612","source":"Crossref","is-referenced-by-count":0,"title":["Joint Speaker Diarisation and Tracking in Switching State-Space Model"],"prefix":"10.1109","volume":"146","author":[{"given":"Jeremy H. M.","family":"Wong","sequence":"first","affiliation":[{"name":"Institute for Infocomm Research, A*STAR,Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yifan","family":"Gong","sequence":"additional","affiliation":[{"name":"Microsoft,USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.2307\/2291224"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TC.2007.1077"},{"key":"ref34","doi-asserted-by":"crossref","first-page":"2","DOI":"10.1049\/ip-rsn:19990255","article-title":"An improved par-ticle filter for non-linear problems","volume":"146","author":"carpenter","year":"0","journal-title":"IEE Proceedings - Radar Sonar and Navigation"},{"key":"ref12","first-page":"98","article-title":"Towards neural diarization for unlim-ited numbers of speakers using global and local attractors","author":"horiguchi","year":"2021","journal-title":"ASRU Cartagena Colombia"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1145\/355744.355745"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9413761"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1023\/A:1008935410038"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6288838"},{"key":"ref31","first-page":"3637","article-title":"The continuous categorical: a novel simplex-valued exponential family","author":"gordon-rodriguez","year":"2020","journal-title":"ICML"},{"key":"ref30","first-page":"276","article-title":"Ad-vances in online audio-visual meeting transcription","author":"yoshioka","year":"2019","journal-title":"ASRU Singapore"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.2307\/2289460"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747343"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1049\/ip-f-2.1993.0015"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2022.3162080"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2019.2961071"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1111\/1467-9868.00293"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/1143844.1143905"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1016\/j.procs.2011.08.047"},{"key":"ref38","first-page":"521","article-title":"&#x2018;N-body&#x2019; problems in statistical learning","author":"gray","year":"2000","journal-title":"NIPS Denver USA"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/AIPR.2007.21"},{"key":"ref19","doi-asserted-by":"crossref","first-page":"1620","DOI":"10.1109\/TASLP.2020.2990485","article-title":"The LOCATA chal-lenge: acoustic source localization and tracking","volume":"28","author":"evers","year":"0","journal-title":"IEEE\/ACM Transactions on Audio Speech and Language Processing"},{"key":"ref18","first-page":"702","article-title":"Tracking the active speaker based on ajoint audio-visual observation model","author":"gebru","year":"2015","journal-title":"ICCV Santiago Chile"},{"key":"ref24","first-page":"137","article-title":"Tracking multiple speak-ers with probabilistic data association filters","author":"gehrig","year":"2006","journal-title":"CLEAR Southampton UK"},{"key":"ref23","first-page":"82","article-title":"Multi-speaker localization and tracking in intelligent environments","author":"segura","year":"2007","journal-title":"CLEAR2007 and RT2007 Baltimore USA"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638406"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2005-120"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.5194\/ars-1-113-2003"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1002\/nav.3800020109"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/j.robot.2010.08.001"},{"key":"ref21","article-title":"Localization and tracking of an acoustic source using a diagonal unloading beamforming and a Kalman filter","author":"salvati","year":"2018","journal-title":"LOCATA Challenge Workshop"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1162\/089976600300015619"},{"key":"ref27","first-page":"614","article-title":"Multi-speaker tracking using multi-ple distributed microphone arrays","author":"plinge","year":"2014","journal-title":"ICASSP Florence Italy"},{"key":"ref29","first-page":"1153","article-title":"Complex angular cen-tral Gaussian mixture model for directional statistics in mask-based microphone array signal processing","author":"ito","year":"2016","journal-title":"EUSIPCO Budapest Hungary"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-2813"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2003.1318476"},{"key":"ref9","first-page":"6529","article-title":"BUT system for the second DI-HARD speech diarization challenge","author":"landini","year":"2020","journal-title":"IEEE ICASSP Barcelona Spain"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2006-566"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2011-383"},{"key":"ref6","article-title":"Automatic speaker clus-tering","author":"jin","year":"1997","journal-title":"DARPA Speech Recognition Workshop"},{"key":"ref5","first-page":"97","article-title":"Automatic segmentation, classification and clustering of broadcast news audio","author":"siegler","year":"1997","journal-title":"DARPA Speech Recognition Workshop"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/SLT48900.2021.9383531"}],"event":{"name":"2022 IEEE Spoken Language Technology Workshop (SLT)","start":{"date-parts":[[2023,1,9]]},"location":"Doha, Qatar","end":{"date-parts":[[2023,1,12]]}},"container-title":["2022 IEEE Spoken Language Technology Workshop (SLT)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10022052\/10022330\/10023184.pdf?arnumber=10023184","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,20]],"date-time":"2023-02-20T17:08:56Z","timestamp":1676912936000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10023184\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,1,9]]},"references-count":41,"URL":"https:\/\/doi.org\/10.1109\/slt54892.2023.10023184","relation":{},"subject":[],"published":{"date-parts":[[2023,1,9]]}}}