{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,18]],"date-time":"2026-03-18T00:47:36Z","timestamp":1773794856991,"version":"3.50.1"},"reference-count":34,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"7","license":[{"start":{"date-parts":[[2003,7,1]],"date-time":"2003-07-01T00:00:00Z","timestamp":1057017600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Machine Intell."],"published-print":{"date-parts":[[2003,7]]},"DOI":"10.1109\/tpami.2003.1206512","type":"journal-article","created":{"date-parts":[[2003,6,23]],"date-time":"2003-06-23T19:10:59Z","timestamp":1056395459000},"page":"828-836","source":"Crossref","is-referenced-by-count":81,"title":["A graphical model for audiovisual object tracking"],"prefix":"10.1109","volume":"25","author":[{"given":"M.J.","family":"Beal","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"N.","family":"Jojic","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"H.","family":"Attias","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.21437\/Eurospeech.2001-450"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1998.10.6.1373"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.1999.786997"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4471-1555-7"},{"key":"ref5","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-662-04619-7","volume-title":"Microphone Arrays","author":"Brandstein","year":"2001"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1121\/1.426904"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1994.389567"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ITSC.2000.881070"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2000.871073"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1145\/641007.641112"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.940366"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/1120.003.0097"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2005.169"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2003.1159942"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/AFGR.2000.840663"},{"key":"ref16","article-title":"\u201cStereo Vision Lip-Tracking for Audio-Video Speech Processing","volume-title":"Proc. IEEE Conf. Acoustics, Speech, and Signal Processing","author":"Goecke"},{"key":"ref17","article-title":"\u201cAudio-Visual Speech Separation Using Hidden Markov Models","volume-title":"Proc. Advances in Neural Information Processing Systems 2001","volume":"14","author":"Hershey"},{"key":"ref18","article-title":"\u201cUsing Audio-Visual Synchrony to Locate Sounds","volume-title":"Proc. Advances in Neural Information Processing Systems 1999","volume":"12","author":"Hershey"},{"key":"ref19","article-title":"\u201cLearning Joint Statistical Models for Audio-Visual Fusion and Segregation","volume-title":"Proc. Advances in Neural Information Processing Systems 2000","volume":"14","author":"Fisher"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2001.990505"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2001.990476"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2000.854728"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1007\/978-94-011-5014-9_5"},{"key":"ref24","article-title":"\u201cReal-Time Auditory and Visual Multiple-Object Tracking for Robots","volume-title":"Proc. Int\u2019l Joint Conf. Artificial Intelligence","author":"Nakadai"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/978-94-011-5014-9_12"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-48035-8_70"},{"key":"ref27","article-title":"\u201cAudio-Visual Tracking for Natural Interfaces","volume-title":"Proc. ACM Multimedia","author":"Pingali"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2001.991045"},{"key":"ref29","article-title":"\u201cFacesync: A Linear Operator for Measuring Synchronization of Video Facial Images and Audio Tracks","volume-title":"Proc. Advances in Neural Information Processing Systems 2000","volume":"14","author":"Slaney"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1997.599650"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2001.937600"},{"key":"ref32","article-title":"\u201cVoice Source Localization for Automatic Camera Pointing System in Cideoconferencing","volume-title":"Proc. IEEE Conf. Acoustics, Speech, and Signal Processing","author":"Wang"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/971478.971500"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1155\/S1110865702206058"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/34\/27147\/01206512.pdf?arnumber=1206512","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,16]],"date-time":"2025-03-16T04:49:44Z","timestamp":1742100584000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/1206512\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2003,7]]},"references-count":34,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2003,7]]}},"URL":"https:\/\/doi.org\/10.1109\/tpami.2003.1206512","relation":{},"ISSN":["0162-8828"],"issn-type":[{"value":"0162-8828","type":"print"}],"subject":[],"published":{"date-parts":[[2003,7]]}}}