{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,14]],"date-time":"2025-02-14T05:23:41Z","timestamp":1739510621451,"version":"3.37.0"},"reference-count":53,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"2","license":[{"start":{"date-parts":[[2010,2,1]],"date-time":"2010-02-01T00:00:00Z","timestamp":1264982400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Multimedia"],"published-print":{"date-parts":[[2010,2]]},"DOI":"10.1109\/tmm.2009.2037387","type":"journal-article","created":{"date-parts":[[2009,12,1]],"date-time":"2009-12-01T15:11:45Z","timestamp":1259680305000},"page":"108-120","source":"Crossref","is-referenced-by-count":10,"title":["Onsets Coincidence for Cross-Modal Analysis"],"prefix":"10.1109","volume":"12","author":[{"given":"Z.","family":"Barzelay","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Y.Y.","family":"Schechner","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","article-title":"blind one-microphone speech separation: a spectral learning approach","author":"bach","year":"2004","journal-title":"Proc NIPS"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/78.258082"},{"key":"ref33","article-title":"high accuracy optical flow estimation based on a theory for warping","author":"brox","year":"2004","journal-title":"Proc ECCV"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2005.851998"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2002.1047425"},{"key":"ref30","article-title":"action recognition based on view invariant spatio-temporal analysis","author":"rao","year":"2003","journal-title":"Proc ACM Multimedia"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1137\/S1064827596304010"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1999.757494"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/34.868680"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2000.855807"},{"journal-title":"An Implementation of the Kanade-Lucas-Tomasi Feature Tracker","year":"0","author":"birchfield","key":"ref28"},{"key":"ref27","first-page":"593","article-title":"good features to track","author":"shi","year":"1994","journal-title":"Proc IEEE CVPR"},{"journal-title":"Experiments Data","year":"0","author":"barzelay","key":"ref29"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2004.1327196"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ROBOT.2002.1013493"},{"journal-title":"Computer Vision A Modern Approach","year":"2003","author":"forsyth","key":"ref20"},{"key":"ref22","doi-asserted-by":"crossref","DOI":"10.1163\/9789004658820","author":"moore","year":"1997","journal-title":"An Introduction to the Psychology of Hearing"},{"key":"ref21","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4613-2551-2","author":"lowe","year":"1985","journal-title":"Perceptual Organization and Visual Recognition"},{"key":"ref24","first-page":"813","article-title":"audio vision: using audio-visual synchrony to locate sounds","author":"hershey","year":"1999","journal-title":"Proc NIPS"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1121\/1.2816572"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.1998.710832"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/s00221-005-2385-8"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.904233"},{"key":"ref51","first-page":"753","article-title":"musical instrument recognition using cepstral coefficients and temporal features","volume":"2","author":"eronen","year":"2000","journal-title":"IEEE Proc ICASSP"},{"key":"ref53","article-title":"efficient pitch detection techniques for interactive music using harmonic model","author":"cuadra","year":"2001","journal-title":"Proc ICMI"},{"journal-title":"Multirate Digital Signal Processing","year":"1983","author":"crochiere","key":"ref52"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2006.34"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1126\/science.1073712"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2004.828896"},{"key":"ref12","first-page":"793","article-title":"one microphone source separation","author":"roweis","year":"2001","journal-title":"Proc NIPS"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1145\/146370.146374"},{"key":"ref14","doi-asserted-by":"crossref","DOI":"10.7551\/mitpress\/1486.001.0001","author":"bregman","year":"1990","journal-title":"Auditory Scene Analysis"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2007.383345"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2006.277"},{"key":"ref17","first-page":"597","article-title":"computer vision for music identification","volume":"1","author":"ke","year":"2005","journal-title":"Proc IEEE CVPR"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2005.216"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2007.383344"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICPR.2002.1048137"},{"key":"ref3","first-page":"709","article-title":"audio\/visual independent components","author":"smaragdis","year":"2003","journal-title":"Proc ICA"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2003.823147"},{"key":"ref5","first-page":"1173","article-title":"audio-visual sound separation via hidden markov models","author":"hershey","year":"2001","journal-title":"Proc NIPS"},{"key":"ref8","first-page":"1611","article-title":"audio-visual segmentation and the cocktail party effect","author":"darrell","year":"2000","journal-title":"Proc ICMI"},{"key":"ref7","doi-asserted-by":"crossref","first-page":"213","DOI":"10.1109\/ICIF.2002.1021153","article-title":"relating audio-visual events caused by multiple movements: in the case of entire object movement","author":"chen","year":"2002","journal-title":"Inf Fusion"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.901310"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2006.888095"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2003.815516"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1016\/j.sigpro.2007.01.016"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1993.319415"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2003.819950"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2005.854110"},{"journal-title":"Discrete-Time Speech Signal Processing Principles and Practice","year":"2002","author":"quatieri","key":"ref41"},{"key":"ref44","first-page":"749","article-title":"separation of stop consonants","author":"hu","year":"2003","journal-title":"Proc IEEE ICASSP"},{"journal-title":"Digital Processing of Speech Signals","year":"1978","author":"rabiner","key":"ref43"}],"container-title":["IEEE Transactions on Multimedia"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx5\/6046\/5379168\/05340552.pdf?arnumber=5340552","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,13]],"date-time":"2025-02-13T15:02:24Z","timestamp":1739458944000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/5340552\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2010,2]]},"references-count":53,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.1109\/tmm.2009.2037387","relation":{},"ISSN":["1520-9210","1941-0077"],"issn-type":[{"type":"print","value":"1520-9210"},{"type":"electronic","value":"1941-0077"}],"subject":[],"published":{"date-parts":[[2010,2]]}}}