{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,28]],"date-time":"2026-07-28T09:53:03Z","timestamp":1785232383274,"version":"3.55.0"},"reference-count":364,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2018,8,1]],"date-time":"2018-08-01T00:00:00Z","timestamp":1533081600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"funder":[{"name":"Research Programme KAMoulox","award":["ANR-15-CE38-0003-01"],"award-info":[{"award-number":["ANR-15-CE38-0003-01"]}]},{"name":"ANR"},{"name":"French State Agency for Research"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2018,8]]},"DOI":"10.1109\/taslp.2018.2825440","type":"journal-article","created":{"date-parts":[[2018,4,12]],"date-time":"2018-04-12T20:27:02Z","timestamp":1523564822000},"page":"1307-1335","source":"Crossref","is-referenced-by-count":90,"title":["An Overview of Lead and Accompaniment Separation in Music"],"prefix":"10.1109","volume":"26","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1889-5175","authenticated-orcid":false,"given":"Zafar","family":"Rafii","sequence":"first","affiliation":[{"name":"Gracenote, Emeryville, CA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Antoine","family":"Liutkus","sequence":"additional","affiliation":[{"name":"Inria and LIRMM, University of Montpellier, Montpellier, France"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fabian-Robert","family":"Stoter","sequence":"additional","affiliation":[{"name":"Inria and LIRMM, University of Montpellier, Montpellier, France"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Stylianos Ioannis","family":"Mimilakis","sequence":"additional","affiliation":[{"name":"Fraunhofer IDMT, Ilmenau, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Derry","family":"FitzGerald","sequence":"additional","affiliation":[{"name":"Cork School of Music, Cork Institute of Technology, Cork, U.K."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bryan","family":"Pardo","sequence":"additional","affiliation":[{"name":"Northwestern University, Evanston, IL, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref275","article-title":"Musdb18, a dataset for audio source separation","author":"rafii","year":"2017"},{"key":"ref364","article-title":"Untwist: A new toolbox for audio source separation","author":"roma","year":"2016","journal-title":"Proc 17th Int Soc Music Inf Retr Conf"},{"key":"ref274","article-title":"MedleyDB: A multitrack dataset for annotation-intensive MIR research","author":"bittner","year":"2014","journal-title":"Proc 15th Int Soc Music Inf Retr Conf"},{"key":"ref363","first-page":"126","article-title":"Common fate model for unison source separation","author":"st\u00f6ter","year":"2016","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref277","doi-asserted-by":"publisher","DOI":"10.1162\/0148926041790630"},{"key":"ref362","article-title":"On the perceptual relevance of objective source separation measures for singing voice separation","author":"gupta","year":"2005","journal-title":"Proc IEEE Workshop Appl Signal Process Audio Acoust"},{"key":"ref276","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2005.1540176"},{"key":"ref361","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7471749"},{"key":"ref271","doi-asserted-by":"crossref","first-page":"387","DOI":"10.1007\/978-3-319-22482-4_45","article-title":"The 2015 signal separation evaluation campaign","author":"ono","year":"2015","journal-title":"Proc 13th Int Conf Latent Var Anal Signal Separation"},{"key":"ref360","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-28551-6_53"},{"key":"ref270","doi-asserted-by":"publisher","DOI":"10.1016\/j.sigpro.2011.10.007"},{"key":"ref273","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2011.2119315"},{"key":"ref170","first-page":"283","article-title":"Vocal separation using singer-vowel priors obtained from polyphonic audio","author":"venkataramani","year":"2014","journal-title":"Proc 15th Int Soc Music Inf Retr Conf"},{"key":"ref272","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-53547-0_31"},{"key":"ref172","first-page":"43","article-title":"Context-aware features for singing voice detection in polyphonic music","author":"rao","year":"2011","journal-title":"Proc Int Workshop Adapt Multimedia Ret"},{"key":"ref171","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2042124"},{"key":"ref174","doi-asserted-by":"crossref","first-page":"54","DOI":"10.1109\/MSP.2014.2298891","article-title":"Nonnegative matrix and tensor factorizations: An algorithmic perspective","volume":"31","author":"zhang","year":"2014","journal-title":"IEEE Signal Process Mag"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2011.2158803"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2577879"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178034"},{"key":"ref178","article-title":"A music performance assistance system based on vocal, harmonic, and percussive source separation and content visualization for music audio signals","author":"dobashi","year":"2015","journal-title":"Proc Sound and Music Computing Conf"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.1121\/1.396427"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2354242"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2042119"},{"key":"ref39","article-title":"Separation of singing and piano sounds","author":"meron","year":"1998","journal-title":"Proc Int Conf Spoken Lang Process"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.1995.482910"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2013.2271648"},{"key":"ref32","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1111\/j.2517-6161.1977.tb01600.x","article-title":"Maximum likelihood from incomplete data via the EM algorithm","volume":"39","author":"dempster","year":"1977","journal-title":"J Roy Stat Soc"},{"key":"ref359","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2109381"},{"key":"ref31","author":"bishop","year":"1996","journal-title":"Neural Networks for Pattern Recognition"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2006.1657823"},{"key":"ref357","doi-asserted-by":"publisher","DOI":"10.1121\/1.2972136"},{"key":"ref267","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-00599-2_92"},{"key":"ref37","article-title":"Instantaneous and frequency-warped techniques for auditory source separation","author":"wang","year":"1994"},{"key":"ref358","article-title":"Multi-criteria subjective and objective evaluation of audio source separation","author":"emiya","year":"2010","journal-title":"Proc 38th Audio Eng Soc Conf"},{"key":"ref268","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15995-4_15"},{"key":"ref36","article-title":"An approach for the separation of voices in composite musical signals","author":"maher","year":"1989"},{"key":"ref355","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-74494-8_57"},{"key":"ref269","first-page":"414","article-title":"The 2011 signal separation evaluation campaign (SiSEC2011): - Audio source separation -","author":"arakiet","year":"0","journal-title":"Proc 10th Int Conf Latent Variable Anal Signal Separat"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TAU.1968.1161965"},{"key":"ref356","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2007.4285046"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.21236\/ADA008785"},{"key":"ref352","first-page":"247","article-title":"Influence of phase, magnitude and location of harmonic components in the perceived quality of extracted solo signals","author":"cano","year":"2011","journal-title":"Proc Audio Eng Soc Conf 42nd Int Conf Semantic Audio"},{"key":"ref288","doi-asserted-by":"publisher","DOI":"10.1038\/323533a0"},{"key":"ref351","article-title":"Preliminary guidelines for subjective evaluation of audio source separation algorithms","author":"vincent","year":"2006","journal-title":"Proc ICA Res Netw Int Workshop"},{"key":"ref287","doi-asserted-by":"publisher","DOI":"10.1214\/aoms\/1177729586"},{"key":"ref354","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2005.858005"},{"key":"ref286","author":"goodfellow","year":"2016","journal-title":"Deep Learning"},{"key":"ref353","article-title":"BSS_EVAL toolbox user guide - revision 2.0","author":"f\u00e9votte","year":"2005"},{"key":"ref285","doi-asserted-by":"publisher","DOI":"10.1038\/nature14539"},{"key":"ref284","doi-asserted-by":"publisher","DOI":"10.1561\/2000000039"},{"key":"ref181","first-page":"341","article-title":"PRAAT, a system for doing phonetics by computer","volume":"5","author":"boersma","year":"2001","journal-title":"Glot Int"},{"key":"ref283","first-page":"2013","article-title":"Speech enhancement using Bayesian wavenet","author":"qian","year":"0","journal-title":"Proc Interspeech 2017"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5495305"},{"key":"ref350","article-title":"Bs. 1534-1. method for the subjective assessment of intermediate sound quality (MUSHRA)","author":"recommendation","year":"2001","journal-title":"International Telecommunication Union Geneva"},{"key":"ref282","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15995-4_18"},{"key":"ref281","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854951"},{"key":"ref280","article-title":"Combining modeling of singing voice and background music for automatic separation of musical mixtures","author":"rafii","year":"2013","journal-title":"Proc 14th Int Soc Music Inf Retr Conf"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7177946"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-42297-8_4"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2004.03.007"},{"key":"ref182","doi-asserted-by":"crossref","first-page":"1361","DOI":"10.1109\/TASL.2009.2020886","article-title":"Monaural musical sound separation based on pitch and common amplitude modulation","volume":"17","author":"li","year":"2009","journal-title":"IEEE Trans Audio Speech Lang Process"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2009.4959531"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2008.4517573"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1145\/2733373.2806257"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1121\/1.1458024"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1214\/aos\/1176344136"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511779398"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2015.2396681"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/5.18626"},{"key":"ref348","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2008.930649"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7177973"},{"key":"ref349","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2015.7404837"},{"key":"ref22","first-page":"209","article-title":"The quefrency alanysis of time series for echoes: Cepstrum pseudo-autocovariance, cross-cepstrum, and saphe cracking","author":"bogert","year":"0","journal-title":"Proc Symp Time Series Anal"},{"key":"ref21","author":"fant","year":"1970","journal-title":"Acoustic Theory of Speech Production"},{"key":"ref344","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2050716"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1121\/1.1910339"},{"key":"ref345","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2011.6082285"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1121\/1.1918949"},{"key":"ref346","author":"zwicker","year":"2013","journal-title":"Psychoacoustics Facts and Models"},{"key":"ref278","doi-asserted-by":"publisher","DOI":"10.1109\/89.279278"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1121\/1.1911395"},{"key":"ref347","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.941023"},{"key":"ref279","first-page":"162","article-title":"Probabilistic modeling paradigms for audio source separation","author":"vincent","year":"2010","journal-title":"Machine Audition Principles Algorithms and Systems"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1980.1163420"},{"key":"ref293","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178348"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2041386"},{"key":"ref292","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6853860"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2004.07.001"},{"key":"ref295","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-22482-4_50"},{"key":"ref294","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952158"},{"key":"ref297","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-53547-0_25"},{"key":"ref296","first-page":"44","article-title":"Learning to pinpoint singing voice from weakly labeled examples","author":"schl\u00fcter","year":"2016","journal-title":"Proc 17th Int Soc Music Inf Retr Conf"},{"key":"ref299","doi-asserted-by":"publisher","DOI":"10.1109\/MLSP.2017.8168117"},{"key":"ref298","article-title":"New sonorities for jazz recordings: Separation and mixing using deep neural networks","author":"mimilakis","year":"2016","journal-title":"Proc 2nd AES Workshop Intell Music Prod"},{"key":"ref154","article-title":"Separating a foreground singer from background music","author":"raj","year":"0","journal-title":"Proc Int Symp Frontiers Res Speech and Music"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.2004304"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2005.1540157"},{"key":"ref155","article-title":"Shift-invariant probabilistic latent component analysis","author":"smaragdis","year":"2006"},{"key":"ref150","first-page":"3317","article-title":"Vocal separation from monaural music using adaptive auditory filtering based on kernel back-fitting","author":"lee","year":"2015","journal-title":"Proc INTERSPEECH"},{"key":"ref291","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2015.2468583"},{"key":"ref152","first-page":"510","article-title":"Music\/voice separation based on kernel back-fitting using weighted $\\beta$-order MMSE estimation","volume":"38","author":"kim","year":"2016","journal-title":"ETRI J"},{"key":"ref290","article-title":"How to construct deep recurrent neural networks","author":"pascanu","year":"2014","journal-title":"Proc Int Conf Learn Representations"},{"key":"ref151","first-page":"639","article-title":"Singing voice separation from monaural music based on kernel back-fitting using beta-order spectral amplitude estimation","author":"cho","year":"2015","journal-title":"Proc 16th Int Soc Music Inf Retr Conf"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/78.258082"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/ISSPIT.2015.7394320"},{"key":"ref148","first-page":"62","article-title":"Single channel vocal separation using median filtering and factorisation techniques","volume":"4","author":"fitzgerald","year":"2010","journal-title":"ISAST Trans Electron Signal Process"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.7776\/ASK.2015.34.3.227"},{"key":"ref289","first-page":"190","article-title":"Training and analysing deep recurrent neural networks","author":"hermans","year":"2013","journal-title":"Proc 26th Int Conf Neural Inf Process Syst"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2007.366616"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1994.389714"},{"key":"ref57","first-page":"290","article-title":"PARSHL: An analysis\/synthesis program for non-harmonic sounds based on a sinusoidal representation","author":"smith","year":"1987","journal-title":"Proc Int Comput Music Conf"},{"key":"ref56","article-title":"Musical sound signal analysis\/synthesis: Sinusoidal+residual and elementary waveform models","author":"rodet","year":"1997","journal-title":"Proc IEEE Time-Frequency and Time-Scale Workshop"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2008.919073"},{"key":"ref54","article-title":"Transcription of the singing melody in polyphonic music","author":"ryyn\u00e4nen","year":"2006","journal-title":"Proc 7th Int Conf Music Inf Ret"},{"key":"ref53","first-page":"375","article-title":"Singer identification in polyphonic music using vocal separation and pattern recognition methods","author":"mesaros","year":"2007","journal-title":"Proc 7th Int Conf Music Inf Ret"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/PROC.1977.10660"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/78.120793"},{"key":"ref167","first-page":"201","article-title":"Singing pitch extraction from monaural polyphonic songs by contextual audio modeling and singing harmonic enhancement","author":"hsu","year":"2009","journal-title":"Proc 10th Int Soc Music Inf Ret Conf"},{"key":"ref166","first-page":"216","article-title":"Multiple fundamental frequency estimation by summing harmonic amplitudes","author":"klapuri","year":"2006","journal-title":"Proc 7th Int Conf Music Inf Ret"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5946313"},{"key":"ref164","article-title":"Combining pitch-based inference and non-negative spectrogram factorization in separating vocals from polyphonic music","author":"virtanen","year":"2008","journal-title":"Proc ISCA Tut Res Workshop Stat Perceptual Audition"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-53547-0_52"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178063"},{"key":"ref161","article-title":"Music-content-adaptive robust principal component analysis for a semantically consistent separation of foreground and background in music audio signals","author":"papadopoulos","year":"2014","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref160","article-title":"Separation of a monaural audio signal into harmonic\/percussive components by complementary diffusion on spectrogram","author":"ono","year":"2008","journal-title":"Proc 16th Eur Signal Process Conf"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-55016-4"},{"key":"ref3","author":"common","year":"2010","journal-title":"Handbook of Blind Source Separation"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1016\/S0893-6080(00)00026-5"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/72.761722"},{"key":"ref8","doi-asserted-by":"crossref","DOI":"10.1002\/9781119279860","author":"vincent","year":"2018","journal-title":"Audio Source Separation and Speech Enhancement"},{"key":"ref159","article-title":"Predominant fundamental frequency estimation vs singing voice separation for the automatic transcription of accompanied flamenco singing","author":"g\u00f3mez","year":"2012","journal-title":"Proc of 13th Int Conf on Music Inf Ret"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4020-6479-1"},{"key":"ref49","first-page":"329","article-title":"Singer identification based on accompaniment sound reduction and reliable frame selection","author":"fujihara","year":"2005","journal-title":"Proc Int Conf Music Inf Retr"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5946321"},{"key":"ref9","author":"loizou","year":"1990","journal-title":"Speech Enhancement Theory and Practice"},{"key":"ref158","first-page":"97","article-title":"Accurate short-term analysis of the fundamental frequency and the harmonics-to-noise ratio of a sampled sound","author":"boersma","year":"0","journal-title":"Proc Inst Phonetic Sci Univ Amsterdam Proc 17"},{"key":"ref46","first-page":"1617","article-title":"Separation of music signals by harmonic structure modeling","author":"zhang","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref45","first-page":"562","article-title":"Separation of voice and music by harmonic structure stability analysis","author":"zhang","year":"2005","journal-title":"Proc IEEE Int Conf Multimedia Expo"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-39857-8_43"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1016\/0378-5955(79)90025-X"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1145\/564376.564435"},{"key":"ref41","article-title":"Optimal filtering of an instrument sound in a mixed recording given approximate pitch prior","author":"ben-shalom","year":"2004","journal-title":"Proc Int Comput Music Conf"},{"key":"ref44","first-page":"1","article-title":"Beamforming techniques for spatial filtering","author":"veen","year":"1997","journal-title":"Handbook for digital signal processing"},{"key":"ref43","first-page":"91","article-title":"Musical sound modeling with sinusoids plus noise","author":"serra","year":"1997","journal-title":"Musical Signal Processing"},{"key":"ref320","doi-asserted-by":"publisher","DOI":"10.1016\/j.dsp.2008.06.004"},{"key":"ref321","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2004.828896"},{"key":"ref73","first-page":"217","article-title":"Separation of singing voice from music accompaniment with unvoiced sounds reconstruction for monaural recordings","author":"hsu","year":"2008","journal-title":"Proc 125th AES Conv"},{"key":"ref72","first-page":"793","article-title":"One microphone source separation","author":"roweis","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref71","first-page":"145","article-title":"Desoloing monaural audio using mixture models","author":"han","year":"2007","journal-title":"Proc 7th Int Conf Music Inf Ret"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2004.832812"},{"key":"ref318","article-title":"Sound source separation: Azimuth discrimination and resynthesis","author":"barry","year":"2004","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1996.543199"},{"key":"ref317","article-title":"Frequency domain techniques for stereo to multichannel upmix","author":"avendano","year":"2002","journal-title":"Proc 22nd Int Audio Eng Soc Conf"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1162\/comj.2008.32.1.51"},{"key":"ref316","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2003.1285818"},{"key":"ref74","doi-asserted-by":"crossref","first-page":"310","DOI":"10.1109\/TASL.2009.2026503","article-title":"On the improvement of singing voice separation for monaural recordings using the MIR-1K dataset","volume":"18","author":"hsu","year":"2010","journal-title":"IEEE Trans Audio Speech Lang Process"},{"key":"ref315","doi-asserted-by":"publisher","DOI":"10.1109\/BigMM.2016.56"},{"key":"ref75","first-page":"247","article-title":"Sinusoidal extraction using an efficient implementation of a multi-resolution FFT","author":"dressler","year":"2006","journal-title":"Proc 9th Int Conf Digit Audio Effects"},{"key":"ref314","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1991.150496"},{"key":"ref313","doi-asserted-by":"publisher","DOI":"10.1109\/SPCOM.2016.7746672"},{"key":"ref312","article-title":"Joint optimization of recurrent networks exploiting source auto-regression for source separation","author":"nie","year":"2015","journal-title":"Proc INTERSPEECH"},{"key":"ref78","author":"breiman","year":"1984","journal-title":"Classification and Regression Trees"},{"key":"ref311","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2017.2716443"},{"key":"ref79","first-page":"478","article-title":"Melody line detection and source separation in classical saxophone recordings","author":"cano","year":"2009","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref319","article-title":"Demixing commercial music productions via human-assisted time-frequency masking","author":"vinyes","year":"2006","journal-title":"Proc 120th Audio Eng Soc Conv"},{"key":"ref310","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-53547-0_23"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.909260"},{"key":"ref62","first-page":"1417","article-title":"Accompaniment separation and karaoke application based on automatic melody transcription","author":"ryyn\u00e4nen","year":"2008","journal-title":"Proc IEEE Int Conf Multimedia Expo"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/34.868688"},{"key":"ref305","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952118"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1162\/comj.2008.32.3.72"},{"key":"ref304","first-page":"545","article-title":"Single-channel multispeaker separation using deep clustering","author":"isik","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref64","first-page":"571","article-title":"Processing of musical tones using a combined quadratic polynomial-phase sinusoid and residual (QUASAR) signal model","volume":"45","author":"ding","year":"1997","journal-title":"J Audio Eng Soc"},{"key":"ref307","first-page":"3371","article-title":"Stacked denoising autoencoders: Learning useful representations in a deep network with a local denoising criterion","volume":"11","author":"vincent","year":"2010","journal-title":"J Mach Learn Res"},{"key":"ref65","article-title":"Singing voice separation from monaural recordings","author":"li","year":"0","journal-title":"Proc 7th Int Conf Music Inf Ret"},{"key":"ref306","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-22482-4_12"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.889789"},{"key":"ref301","first-page":"745","article-title":"Singing voice separation with deep U-Net convolutional networks","author":"jansson","year":"2017","journal-title":"Proc 18th Int Soc Music Inf Ret Conf"},{"key":"ref67","article-title":"Complex domain onset detection for musical signals","author":"duxbury","year":"2003","journal-title":"Proc 6th Int Conf Digital Audio Effects"},{"key":"ref300","article-title":"Monaural singing voice separation with skip-filtering connections and recurrent inference of time-frequency mask","author":"mimilakis","year":"0","journal-title":"Proc IEEE 27th Int Conf Acoust Speech Signal Process"},{"key":"ref68","first-page":"17","article-title":"Detecting pitch of singing voice in polyphonic audio","author":"li","year":"2005","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref303","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7471631"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2003.811539"},{"key":"ref302","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2017.8169987"},{"key":"ref309","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-216"},{"key":"ref308","article-title":"Single channel audio source separation using deep neural network ensembles","author":"grais","year":"2016","journal-title":"Proc 140th Audio Eng Soc Conv"},{"key":"ref197","first-page":"2654","article-title":"Blind harmonic adaptive decomposition applied to supervised source separation","author":"fuentes","year":"0","journal-title":"Proc IEEE 20th Eur Signal Process Conf"},{"key":"ref198","doi-asserted-by":"publisher","DOI":"10.1121\/1.400476"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1121\/1.404385"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2003.1201756"},{"key":"ref194","first-page":"283","article-title":"Generalized nonnegative matrix approximations with Bregman divergences","author":"dhillon","year":"0","journal-title":"Proc Adv Neural Inf Process Syst 18"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2005.854110"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-28551-6_54"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1016\/0165-1684(94)90029-9"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2008.04-08-771"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2041114"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.885253"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.899291"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2003.1285860"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1121\/1.398894"},{"key":"ref342","article-title":"Multichannel audio source separation with deep neural networks","author":"nugraha","year":"2015"},{"key":"ref91","first-page":"556","article-title":"Algorithms for non-negative matrix factorization","author":"lee","year":"0","journal-title":"Proc"},{"key":"ref343","doi-asserted-by":"publisher","DOI":"10.1109\/EUSIPCO.2016.7760548"},{"key":"ref90","doi-asserted-by":"crossref","first-page":"788","DOI":"10.1038\/44565","article-title":"Learning the parts of objects by non-negative matrix factorization","volume":"401","author":"lee","year":"1999","journal-title":"Nature"},{"key":"ref340","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2015.7404834"},{"key":"ref341","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2580946"},{"key":"ref336","first-page":"40","article-title":"On monotonicity of multiplicative update rules for weighted nonnegative tensor factorization","author":"ozerov","year":"2014","journal-title":"Proc Int Symp Nonlinear Theory Appl"},{"key":"ref335","first-page":"102","article-title":"Notes on nonnegative tensor factorization of the spectrogram for audio source separation: Statistical insights and towards self-clustering of the spatial cues","author":"f\u00e9votte","year":"2010","journal-title":"Proc 7th Int Symp Comput Music Model"},{"key":"ref334","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15995-4_62"},{"key":"ref333","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5946389"},{"key":"ref98","first-page":"138","article-title":"Automatic detection of vocal segments in popular songs","author":"nwe","year":"2004","journal-title":"Proc Int Conf Music Inf Retr"},{"key":"ref339","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2013.2239990"},{"key":"ref99","article-title":"Separation of mixed audio sources by independent subspace analysis","author":"casey","year":"2000","journal-title":"Proc Int Comput Music Conf"},{"key":"ref338","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6287867"},{"key":"ref96","first-page":"337","article-title":"Separation of vocals from polyphonic audio recordings","author":"vembu","year":"2005","journal-title":"Proc Int Conf Music Inf Retr"},{"key":"ref337","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2011.6082275"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1121\/1.399423"},{"key":"ref82","first-page":"285","article-title":"Efficient implementation of a system for solo and accompaniment separation in polyphonic music","author":"cano","year":"2012","journal-title":"Proc 20th Eur Signal Process Conf"},{"key":"ref81","first-page":"95","article-title":"Music information retrieval meets music education","author":"dittmar","year":"2012","journal-title":"Multimodal Music Processing"},{"key":"ref84","article-title":"Re-thinking sound separation: Prior information and additivity constraints in separation algorithms","author":"cano","year":"2013","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref83","article-title":"Pitch estimation by the pair-wise evaluation of spectral peaks","author":"dressler","year":"2011","journal-title":"Proc Audio Eng Soc Conf 42nd Int Conf Semantic Audio"},{"key":"ref330","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2168211"},{"key":"ref331","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2009.4960289"},{"key":"ref80","article-title":"Songs2See: Learn to play by playing","author":"grollmisch","year":"0","journal-title":"Proc Audio Eng Soc 41st Int Conf Audio for Games"},{"key":"ref332","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2031510"},{"key":"ref323","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5496004"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7177944"},{"key":"ref322","doi-asserted-by":"publisher","DOI":"10.1109\/TSMC.1979.4310076"},{"key":"ref325","first-page":"831","article-title":"H-semantics: A hybrid approach to singing voice separation","volume":"60","author":"sofianos","year":"2012","journal-title":"J Audio Eng Soc"},{"key":"ref324","first-page":"221","article-title":"Singing voice separation based on non-vocal independent component subtraction and amplitude discrimination","author":"sofianos","year":"2010","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref327","first-page":"786","article-title":"Singing voice separation combining panning information and pitch tracking","author":"cobos","year":"2008","journal-title":"Audio Eng Soc 124th Conv"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1186\/1687-6180-2014-23"},{"key":"ref326","article-title":"Gaussian mixture model for singing voice separation from stereophonic music","author":"kim","year":"2011","journal-title":"Proc Audio Eng Soc 43rd Conf"},{"key":"ref86","first-page":"2417","article-title":"Score-informed and timbre independent lead instrument separation in real-world scenarios","author":"bosch","year":"2012","journal-title":"Proc 20th Eur Signal Process Conf"},{"key":"ref329","doi-asserted-by":"publisher","DOI":"10.1049\/ic.2013.0026"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-28551-6_39"},{"key":"ref328","article-title":"Stereo vocal extraction using ADRess and nearest neighbours median filtering","author":"fitzgerald","year":"2013","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref88","article-title":"An automated source separation technology and its practical applications","author":"vaneph","year":"2016","journal-title":"Proc 140th Audio Eng Soc Conv"},{"key":"ref200","article-title":"Constant-Q transform toolbox","author":"sch\u00f6rkhuber","year":"2010","journal-title":"Proc 7th Sound Music Comput Conf"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/ISCIT.2008.4700194"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/ATC.2008.4760565"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5947511"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2134092"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/ISCSLP.2014.6936723"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2011.2158801"},{"key":"ref202","first-page":"277","article-title":"Score-informed leading voice separation from monaural audio","author":"joder","year":"2012","journal-title":"Proc of 13th Int Conf on Music Inf Ret"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6287872"},{"key":"ref208","article-title":"Modelling and separation of singing voice breathiness in polyphonic mixtures","author":"marxer","year":"2013","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref205","first-page":"15","article-title":"Main instrument separation from stereophonic audio signals using a source\/filter model","author":"durrieu","year":"2009","journal-title":"Proc 17th Eur Signal Process Conf"},{"key":"ref206","article-title":"Separation of unvoiced fricatives in singing voice mixtures with semi-supervised NMF","author":"janer","year":"2013","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2172425"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-15995-4_5"},{"key":"ref212","article-title":"The flexible audio source separation toolbox version 2.0","author":"sala\u00fcn","year":"2014","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref213","article-title":"Long-term reverberation modeling for under-determined audio source separation with application to vocal melody extraction","author":"hennequin","year":"2016","journal-title":"Proc 17th Int Soc Music Inf Retr Conf"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5495326"},{"key":"ref215","first-page":"139","article-title":"A real-time equalizer of harmonic and percussive components in music signals","author":"ono","year":"2008","journal-title":"Proc 9th Int Conf Music Inf Ret"},{"key":"ref216","article-title":"Harmonic\/percussive separation using median filtering","author":"fitzgerald","year":"2010","journal-title":"Proc 13th Int Conf Digital Audio Effects"},{"key":"ref217","doi-asserted-by":"publisher","DOI":"10.1145\/2393347.2396305"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2014.2329946"},{"key":"ref219","doi-asserted-by":"publisher","DOI":"10.1109\/APSIPA.2015.7415317"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1109\/MWSCAS.2016.7870055"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1109\/APSIPA.2016.7820879"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1137\/120872802"},{"key":"ref229","doi-asserted-by":"publisher","DOI":"10.1109\/GlobalSIP.2015.7418163"},{"key":"ref228","first-page":"465","article-title":"Comparative evaluations of multiple harmonic\/percussive sound separation techniques based on anisotropic smoothness of spectrogram","author":"tachibana","year":"2012","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-11674-2_10"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.2197\/ipsjjip.24.470"},{"key":"ref225","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5495764"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2013.2287052"},{"key":"ref223","article-title":"Using tensor factorisation models to separate drums from polyphonic music","author":"fitzgerald","year":"2009","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-30441-0_21"},{"key":"ref126","first-page":"143","article-title":"Deriving musical structures from signal analysis for music audio summary generation: &#x201D;sequence&#x201D; and &#x201D;state&#x201D; approach","author":"peeters","year":"2003","journal-title":"Proc Int Symp Computer Music Multidisciplinary Research"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2016.2514845"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553463"},{"key":"ref129","first-page":"221","article-title":"A simple music\/voice separation system based on the extraction of the repeating musical structure","author":"rafii","year":"2011","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref128","first-page":"625","article-title":"Audio-based music structure analysis","author":"paulus","year":"2010","journal-title":"Proc 11th Int Soc Music Inf Retr Conf"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2012.2213249"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2017.8169990"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6287815"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-55016-4_14"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2001.1237863"},{"key":"ref232","first-page":"611","article-title":"Extending harmonic-percussive separation of audio signals","author":"driedger","year":"2014","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2093651"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2013.2266773"},{"key":"ref231","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7177945"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6637775"},{"key":"ref238","first-page":"iii-208","article-title":"An efficient posterior regularized latent variable model for interactive sound source separation","author":"bryan","year":"2013","journal-title":"Proc 30th Int Conf Mach Learn"},{"key":"ref235","doi-asserted-by":"crossref","first-page":"2067","DOI":"10.1109\/TASL.2010.2041110","article-title":"A tandem algorithm for pitch estimation and voiced speech segregation","volume":"18","author":"hu","year":"2010","journal-title":"IEEE Trans Audio Speech Lang Process"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2011.2182510"},{"key":"ref237","article-title":"Interactive user-feedback for sound source separation","author":"bryan","year":"2013","journal-title":"Proc Int Conf Intell User Interfaces Workshop Interact Mach Learn"},{"key":"ref236","first-page":"318","article-title":"Learning internal representations by error propagation","author":"rumelhart","year":"1986","journal-title":"Parallel Distributed Processing Explorations in the Microstructure of Cognition Vol 1"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1145\/319463.319472"},{"key":"ref135","first-page":"583","article-title":"Music\/voice separation using the similarity matrix","author":"rafii","year":"2012","journal-title":"Proc of 13th Int Conf on Music Inf Ret"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7177974"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6637768"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1049\/ic.2012.0225"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/HSCMA.2014.6843240"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2014.2332434"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7177935"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178036"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/381641.381658"},{"key":"ref144","first-page":"51","article-title":"Interference reduction in music recordings combining kernel additive modelling and non-negative matrix factorization","author":"yela","year":"2017","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref1","author":"kalakota","year":"2000","journal-title":"E-Business 2 0 Roadmap for Success"},{"key":"ref145","first-page":"2644","article-title":"Audio source separation informed by redundancy with greedy multiscale decompositions","author":"moussallam","year":"2012","journal-title":"Proc 20th Eur Signal Process Conf"},{"key":"ref241","article-title":"Weighted nonnegative tensor factorization: on monotonicity of multiplicative update rules and application to user-guided audio source separation","author":"ozerov","year":"2013"},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.1109\/MLSP.2013.6661930"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.1109\/SSP.2014.6884568"},{"key":"ref244","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2553441"},{"key":"ref240","first-page":"2001","article-title":"Posterior regularization for structured latent variable models","volume":"11","author":"ganchev","year":"2010","journal-title":"J Mach Learn Res"},{"key":"ref248","article-title":"Singing-voice separation from monaural recordings using deep recurrent neural networks","author":"huang","year":"2014","journal-title":"Proc 15th Int Soc Music Inf Retr Conf"},{"key":"ref247","doi-asserted-by":"publisher","DOI":"10.1109\/ICSMC.1990.142050"},{"key":"ref246","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7471715"},{"key":"ref245","first-page":"382","article-title":"Bayesian model averaging: A tutorial","volume":"14","author":"hoeting","year":"1999","journal-title":"Stat Sci"},{"key":"ref249","first-page":"-53i","article-title":"Block-coordinate Frank-Wolfe optimization for structural SVMs","author":"lacoste-julien","year":"2013","journal-title":"Proc 30th Int Conf Mach Learn"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2009.5346542"},{"key":"ref108","article-title":"Source-filter based clustering for monaural blind source separation","author":"spiertz","year":"2009","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-00599-2_68"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1155\/2009\/785152"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2015.2502141"},{"key":"ref104","first-page":"507","article-title":"Bayesian singing-voice separation","author":"yang","year":"2014","journal-title":"Proc 15th Int Soc Music Inf Retr Conf"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6287871"},{"key":"ref102","first-page":"1035","article-title":"Solution of incorrectly formulated problems and the regularization method","volume":"4","author":"tikhonov","year":"1963","journal-title":"Soviet Math"},{"key":"ref111","first-page":"2115","article-title":"$L_p$-norm non-negative matrix factorization and its application to singing voice enhancement","author":"nakamuray","year":"2015","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref112","author":"ortega","year":"1970","journal-title":"Iterative Solution of Nonlinear Equations in Several Variables"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-74494-8_52"},{"key":"ref250","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2017.8170038"},{"key":"ref251","doi-asserted-by":"publisher","DOI":"10.1109\/MLSP.2014.6958893"},{"key":"ref254","doi-asserted-by":"publisher","DOI":"10.1006\/acha.2000.0341"},{"key":"ref255","first-page":"617","article-title":"Singing voice separation using spectro-temporal modulation features","author":"yen","year":"2014","journal-title":"Proc 15th Int Soc Music Inf Retr Conf"},{"key":"ref252","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2015.2508787"},{"key":"ref253","doi-asserted-by":"publisher","DOI":"10.1109\/TSP.2014.2326991"},{"key":"ref257","doi-asserted-by":"publisher","DOI":"10.1121\/1.1945807"},{"key":"ref256","first-page":"3321","article-title":"A two-stage singing voice separation algorithm using spectro-temporal modulation features","author":"yen","year":"2015","journal-title":"Proc INTERSPEECH"},{"key":"ref259","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2017.2647810"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/WIAMIS.2013.6616139"},{"key":"ref258","doi-asserted-by":"publisher","DOI":"10.1121\/1.428100"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2013.2297440"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1002\/9781119991298"},{"key":"ref13","author":"m\u00fcller","year":"2015","journal-title":"Fundamentals of Music Processing Audio Analysis Algorithms Applications"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511790423"},{"key":"ref15","doi-asserted-by":"crossref","DOI":"10.1007\/0-387-28982-8","author":"capp\u00e9","year":"2005","journal-title":"Inference in Hidden Markov Models (Springer Series in Statistics)"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1986.1164910"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1007\/s12532-013-0053-8"},{"key":"ref17","first-page":"-529i","article-title":"On the approximate W-disjoint orthogonality of speech","author":"rickard","year":"2002","journal-title":"Proc IEEE Int Conf Acoust Speech Signal Process"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1137\/070697835"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1979.1163209"},{"key":"ref19","author":"wiener","year":"1975","journal-title":"Extrapolation Interpolation and Smoothing of Stationary Time Series"},{"key":"ref119","first-page":"399","article-title":"Learning fast approximations of sparse coding","author":"gregor","year":"2010","journal-title":"Proc 27th Int Conf Mach Learn"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1145\/1970392.1970395"},{"key":"ref113","article-title":"Selective amplifier of periodic and non-periodic components in concurrent audio signals with spectral control envelopes","author":"kameoka","year":"2006"},{"key":"ref116","first-page":"67","article-title":"Real-time online singing voice separation from monaural recordings using robust low-rank modeling","author":"sprechmann","year":"2012","journal-title":"Proc of 13th Int Conf on Music Inf Ret"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2012.6287816"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1007\/s11460-011-0128-0"},{"key":"ref121","article-title":"Vocal separation using extended robust principal component analysis with Schatten $P$\/ $L_p$-norm and scale compression","author":"jeong","year":"2014","journal-title":"Proc Int Workshop Mach Learn Signal Process"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1007\/s10115-013-0713-z"},{"key":"ref123","first-page":"427","article-title":"Low-rank representation of both singing voice and music accompaniment via learned dictionaries","author":"yang","year":"2013","journal-title":"Proc 14th Int Soc Music Inf Retr Conf"},{"key":"ref260","doi-asserted-by":"publisher","DOI":"10.1111\/j.1467-9868.2005.00532.x"},{"key":"ref261","doi-asserted-by":"publisher","DOI":"10.1007\/s10915-015-0150-0"},{"key":"ref262","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.88"},{"key":"ref263","doi-asserted-by":"publisher","DOI":"10.1016\/0167-6393(93)90095-3"},{"key":"ref264","article-title":"DARPA TIMIT acoustic-phonetic continuous speech corpus CD-ROM. NIST speech disc 1-1.1","author":"garofolo","year":"1993"},{"key":"ref265","article-title":"Linear mixing models for active listening of music productions in realistic studio conditions","author":"sturmel","year":"2012","journal-title":"Proc 102nd AES Convention"},{"key":"ref266","article-title":"MTG MASS database","author":"vinyes","year":"2008"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/8356719\/08336997.pdf?arnumber=8336997","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,5]],"date-time":"2024-07-05T23:35:11Z","timestamp":1720222511000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8336997\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,8]]},"references-count":364,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/taslp.2018.2825440","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,8]]}}}