{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,21]],"date-time":"2026-05-21T17:40:32Z","timestamp":1779385232306,"version":"3.53.1"},"reference-count":69,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2022,1,1]],"date-time":"2022-01-01T00:00:00Z","timestamp":1640995200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"JST ACT-X","award":["JPMJAX200R"],"award-info":[{"award-number":["JPMJAX200R"]}]},{"name":"JST CREST","award":["JPMJCR20D4"],"award-info":[{"award-number":["JPMJCR20D4"]}]},{"name":"JSPS KAKENHI","award":["JP21J20353"],"award-info":[{"award-number":["JP21J20353"]}]},{"name":"JSPS KAKENHI","award":["JP21H04917"],"award-info":[{"award-number":["JP21H04917"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2022]]},"DOI":"10.1109\/taslp.2022.3169627","type":"journal-article","created":{"date-parts":[[2022,4,26]],"date-time":"2022-04-26T19:37:08Z","timestamp":1651001828000},"page":"1614-1623","source":"Crossref","is-referenced-by-count":16,"title":["Self-Supervised Contrastive Learning for Singing Voices"],"prefix":"10.1109","volume":"30","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2558-735X","authenticated-orcid":false,"given":"Hiromu","family":"Yakura","sequence":"first","affiliation":[{"name":"Graduate School of Science and Technology, University of Tsukuba, Ibaraki, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8311-6073","authenticated-orcid":false,"given":"Kento","family":"Watanabe","sequence":"additional","affiliation":[{"name":"National Institute of Advanced Industrial Science and Technology (AIST), Ibaraki, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1167-0977","authenticated-orcid":false,"given":"Masataka","family":"Goto","sequence":"additional","affiliation":[{"name":"National Institute of Advanced Industrial Science and Technology (AIST), Ibaraki, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1002\/9781118680605.ch15"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/s10844-019-00582-9"},{"key":"ref3","first-page":"395","article-title":"A survey of music recommendation systems and future perspectives","volume-title":"Proc. Int. Symp. Comput. Music Model. Retrieval","author":"Song","year":"2012"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.3389\/fams.2019.00044"},{"key":"ref5","first-page":"514","article-title":"Vocals in music matter: The relevance of vocals in the minds of listeners","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Demetriou","year":"2018"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.2992393"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.3390\/technologies9010002"},{"issue":"5","key":"ref8","first-page":"340","article-title":"A detailed analysis of a time-domain formant-corrected pitch-shifting algorithm","volume":"43","author":"Bristow-Johnson","year":"1993","journal-title":"J. Audio Eng. Soc."},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1121\/1.399243"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2015.2424572"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICOSP.2014.7015431"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2018.2875133"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2003.1220847"},{"key":"ref14","first-page":"329","article-title":"Singer identification based on accompaniment sound reduction and reliable frame selection","volume-title":"Proc. Int. Conf. Music Inf. Retrieval","author":"Fujihara","year":"2005"},{"key":"ref15","first-page":"375","article-title":"Singer identification in polyphonic music using vocal separation and pattern recognition methods","volume-title":"Proc. Int. Conf. Music Inf. Retrieval","author":"Mesaros","year":"2007"},{"key":"ref16","first-page":"595","article-title":"Robust singer identification in polyphonic music using melody enhancement and uncertainty-based learning","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Lagrange","year":"2012"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-13-8707-4_1"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1007\/s10772-021-09849-5"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.876756"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2008.4518087"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-13-1747-7_27"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2019.8851988"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9054069"},{"key":"ref24","first-page":"467","article-title":"A music information retrieval system based on singing voice timbre","volume-title":"Proc. Int. Conf. Music Inf. Retrieval","author":"Fujihara","year":"2007"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2041386"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854595"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461660"},{"key":"ref28","first-page":"295","article-title":"Learning a joint embedding space of monophonic and mixed music signals for singing voice","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Lee","year":"2019"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2015.2462851"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2017.08.015"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2064307"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461375"},{"key":"ref33","first-page":"554","article-title":"I-vectors for timbre-based music similarity and music artist classification","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Eghbal-zadeh","year":"2015"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-1925"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414973"},{"key":"ref36","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chen","year":"2020"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00393"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414405"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2021.3067635"},{"key":"ref41","first-page":"673","article-title":"Contrastive learning of musical representations","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Spijkervet","year":"2021"},{"key":"ref42","first-page":"12 449","article-title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","author":"Baevski","year":"2020"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"ref44","first-page":"2530","article-title":"CLAR: Contrastive learning of auditory representations","volume-title":"Proc. Int. Conf. Artif. Intell. Statist.","author":"Al-Tahan","year":"2021"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9413528"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN52387.2021.9534474"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413694"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1016\/0167-6393(90)90021-Z"},{"key":"ref49","volume-title":"The Vibrato, Series Studies in the Psychology of Music","author":"Seashore","year":"1932"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2008-32"},{"key":"ref51","first-page":"393","article-title":"Automatic identification for singing style based on sung melodic contour characterized in phase plane","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf","author":"Kako","year":"2009"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00649"},{"key":"ref53","first-page":"637","article-title":"End-to-end learning for music audio tagging at scale","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Pons","year":"2018"},{"key":"ref54","first-page":"591","article-title":"The million song dataset","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Bertin-Mahieux","year":"2011"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.21105\/joss.02154"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.3390\/app9071324"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952585"},{"key":"ref58","first-page":"15","article-title":"Adam: A method for stochastic optimization","volume-title":"Proc. Int. Conf. Learn. Representation","author":"Kingma","year":"2015"},{"key":"ref59","article-title":"Correlation analyses of encoded music performance","author":"Smith","year":"2013"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1093\/oso\/9780190052201.001.0001"},{"key":"ref61","volume-title":"Rap Music and the Poetics of Identity","author":"Krims","year":"2000"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1002\/9780470996522.ch14"},{"issue":"86","key":"ref63","first-page":"2579","article-title":"Visualizing data using t-SNE","volume":"9","author":"Maaten","year":"2008","journal-title":"J. Mach. Learn. Res."},{"key":"ref64","first-page":"468","article-title":"VocalSet: A singing voice dataset","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Wilkins","year":"2018"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1007\/978-0-387-39940-9_488"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1145\/3331184.3331259"},{"key":"ref67","first-page":"239","article-title":"Template-based vibrato analysis in complex music signals","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Driedger","year":"2016"},{"key":"ref68","first-page":"1","article-title":"Singing voice conversion method based on many-to-many eigenvoice conversion and training data generation using a singing-to-singing synthesis system","volume-title":"Proc. Asia Pacific Signal Inf. Process. Assoc. Annu. Summit Conf.","author":"Doi","year":"2012"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1862"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/9657755\/09763018.pdf?arnumber=9763018","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,22]],"date-time":"2024-01-22T20:51:18Z","timestamp":1705956678000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9763018\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022]]},"references-count":69,"URL":"https:\/\/doi.org\/10.1109\/taslp.2022.3169627","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022]]}}}