{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T14:57:52Z","timestamp":1782313072800,"version":"3.54.5"},"reference-count":67,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"MOST Taiwan","award":["MOST 106-2218-E-001-003-MY3"],"award-info":[{"award-number":["MOST 106-2218-E-001-003-MY3"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2020]]},"DOI":"10.1109\/taslp.2020.3030482","type":"journal-article","created":{"date-parts":[[2020,10,13]],"date-time":"2020-10-13T19:51:58Z","timestamp":1602618718000},"page":"2796-2809","source":"Crossref","is-referenced-by-count":49,"title":["Multi-Instrument Automatic Music Transcription With Self-Attention-Based Instance Segmentation"],"prefix":"10.1109","volume":"28","author":[{"given":"Yu-Te","family":"Wu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Berlin","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4275-8832","authenticated-orcid":false,"given":"Li","family":"Su","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","first-page":"155","article-title":"MedleyDB: A multitrack dataset for annotation-intensive MIR research","author":"bittner","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854172"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-30110-3_151"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2013.2260741"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1162\/COMJ_a_00146"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2034186"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1121\/1.4790351"},{"key":"ref36","first-page":"894","article-title":"Multiple instrument tracking based on reconstruction error, pitch continuity and instrument activity","author":"kirchhoff","year":"0","journal-title":"Proc Int Symp Computer Music Multidisciplinary Research"},{"key":"ref35","first-page":"1","article-title":"Multiple-F0 tracking based on a high-order HMM model","author":"chang","year":"0","journal-title":"Proc Int Conf Digital Audio Effects"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.885248"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2856090"},{"key":"ref62","first-page":"475","article-title":"On the potential of simple framewise approaches to piano transcription","author":"kelz","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref61","first-page":"367","article-title":"Mir_eval: A transparent implementation of common MIR metrics","author":"raffel","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref63","first-page":"758","article-title":"Transcribing human piano performances into music notation","author":"cogliati","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2313404"},{"key":"ref64","first-page":"678","article-title":"Automatic music transcription and ethnomusicology: A user study","author":"holzapfel","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2013.2285484"},{"key":"ref65","first-page":"71","article-title":"An analysis\/synthesis framework for automatic F0 annotation of multitrack datasets","author":"salamon","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.2982285"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2387388"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683024"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/s10844-013-0258-3"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2018.2869928"},{"key":"ref20","first-page":"63","article-title":"Deep salience representations for F0 estimation in polyphonic music","author":"bittner","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref22","first-page":"4052","article-title":"Image transformer","author":"parmar","year":"0","journal-title":"Proc 35th Int Conf Mach Learn"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref24","first-page":"229","article-title":"RWC music database: Music genre database and musical instrument sound database","author":"goto","year":"0","journal-title":"Proc 4th Int Conf Music Inf Retrieval Proc"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2042119"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2019.8937170"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461686"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2006.1661210"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/GlobalSIP.2018.8646684"},{"key":"ref59","first-page":"1","article-title":"Learning features of music from scratch","author":"thickstun","year":"0","journal-title":"Proc Intl Conf on Learning Representations"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2038819"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.308"},{"key":"ref56","first-page":"4696","article-title":"When does label smoothing help?","author":"m\u00fcller","year":"0","journal-title":"Proc Adv Neural Inf Process Syst Annu Conf Neural Inf Process Syst"},{"key":"ref55","article-title":"Adversarial robustness via adversarial label-smoothing","author":"goibert","year":"2019"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.324"},{"key":"ref53","first-page":"5998","article-title":"Attention is all you need","author":"vaswani","year":"0","journal-title":"Proc Adv Neural Inf Process Syst Annu Conf Neural Inf Process Syst"},{"key":"ref52","article-title":"Rethinking atrous convolution for semantic image segmentation","author":"chen","year":"2017"},{"key":"ref10","first-page":"50","article-title":"Onsets and frames: Dual-objective piano transcription","author":"hawthorne","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref11","first-page":"1","article-title":"Enabling factorized piano music modeling and generation with the MAESTRO dataset","author":"hawthorne","year":"0","journal-title":"Proc Intl Conf on Learning Representations"},{"key":"ref40","first-page":"438","article-title":"Openmic-2018: An open data-set for multiple instrument recognition","author":"humphrey","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref12","first-page":"1","article-title":"Music transformer: Generating music with long-term structure","author":"huang","year":"0","journal-title":"Proc Intl Conf on Learning Representations"},{"key":"ref13","first-page":"135","article-title":"Frame-level instrument recognition by timbre and pitch","author":"hung","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683426"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8682605"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952168"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"ref18","first-page":"745","article-title":"Singing voice separation with deep U-net convolutional networks","author":"jansson","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref19","first-page":"521","article-title":"Vocal melody extraction with semantic segmentation and audio-symbolic domain transfer learning","author":"lu","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46282-0_20"},{"key":"ref3","first-page":"379","article-title":"Automatic music transcription: Breaking the glass ceiling","author":"emmanouil","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6853672"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2011.5946322"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2011.2162395"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952164"},{"key":"ref49","first-page":"393","article-title":"Exploiting frequency, periodicity and harmonicity using advanced time-frequency concentration techniques for multipitch estimation of choir and symphony","author":"li","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1093\/nsr\/nwx105"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462079"},{"key":"ref45","article-title":"Instrument Identification in Polyphonic Music","author":"shankar","year":"2018"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/TASSP.1984.1164454"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2015.2442411"},{"key":"ref42","first-page":"559","article-title":"A comparison of sound segregation techniques for predominant instrument recognition in musical audio signals","author":"bosch","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref41","first-page":"1","article-title":"Mixing secrets: A multi-track dataset for instrument recognition in polyphonic music","author":"gururani","year":"0","journal-title":"Proc 18th Int Soc Music Inf Retrieval Conf (Late Breaking and Demo Paper)"},{"key":"ref44","first-page":"569","article-title":"Instrument activity detection in polyphonic music using deep neural networks","author":"gururani","year":"0","journal-title":"Proc Int Soc for Music Inf Retrieval Conf"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2632307"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/8938144\/09222310.pdf?arnumber=9222310","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,4,27]],"date-time":"2022-04-27T17:31:23Z","timestamp":1651080683000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9222310\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020]]},"references-count":67,"URL":"https:\/\/doi.org\/10.1109\/taslp.2020.3030482","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020]]}}}