{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T19:20:41Z","timestamp":1777490441372,"version":"3.51.4"},"reference-count":37,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,4,14]],"date-time":"2024-04-14T00:00:00Z","timestamp":1713052800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,4,14]],"date-time":"2024-04-14T00:00:00Z","timestamp":1713052800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,4,14]]},"DOI":"10.1109\/icassp48485.2024.10445818","type":"proceedings-article","created":{"date-parts":[[2024,3,18]],"date-time":"2024-03-18T18:56:31Z","timestamp":1710788191000},"page":"7915-7919","source":"Crossref","is-referenced-by-count":5,"title":["Humtrans: A Novel Open-Source Dataset for Humming Melody Transcription and Beyond"],"prefix":"10.1109","author":[{"given":"Shansong","family":"Liu","sequence":"first","affiliation":[{"name":"Tencent PCG,ARC Lab"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xu","family":"Li","sequence":"additional","affiliation":[{"name":"Tencent PCG,ARC Lab"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dian","family":"Li","sequence":"additional","affiliation":[{"name":"Tencent PCG,Foundational Technology Center"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ying","family":"Shan","sequence":"additional","affiliation":[{"name":"Tencent PCG,ARC Lab"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","first-page":"40","article-title":"Modelling of Note Events for Singing Transcription","volume-title":"SAPA","author":"Ryynanen"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2006.889797"},{"key":"ref3","first-page":"277","article-title":"Automatic Music Transcription","volume-title":"Handbook of Signal Processing in Acoustics","author":"Klapuri","year":"2009"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/s10844-013-0258-3"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2018.2869928"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.21105\/joss.03391"},{"key":"ref7","article-title":"MT3: Multi-Task Multitrack Music Transcription","volume-title":"ICLR","author":"Gardner"},{"key":"ref8","first-page":"485","article-title":"Melody Transcription via Generative Pre-training","volume-title":"ISMIR","author":"Donahue"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10096707"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1121\/1.400923"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1121\/1.407518"},{"key":"ref12","first-page":"257","article-title":"Monophonic Transcription with Autocorrelation","volume-title":"DAFx-00","author":"Monti"},{"key":"ref13","article-title":"A Blackboard System for Automatic Transcription of Simple Polyphonic Music","volume":"385","author":"Martin","year":"1996","journal-title":"Massachusetts Institute of Technology Media Laboratory Perceptual Computing Section Technical Report"},{"key":"ref14","article-title":"A Predominant-F0 Estimation Method for Real-world Musical Audio Signals: MAP Estimation for Incorporating Prior Knowledge about F0s and Tone Models","volume-title":"CRAC","author":"Goto"},{"key":"ref15","article-title":"An Auditory Model based Transcriber of Singing Sequences","volume-title":"ISMIR","author":"Clarisse"},{"key":"ref16","volume-title":"Signal Processing Methods for the Automatic Transcription of Music","author":"Klapuri","year":"2004"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ASPAA.2005.1540233"},{"key":"ref18","first-page":"222","article-title":"Transcription of the Singing Melody in Polyphonic Music","volume-title":"ISMIR","author":"Ryynanen"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1155\/2007\/48317"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2016.2533858"},{"key":"ref21","first-page":"34","article-title":"An End-to-end Framework for Audio-to-Score Music Transcription on Monophonic Excerpts","volume-title":"ISMIR","author":"Rom\u00e1n"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3030482"},{"issue":"1","key":"ref23","first-page":"5485","article-title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","volume":"21","author":"Roberts","year":"2020","journal-title":"JMLR"},{"key":"ref24","first-page":"737","article-title":"Singing Voice Melody Transcription Using Deep Neural Networks","volume-title":"IS-MIR","author":"Rigaud"},{"key":"ref25","first-page":"229","article-title":"Musi-cYOLO: A Vision-Based Framework for Automatic Singing Transcription","volume":"31","author":"Wang","year":"2022","journal-title":"TASLP"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414601"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2022-48"},{"key":"ref28","first-page":"6914","article-title":"M4Singer: A Multi-Style, Multi-Singer and Musical Score Provided Mandarin Singing Corpus","volume":"35","author":"Zhang","year":"2022","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref29","article-title":"Query by Singing\/Humming - MIREX Challenge","author":"Jang"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/s13735-012-0026-0"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref32","article-title":"MLEnd Hums and Whistles","author":"Requena"},{"key":"ref33","first-page":"6493","article-title":"DNS-MOS: A Non-Intrusive Perceptual Objective Speech Quality Metric to Evaluate Noise Suppressors","volume-title":"ICASSP","author":"Reddy"},{"key":"ref34","first-page":"2014","article-title":"MIR_EVAL: A Transparent Implementation of Common MIR Metrics","volume-title":"ISMIR","volume":"10","author":"Raffel"},{"key":"ref35","article-title":"VOCANO: A Note Transcription Framework For Singing Voice In Polyphonic Music","volume-title":"IS-MIR","author":"Hsu"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747147"},{"key":"ref37","first-page":"6105","article-title":"Efficientnet: Rethinking model scaling for convolutional neural networks","volume-title":"ICML","author":"Tan"}],"event":{"name":"ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Seoul, Korea, Republic of","start":{"date-parts":[[2024,4,14]]},"end":{"date-parts":[[2024,4,19]]}},"container-title":["ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10445798\/10445803\/10445818.pdf?arnumber=10445818","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,2]],"date-time":"2024-08-02T04:43:22Z","timestamp":1722573802000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10445818\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,4,14]]},"references-count":37,"URL":"https:\/\/doi.org\/10.1109\/icassp48485.2024.10445818","relation":{},"subject":[],"published":{"date-parts":[[2024,4,14]]}}}