{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,24]],"date-time":"2026-06-24T14:58:26Z","timestamp":1782313106607,"version":"3.54.5"},"reference-count":31,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,6,4]],"date-time":"2023-06-04T00:00:00Z","timestamp":1685836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,6,4]],"date-time":"2023-06-04T00:00:00Z","timestamp":1685836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,6,4]]},"DOI":"10.1109\/icassp49357.2023.10096688","type":"proceedings-article","created":{"date-parts":[[2023,5,5]],"date-time":"2023-05-05T13:28:30Z","timestamp":1683293310000},"page":"1-5","source":"Crossref","is-referenced-by-count":20,"title":["Multitrack Music Transcription with a Time-Frequency Perceiver"],"prefix":"10.1109","author":[{"given":"Wei -Tsung","family":"Lu","sequence":"first","affiliation":[{"name":"SAMI,ByteDance, Mountain View,CA,USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ju-Chiang","family":"Wang","sequence":"additional","affiliation":[{"name":"SAMI,ByteDance, Mountain View,CA,USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yun -Ning","family":"Hung","sequence":"additional","affiliation":[{"name":"SAMI,ByteDance, Mountain View,CA,USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414601"},{"key":"ref12","article-title":"Jointist: Joint learning for multi-instrument transcription and its applications","author":"cheuk","year":"2022","journal-title":"arXiv preprint arXiv 2206 10805"},{"key":"ref15","first-page":"293","article-title":"Vocano: A note transcription framework for singing voice in polyphonic music","author":"hsu","year":"2021","journal-title":"Proc ISMIR"},{"key":"ref14","article-title":"Pseudo-label transfer from framelevel to note-level in a teacher-student framework for singing transcription from polyphonic music","author":"kum","year":"2022","journal-title":"Proc ICASSP"},{"key":"ref31","first-page":"42","article-title":"Evaluating automatic polyphonic music transcription","author":"mcleod","year":"2018","journal-title":"Proc ISMIR"},{"key":"ref30","article-title":"Decoupled weight decay regularization","author":"loshchilov","year":"2017","journal-title":"Proc ICLR"},{"key":"ref11","article-title":"Multi-instrument music transcription based on deep spherical clustering of spectrograms and pitchgrams","author":"tanaka","year":"2020","journal-title":"Proc ISMIR"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3030482"},{"key":"ref2","article-title":"MT3: Multi-task multitrack music transcription","author":"gardner","year":"2021","journal-title":"Proc ICLR"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475405"},{"key":"ref17","first-page":"769","article-title":"Semi-supervised music tagging transformer","author":"won","year":"2021","journal-title":"Proc ISMIR"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-3015"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747252"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747048"},{"key":"ref24","author":"raffel","year":"2016","journal-title":"Learning-Based Methods for Comparing Sequences with Applications to Audio-to-MIDI Alignment and Matching"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2019.8937170"},{"key":"ref26","first-page":"453","article-title":"Guitarset: A dataset for guitar transcription","author":"xi","year":"2018","journal-title":"Proc ISMIR"},{"key":"ref25","article-title":"Enabling factorized piano music modeling and generation with the maestro dataset","author":"hawthorne","year":"2019","journal-title":"Proc ICLR"},{"key":"ref20","first-page":"630","article-title":"Identity mappings in deep residual networks","author":"he","year":"2016","journal-title":"European Conference on Computer Vision"},{"key":"ref22","article-title":"Empirical evaluation of gated recurrent neural networks on sequence modeling","author":"chung","year":"2014","journal-title":"Proc NeurIPS"},{"key":"ref21","first-page":"50","article-title":"Onsets and frames: Dual-objective piano transcription","author":"hawthorne","year":"2018","journal-title":"Proc ISMIR"},{"key":"ref28","article-title":"Decoupling magnitude and phase estimation with deep resunet for music source separation","author":"kong","year":"2021","journal-title":"Proc ISMIR"},{"key":"ref27","doi-asserted-by":"crossref","first-page":"1324","DOI":"10.3390\/app9071324","article-title":"Joint detection and classification of singing voice melody using convolutional recurrent neural networks","volume":"9","author":"kum","year":"2019","journal-title":"Applied Sciences"},{"key":"ref29","article-title":"Pytorch: An imperative style, high-performance deep learning library","volume":"32","author":"paszke","year":"2019","journal-title":"Neural Information Processing Systems"},{"key":"ref8","first-page":"381","article-title":"Multitask learning for frame-level instrument recognition","author":"hung","year":"2019","journal-title":"Proc ICASSP"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2018.2825440"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.23919\/EUSIPCO.2019.8902550"},{"key":"ref4","article-title":"SpecTNT: A time-frequency transformer for music audio","author":"lu","year":"2021","journal-title":"Proc ISMIR"},{"key":"ref3","first-page":"4651","article-title":"Perceiver: General perception with iterative attention","author":"jaegle","year":"2021","journal-title":"Proc ICML"},{"key":"ref6","article-title":"Catnet: Music source separation system with mixaudio augmentation","author":"song","year":"2021","journal-title":"arXiv preprint arXiv 2102 09032"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952158"}],"event":{"name":"ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Rhodes Island, Greece","start":{"date-parts":[[2023,6,4]]},"end":{"date-parts":[[2023,6,10]]}},"container-title":["ICASSP 2023 - 2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10094559\/10094560\/10096688.pdf?arnumber=10096688","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,11,13]],"date-time":"2023-11-13T13:56:31Z","timestamp":1699883791000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10096688\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,6,4]]},"references-count":31,"URL":"https:\/\/doi.org\/10.1109\/icassp49357.2023.10096688","relation":{},"subject":[],"published":{"date-parts":[[2023,6,4]]}}}