{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,16]],"date-time":"2026-03-16T10:20:15Z","timestamp":1773656415148,"version":"3.50.1"},"reference-count":43,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,6,6]]},"DOI":"10.1109\/icassp39728.2021.9414001","type":"proceedings-article","created":{"date-parts":[[2021,5,13]],"date-time":"2021-05-13T19:53:45Z","timestamp":1620935625000},"page":"8613-8617","source":"Crossref","is-referenced-by-count":20,"title":["The Multi-Speaker Multi-Style Voice Cloning Challenge 2021"],"prefix":"10.1109","author":[{"given":"Qicong","family":"Xie","sequence":"first","affiliation":[{"name":"ASLP@NPU, School of Computer Science, Northwestern Polytechnical University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaohai","family":"Tian","sequence":"additional","affiliation":[{"name":"National University of Singapore,Department of Electrical and Computer Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guanghou","family":"Liu","sequence":"additional","affiliation":[{"name":"ASLP@NPU, School of Computer Science, Northwestern Polytechnical University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kun","family":"Song","sequence":"additional","affiliation":[{"name":"ASLP@NPU, School of Computer Science, Northwestern Polytechnical University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lei","family":"Xie","sequence":"additional","affiliation":[{"name":"ASLP@NPU, School of Computer Science, Northwestern Polytechnical University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiyong","family":"Wu","sequence":"additional","affiliation":[{"name":"Tsinghua Shenzhen International Graduate School, Tsinghua University,Shenzhen,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hai","family":"Li","sequence":"additional","affiliation":[{"name":"iQIYI Inc,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Song","family":"Shi","sequence":"additional","affiliation":[{"name":"iQIYI Inc,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haizhou","family":"Li","sequence":"additional","affiliation":[{"name":"National University of Singapore,Department of Electrical and Computer Engineering"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fen","family":"Hong","sequence":"additional","affiliation":[{"name":"Originbeat Inc,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hui","family":"Bu","sequence":"additional","affiliation":[{"name":"Beijing Shell Shell Technology Co., Ltd,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xin","family":"Xu","sequence":"additional","affiliation":[{"name":"Beijing Shell Shell Technology Co., Ltd,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","article-title":"The huya multi-speaker and multi-style speech synthesis system for m2voc challenge 2020","author":"wang","year":"2021","journal-title":"2021 IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-2663"},{"key":"ref33","article-title":"Wavegrad: Estimating gradients for waveform generation","author":"chen","year":"2020","journal-title":"arXiv preprint arXiv 2009 02026"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053795"},{"key":"ref31","article-title":"Multi-band melgan: Faster waveform generation for high-quality text-to-speech","author":"yang","year":"2020","journal-title":"arXiv preprint arXiv 2005 06138"},{"key":"ref30","article-title":"MelGAN: Generative adversarial networks for conditional waveform synthesis","volume":"32","author":"kumar","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"ref37","article-title":"Investigating on incorporating pretrained and learnable speaker representations for multi-speaker multi-style text-to-speech","author":"chien","year":"2021","journal-title":"2021 IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461375"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.2980991"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462665"},{"key":"ref10","article-title":"Voiceloop: Voice fitting and synthesis via a phonological loop","author":"taigman","year":"2017","journal-title":"arXiv preprint arXiv 1707 06892"},{"key":"ref40","article-title":"Prosody and voice factorization for few-shot speaker adaptation in the challenge m2voc 2021","author":"wang","year":"2021","journal-title":"2021 IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref11","article-title":"Sample efficient adaptive text-to-speech","author":"chen","year":"2018","journal-title":"arXiv preprint arXiv 1809 10460"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1745"},{"key":"ref13","article-title":"Neural discrete representation learning","author":"den oord","year":"2017","journal-title":"arXiv preprint arXiv 1711 00540"},{"key":"ref14","article-title":"Generating diverse high-fidelity images with vq-vae-2","author":"razavi","year":"2019","journal-title":"arXiv preprint arXiv 1906 03008"},{"key":"ref15","first-page":"234","article-title":"U-net: Convolutional networks for biomedical image segmentation","author":"ronneberger","year":"2015","journal-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention"},{"key":"ref16","article-title":"Vqvc+: One-shot voice conversion by vector quantization and u-net architecture","author":"wu","year":"2020","journal-title":"arXiv preprint arXiv 2006 04989"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2096"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1737"},{"key":"ref19","article-title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines","author":"shi","year":"2020","journal-title":"arXiv preprint arXiv 2010 11567"},{"key":"ref28","article-title":"Speaker conditional wav-ernn: Towards universal neural vocoder for unseen speaker and recording conditions","author":"paul","year":"2020","journal-title":"arXiv preprint arXiv 2008 06439"},{"key":"ref4","article-title":"Fastpitch: Parallel text-to-speech with pitch prediction","author":"la?cucki","year":"2020","journal-title":"arXiv preprint arXiv 2006 04989"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8682804"},{"key":"ref3","article-title":"FastSpeech: Fast, robust and controllable text to speech","author":"ren","year":"2019","journal-title":"ArXiv"},{"key":"ref6","article-title":"Auto-encoding variational bayes","author":"kingma","year":"2013","journal-title":"arXiv preprint arXiv 1312 6114"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2143"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2861"},{"key":"ref8","first-page":"5167","article-title":"Style tokens: Unsuper-vised style modeling, control and transfer in end-to-end speech synthesis","author":"wang","year":"2018","journal-title":"Proceedings of the 35th International Conference on Machine Learning ICML 2018 Stockholmsm&#x00E4;ssan Stockholm Sweden July 10-15 2018"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2018-1113"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2968"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2018.8639682"},{"key":"ref1","article-title":"Tacotron: Towards end-to-end speech synthesis","author":"wang","year":"2017","journal-title":"arXiv preprint arXiv 1703 10593"},{"key":"ref20","article-title":"From speaker verification to multi-speaker speech synthesis, deep transfer with feedback constraint","author":"cai","year":"2020","journal-title":"arXiv preprint arXiv 2005 06138"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2530"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683561"},{"key":"ref42","article-title":"The thinkit system for icassp2021 m2voc challenge","author":"shang","year":"2021","journal-title":"2021 IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461368"},{"key":"ref41","article-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"devlin","year":"2018","journal-title":"arXiv preprint arXiv 1810 04805"},{"key":"ref23","article-title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","author":"shi","year":"2020","journal-title":"arXiv preprint arXiv 2010 11567"},{"key":"ref26","first-page":"1","article-title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","author":"ren","year":"2020","journal-title":"ArXiv"},{"key":"ref43","article-title":"Dian: duration informed auto-regressive network for voice cloning","author":"song","year":"2021","journal-title":"2021 IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP)"},{"key":"ref25","article-title":"Non-Attentive Tacotron: Robust and controllable neural TTS synthesis including unsupervised duration modeling","author":"shen","year":"2020"}],"event":{"name":"ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Toronto, ON, Canada","start":{"date-parts":[[2021,6,6]]},"end":{"date-parts":[[2021,6,11]]}},"container-title":["ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9413349\/9413350\/09414001.pdf?arnumber=9414001","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,3]],"date-time":"2022-08-03T00:19:07Z","timestamp":1659485947000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9414001\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,6,6]]},"references-count":43,"URL":"https:\/\/doi.org\/10.1109\/icassp39728.2021.9414001","relation":{},"subject":[],"published":{"date-parts":[[2021,6,6]]}}}