{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T15:36:32Z","timestamp":1780587392042,"version":"3.54.1"},"reference-count":24,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,12,2]],"date-time":"2024-12-02T00:00:00Z","timestamp":1733097600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,12,2]],"date-time":"2024-12-02T00:00:00Z","timestamp":1733097600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,12,2]]},"DOI":"10.1109\/slt61566.2024.10832324","type":"proceedings-article","created":{"date-parts":[[2025,1,16]],"date-time":"2025-01-16T18:31:27Z","timestamp":1737052287000},"page":"705-710","source":"Crossref","is-referenced-by-count":4,"title":["NDVQ: Robust Neural Audio Codec With Normal Distribution-Based Vector Quantization"],"prefix":"10.1109","author":[{"given":"Zhikang","family":"Niu","sequence":"first","affiliation":[{"name":"Shanghai Jiao Tong University,MoE Key Lab of Artificial Intelligence AI Institute, X-LANCE Lab,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sanyuan","family":"Chen","sequence":"additional","affiliation":[{"name":"Microsoft Research Asia,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Long","family":"Zhou","sequence":"additional","affiliation":[{"name":"Microsoft Research Asia,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziyang","family":"Ma","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University,MoE Key Lab of Artificial Intelligence AI Institute, X-LANCE Lab,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xie","family":"Chen","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University,MoE Key Lab of Artificial Intelligence AI Institute, X-LANCE Lab,China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shujie","family":"Liu","sequence":"additional","affiliation":[{"name":"Microsoft Research Asia,China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1987.1169405"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/45.1890"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.17487\/rfc6716"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7179063"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/taslp.2021.3129994"},{"key":"ref6","article-title":"High fidelity neural audio compression","author":"D\u00e9fossez","year":"2022","journal-title":"arXiv preprint arXiv:2210.13438"},{"key":"ref7","article-title":"High-fidelity audio compression with improved RVQGAN","volume-title":"Proc. of NeurIPS","volume":"36","author":"Kumar"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1563"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1312.6114"},{"key":"ref10","article-title":"Generative adversarial nets","volume-title":"Proc. of NeurIPS","volume":"27","author":"Goodfellow"},{"key":"ref11","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. NeurIPS","author":"Ho"},{"key":"ref12","article-title":"Language models are unsupervised multitask learners","author":"Radford","year":"2019","journal-title":"OpenAI blog"},{"key":"ref13","article-title":"Neural discrete representation learning","volume-title":"Proc. NeurIPS","author":"Van"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-2441"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2001.941023"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1186\/s13636-015-0054-9"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/PACRIM.1993.407206"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1016\/j.dsp.2006.06.007"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683855"},{"key":"ref20","article-title":"Neural codec language models are zero-shot text to speech synthesizers","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv:2301.02111"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2022.3188113"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"ref23","article-title":"Superseded-CSTR VCTK corpus: English multi-speaker corpus for CSTR voice cloning toolkit","author":"Veaux","year":"2016"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICSDA.2017.8384449"}],"event":{"name":"2024 IEEE Spoken Language Technology Workshop (SLT)","location":"Macao","start":{"date-parts":[[2024,12,2]]},"end":{"date-parts":[[2024,12,5]]}},"container-title":["2024 IEEE Spoken Language Technology Workshop (SLT)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10830790\/10830793\/10832324.pdf?arnumber=10832324","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,17]],"date-time":"2025-01-17T08:10:57Z","timestamp":1737101457000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10832324\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,2]]},"references-count":24,"URL":"https:\/\/doi.org\/10.1109\/slt61566.2024.10832324","relation":{},"subject":[],"published":{"date-parts":[[2024,12,2]]}}}