{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T07:10:30Z","timestamp":1737443430875,"version":"3.33.0"},"reference-count":25,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,10,6]],"date-time":"2024-10-06T00:00:00Z","timestamp":1728172800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,10,6]],"date-time":"2024-10-06T00:00:00Z","timestamp":1728172800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,10,6]]},"DOI":"10.1109\/smc54092.2024.10831059","type":"proceedings-article","created":{"date-parts":[[2025,1,20]],"date-time":"2025-01-20T18:39:20Z","timestamp":1737398360000},"page":"336-341","source":"Crossref","is-referenced-by-count":0,"title":["Vrefine: A Self-Refinement Approach for Enhanced Clarity and Quality in Text-to-Speech Models"],"prefix":"10.1109","author":[{"given":"Dongjin","family":"Huang","sequence":"first","affiliation":[{"name":"Shanghai University,Shanghai Film Academy,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuhua","family":"Liu","sequence":"additional","affiliation":[{"name":"Shanghai University,Shanghai Film Academy,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jixu","family":"Qian","sequence":"additional","affiliation":[{"name":"Shanghai University,Shanghai Film Academy,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yanli","family":"Wang","sequence":"additional","affiliation":[{"name":"Shanghai University,Shanghai Film Academy,Shanghai,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Attention is All you Need","author":"Vaswani","year":"2017","journal-title":"Neural Information Processing Systems"},{"key":"ref2","article-title":"Text-to-image Diffusion Models in Gener-ative AI: A Survey","author":"Chenshuang","year":"2023","journal-title":"ArXiv"},{"journal-title":"GPT-4 Technical Report","year":"2023","author":"Achiam","key":"ref3"},{"key":"ref4","first-page":"2523","article-title":"AudioLM: A Language Modeling Approach to Audio Generation","volume":"31","author":"Zalan","year":"2022","journal-title":"IEEE\/ ACM Transactions on Audio, Speech, and Language Processing"},{"volume-title":"Suno","year":"2023","key":"ref5"},{"key":"ref6","article-title":"Language Models Are Few-Shot Learners","author":"Brown","year":"2020","journal-title":"arXiv: Computation and Language. arXiv: Computation and Language"},{"journal-title":"Neural Codec Language Models Are Zero-Shot Text to Speech Synthesizers","year":"2023","author":"Chengyi","key":"ref7"},{"key":"ref8","article-title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","author":"Mateusz","year":"2024","journal-title":"ArXiv"},{"key":"ref9","article-title":"Large language models: a compre-hensive survey of its applications, challenges, limitations, and future prospects","author":"Muhammad Usman","year":"2023","journal-title":"Authorea Preprints"},{"key":"ref10","article-title":"Self-Refine: Iterative Refinement with Self-Feedback","author":"Aman","year":"2023","journal-title":"ArXiv"},{"key":"ref11","article-title":"Audio self-supervised learning: A survey","volume":"3","author":"Shuo","year":"2022","journal-title":"Patterns"},{"key":"ref12","article-title":"Self-Supervised Learning from Contrastive Mixtures for Personalized Speech Enhancement","author":"Aswin","year":"2020","journal-title":"ArXiv"},{"key":"ref13","article-title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","author":"Alexei","year":"2020","journal-title":"ArXiv"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"ref15","first-page":"1505","article-title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","volume":"16","author":"Sanyuan","year":"2021","journal-title":"IEEE Journal of Selected Topics in Signal Processing"},{"key":"ref16","article-title":"Self-Training: A Survey","author":"Massih-Reza","year":"2022","journal-title":"ArXiv"},{"journal-title":"Enabling Language Models to Implicitly Learn Self-Improvement","year":"2023","author":"Ziqi","key":"ref17"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414460"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178964"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2409"},{"key":"ref21","article-title":"Music Source Separation in the Waveform Domain","author":"D\u2019efossez","year":"2019","journal-title":"ArXiv"},{"key":"ref22","article-title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","author":"Jiaming","year":"2023","journal-title":"ArXiv"},{"key":"ref23","article-title":"Qwen Technical Report","author":"Jinze","year":"2023","journal-title":"ArXiv"},{"key":"ref24","article-title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","author":"Heiga","year":"2019","journal-title":"Interspeech"},{"volume-title":"RALL-E: Robust Codec Language Modeling with Chain-of-Thought Prompting for Text-to-Speech Synthesis","year":"2024","author":"Detai","key":"ref25"}],"event":{"name":"2024 IEEE International Conference on Systems, Man, and Cybernetics (SMC)","start":{"date-parts":[[2024,10,6]]},"location":"Kuching, Malaysia","end":{"date-parts":[[2024,10,10]]}},"container-title":["2024 IEEE International Conference on Systems, Man, and Cybernetics (SMC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10830919\/10830920\/10831059.pdf?arnumber=10831059","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T06:37:25Z","timestamp":1737441445000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10831059\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,6]]},"references-count":25,"URL":"https:\/\/doi.org\/10.1109\/smc54092.2024.10831059","relation":{},"subject":[],"published":{"date-parts":[[2024,10,6]]}}}