{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T19:17:19Z","timestamp":1776885439267,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":48,"publisher":"ACM","funder":[{"name":"Early Career Scheme (ECS-Hong Kong University of Science and Technology)","award":["22201322"],"award-info":[{"award-number":["22201322"]}]},{"name":"NSFC","award":["62206234"],"award-info":[{"award-number":["62206234"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3755377","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T06:54:15Z","timestamp":1761375255000},"page":"10083-10092","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":1,"title":["MelodyEdit: Zero-shot Music Editing with Disentangled Inversion Control"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-5782-5641","authenticated-orcid":false,"given":"Huadai","family":"Liu","sequence":"first","affiliation":[{"name":"HKUST, Hong Kong, China and Alibaba Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-2786-3896","authenticated-orcid":false,"given":"Jialei","family":"Wang","sequence":"additional","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0550-8247","authenticated-orcid":false,"given":"Xiangtai","family":"Li","sequence":"additional","affiliation":[{"name":"ByteDance Inc., Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0356-1968","authenticated-orcid":false,"given":"Wen","family":"Wang","sequence":"additional","affiliation":[{"name":"Alibaba Group, Sunnyvale, California, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6939-7438","authenticated-orcid":false,"given":"Qian","family":"Chen","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1695-9000","authenticated-orcid":false,"given":"Rongjie","family":"Huang","sequence":"additional","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-8246-0741","authenticated-orcid":false,"given":"Yang","family":"Liu","sequence":"additional","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-2557-2438","authenticated-orcid":false,"given":"Jiayang","family":"Xu","sequence":"additional","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6121-0384","authenticated-orcid":false,"given":"Zhou","family":"Zhao","sequence":"additional","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4942-7748","authenticated-orcid":false,"given":"Wei","family":"Xue","sequence":"additional","affiliation":[{"name":"HKUST, Hong Kong, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Musiclm: Generating music from text. arXiv preprint arXiv:2301.11325","author":"Agostinelli Andrea","year":"2023","unstructured":"Andrea Agostinelli, Timo I Denk, Zal\u00e1n Borsos, Jesse Engel, Mauro Verzetti, Antoine Caillon, Qingqing Huang, Aren Jansen, Adam Roberts, Marco Tagliasacchi, et al. 2023. Musiclm: Generating music from text. arXiv preprint arXiv:2301.11325 (2023)."},{"key":"e_1_3_2_1_2_1","first-page":"155","article-title":"Medleydb: A multitrack dataset for annotation intensive mir research","volume":"14","author":"Bittner Rachel M","year":"2014","unstructured":"Rachel M Bittner, Justin Salamon, Mike Tierney, Matthias Mauch, Chris Cannam, and Juan Pablo Bello. 2014. Medleydb: A multitrack dataset for annotation intensive mir research.. In ISMIR, Vol. 14. 155--160.","journal-title":"ISMIR"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01764"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02062"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10447265"},{"key":"e_1_3_2_1_6_1","unstructured":"Jade Copet Felix Kreuk Itai Gat Tal Remez David Kant Gabriel Synnaeve Yossi Adi and Alexandre D\u00e9fossez. 2023. Simple and Controllable Music Generation. arXiv:2306.05284 [cs.SD]"},{"key":"e_1_3_2_1_7_1","volume-title":"Diffusion models beat gans on image synthesis. Advances in neural information processing systems 34","author":"Dhariwal Prafulla","year":"2021","unstructured":"Prafulla Dhariwal and Alexander Nichol. 2021. Diffusion models beat gans on image synthesis. Advances in neural information processing systems 34 (2021), 8780--8794."},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"crossref","unstructured":"Wenkai Dong Song Xue Xiaoyue Duan and Shumin Han. 2023. Prompt Tuning Inversion for Text-Driven Image Editing Using Diffusion Models. arXiv:2305.04441 [cs.CV]","DOI":"10.1109\/ICCV51070.2023.00683"},{"key":"e_1_3_2_1_9_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly et al. 2020. An image is worth 16x16 words: Transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095889"},{"key":"e_1_3_2_1_11_1","volume-title":"Fast timing-conditioned latent audio diffusion. arXiv preprint arXiv:2402.04825","author":"Evans Zach","year":"2024","unstructured":"Zach Evans, CJ Carr, Josiah Taylor, Scott H Hawley, and Jordi Pons. 2024. Fast timing-conditioned latent audio diffusion. arXiv preprint arXiv:2402.04825 (2024)."},{"key":"e_1_3_2_1_12_1","volume-title":"Long-form music generation with latent diffusion. arXiv preprint arXiv:2404.10301","author":"Evans Zach","year":"2024","unstructured":"Zach Evans, Julian D Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons. 2024. Long-form music generation with latent diffusion. arXiv preprint arXiv:2404.10301 (2024)."},{"key":"e_1_3_2_1_13_1","volume-title":"Xin Eric Wang, and William Yang Wang","author":"Feng Weixi","year":"2023","unstructured":"Weixi Feng, Xuehai He, Tsu-Jui Fu, Varun Jampani, Arjun Akula, Pradyumna Narayana, Sugato Basu, Xin Eric Wang, and William Yang Wang. 2023. Training- Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis. arXiv:2212.05032 [cs.CV]"},{"key":"e_1_3_2_1_14_1","unstructured":"Bing Han Junyu Dai Weituo Hao Xinyan He Dong Guo Jitong Chen Yuxuan Wang Yanmin Qian and Xuchen Song. 2023. InstructME: An Instruction Guided Music Edit And Remix Framework with Latent Diffusion Models. arXiv:2308.14360 [cs.SD]"},{"key":"e_1_3_2_1_15_1","unstructured":"Ligong Han Song Wen Qi Chen Zhixing Zhang Kunpeng Song Mengwei Ren Ruijiang Gao Anastasis Stathopoulos Xiaoxiao He Yuxiao Chen Di Liu Qilong Zhangli Jindong Jiang Zhaoyang Xia Akash Srivastava and Dimitris Metaxas. 2023. Improving Tuning-Free Real Image Editing with Proximal Guidance. arXiv:2306.05414 [cs.CV]"},{"key":"e_1_3_2_1_16_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2015. Deep Residual Learning for Image Recognition. arXiv:1512.03385 [cs.CV]"},{"key":"e_1_3_2_1_17_1","volume-title":"Prompt-to-prompt image editing with cross attention control. arXiv preprint arXiv:2208.01626","author":"Hertz Amir","year":"2022","unstructured":"Amir Hertz, Ron Mokady, Jay Tenenbaum, Kfir Aberman, Yael Pritch, and Daniel Cohen-Or. 2022. Prompt-to-prompt image editing with cross attention control. arXiv preprint arXiv:2208.01626 (2022)."},{"key":"e_1_3_2_1_18_1","volume-title":"Proc. of NeurIPS.","author":"Ho Jonathan","year":"2020","unstructured":"Jonathan Ho, Ajay Jain, and Pieter Abbeel. 2020. Denoising Diffusion Probabilistic Models. In Proc. of NeurIPS."},{"key":"e_1_3_2_1_19_1","volume-title":"NeurIPS 2021 workshop on deep generative models and downstream applications.","author":"Ho Jonathan","year":"2021","unstructured":"Jonathan Ho and Tim Salimans. 2021. Classifier-free diffusion guidance. In NeurIPS 2021 workshop on deep generative models and downstream applications."},{"key":"e_1_3_2_1_20_1","unstructured":"Rongjie Huang Jiawei Huang Dongchao Yang Yi Ren Luping Liu Mingze Li Zhenhui Ye Jinglin Liu Xiang Yin and Zhou Zhao. 2023. Make-An- Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models. arXiv:2301.12661 [cs.SD]"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Inbar Huberman-Spiegelglas Vladimir Kulikov and Tomer Michaeli. 2024. An Edit Friendly DDPM Noise Space: Inversion and Manipulations. arXiv:2304.06140 [cs.CV]","DOI":"10.1109\/CVPR52733.2024.01185"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"crossref","unstructured":"Vladimir Iashin and Esa Rahtu. 2021. Taming Visually Guided Sound Generation. arXiv:2110.08791 [cs.CV]","DOI":"10.5244\/C.35.336"},{"key":"e_1_3_2_1_23_1","volume-title":"Direct inversion: Boosting diffusion-based editing with 3 lines of code. arXiv preprint arXiv:2310.01506","author":"Ju Xuan","year":"2023","unstructured":"Xuan Ju, Ailing Zeng, Yuxuan Bian, Shaoteng Liu, and Qiang Xu. 2023. Direct inversion: Boosting diffusion-based editing with 3 lines of code. arXiv preprint arXiv:2310.01506 (2023)."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00582"},{"key":"e_1_3_2_1_25_1","volume-title":"A Metric for Evaluating Music Enhancement Algorithms. arXiv preprint arXiv:1812.08466","author":"Kilgour Kevin","year":"2018","unstructured":"Kevin Kilgour, Mauricio Zuluaga, Dominik Roblek, and Matthew Sharifi. 2018. Fr\\'echet Audio Distance: A Metric for Evaluating Music Enhancement Algorithms. arXiv preprint arXiv:1812.08466 (2018)."},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00246"},{"key":"e_1_3_2_1_27_1","volume-title":"Audioldm: Text-to-audio generation with latent diffusion models. arXiv preprint arXiv:2301.12503","author":"Liu Haohe","year":"2023","unstructured":"Haohe Liu, Zehua Chen, Yi Yuan, Xinhao Mei, Xubo Liu, Danilo Mandic, Wenwu Wang, and Mark D Plumbley. 2023. Audioldm: Text-to-audio generation with latent diffusion models. arXiv preprint arXiv:2301.12503 (2023)."},{"key":"e_1_3_2_1_28_1","volume-title":"Vit-tts: visual text-to-speech with scalable diffusion transformer. arXiv preprint arXiv:2305.12708","author":"Liu Huadai","year":"2023","unstructured":"Huadai Liu, Rongjie Huang, Xuan Lin, Wenqiang Xu, Maozong Zheng, Hong Chen, Jinzheng He, and Zhou Zhao. 2023. Vit-tts: visual text-to-speech with scalable diffusion transformer. arXiv preprint arXiv:2305.12708 (2023)."},{"key":"e_1_3_2_1_29_1","volume-title":"AudioLCM: Text-to-Audio Generation with Latent Consistency Models. arXiv preprint arXiv:2406.00356","author":"Liu Huadai","year":"2024","unstructured":"Huadai Liu, Rongjie Huang, Yang Liu, Hengyuan Cao, Jialei Wang, Xize Cheng, Siqi Zheng, and Zhou Zhao. 2024. AudioLCM: Text-to-Audio Generation with Latent Consistency Models. arXiv preprint arXiv:2406.00356 (2024)."},{"key":"e_1_3_2_1_30_1","volume-title":"AudioLDM 2: Learning holistic audio generation with self-supervised pretraining. arXiv preprint arXiv:2308.05734","author":"Liu Haohe","year":"2023","unstructured":"Haohe Liu, Qiao Tian, Yi Yuan, Xubo Liu, Xinhao Mei, Qiuqiang Kong, Yuping Wang, Wenwu Wang, Yuxuan Wang, and Mark D Plumbley. 2023. AudioLDM 2: Learning holistic audio generation with self-supervised pretraining. arXiv preprint arXiv:2308.05734 (2023)."},{"key":"e_1_3_2_1_31_1","volume-title":"Flashaudio: Rectified flows for fast and high-fidelity text-to-audio generation. arXiv preprint arXiv:2410.12266","author":"Liu Huadai","year":"2024","unstructured":"Huadai Liu, Jialei Wang, Rongjie Huang, Yang Liu, Heng Lu, Zhou Zhao, and Wei Xue. 2024. Flashaudio: Rectified flows for fast and high-fidelity text-to-audio generation. arXiv preprint arXiv:2410.12266 (2024)."},{"key":"e_1_3_2_1_32_1","unstructured":"Wenrui Liu Qian Chen Wen Wang Yafeng Chen Jin Xu Zhifang Guo Guanrou Yang Weiqin Li Xiaoda Yang Tao Jin et al. 2025. Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation. arXiv preprint arXiv:2505.24496 (2025)."},{"key":"e_1_3_2_1_33_1","volume-title":"Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion. arXiv preprint arXiv:2402.10009","author":"Manor Hila","year":"2024","unstructured":"Hila Manor and Tomer Michaeli. 2024. Zero-Shot Unsupervised and Text-Based Audio Editing Using DDPM Inversion. arXiv preprint arXiv:2402.10009 (2024)."},{"key":"e_1_3_2_1_34_1","unstructured":"Daiki Miyake Akihiro Iohara Yu Saito and Toshiyuki Tanaka. 2023. Negative prompt Inversion: Fast Image Inversion for Editing with Text-guided Diffusion Models. arXiv:2305.16807 [cs.CV]"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00585"},{"key":"e_1_3_2_1_36_1","volume-title":"Ditto: Diffusion inference-time t-optimization for music generation. arXiv preprint arXiv:2401.12179","author":"Novack Zachary","year":"2024","unstructured":"Zachary Novack, Julian McAuley, Taylor Berg-Kirkpatrick, and Nicholas J Bryan. 2024. Ditto: Diffusion inference-time t-optimization for music generation. arXiv preprint arXiv:2401.12179 (2024)."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"crossref","unstructured":"Francesco Paissan ZhepeiWang Mirco Ravanelli Paris Smaragdis and Cem Subakan. 2023. Audio Editing with Non-Rigid Text Prompts. arXiv:2310.12858 [cs.SD]","DOI":"10.21437\/Interspeech.2024-636"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1145\/3588432.3591513"},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"crossref","unstructured":"William Peebles and Saining Xie. 2023. Scalable Diffusion Models with Transformers. arXiv:2212.09748 [cs.CV]","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446869"},{"key":"e_1_3_2_1_41_1","volume-title":"Proc. of ICLR.","author":"Song Jiaming","year":"2020","unstructured":"Jiaming Song, Chenlin Meng, and Stefano Ermon. 2020. Denoising Diffusion Implicit Models. In Proc. of ICLR."},{"key":"e_1_3_2_1_42_1","volume-title":"Improved techniques for training score based generative models. Advances in neural information processing systems 33","author":"Song Yang","year":"2020","unstructured":"Yang Song and Stefano Ermon. 2020. Improved techniques for training score based generative models. Advances in neural information processing systems 33 (2020), 12438--12448."},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"crossref","unstructured":"Narek Tumanyan Michal Geyer Shai Bagon and Tali Dekel. 2022. Plug-and-Play Diffusion Features for Text-Driven Image-to-Image Translation. arXiv:2211.12572 [cs.CV]","DOI":"10.1109\/CVPR52729.2023.00191"},{"key":"e_1_3_2_1_44_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2023. Attention Is All You Need. arXiv:1706.03762 [cs.CL]"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00678"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2024.3399026"},{"key":"e_1_3_2_1_47_1","volume-title":"Emovoice: Llm-based emotional text-to-speech model with freestyle text prompting. arXiv preprint arXiv:2504.12867","author":"Yang Guanrou","year":"2025","unstructured":"Guanrou Yang, Chen Yang, Qian Chen, Ziyang Ma, Wenxi Chen, Wen Wang, Tianrui Wang, Yifan Yang, Zhikang Niu, Wenrui Liu, et al. 2025. Emovoice: Llm-based emotional text-to-speech model with freestyle text prompting. arXiv preprint arXiv:2504.12867 (2025)."},{"key":"e_1_3_2_1_48_1","unstructured":"Yixiao Zhang Yukara Ikemiya Gus Xia Naoki Murata Marco A. Mart\u00ednez-Ram\u00edrez Wei-Hsiang Liao Yuki Mitsufuji and Simon Dixon. 2024. MusicMagus: Zero-Shot Text-to-Music Editing via Diffusion Models. arXiv:2402.06178 [cs.SD]"}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","location":"Dublin Ireland","acronym":"MM '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3755377","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:01:03Z","timestamp":1765339263000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3755377"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":48,"alternative-id":["10.1145\/3746027.3755377","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3755377","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}