{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,14]],"date-time":"2026-07-14T04:22:09Z","timestamp":1784002929829,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":108,"publisher":"ACM","license":[{"start":{"date-parts":[[2025,4,25]],"date-time":"2025-04-25T00:00:00Z","timestamp":1745539200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100003725","name":"National Research Foundation of Korea","doi-asserted-by":"publisher","award":["RS-2024-00337007"],"award-info":[{"award-number":["RS-2024-00337007"]}],"id":[{"id":"10.13039\/501100003725","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,4,26]]},"DOI":"10.1145\/3706598.3713818","type":"proceedings-article","created":{"date-parts":[[2025,4,24]],"date-time":"2025-04-24T03:24:33Z","timestamp":1745465073000},"page":"1-28","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":22,"title":["Amuse: Human-AI Collaborative Songwriting with Multimodal Inspirations"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-2013-4278","authenticated-orcid":false,"given":"Yewon","family":"Kim","sequence":"first","affiliation":[{"name":"School of Electrical Engineering, KAIST, Daejeon, Republic of Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5518-2126","authenticated-orcid":false,"given":"Sung-Ju","family":"Lee","sequence":"additional","affiliation":[{"name":"School of Electrical Engineering, KAIST, Daejeon, Republic of Korea"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-6825-6327","authenticated-orcid":false,"given":"Chris","family":"Donahue","sequence":"additional","affiliation":[{"name":"Computer Science Department, Carnegie Mellon University, Pittsburgh, Pennsylvania, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,4,25]]},"reference":[{"key":"e_1_3_3_3_2_2","unstructured":"Andrea Agostinelli Timo\u00a0I. Denk Zal\u00e1n Borsos Jesse Engel Mauro Verzetti Antoine Caillon Qingqing Huang Aren Jansen Adam Roberts Marco Tagliasacchi Matt Sharifi Neil Zeghidour and Christian Frank. 2023. MusicLM: Generating Music From Text. arxiv:https:\/\/arXiv.org\/abs\/2301.11325\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2301.11325"},{"key":"e_1_3_3_3_3_2","unstructured":"Music AI. 2024. Music AI: AI Audio Models to Power Your Music Business. https:\/\/www.music.ai."},{"key":"e_1_3_3_3_4_2","unstructured":"Suno AI. 2024. Suno AI. https:\/\/suno.com\/."},{"key":"e_1_3_3_3_5_2","doi-asserted-by":"crossref","unstructured":"Philip Alperson. 1984. On Musical Improvisation. The Journal of Aesthetics and Art Criticism 43 1 (1984) 17\u201329. http:\/\/www.jstor.org\/stable\/430189","DOI":"10.2307\/430189"},{"key":"e_1_3_3_3_6_2","doi-asserted-by":"publisher","DOI":"10.1145\/3635636.3656204"},{"key":"e_1_3_3_3_7_2","unstructured":"Aria. 2024. Introducing Aria - Your personal AI co-creator for chords and melody. https:\/\/www.hooktheory.com\/hookpad\/aria."},{"key":"e_1_3_3_3_8_2","unstructured":"NIC BECKER RYAN LOUIE JOHN THICKSTUN and PERCY LIANG. 2024. Designing Live Human-AI Collaboration for Musical Improvisation."},{"key":"e_1_3_3_3_9_2","doi-asserted-by":"publisher","DOI":"10.5281\/zenodo.4813234"},{"key":"e_1_3_3_3_10_2","unstructured":"Eden Bensaid Mauro Martino Benjamin Hoover and Hendrik Strobelt. 2021. FairyTailor: A Multimodal Generative Framework for Storytelling. arxiv:https:\/\/arXiv.org\/abs\/2108.04324\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2108.04324"},{"key":"e_1_3_3_3_11_2","doi-asserted-by":"publisher","DOI":"10.1145\/3527927.3535200"},{"key":"e_1_3_3_3_12_2","doi-asserted-by":"publisher","DOI":"10.1145\/3411764.3445372"},{"key":"e_1_3_3_3_13_2","doi-asserted-by":"publisher","DOI":"10.1145\/3613904.3642320"},{"key":"e_1_3_3_3_14_2","unstructured":"Angel\u00a0X. Chang Mihail Eric Manolis Savva and Christopher\u00a0D. Manning. 2017. SceneSeer: 3D Scene Design with Natural Language. arxiv:https:\/\/arXiv.org\/abs\/1703.00050\u00a0[cs.GR] https:\/\/arxiv.org\/abs\/1703.00050"},{"key":"e_1_3_3_3_15_2","doi-asserted-by":"publisher","DOI":"10.1145\/2501988.2502008"},{"key":"e_1_3_3_3_16_2","doi-asserted-by":"crossref","unstructured":"Ke Chen Xingjian Du Bilei Zhu Zejun Ma Taylor Berg-Kirkpatrick and Shlomo Dubnov. 2022. HTS-AT: A Hierarchical Token-Semantic Audio Transformer for Sound Classification and Detection. arxiv:https:\/\/arXiv.org\/abs\/2202.00874\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2202.00874","DOI":"10.31219\/osf.io\/d264y"},{"key":"e_1_3_3_3_17_2","doi-asserted-by":"publisher","unstructured":"Erin Cherry and Celine Latulipe. 2014. Quantifying the Creativity Support of Digital Tools through the Creativity Support Index. ACM Trans. Comput.-Hum. Interact. 21 4 Article 21 (jun 2014) 25\u00a0pages. 10.1145\/2617588","DOI":"10.1145\/2617588"},{"key":"e_1_3_3_3_18_2","doi-asserted-by":"publisher","DOI":"10.1145\/3613904.3642794"},{"key":"e_1_3_3_3_19_2","doi-asserted-by":"publisher","DOI":"10.1145\/3491102.3501819"},{"key":"e_1_3_3_3_20_2","doi-asserted-by":"publisher","DOI":"10.1145\/3172944.3172983"},{"key":"e_1_3_3_3_21_2","volume-title":"Practical nonparametric statistics","author":"Conover WJ","year":"1999","unstructured":"WJ Conover. 1999. Practical nonparametric statistics. John Wiley & Sons, Inc, New York, NY, USA."},{"key":"e_1_3_3_3_22_2","unstructured":"Jade Copet Felix Kreuk Itai Gat Tal Remez David Kant Gabriel Synnaeve Yossi Adi and Alexandre D\u00e9fossez. 2024. Simple and Controllable Music Generation. arxiv:https:\/\/arXiv.org\/abs\/2306.05284\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2306.05284"},{"key":"e_1_3_3_3_23_2","doi-asserted-by":"publisher","unstructured":"Juliet Corbin and Anselm Strauss. 2008. Basics of Qualitative Research (3rd ed.): Techniques and Procedures for Developing Grounded Theory. 10.4135\/9781452230153","DOI":"10.4135\/9781452230153"},{"key":"e_1_3_3_3_24_2","doi-asserted-by":"publisher","DOI":"10.1145\/383259.383316"},{"key":"e_1_3_3_3_25_2","unstructured":"Mihaly Csikszentmihalyi. 1997. Flow and Creativity. NAMTA Journal 22 2 (1997) 60\u201397. https:\/\/eric.ed.gov\/?id=EJ547968"},{"key":"e_1_3_3_3_26_2","unstructured":"Mihaly Csikszentmihalyi. 1997. Flow and the psychology of discovery and invention. HarperPerennial New York 39 (1997) 1\u201316."},{"key":"e_1_3_3_3_27_2","doi-asserted-by":"publisher","DOI":"10.1145\/3544548.3580969"},{"key":"e_1_3_3_3_28_2","unstructured":"TheoryTab DB. 2024. TheoryTab DB: Tabs that show the theory behind songs. https:\/\/www.hooktheory.com\/theorytab."},{"key":"e_1_3_3_3_29_2","unstructured":"Prafulla Dhariwal Heewoo Jun Christine Payne Jong\u00a0Wook Kim Alec Radford and Ilya Sutskever. 2020. Jukebox: A Generative Model for Music. arxiv:https:\/\/arXiv.org\/abs\/2005.00341\u00a0[eess.AS] https:\/\/arxiv.org\/abs\/2005.00341"},{"key":"e_1_3_3_3_30_2","unstructured":"Chris Donahue Antoine Caillon Adam Roberts Ethan Manilow Philippe Esling Andrea Agostinelli Mauro Verzetti Ian Simon Olivier Pietquin Neil Zeghidour and Jesse Engel. 2023. SingSong: Generating musical accompaniments from singing. arxiv:https:\/\/arXiv.org\/abs\/2301.12662\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2301.12662"},{"key":"e_1_3_3_3_31_2","unstructured":"Chris Donahue Huanru\u00a0Henry Mao Yiting\u00a0Ethan Li Garrison\u00a0W. Cottrell and Julian McAuley. 2019. LakhNES: Improving multi-instrumental music generation with cross-domain pre-training. arxiv:https:\/\/arXiv.org\/abs\/1907.04868\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/1907.04868"},{"key":"e_1_3_3_3_32_2","unstructured":"Chris Donahue John Thickstun and Percy Liang. 2022. Melody transcription via generative pre-training. arxiv:https:\/\/arXiv.org\/abs\/2212.01884\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2212.01884"},{"key":"e_1_3_3_3_33_2","unstructured":"Chris Donahue Shih-Lun Wu Yewon Kim Dave Carlton Ryan Miyakawa and John Thickstun. 2024. Hookpad Aria: A Copilot for Songwriters."},{"key":"e_1_3_3_3_34_2","unstructured":"Anil\u00a0R. Doshi and Oliver\u00a0P. Hauser. 2024. Generative artificial intelligence enhances creativity but reduces the diversity of novel content. arxiv:https:\/\/arXiv.org\/abs\/2312.00506\u00a0[cs.HC] https:\/\/arxiv.org\/abs\/2312.00506"},{"key":"e_1_3_3_3_35_2","doi-asserted-by":"crossref","unstructured":"Alaaeldin El-Nouby Shikhar Sharma Hannes Schulz Devon Hjelm Layla\u00a0El Asri Samira\u00a0Ebrahimi Kahou Yoshua Bengio and Graham\u00a0W. Taylor. 2019. Tell Draw and Repeat: Generating and Modifying Images Based on Continual Linguistic Instruction. arxiv:https:\/\/arXiv.org\/abs\/1811.09845\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/1811.09845","DOI":"10.1109\/ICCV.2019.01040"},{"key":"e_1_3_3_3_36_2","doi-asserted-by":"publisher","DOI":"10.7551\/mitpress\/7722.001.0001"},{"key":"e_1_3_3_3_37_2","unstructured":"Seth* Forsgren and Hayk* Martiros. 2022. Riffusion - Stable diffusion for real-time music generation. https:\/\/riffusion.com\/about"},{"key":"e_1_3_3_3_38_2","unstructured":"Satoru Fukayama Kazuyoshi Yoshii and Masataka Goto. 2013. Chord-Sequence-Factory: A Chord Arrangement System Modifying Factorized Chord Sequence Probabilities. https:\/\/api.semanticscholar.org\/CorpusID:1099764"},{"key":"e_1_3_3_3_39_2","doi-asserted-by":"publisher","DOI":"10.1145\/3290605.3300526"},{"key":"e_1_3_3_3_40_2","doi-asserted-by":"publisher","DOI":"10.4324\/9780203793206"},{"key":"e_1_3_3_3_41_2","unstructured":"Ga\u00ebtan Hadjeres and L\u00e9opold Crestel. 2021. The Piano Inpainting Application. arxiv:https:\/\/arXiv.org\/abs\/2107.05944\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2107.05944"},{"key":"e_1_3_3_3_42_2","series-title":"Proceedings of Machine Learning Research","first-page":"1362","volume-title":"Proceedings of the 34th International Conference on Machine Learning","volume":"70","author":"Hadjeres Ga\u00ebtan","year":"2017","unstructured":"Ga\u00ebtan Hadjeres, Fran\u00e7ois Pachet, and Frank Nielsen. 2017. DeepBach: a Steerable Model for Bach Chorales Generation. In Proceedings of the 34th International Conference on Machine Learning(Proceedings of Machine Learning Research, Vol.\u00a070), Doina Precup and Yee\u00a0Whye Teh (Eds.). PMLR, International Convention Centre, Sydney, Australia, 1362\u20131371. http:\/\/proceedings.mlr.press\/v70\/hadjeres17a.html"},{"key":"e_1_3_3_3_43_2","unstructured":"Hookpad. 2024. Hookpad Songwriting Software: Create Amazing Music. https:\/\/www.hooktheory.com\/hookpad."},{"key":"e_1_3_3_3_44_2","unstructured":"Hooktheory. 2024. Hooktheory: Create amazing music. https:\/\/www.hooktheory.com\/."},{"key":"e_1_3_3_3_45_2","doi-asserted-by":"publisher","DOI":"10.1145\/302979.303030"},{"key":"e_1_3_3_3_46_2","unstructured":"Cheng-Zhi\u00a0Anna Huang Tim Cooijmans Adam Roberts Aaron Courville and Douglas Eck. 2019. Counterpoint by Convolution. arxiv:https:\/\/arXiv.org\/abs\/1903.07227\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/1903.07227"},{"key":"e_1_3_3_3_47_2","doi-asserted-by":"publisher","DOI":"10.1145\/2856767.2856792"},{"key":"e_1_3_3_3_48_2","unstructured":"Cheng-Zhi\u00a0Anna Huang Curtis Hawthorne Adam Roberts Monica Dinculescu James Wexler Leon Hong and Jacob Howcroft. 2019. The Bach Doodle: Approachable music composition with machine learning at scale. arxiv:https:\/\/arXiv.org\/abs\/1907.06637\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/1907.06637"},{"key":"e_1_3_3_3_49_2","unstructured":"Cheng-Zhi\u00a0Anna Huang Hendrik\u00a0Vincent Koops Ed Newton-Rex Monica Dinculescu and Carrie\u00a0J. Cai. 2020. AI Song Contest: Human-AI Co-Creation in Songwriting. arxiv:https:\/\/arXiv.org\/abs\/2010.05388\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2010.05388"},{"key":"e_1_3_3_3_50_2","unstructured":"Cheng-Zhi\u00a0Anna Huang Ashish Vaswani Jakob Uszkoreit Noam Shazeer Ian Simon Curtis Hawthorne Andrew\u00a0M. Dai Matthew\u00a0D. Hoffman Monica Dinculescu and Douglas Eck. 2018. Music Transformer. arxiv:https:\/\/arXiv.org\/abs\/1809.04281\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/1809.04281"},{"key":"e_1_3_3_3_51_2","unstructured":"Qingqing Huang Daniel\u00a0S. Park Tao Wang Timo\u00a0I. Denk Andy Ly Nanxin Chen Zhengdong Zhang Zhishuai Zhang Jiahui Yu Christian Frank Jesse Engel Quoc\u00a0V. Le William Chan Zhifeng Chen and Wei Han. 2023. Noise2Music: Text-conditioned Music Generation with Diffusion Models. arxiv:https:\/\/arXiv.org\/abs\/2302.03917\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2302.03917"},{"key":"e_1_3_3_3_52_2","doi-asserted-by":"publisher","DOI":"10.1145\/3613904.3642040"},{"key":"e_1_3_3_3_53_2","doi-asserted-by":"publisher","DOI":"10.1145\/3379503.3403556"},{"key":"e_1_3_3_3_54_2","doi-asserted-by":"crossref","unstructured":"Ziva Kunda Dale\u00a0T. Miller and Theresa Claire. 1990. Combining Social Concepts: The Role of Causal Reasoning. Cognitive Science 14 4 (1990) 551\u2013577.","DOI":"10.1207\/s15516709cog1404_3"},{"key":"e_1_3_3_3_55_2","doi-asserted-by":"publisher","DOI":"10.1145\/3563657.3595977"},{"key":"e_1_3_3_3_56_2","doi-asserted-by":"publisher","DOI":"10.1145\/3613904.3642697"},{"key":"e_1_3_3_3_57_2","doi-asserted-by":"publisher","DOI":"10.1145\/3491102.3502030"},{"key":"e_1_3_3_3_58_2","doi-asserted-by":"publisher","DOI":"10.1145\/1142405.1142428"},{"key":"e_1_3_3_3_59_2","doi-asserted-by":"publisher","unstructured":"J. Lin. 1991. Divergence measures based on the Shannon entropy. IEEE Transactions on Information Theory 37 1 (1991) 145\u2013151. 10.1109\/18.61115","DOI":"10.1109\/18.61115"},{"key":"e_1_3_3_3_60_2","doi-asserted-by":"publisher","DOI":"10.1145\/3526113.3545621"},{"key":"e_1_3_3_3_61_2","unstructured":"Vivian Liu Jo Vermeulen George Fitzmaurice and Justin Matejka. 2023. 3DALL-E: Integrating Text-to-Image AI in 3D Design Workflows. arxiv:https:\/\/arXiv.org\/abs\/2210.11603\u00a0[cs.HC] https:\/\/arxiv.org\/abs\/2210.11603"},{"key":"e_1_3_3_3_62_2","doi-asserted-by":"publisher","DOI":"10.1145\/3313831.3376739"},{"key":"e_1_3_3_3_63_2","doi-asserted-by":"publisher","DOI":"10.1145\/3490099.3511159"},{"key":"e_1_3_3_3_64_2","unstructured":"Martin\u00a0E. Malandro. 2023. Composer\u2019s Assistant: An Interactive Transformer for Multi-Track MIDI Infilling. arxiv:https:\/\/arXiv.org\/abs\/2301.12525\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2301.12525"},{"key":"e_1_3_3_3_65_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W17-3904"},{"key":"e_1_3_3_3_66_2","unstructured":"Lidia Morris Rebecca Leger Michele Newman John\u00a0Ashley Burgoyne Ryan Groves Natasha Mangal and Jin\u00a0Ha Lee. 2024. Human-AI Music Process: A Dataset of AI-Supported Songwriting Processes from the AI Song Contest."},{"key":"e_1_3_3_3_67_2","doi-asserted-by":"publisher","unstructured":"Radford\u00a0M. Neal. 2003. Slice sampling. The Annals of Statistics 31 3 (2003) 705 \u2013 767. 10.1214\/aos\/1056562461","DOI":"10.1214\/aos\/1056562461"},{"key":"e_1_3_3_3_68_2","doi-asserted-by":"publisher","unstructured":"Michele Newman Lidia Morris and Jin Ha\u00a0Lee 0001. 2023. Human-AI Music Creation: Understanding the Perceptions and Experiences of Music Creators for Ethical and Productive Collaboration. 80-88\u00a0pages. 10.5281\/zenodo.10265227","DOI":"10.5281\/zenodo.10265227"},{"key":"e_1_3_3_3_69_2","volume-title":"The Design of Everyday Things","author":"Norman D.A.","year":"2013","unstructured":"D.A. Norman. 2013. The Design of Everyday Things. MIT Press, Cambridge, MA, USA. https:\/\/books.google.co.kr\/books?id=heCtnQEACAAJ"},{"key":"e_1_3_3_3_70_2","doi-asserted-by":"crossref","unstructured":"Richard\u00a0L. Oliver. 1980. A Cognitive Model of the Antecedents and Consequences of Satisfaction Decisions. Journal of Marketing Research 17 4 (1980) 460\u2013469. http:\/\/www.jstor.org\/stable\/3150499","DOI":"10.1177\/002224378001700405"},{"key":"e_1_3_3_3_71_2","unstructured":"OpenAI. 2024. GPT-4o System Card. https:\/\/cdn.openai.com\/gpt-4o-system-card.pdf."},{"key":"e_1_3_3_3_72_2","unstructured":"OpenAI. 2024. Hello GPT-4o. https:\/\/openai.com\/index\/hello-gpt-4o\/."},{"key":"e_1_3_3_3_73_2","unstructured":"OpenAI. 2024. OpenAI Platform. https:\/\/platform.openai.com\/docs\/overview."},{"key":"e_1_3_3_3_74_2","unstructured":"Long Ouyang Jeff Wu Xu Jiang Diogo Almeida Carroll\u00a0L. Wainwright Pamela Mishkin Chong Zhang Sandhini Agarwal Katarina Slama Alex Ray John Schulman Jacob Hilton Fraser Kelton Luke Miller Maddie Simens Amanda Askell Peter Welinder Paul Christiano Jan Leike and Ryan Lowe. 2022. Training language models to follow instructions with human feedback. arxiv:https:\/\/arXiv.org\/abs\/2203.02155\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2203.02155"},{"key":"e_1_3_3_3_75_2","unstructured":"Vishakh Padmakumar and He He. 2024. Does Writing with Language Models Reduce Content Diversity?https:\/\/openreview.net\/forum?id=Feiz5HtCD0"},{"key":"e_1_3_3_3_76_2","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_3_3_77_2","unstructured":"Christine\u00a0McLeavy Payne. 2019. MuseNet. https:\/\/openai.com\/blog\/musenet\/."},{"key":"e_1_3_3_3_78_2","unstructured":"Dustin Podell Zion English Kyle Lacey Andreas Blattmann Tim Dockhorn Jonas M\u00fcller Joe Penna and Robin Rombach. 2023. SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis. arxiv:https:\/\/arXiv.org\/abs\/2307.01952\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2307.01952"},{"key":"e_1_3_3_3_79_2","unstructured":"Prolific. 2024. Prolific | Quickly find research participants you can trust. https:\/\/www.prolific.com\/."},{"key":"e_1_3_3_3_80_2","unstructured":"Alec Radford Jong\u00a0Wook Kim Chris Hallacy Aditya Ramesh Gabriel Goh Sandhini Agarwal Girish Sastry Amanda Askell Pamela Mishkin Jack Clark Gretchen Krueger and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. arxiv:https:\/\/arXiv.org\/abs\/2103.00020\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2103.00020"},{"key":"e_1_3_3_3_81_2","unstructured":"Reddit. 2024. Songwriting. https:\/\/www.reddit.com\/r\/Songwriting\/."},{"key":"e_1_3_3_3_82_2","doi-asserted-by":"publisher","unstructured":"Mitchel Resnick Brad Myers Kumiyo Nakakoji Ben Shneiderman Randy Pausch Ted Selker and Mike Eisenberg. 2018. Design Principles for Tools to Support Creative Thinking. 10.1184\/R1\/6621917.v1","DOI":"10.1184\/R1\/6621917.v1"},{"key":"e_1_3_3_3_83_2","unstructured":"Flavio Schneider Ojasv Kamal Zhijing Jin and Bernhard Sch\u00f6lkopf. 2023. Mo\u00fbsai: Text-to-Music Generation with Long-Context Latent Diffusion. arxiv:https:\/\/arXiv.org\/abs\/2301.11757\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2301.11757"},{"key":"e_1_3_3_3_84_2","unstructured":"Shikhar Sharma Dendi Suhubdy Vincent Michalski Samira\u00a0Ebrahimi Kahou and Yoshua Bengio. 2018. ChatPainter: Improving Text to Image Generation using Dialogue. arxiv:https:\/\/arXiv.org\/abs\/1802.08216\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/1802.08216"},{"key":"e_1_3_3_3_85_2","doi-asserted-by":"publisher","DOI":"10.1093\/oso\/9780192845290.001.0001"},{"key":"e_1_3_3_3_86_2","volume-title":"Designing the User Interface: Strategies for Effective Human-Computer Interaction (6th ed.)","author":"Shneiderman Ben","year":"2016","unstructured":"Ben Shneiderman, Catherine Plaisant, Maxine Cohen, Steven Jacobs, Niklas Elmqvist, and Nicholas Diakopoulos. 2016. Designing the User Interface: Strategies for Effective Human-Computer Interaction (6th ed.). Pearson, London, UK."},{"key":"e_1_3_3_3_87_2","unstructured":"Ian Simon and Sageev Oore. 2017. Performance RNN: Generating Music with Expressive Timing and Dynamics. https:\/\/magenta.tensorflow.org\/performance-rnn."},{"key":"e_1_3_3_3_88_2","unstructured":"Uriel Singer Adam Polyak Thomas Hayes Xi Yin Jie An Songyang Zhang Qiyuan Hu Harry Yang Oron Ashual Oran Gafni Devi Parikh Sonal Gupta and Yaniv Taigman. 2022. Make-A-Video: Text-to-Video Generation without Text-Video Data. arxiv:https:\/\/arXiv.org\/abs\/2209.14792\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2209.14792"},{"key":"e_1_3_3_3_89_2","doi-asserted-by":"publisher","unstructured":"Nikhil Singh Guillermo Bernal Daria Savchenko and Elena\u00a0L. Glassman. 2023. Where to Hide a Stolen Elephant: Leaps in Creative Writing with Multimodal Machine Intelligence. ACM Trans. Comput.-Hum. Interact. 30 5 Article 68 (sep 2023) 57\u00a0pages. 10.1145\/3511599","DOI":"10.1145\/3511599"},{"key":"e_1_3_3_3_90_2","doi-asserted-by":"publisher","DOI":"10.1145\/3411764.3445219"},{"key":"e_1_3_3_3_91_2","unstructured":"suno.wiki. 2024. Style and Genre List. https:\/\/www.suno.wiki\/faq\/style-and-lyrics\/styles-and-genres\/."},{"key":"e_1_3_3_3_92_2","unstructured":"Ultimate\u00a0Guitar Tabs. 2024. Misty Chords by Ella Fitzgerald. https:\/\/tabs.ultimate-guitar.com\/tab\/ella-fitzgerald\/misty-chords-1206796."},{"key":"e_1_3_3_3_93_2","unstructured":"John Thickstun David Leo\u00a0Wright Hall Chris Donahue and Percy Liang. 2024. Anticipatory Music Transformer. https:\/\/openreview.net\/forum?id=EBNJ33Fcrl"},{"key":"e_1_3_3_3_94_2","unstructured":"Udio. 2024. Udio | AI Music Generator - Official Website. https:\/\/udio.com\/."},{"key":"e_1_3_3_3_95_2","unstructured":"Unison. 2024. 7 Sad Chord Progressions That Instantly Get People Invested. https:\/\/unison.audio\/sad-chord-progressions\/."},{"key":"e_1_3_3_3_96_2","unstructured":"Aaron van\u00a0den Oord Yazhe Li and Oriol Vinyals. 2019. Representation Learning with Contrastive Predictive Coding. arxiv:https:\/\/arXiv.org\/abs\/1807.03748\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/1807.03748"},{"key":"e_1_3_3_3_97_2","doi-asserted-by":"publisher","unstructured":"Ashley Walton Auriel Washburn Peter Langland-Hassan Anthony Chemero Heidi Kloos and Michael Richardson. 2017. Creating Time: Social Collaboration in Music Improvisation. Topics in Cognitive Science 10 (11 2017). 10.1111\/tops.12306","DOI":"10.1111\/tops.12306"},{"key":"e_1_3_3_3_98_2","doi-asserted-by":"publisher","DOI":"10.1145\/3640543.3645143"},{"key":"e_1_3_3_3_99_2","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548368"},{"key":"e_1_3_3_3_100_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4899-3330-0"},{"key":"e_1_3_3_3_101_2","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511627101.014"},{"key":"e_1_3_3_3_102_2","doi-asserted-by":"publisher","unstructured":"Shih-Lun Wu Chris Donahue Shinji Watanabe and Nicholas\u00a0J. Bryan. 2024. Music ControlNet: Multiple Time-Varying Controls for Music Generation. IEEE\/ACM Trans. Audio Speech and Lang. Proc. 32 (May 2024) 2692\u20132703. 10.1109\/TASLP.2024.3399026","DOI":"10.1109\/TASLP.2024.3399026"},{"key":"e_1_3_3_3_103_2","doi-asserted-by":"publisher","DOI":"10.1145\/3491102.3517582"},{"key":"e_1_3_3_3_104_2","doi-asserted-by":"publisher","unstructured":"Yusong Wu Ke Chen Tianyu Zhang Yuchen Hui Taylor Berg-Kirkpatrick and Shlomo Dubnov. 2023. Large-Scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation. 5\u00a0pages. 10.1109\/ICASSP49357.2023.10095969","DOI":"10.1109\/ICASSP49357.2023.10095969"},{"key":"e_1_3_3_3_105_2","series-title":"Proceedings of Machine Learning Research","first-page":"53328","volume-title":"Proceedings of the 41st International Conference on Machine Learning","volume":"235","author":"Wu Yusong","year":"2024","unstructured":"Yusong Wu, Tim Cooijmans, Kyle Kastner, Adam Roberts, Ian Simon, Alexander Scarlatos, Chris Donahue, Cassie Tarakajian, Shayegan Omidshafiei, Aaron Courville, Pablo\u00a0Samuel Castro, Natasha Jaques, and Cheng-Zhi\u00a0Anna Huang. 2024. Adaptive Accompaniment with ReaLchords. In Proceedings of the 41st International Conference on Machine Learning(Proceedings of Machine Learning Research, Vol.\u00a0235), Ruslan Salakhutdinov, Zico Kolter, Katherine Heller, Adrian Weller, Nuria Oliver, Jonathan Scarlett, and Felix Berkenkamp (Eds.). PMLR, Valencia, Spain, 53328\u201353345. https:\/\/proceedings.mlr.press\/v235\/wu24c.html"},{"key":"e_1_3_3_3_106_2","doi-asserted-by":"publisher","DOI":"10.1145\/3586183.3606826"},{"key":"e_1_3_3_3_107_2","unstructured":"Sihyun Yu Weili Nie De-An Huang Boyi Li Jinwoo Shin and Anima Anandkumar. 2024. Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition. arxiv:https:\/\/arXiv.org\/abs\/2403.14148\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2403.14148"},{"key":"e_1_3_3_3_108_2","unstructured":"Yiming Zhang Avi Schwarzschild Nicholas Carlini Zico Kolter and Daphne Ippolito. 2024. Forcing Diffuse Distributions out of Language Models. arxiv:https:\/\/arXiv.org\/abs\/2404.10859\u00a0[cs.CL]"},{"key":"e_1_3_3_3_109_2","doi-asserted-by":"publisher","DOI":"10.1145\/3209978.3210080"}],"event":{"name":"CHI 2025: CHI Conference on Human Factors in Computing Systems","location":"Yokohama Japan","acronym":"CHI '25","sponsor":["SIGCHI ACM Special Interest Group on Computer-Human Interaction"]},"container-title":["Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3706598.3713818","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3706598.3713818","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,4]],"date-time":"2025-07-04T05:14:06Z","timestamp":1751606046000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3706598.3713818"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,25]]},"references-count":108,"alternative-id":["10.1145\/3706598.3713818","10.1145\/3706598"],"URL":"https:\/\/doi.org\/10.1145\/3706598.3713818","relation":{},"subject":[],"published":{"date-parts":[[2025,4,25]]},"assertion":[{"value":"2025-04-25","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}