{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,13]],"date-time":"2026-06-13T07:20:42Z","timestamp":1781335242709,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":70,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,7,5]]},"DOI":"10.1145\/3715336.3735814","type":"proceedings-article","created":{"date-parts":[[2025,7,4]],"date-time":"2025-07-04T10:12:29Z","timestamp":1751623949000},"page":"2738-2754","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":4,"title":["\u201cIt\u2019s more of a vibe I\u2019m going for\u201d: Designing Text-to-Music Generation Interfaces for Video Creators"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1145-1926","authenticated-orcid":false,"given":"Noor","family":"Hammad","sequence":"first","affiliation":[{"name":"Carnegie Mellon University, Pittsburgh, Pennsylvania, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-5758-707X","authenticated-orcid":false,"given":"C. Ailie","family":"Fraser","sequence":"additional","affiliation":[{"name":"Adobe Research, Seattle, Washington, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3019-3627","authenticated-orcid":false,"given":"Erik","family":"Harpstead","sequence":"additional","affiliation":[{"name":"Carnegie Mellon University, Pittsburgh, Pennsylvania, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4102-2575","authenticated-orcid":false,"given":"Jessica","family":"Hammer","sequence":"additional","affiliation":[{"name":"Carnegie Mellon University, Pittsburgh, Pennsylvania, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-5394-2706","authenticated-orcid":false,"given":"Mira","family":"Dontcheva","sequence":"additional","affiliation":[{"name":"Adobe Research, Seattle, Washington, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,7,4]]},"reference":[{"key":"e_1_3_3_2_2_2","unstructured":"Adobe. 2024. Seeds - Adobe Firefly API. https:\/\/developer.adobe.com\/firefly-services\/docs\/firefly-api\/guides\/concepts\/seeds\/ Accessed: 2025-1-17."},{"key":"e_1_3_3_2_3_2","unstructured":"Adobe. 2025. Advanced Search Features. https:\/\/stock.adobe.com\/search-features Accessed: 2025-1-10."},{"key":"e_1_3_3_2_4_2","unstructured":"Andrea Agostinelli Timo\u00a0I. Denk Zal\u00e1n Borsos Jesse Engel Mauro Verzetti Antoine Caillon Qingqing Huang Aren Jansen Adam Roberts Marco Tagliasacchi Matt Sharifi Neil Zeghidour and Christian Frank. 2023. MusicLM: Generating Music From Text. arxiv:https:\/\/arXiv.org\/abs\/2301.11325\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2301.11325"},{"key":"e_1_3_3_2_5_2","volume-title":"Riffusion","author":"AI Riffusion","unstructured":"Riffusion AI. [n. d.]. Riffusion. https:\/\/www.riffusion.com\/"},{"key":"e_1_3_3_2_6_2","volume-title":"Stable Audio","author":"AI Stability","year":"2023","unstructured":"Stability AI. 2023. Stable Audio. Stability AI. https:\/\/stability.ai\/stable-audio"},{"key":"e_1_3_3_2_7_2","volume-title":"Stable Audio - User Guide","author":"AI Stability","year":"2025","unstructured":"Stability AI. 2025. Stable Audio - User Guide. https:\/\/stableaudio.com\/user-guide\/prompt-structure Accessed: 2025-01-19."},{"key":"e_1_3_3_2_8_2","doi-asserted-by":"publisher","DOI":"10.1145\/3290605.3300233"},{"key":"e_1_3_3_2_9_2","unstructured":"Artlist.io. 2016. Artlist.io. https:\/\/artlist.io Accessed: 2025-1-19."},{"key":"e_1_3_3_2_10_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-demo.9"},{"key":"e_1_3_3_2_11_2","unstructured":"Syed Balkhi. 2023. 2025\u2019s Creator Economy Statistics That Will Blow You Away. https:\/\/www.wpbeginner.com\/research\/creator-economy-statistics-that-will-blow-you-away\/ Accessed: 2025-1-19."},{"key":"e_1_3_3_2_12_2","doi-asserted-by":"crossref","unstructured":"V Braun and V Clarke. 2006. Using thematic analysis in psychology. Qual. Res. Psychol. (2006).","DOI":"10.1191\/1478088706qp063oa"},{"key":"e_1_3_3_2_13_2","unstructured":"Blake Brittain. 2024. Music labels sue AI companies Suno Udio for US copyright infringement. Reuters (June 2024). https:\/\/www.reuters.com\/technology\/artificial-intelligence\/music-labels-sue-ai-companies-suno-udio-us-copyright-infringement-2024-06-24\/"},{"key":"e_1_3_3_2_14_2","unstructured":"Cambridge Dictionary. 2025. Vibe Definition. https:\/\/dictionary.cambridge.org\/dictionary\/english\/vibe"},{"key":"e_1_3_3_2_15_2","doi-asserted-by":"crossref","unstructured":"Tuhin Chakrabarty Vishakh Padmakumar Faeze Brahman and Smaranda Muresan. 2024. Creativity Support in the Age of Large Language Models: An Empirical Study Involving Emerging Writers. arxiv:https:\/\/arXiv.org\/abs\/2309.12570\u00a0[cs.HC] https:\/\/arxiv.org\/abs\/2309.12570","DOI":"10.1145\/3635636.3656201"},{"key":"e_1_3_3_2_16_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10447265"},{"key":"e_1_3_3_2_17_2","doi-asserted-by":"publisher","unstructured":"Erin Cherry and Celine Latulipe. 2014. Quantifying the Creativity Support of Digital Tools through the Creativity Support Index. ACM Trans. Comput.-Hum. Interact. 21 4 Article 21 (June 2014) 25\u00a0pages. 10.1145\/2617588","DOI":"10.1145\/2617588"},{"key":"e_1_3_3_2_18_2","unstructured":"Sanjoy Chowdhury Sayan Nag K\u00a0J Joseph Balaji\u00a0Vasan Srinivasan and Dinesh Manocha. 2024. MeLFusion: Synthesizing Music from Image and Language Cues using Diffusion Models. arxiv:https:\/\/arXiv.org\/abs\/2406.04673\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2406.04673"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","DOI":"10.1145\/3491102.3501819"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"publisher","unstructured":"Miguel Civit Javier Civit-Masot Francisco Cuadrado and Maria\u00a0J. Escalona. 2022. A systematic review of artificial intelligence-based music generation: Scope applications and future trends. Expert Systems with Applications 209 (2022) 118190. 10.1016\/j.eswa.2022.118190","DOI":"10.1016\/j.eswa.2022.118190"},{"key":"e_1_3_3_2_21_2","unstructured":"Jade Copet Felix Kreuk Itai Gat Tal Remez David Kant Gabriel Synnaeve Yossi Adi and Alexandre D\u00e9fossez. 2024. Simple and Controllable Music Generation. arxiv:https:\/\/arXiv.org\/abs\/2306.05284\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2306.05284"},{"key":"e_1_3_3_2_22_2","unstructured":"Jenny Crawford. 2024. 2023 TikTok data report: 85% of videos on TikTok contain music. https:\/\/pex.com\/blog\/2023-tiktok-data-report-85-of-videos-on-tiktok-contain-music\/ Accessed: 2025-1-19."},{"key":"e_1_3_3_2_23_2","unstructured":"Hai Dang Lukas Mecke Florian Lehmann Sven Goller and Daniel Buschek. 2022. How to Prompt? Opportunities and Challenges of Zero- and Few-Shot Learning for Human-AI Interaction in Creative Applications of Generative Models. arxiv:https:\/\/arXiv.org\/abs\/2209.01390\u00a0[cs.HC] https:\/\/arxiv.org\/abs\/2209.01390"},{"key":"e_1_3_3_2_24_2","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475195"},{"key":"e_1_3_3_2_25_2","unstructured":"Chris Donahue Antoine Caillon Adam Roberts Ethan Manilow Philippe Esling Andrea Agostinelli Mauro Verzetti Ian Simon Olivier Pietquin Neil Zeghidour and Jesse Engel. 2023. SingSong: Generating musical accompaniments from singing. arxiv:https:\/\/arXiv.org\/abs\/2301.12662\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2301.12662"},{"key":"e_1_3_3_2_26_2","unstructured":"Zhikang Dong Bin Chen Xiulong Liu Pawel Polak and Peng Zhang. 2024. MuseChat: A Conversational Music Recommendation System for Videos. arxiv:https:\/\/arXiv.org\/abs\/2310.06282\u00a0[cs.LG] https:\/\/arxiv.org\/abs\/2310.06282"},{"key":"e_1_3_3_2_27_2","unstructured":"Zach Evans Julian\u00a0D. Parker CJ Carr Zack Zukowski Josiah Taylor and Jordi Pons. 2024. Long-form music generation with latent diffusion. arxiv:https:\/\/arXiv.org\/abs\/2404.10301\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2404.10301"},{"key":"e_1_3_3_2_28_2","unstructured":"Zach Evans Julian\u00a0D. Parker CJ Carr Zack Zukowski Josiah Taylor and Jordi Pons. 2024. Stable Audio Open. arxiv:https:\/\/arXiv.org\/abs\/2407.14358\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2407.14358"},{"key":"e_1_3_3_2_29_2","doi-asserted-by":"publisher","DOI":"10.1145\/3313831.3376514"},{"key":"e_1_3_3_2_30_2","unstructured":"Josh Howarth. 2022. 30+ Incredible Creator Economy Statistics (2024). https:\/\/explodingtopics.com\/blog\/creator-economy-stats Accessed: 2025-1-19."},{"key":"e_1_3_3_2_31_2","unstructured":"Qingqing Huang Aren Jansen Joonseok Lee Ravi Ganti Judith\u00a0Yue Li and Daniel P.\u00a0W. Ellis. 2022. MuLan: A Joint Embedding of Music Audio and Natural Language. arxiv:https:\/\/arXiv.org\/abs\/2208.12415\u00a0[eess.AS] https:\/\/arxiv.org\/abs\/2208.12415"},{"key":"e_1_3_3_2_32_2","volume-title":"MusicFX","author":"Labs Google","year":"2023","unstructured":"Google Labs. 2023. MusicFX. https:\/\/labs.google\/fx\/tools\/music-fx"},{"key":"e_1_3_3_2_33_2","unstructured":"Elias Leight. 2024. Google Trained Its AI on Copyrighted Music Sources Say \u2014 Now It\u2019s Trying to Make Deals. http:\/\/www.billboard.com\/pro\/google-youtube-trained-ai-copyrighted-music-before-deals Accessed: 2025-1-19."},{"key":"e_1_3_3_2_34_2","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123399"},{"key":"e_1_3_3_2_35_2","doi-asserted-by":"publisher","DOI":"10.1145\/3491102.3501825"},{"key":"e_1_3_3_2_36_2","doi-asserted-by":"publisher","DOI":"10.1145\/3313831.3376739"},{"key":"e_1_3_3_2_37_2","doi-asserted-by":"publisher","DOI":"10.1145\/3490099.3511159"},{"key":"e_1_3_3_2_38_2","unstructured":"Ilaria Manco Emmanouil Benetos Elio Quinton and Gy\u00f6rgy Fazekas. 2022. Contrastive Audio-Language Learning for Music. arxiv:https:\/\/arXiv.org\/abs\/2208.12208\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2208.12208"},{"key":"e_1_3_3_2_39_2","doi-asserted-by":"crossref","unstructured":"Masahiro Matsuo Fumi Masuda Yukiyoshi Sumi Masahiro Takahashi Atsushi Yoshimura Naoto Yamada and Hiroshi Kadotani. 2019. Background music dependent reduction of aversive perception and its relation to P3 amplitude reduction and increased heart rate. Front. Hum. Neurosci. 13 (June 2019) 184. https:\/\/pubmed.ncbi.nlm.nih.gov\/31316359\/","DOI":"10.3389\/fnhum.2019.00184"},{"key":"e_1_3_3_2_40_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01420"},{"key":"e_1_3_3_2_41_2","unstructured":"Zachary Novack Julian McAuley Taylor Berg-Kirkpatrick and Nicholas Bryan. 2024. DITTO-2: Distilled Diffusion Inference-Time T-Optimization for Music Generation. arxiv:https:\/\/arXiv.org\/abs\/2405.20289\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2405.20289"},{"key":"e_1_3_3_2_42_2","unstructured":"Zachary Novack Julian McAuley Taylor Berg-Kirkpatrick and Nicholas\u00a0J. Bryan. 2024. DITTO: Diffusion Inference-Time T-Optimization for Music Generation. arxiv:https:\/\/arXiv.org\/abs\/2401.12179\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2401.12179"},{"key":"e_1_3_3_2_43_2","unstructured":"Zachary Novack Ge Zhu Jonah Casebeer Julian McAuley Taylor Berg-Kirkpatrick and Nicholas\u00a0J. Bryan. 2024. Presto! Distilling Steps and Layers for Accelerating Music Generation. arxiv:https:\/\/arXiv.org\/abs\/2410.05167\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2410.05167"},{"key":"e_1_3_3_2_44_2","unstructured":"OpenAI. 2021. CLIP: Connecting text and images. https:\/\/openai.com\/index\/clip\/ Accessed: 2025-1-19."},{"key":"e_1_3_3_2_45_2","doi-asserted-by":"publisher","DOI":"10.1145\/3613904.3642126"},{"key":"e_1_3_3_2_46_2","unstructured":"Laure Pretet Gael Richard and Geoffroy Peeters. 2021. Cross-Modal Music-Video Recommendation: A Study of Design Choices. arxiv:https:\/\/arXiv.org\/abs\/2104.14799\u00a0[cs.MM] https:\/\/arxiv.org\/abs\/2104.14799"},{"key":"e_1_3_3_2_47_2","doi-asserted-by":"publisher","unstructured":"Laure Pr\u00e9tet Ga\u00ebl Richard Cl\u00e9ment Souchier and Geoffroy Peeters. 2023. Video-to-Music Recommendation Using Temporal Alignment of Segments. IEEE Transactions on Multimedia 25 (2023) 2898\u20132911. 10.1109\/TMM.2022.3152598","DOI":"10.1109\/TMM.2022.3152598"},{"key":"e_1_3_3_2_48_2","unstructured":"Microsoft Research. 2023. LLaVA: Large Language and Vision Assistant. https:\/\/www.microsoft.com\/en-us\/research\/project\/llava-large-language-and-vision-assistant\/ Accessed: 2025-1-19."},{"key":"e_1_3_3_2_49_2","unstructured":"Stephen Robles. 2024. How Much Do YouTubers Make? (Earnings and Examples). https:\/\/riverside.fm\/blog\/how-much-do-youtubers-make Accessed: 2025-1-19."},{"key":"e_1_3_3_2_50_2","unstructured":"Flavio Schneider Ojasv Kamal Zhijing Jin and Bernhard Sch\u00f6lkopf. 2023. Mo\u00fbsai: Text-to-Music Generation with Long-Context Latent Diffusion. arxiv:https:\/\/arXiv.org\/abs\/2301.11757\u00a0[cs.CL] https:\/\/arxiv.org\/abs\/2301.11757"},{"key":"e_1_3_3_2_51_2","unstructured":"Epidemic Sound. 2009. Epidemic Sound. https:\/\/www.epidemicsound.com Accessed: 2025-1-19."},{"key":"e_1_3_3_2_52_2","unstructured":"Speechmatics. 2023. Speechmatics AI Speech Technology. https:\/\/www.speechmatics.com\/ Accessed: 2025-1-19."},{"key":"e_1_3_3_2_53_2","unstructured":"Adobe Stock. 2020. Adobe Royalty Free Stock Music and Audio. https:\/\/stock.adobe.com\/audio Accessed: 2025-1-19."},{"key":"e_1_3_3_2_54_2","doi-asserted-by":"crossref","unstructured":"Kun Su Judith\u00a0Yue Li Qingqing Huang Dima Kuzmin Joonseok Lee Chris Donahue Fei Sha Aren Jansen Yu Wang Mauro Verzetti and Timo\u00a0I. Denk. 2024. V2Meow: Meowing to the Visual Beat via Video-to-Music Generation. arxiv:https:\/\/arXiv.org\/abs\/2305.06594\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2305.06594","DOI":"10.1609\/aaai.v38i5.28299"},{"key":"e_1_3_3_2_55_2","volume-title":"Suno","year":"2023","unstructured":"Suno. 2023. Suno. https:\/\/suno.com"},{"key":"e_1_3_3_2_56_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01031"},{"key":"e_1_3_3_2_57_2","volume-title":"Udio","year":"2024","unstructured":"Udio. 2024. Udio. https:\/\/www.udio.com\/"},{"key":"e_1_3_3_2_58_2","doi-asserted-by":"publisher","unstructured":"Veera Vimpari Annakaisa Kultima Perttu H\u00e4m\u00e4l\u00e4inen and Christian Guckelsberger. 2023. \u201cAn Adapt-or-Die Type of Situation\u201d: Perception Adoption and Use of Text-to-Image-Generation AI by Game Industry Professionals. Proc. ACM Hum.-Comput. Interact. 7 CHI PLAY Article 379 (Oct. 2023) 34\u00a0pages. 10.1145\/3611025","DOI":"10.1145\/3611025"},{"key":"e_1_3_3_2_59_2","doi-asserted-by":"publisher","DOI":"10.1145\/3640543.3645143"},{"key":"e_1_3_3_2_60_2","doi-asserted-by":"publisher","DOI":"10.1109\/DSC63484.2024.00105"},{"key":"e_1_3_3_2_61_2","doi-asserted-by":"publisher","DOI":"10.1145\/3643834.3661591"},{"key":"e_1_3_3_2_62_2","unstructured":"David Winter. 2024. Amplifying Stories: The Vital Role of Audio in Video Narratives. https:\/\/lwks.com\/blog\/amplifying-stories-the-vital-role-of-audio-in-video-narratives Accessed: 2025-1-19."},{"key":"e_1_3_3_2_63_2","unstructured":"Minz Won Justin Salamon Nicholas\u00a0J. Bryan Gautham\u00a0J. Mysore and Xavier Serra. 2021. Emotion Embedding Spaces for Matching Music to Stories. arxiv:https:\/\/arXiv.org\/abs\/2111.13468\u00a0[cs.IR] https:\/\/arxiv.org\/abs\/2111.13468"},{"key":"e_1_3_3_2_64_2","doi-asserted-by":"publisher","unstructured":"Shih-Lun Wu Chris Donahue Shinji Watanabe and Nicholas\u00a0J. Bryan. 2024. Music ControlNet: Multiple Time-Varying Controls for Music Generation. IEEE\/ACM Trans. Audio Speech and Lang. Proc. 32 (May 2024) 2692\u20132703. 10.1109\/TASLP.2024.3399026","DOI":"10.1109\/TASLP.2024.3399026"},{"key":"e_1_3_3_2_65_2","doi-asserted-by":"publisher","DOI":"10.1145\/3491102.3517582"},{"key":"e_1_3_3_2_66_2","doi-asserted-by":"publisher","unstructured":"Jing Yi Yaochen Zhu Jiayi Xie and Zhenzhong Chen. 2023. Cross-Modal Variational Auto-Encoder for Content-Based Micro-Video Background Music Recommendation. IEEE Transactions on Multimedia 25 (2023) 515\u2013528. 10.1109\/TMM.2021.3128254","DOI":"10.1109\/TMM.2021.3128254"},{"key":"e_1_3_3_2_67_2","doi-asserted-by":"publisher","DOI":"10.1145\/3544548.3581388"},{"key":"e_1_3_3_2_68_2","unstructured":"Yongyi Zang and Yixiao Zhang. 2024. The Interpretation Gap in Text-to-Music Generation Models. arxiv:https:\/\/arXiv.org\/abs\/2407.10328\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2407.10328"},{"key":"e_1_3_3_2_69_2","unstructured":"Yixiao Zhang Yukara Ikemiya Woosung Choi Naoki Murata Marco\u00a0A. Mart\u00ednez-Ram\u00edrez Liwei Lin Gus Xia Wei-Hsiang Liao Yuki Mitsufuji and Simon Dixon. 2024. Instruct-MusicGen: Unlocking Text-to-Music Editing for Music Language Models via Instruction Tuning. arxiv:https:\/\/arXiv.org\/abs\/2405.18386\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2405.18386"},{"key":"e_1_3_3_2_70_2","unstructured":"Yixiao Zhang Akira Maezawa Gus Xia Kazuhiko Yamamoto and Simon Dixon. 2024. Loop Copilot: Conducting AI Ensembles for Music Generation and Iterative Editing. arxiv:https:\/\/arXiv.org\/abs\/2310.12404\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2310.12404"},{"key":"e_1_3_3_2_71_2","doi-asserted-by":"publisher","DOI":"10.21428\/92fbeb44.110a7a32"}],"event":{"name":"DIS '25: Designing Interactive Systems Conference","location":"Madeira Portugal","acronym":"DIS '25","sponsor":["SIGCHI ACM Special Interest Group on Computer-Human Interaction"]},"container-title":["Proceedings of the 2025 ACM Designing Interactive Systems Conference"],"original-title":[],"deposited":{"date-parts":[[2025,7,4]],"date-time":"2025-07-04T11:23:18Z","timestamp":1751628198000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3715336.3735814"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,4]]},"references-count":70,"alternative-id":["10.1145\/3715336.3735814","10.1145\/3715336"],"URL":"https:\/\/doi.org\/10.1145\/3715336.3735814","relation":{},"subject":[],"published":{"date-parts":[[2025,7,4]]},"assertion":[{"value":"2025-07-04","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}