{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,25]],"date-time":"2026-06-25T02:02:04Z","timestamp":1782352924983,"version":"3.54.5"},"reference-count":71,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"2","license":[{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,4,1]],"date-time":"2025-04-01T00:00:00Z","timestamp":1743465600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"Special Program of National Natural Science Foundation of China","award":["T2341003"],"award-info":[{"award-number":["T2341003"]}]},{"name":"Advanced Discipline Construction Project of Beijing Universities"},{"DOI":"10.13039\/501100013071","name":"Major Program of National Social Science Fund of China","doi-asserted-by":"publisher","award":["21ZD19"],"award-info":[{"award-number":["21ZD19"]}],"id":[{"id":"10.13039\/501100013071","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Nation Culture and Tourism Technological Innovation Engineering Project"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Comput. Soc. Syst."],"published-print":{"date-parts":[[2025,4]]},"DOI":"10.1109\/tcss.2024.3451515","type":"journal-article","created":{"date-parts":[[2024,10,1]],"date-time":"2024-10-01T13:30:28Z","timestamp":1727789428000},"page":"905-917","source":"Crossref","is-referenced-by-count":2,"title":["Video Echoed in Harmony: Learning and Sampling Video-Integrated Chord Progression Sequences for Controllable Video Background Music Generation"],"prefix":"10.1109","volume":"12","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3269-3628","authenticated-orcid":false,"given":"Xinyi","family":"Tong","sequence":"first","affiliation":[{"name":"Department of AI Music and Music Information Technology, Central Conservatory of Music, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-8055-9237","authenticated-orcid":false,"given":"Sitong","family":"Chen","sequence":"additional","affiliation":[{"name":"Beijing Institute for General Artificial Intelligence, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-5308-771X","authenticated-orcid":false,"given":"Peiyang","family":"Yu","sequence":"additional","affiliation":[{"name":"Department of AI Music and Music Information Technology, Central Conservatory of Music, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-8887-0478","authenticated-orcid":false,"given":"Nian","family":"Liu","sequence":"additional","affiliation":[{"name":"Beijing Institute for General Artificial Intelligence, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1645-777X","authenticated-orcid":false,"given":"Hui","family":"Qv","sequence":"additional","affiliation":[{"name":"Intelligent Science and Technology Academy of CASIC, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3475-7987","authenticated-orcid":false,"given":"Tao","family":"Ma","sequence":"additional","affiliation":[{"name":"China Academy of Aerospace Aerodynamics, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4037-6315","authenticated-orcid":false,"given":"Bo","family":"Zheng","sequence":"additional","affiliation":[{"name":"Alibaba Group, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-0607-7315","authenticated-orcid":false,"given":"Feng","family":"Yu","sequence":"additional","affiliation":[{"name":"Department of AI Music and Music Information Technology, Central Conservatory of Music, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Song-Chun","family":"Zhu","sequence":"additional","affiliation":[{"name":"Beijing Institute for General Artificial Intelligence, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","first-page":"3325","article-title":"Audeo: Audio generation for a silent performance video","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Su","year":"2020"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58621-8_44"},{"key":"ref3","article-title":"Multi-instrumentalist net: Unsupervised generation of music from body movements","author":"Su","year":"2020"},{"key":"ref4","article-title":"Discrete contrastive diffusion for cross-modal music and image generation","author":"Zhu","year":"2022"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3262180"},{"key":"ref6","first-page":"29258","article-title":"How does it sound? Generation of rhythmic soundtracks for human movement videos","volume-title":"Proc. Conf. Neural Inf. Process. Syst.","volume":"35","author":"Su","year":"2021"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19836-6_11"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01433"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475195"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i5.28299"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.3390\/app12105050"},{"key":"ref12","article-title":"Simple and controllable music generation","author":"Copet","year":"2023"},{"key":"ref13","article-title":"MusicLM: Generating music from text","author":"Agostinelli","year":"2023"},{"key":"ref14","article-title":"Tunesensor: A semantic-driven music recommendation service for digital photo albums","volume-title":"Proc. 10th Int. Semantic Web Conf. (ISWC)","author":"Chao","year":"2011"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-04114-8_26"},{"key":"ref16","first-page":"604","article-title":"Query by video: Cross-modal music retrieval","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf. (ISMIR)","author":"Li","year":"2019"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654919"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3206025.3206046"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3128254"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN52387.2021.9533662"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ISM.2018.00-21"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.2307\/842857"},{"issue":"1","key":"ref23","first-page":"34","article-title":"MuseGAN: Multi-track sequential generative adversarial networks for symbolic music generation and accompaniment","volume-title":"Proc. AAAI Conf. Artif. Intell.","volume":"32","author":"Dong","year":"2018"},{"key":"ref24","first-page":"4364","article-title":"A hierarchical latent vector model for learning long-term structure in music","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Roberts","year":"2018"},{"key":"ref25","article-title":"Deep music analogy via latent representation disentanglement","author":"Yang","year":"2019"},{"key":"ref26","article-title":"Music faderNets: Controllable music generation based on high-level features via low-level feature modelling","author":"Tan","year":"2020"},{"key":"ref27","first-page":"670","article-title":"Attributes-aware deep music transformation","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf. (ISMIR)","author":"Kawai","year":"2020"},{"key":"ref28","article-title":"Learning interpretable representation for controllable polyphonic music generation","author":"Wang","year":"2020"},{"key":"ref29","article-title":"Domain adversarial training on conditional variational auto-encoder for controllable music generation","author":"Zhao","year":"2022"},{"key":"ref30","article-title":"Controllable deep melody generation via hierarchical music structure representation","author":"Dai","year":"2021"},{"key":"ref31","article-title":"Commu: Dataset for combinatorial music generation","author":"Hyun","year":"2022"},{"key":"ref32","article-title":"Riffusion-stable diffusion for real-time music generation","author":"Forsgren","year":"2022"},{"key":"ref33","article-title":"AudioGEN: Textually guided audio generation","author":"Kreuk","year":"2022"},{"key":"ref34","article-title":"Audioldm: Text-to-audio generation with latent diffusion models","author":"Liu","year":"2023"},{"key":"ref35","article-title":"Noise2music: Text-conditioned music generation with diffusion models","author":"Huang","year":"2023"},{"key":"ref36","article-title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","author":"Huang","year":"2023"},{"key":"ref37","article-title":"Music controlnet: Multiple time-varying controls for music generation","author":"Wu","year":"2023"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2024\/864"},{"key":"ref39","article-title":"M${}^{2}$ugen: Multi-modal music understanding and generation with the power of large language models","author":"Hussain","year":"2023"},{"key":"ref40","article-title":"Stemgen: A music generation model that listens","author":"Parker","year":"2023"},{"key":"ref41","article-title":"Accelerating diffusion-based text-to-audio generation with consistency distillation","author":"Bai","year":"2023"},{"key":"ref42","article-title":"MusiCRL: Aligning music generation to human preferences","author":"Cideron","year":"2024"},{"key":"ref43","article-title":"Songcomposer: A large language model for lyric and melody composition in song generation","author":"Ding","year":"2024"},{"key":"ref44","article-title":"Dance-to-music generation with encoder-based textual inversion of diffusion models","author":"Li","year":"2024"},{"key":"ref45","article-title":"Videochat: Chat-centric video understanding","author":"Li","year":"2023"},{"key":"ref46","article-title":"Internvideo: General video foundation models via generative and discriminative learning","author":"Wang","year":"2022"},{"key":"ref47","article-title":"Uniformerv2: Spatiotemporal learning by arming image VITS with video uniformer","author":"Li","year":"2022"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01826"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01385"},{"key":"ref50","article-title":"Tag2text: Guiding vision-language model via image tagging","author":"Huang","year":"2023"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72989-8_12"},{"key":"ref52","first-page":"28492","article-title":"Robust speech recognition via large-scale weak supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford","year":"2023"},{"issue":"1","key":"ref53","first-page":"5485","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1037\/h0077714"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1007\/BF02686918"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1627"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10238"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.5040\/9798216971948"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1140\/epjp\/s13360-022-03456-2"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1713206115"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1038\/s41583-022-00578-5"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.4324\/9780429274015"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.3390\/e22111291"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2019-2219"},{"key":"ref65","article-title":"MusiCNN: Pre-trained convolutional neural networks for music audio tagging","author":"Pons","year":"2019"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095969"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i1.16117"},{"key":"ref68","first-page":"364","article-title":"ChordAL: A chord-based approach for music generation using bi-LSTMs","volume-title":"Proc. IEEE\/CIC Int. Conf. Commun. China ICCC","author":"Tan","year":"2019"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.54097\/hset.v39i.6538"},{"key":"ref70","article-title":"Spekculator: Genetic algorithm chord progression generator","author":"Keeling","year":"2016"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.23919\/APSIPAASC55919.2022.9979830"}],"container-title":["IEEE Transactions on Computational Social Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6570650\/10948539\/10701611.pdf?arnumber=10701611","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,6]],"date-time":"2026-01-06T18:37:12Z","timestamp":1767724632000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10701611\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4]]},"references-count":71,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.1109\/tcss.2024.3451515","relation":{},"ISSN":["2329-924X","2373-7476"],"issn-type":[{"value":"2329-924X","type":"electronic"},{"value":"2373-7476","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4]]}}}