{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,27]],"date-time":"2026-08-27T20:10:18Z","timestamp":1787861418105,"version":"build-2784847793"},"publisher-location":"New York, NY, USA","reference-count":34,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Fundamental Research Funds for the Central Universities","award":["2020QNA5024"],"award-info":[{"award-number":["2020QNA5024"]}]},{"name":"National Natural Science Foundation of China","award":["61836002,U1611461,61751209"],"award-info":[{"award-number":["61836002,U1611461,61751209"]}]},{"name":"Zhejiang Natural Science Foundation","award":["LR19F020006"],"award-info":[{"award-number":["LR19F020006"]}]},{"name":"National Key R&D Program of China","award":["2018AAA0100603"],"award-info":[{"award-number":["2018AAA0100603"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413721","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T09:12:00Z","timestamp":1602493920000},"page":"1198-1206","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":74,"title":["PopMAG"],"prefix":"10.1145","author":[{"given":"Yi","family":"Ren","sequence":"first","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinzheng","family":"He","sequence":"additional","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xu","family":"Tan","sequence":"additional","affiliation":[{"name":"Microsoft Research Asia, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tao","family":"Qin","sequence":"additional","affiliation":[{"name":"Microsoft Research Asia, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhou","family":"Zhao","sequence":"additional","affiliation":[{"name":"Zhejiang University, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tie-Yan","family":"Liu","sequence":"additional","affiliation":[{"name":"Microsoft Research Asia, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33013159"},{"key":"e_1_3_2_2_2_1","unstructured":"Alexei Baevski and Michael Auli. 2018. Adaptive input representations for neural language modeling. arXiv preprint arXiv:1809.10853 (2018).  Alexei Baevski and Michael Auli. 2018. Adaptive input representations for neural language modeling. arXiv preprint arXiv:1809.10853 (2018)."},{"key":"e_1_3_2_2_3_1","unstructured":"Thierry Bertin-Mahieux Daniel PW Ellis Brian Whitman and Paul Lamere. 2011. The million song dataset. (2011).  Thierry Bertin-Mahieux Daniel PW Ellis Brian Whitman and Paul Lamere. 2011. The million song dataset. (2011)."},{"key":"e_1_3_2_2_4_1","unstructured":"Tom B Brown Benjamin Mann Nick Ryder Melanie Subbiah Jared Kaplan Prafulla Dhariwal Arvind Neelakantan Pranav Shyam Girish Sastry Amanda Askell et almbox. 2020. Language models are few-shot learners. arXiv preprint arXiv:2005.14165 (2020).  Tom B Brown Benjamin Mann Nick Ryder Melanie Subbiah Jared Kaplan Prafulla Dhariwal Arvind Neelakantan Pranav Shyam Girish Sastry Amanda Askell et almbox. 2020. Language models are few-shot learners. arXiv preprint arXiv:2005.14165 (2020)."},{"key":"e_1_3_2_2_5_1","unstructured":"Rewon Child Scott Gray Alec Radford and Ilya Sutskever. 2019. Generating long sequences with sparse transformers. arXiv preprint arXiv:1904.10509 (2019).  Rewon Child Scott Gray Alec Radford and Ilya Sutskever. 2019. Generating long sequences with sparse transformers. arXiv preprint arXiv:1904.10509 (2019)."},{"key":"e_1_3_2_2_6_1","unstructured":"Kristy Choi Curtis Hawthorne Ian Simon Monica Dinculescu and Jesse Engel. 2019. Encoding Musical Style with Transformer Autoencoders. arXiv preprint arXiv:1912.05537 (2019).  Kristy Choi Curtis Hawthorne Ian Simon Monica Dinculescu and Jesse Engel. 2019. Encoding Musical Style with Transformer Autoencoders. arXiv preprint arXiv:1912.05537 (2019)."},{"key":"e_1_3_2_2_7_1","volume-title":"Transformer-xl: Attentive language models beyond a fixed-length context. arXiv preprint arXiv:1901.02860","author":"Dai Zihang","year":"2019"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"crossref","unstructured":"Khosrow Dehnad. 1987. Density estimation for statistics and data analysis.  Khosrow Dehnad. 1987. Density estimation for statistics and data analysis.","DOI":"10.1080\/00401706.1987.10488295"},{"key":"e_1_3_2_2_9_1","unstructured":"Chris Donahue Huanru Henry Mao Yiting Ethan Li Garrison W Cottrell and Julian McAuley. 2019. LakhNES: Improving multi-instrumental music generation with cross-domain pre-training. arXiv preprint arXiv:1907.04868 (2019).  Chris Donahue Huanru Henry Mao Yiting Ethan Li Garrison W Cottrell and Julian McAuley. 2019. LakhNES: Improving multi-instrumental music generation with cross-domain pre-training. arXiv preprint arXiv:1907.04868 (2019)."},{"key":"e_1_3_2_2_10_1","unstructured":"Hao-Wen Dong Wen-Yi Hsiao Li-Chia Yang and Yi-Hsuan Yang. 2017. MuseGAN: Demonstration of a convolutional GAN based model for generating multi-track piano-rolls. ISMIR Late Breaking\/Demos (2017).  Hao-Wen Dong Wen-Yi Hsiao Li-Chia Yang and Yi-Hsuan Yang. 2017. MuseGAN: Demonstration of a convolutional GAN based model for generating multi-track piano-rolls. ISMIR Late Breaking\/Demos (2017)."},{"key":"e_1_3_2_2_11_1","volume-title":"Thirty-Second AAAI Conference on Artificial Intelligence.","author":"Dong Hao-Wen","year":"2018"},{"key":"e_1_3_2_2_12_1","unstructured":"Hao-Wen Dong and Yi-Hsuan Yang. 2018. Convolutional generative adversarial networks with binary neurons for polyphonic music generation. arXiv preprint arXiv:1804.09399 (2018).  Hao-Wen Dong and Yi-Hsuan Yang. 2018. Convolutional generative adversarial networks with binary neurons for polyphonic music generation. arXiv preprint arXiv:1804.09399 (2018)."},{"key":"e_1_3_2_2_13_1","unstructured":"Rui Guo Dorien Herremans and Thor Magnusson. 2019. Midi Miner--A Python library for tonal tension and track classification. arXiv preprint arXiv:1910.02049 (2019).  Rui Guo Dorien Herremans and Thor Magnusson. 2019. Midi Miner--A Python library for tonal tension and track classification. arXiv preprint arXiv:1910.02049 (2019)."},{"key":"e_1_3_2_2_14_1","unstructured":"Cheng-Zhi Anna Huang Ashish Vaswani Jakob Uszkoreit Ian Simon Curtis Hawthorne Noam Shazeer Andrew M Dai Matthew D Hoffman Monica Dinculescu and Douglas Eck. 2018. Music transformer: Generating music with long-term structure. (2018).  Cheng-Zhi Anna Huang Ashish Vaswani Jakob Uszkoreit Ian Simon Curtis Hawthorne Noam Shazeer Andrew M Dai Matthew D Hoffman Monica Dinculescu and Douglas Eck. 2018. Music transformer: Generating music with long-term structure. (2018)."},{"key":"e_1_3_2_2_15_1","unstructured":"Yu-Siang Huang and Yi-Hsuan Yang. 2020. Pop Music Transformer: Generating Music with Rhythm and Harmony. arXiv preprint arXiv:2002.00212 (2020).  Yu-Siang Huang and Yi-Hsuan Yang. 2020. Pop Music Transformer: Generating Music with Rhythm and Harmony. arXiv preprint arXiv:2002.00212 (2020)."},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-55750-2_9"},{"key":"e_1_3_2_2_17_1","unstructured":"Juheon Lee Hyeong-Seok Choi Chang-Bin Jeon Junghyun Koo and Kyogu Lee. 2019. Adversarially trained end-to-end Korean singing voice synthesis system. arXiv preprint arXiv:1908.01919 (2019).  Juheon Lee Hyeong-Seok Choi Chang-Bin Jeon Junghyun Koo and Kyogu Lee. 2019. Adversarially trained end-to-end Korean singing voice synthesis system. arXiv preprint arXiv:1908.01919 (2019)."},{"key":"e_1_3_2_2_18_1","unstructured":"Xia Liang Junmin Wu and Jing Cao. 2019. MIDI-Sandwich2: RNN-based Hierarchical Multi-modal Fusion Generation VAE networks for multi-track symbolic music generation. arXiv preprint arXiv:1909.03522 (2019).  Xia Liang Junmin Wu and Jing Cao. 2019. MIDI-Sandwich2: RNN-based Hierarchical Multi-modal Fusion Generation VAE networks for multi-track symbolic music generation. arXiv preprint arXiv:1909.03522 (2019)."},{"key":"e_1_3_2_2_19_1","unstructured":"Peiling Lu Jie Wu Jian Luan Xu Tan and Li Zhou. 2020. XiaoiceSing: A High-Quality and Integrated Singing Voice Synthesis System. arXiv preprint arXiv:2006.06261 (2020).  Peiling Lu Jie Wu Jian Luan Xu Tan and Li Zhou. 2020. XiaoiceSing: A High-Quality and Integrated Singing Voice Synthesis System. arXiv preprint arXiv:2006.06261 (2020)."},{"key":"e_1_3_2_2_20_1","unstructured":"Brian McFee and Juan Pablo Bello. 2017. Structured Training for Large-Vocabulary Chord Recognition.. In ISMIR. 188--194.  Brian McFee and Juan Pablo Bello. 2017. Structured Training for Large-Vocabulary Chord Recognition.. In ISMIR. 188--194."},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2012.6424228"},{"key":"e_1_3_2_2_22_1","unstructured":"Gerhard Nierhaus. 2009. Algorithmic composition: paradigms of automated music generation. Springer Science & Business Media.  Gerhard Nierhaus. 2009. Algorithmic composition: paradigms of automated music generation. Springer Science & Business Media."},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"crossref","unstructured":"Colin Raffel. 2016. Learning-based methods for comparing sequences with applications to audio-to-midi alignment and matching. Ph.D. Dissertation. Columbia University.  Colin Raffel. 2016. Learning-based methods for comparing sequences with applications to audio-to-midi alignment and matching. Ph.D. Dissertation. Columbia University.","DOI":"10.1109\/ICASSP.2016.7471641"},{"key":"e_1_3_2_2_24_1","doi-asserted-by":"crossref","unstructured":"Yi Ren Xu Tan Tao Qin Jian Luan Zhou Zhao and Tie-Yan Liu. 2020. DeepSinger: Singing Voice Synthesis with Data Mined From the Web. arXiv preprint arXiv:2007.04590 (2020).  Yi Ren Xu Tan Tao Qin Jian Luan Zhou Zhao and Tie-Yan Liu. 2020. DeepSinger: Singing Voice Synthesis with Data Mined From the Web. arXiv preprint arXiv:2007.04590 (2020).","DOI":"10.1145\/3394486.3403249"},{"key":"e_1_3_2_2_25_1","unstructured":"Adam Roberts Jesse Engel Colin Raffel Curtis Hawthorne and Douglas Eck. 2018. A hierarchical latent vector model for learning long-term structure in music. arXiv preprint arXiv:1803.05428 (2018).  Adam Roberts Jesse Engel Colin Raffel Curtis Hawthorne and Douglas Eck. 2018. A hierarchical latent vector model for learning long-term structure in music. arXiv preprint arXiv:1803.05428 (2018)."},{"key":"e_1_3_2_2_26_1","volume-title":"JMLR: Workshop and Conference Proceedings","volume":"80","author":"Simon Ian","year":"2017"},{"key":"e_1_3_2_2_27_1","volume-title":"International Conference on Machine Learning. 5926--5936","author":"Song Kaitao","year":"2019"},{"key":"e_1_3_2_2_28_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In Advances in Neural Information Processing Systems. 5998--6008.  Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is all you need. In Advances in Neural Information Processing Systems. 5998--6008."},{"key":"e_1_3_2_2_29_1","unstructured":"Tian Wang and Kyunghyun Cho. 2015. Larger-context language modelling. arXiv preprint arXiv:1511.03729 (2015).  Tian Wang and Kyunghyun Cho. 2015. Larger-context language modelling. arXiv preprint arXiv:1511.03729 (2015)."},{"key":"e_1_3_2_2_30_1","unstructured":"Li-Chia Yang Szu-Yu Chou and Yi-Hsuan Yang. 2017. MidiNet: A convolutional generative adversarial network for symbolic-domain music generation. arXiv preprint arXiv:1703.10847 (2017).  Li-Chia Yang Szu-Yu Chou and Yi-Hsuan Yang. 2017. MidiNet: A convolutional generative adversarial network for symbolic-domain music generation. arXiv preprint arXiv:1703.10847 (2017)."},{"key":"e_1_3_2_2_31_1","unstructured":"Li-Chia Yang and Alexander Lerch. 2018. On the evaluation of generative models in music. Neural Computing and Applications (2018) 1--12.  Li-Chia Yang and Alexander Lerch. 2018. On the evaluation of generative models in music. Neural Computing and Applications (2018) 1--12."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"crossref","unstructured":"Jiacheng Zhang Huanbo Luan Maosong Sun Feifei Zhai Jingfang Xu Min Zhang and Yang Liu. 2018. Improving the transformer translation model with document-level context. arXiv preprint arXiv:1810.03581 (2018).  Jiacheng Zhang Huanbo Luan Maosong Sun Feifei Zhai Jingfang Xu Min Zhang and Yang Liu. 2018. Improving the transformer translation model with document-level context. arXiv preprint arXiv:1810.03581 (2018).","DOI":"10.18653\/v1\/D18-1049"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"crossref","unstructured":"Zaixiang Zheng Xiang Yue Shujian Huang Jiajun Chen and Alexandra Birch. 2020. Toward Making the Most of Context in Neural Machine Translation. arXiv preprint arXiv:2002.07982 (2020).  Zaixiang Zheng Xiang Yue Shujian Huang Jiajun Chen and Alexandra Birch. 2020. Toward Making the Most of Context in Neural Machine Translation. arXiv preprint arXiv:2002.07982 (2020).","DOI":"10.24963\/ijcai.2020\/551"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1145\/3219819.3220105"}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413721","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413721","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T18:01:16Z","timestamp":1750183276000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413721"}},"subtitle":["Pop Music Accompaniment Generation"],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":34,"alternative-id":["10.1145\/3394171.3413721","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413721","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}