{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,14]],"date-time":"2026-04-14T22:58:42Z","timestamp":1776207522150,"version":"3.50.1"},"publisher-location":"Cham","reference-count":33,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031784972","type":"print"},{"value":"9783031784989","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T00:00:00Z","timestamp":1733270400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T00:00:00Z","timestamp":1733270400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-78498-9_23","type":"book-chapter","created":{"date-parts":[[2024,12,3]],"date-time":"2024-12-03T09:26:40Z","timestamp":1733218000000},"page":"332-344","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Generating High-Quality Symbolic Music Using Fine-Grained Discriminators"],"prefix":"10.1007","author":[{"given":"Zhedong","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liang","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jiehua","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhenghui","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hongkui","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenggang","family":"Yan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jian","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuankai","family":"Qi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,4]]},"reference":[{"key":"23_CR1","unstructured":"Chou, Y.H., Chen, I., Chang, C.J., Ching, J., Yang, Y.H., et\u00a0al.: MidiBERT-piano: large-scale pre-training for symbolic music understanding. arXiv preprint arXiv:2107.05223 (2021)"},{"key":"23_CR2","doi-asserted-by":"crossref","unstructured":"Cong, G., et al.: Learning to dub movies via hierarchical prosody models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 14687\u201314697 (2023)","DOI":"10.1109\/CVPR52729.2023.01411"},{"key":"23_CR3","doi-asserted-by":"crossref","unstructured":"Cong, G., et al.: Styledubber: towards multi-scale style learning for movie dubbing. arXiv preprint arXiv:2402.12636 (2024)","DOI":"10.18653\/v1\/2024.findings-acl.404"},{"key":"23_CR4","unstructured":"Dhariwal, P., Jun, H., Payne, C., Kim, J.W., Radford, A., Sutskever, I.: Jukebox: a generative model for music. CoRR abs\/2005.00341 (2020)"},{"key":"23_CR5","doi-asserted-by":"crossref","unstructured":"Dong, H.W., Chen, K., Dubnov, S., McAuley, J., Berg-Kirkpatrick, T.: Multitrack music transformer. In: ICASSP, pp.\u00a01\u20135 (2023)","DOI":"10.1109\/ICASSP49357.2023.10094628"},{"key":"23_CR6","doi-asserted-by":"crossref","unstructured":"Dong, H., Hsiao, W., Yang, L., Yang, Y.: MuseGAN: multi-track sequential generative adversarial networks for symbolic music generation and accompaniment. In: AAAI, pp. 34\u201341 (2018)","DOI":"10.1609\/aaai.v32i1.11312"},{"key":"23_CR7","doi-asserted-by":"crossref","unstructured":"Dowling, W.J., Tighe, T.J.: Psychology and music: the understanding of melody and rhythm. Psychology Press (2014)","DOI":"10.4324\/9781315808116"},{"issue":"11","key":"23_CR8","doi-asserted-by":"publisher","first-page":"139","DOI":"10.1145\/3422622","volume":"63","author":"I Goodfellow","year":"2020","unstructured":"Goodfellow, I., et al.: Generative adversarial networks. Commun. ACM 63(11), 139\u2013144 (2020)","journal-title":"Commun. ACM"},{"key":"23_CR9","doi-asserted-by":"publisher","first-page":"369","DOI":"10.1016\/B978-0-12-381460-9.00009-2","volume":"3","author":"H Honing","year":"2013","unstructured":"Honing, H.: Structure and interpretation of rhythm in music. Psychol. Music 3, 369\u2013404 (2013)","journal-title":"Psychol. Music"},{"key":"23_CR10","doi-asserted-by":"crossref","unstructured":"Hsiao, W., Liu, J., Yeh, Y., Yang, Y.: Compound word transformer: learning to compose full-song music over dynamic directed hypergraphs. In: AAAI, pp. 178\u2013186 (2021)","DOI":"10.1609\/aaai.v35i1.16091"},{"key":"23_CR11","unstructured":"Huang, C.A., et al.: Music transformer: generating music with long-term structure. In: ICLR (2019)"},{"key":"23_CR12","doi-asserted-by":"crossref","unstructured":"Huang, Y., Yang, Y.: Pop music transformer: beat-based modeling and generation of expressive pop piano compositions. In: ACM MM, pp. 1180\u20131188 (2020)","DOI":"10.1145\/3394171.3413671"},{"key":"23_CR13","unstructured":"Jeong, D., Kwon, T., Kim, Y., Nam, J.: Score and performance features for rendering expressive music performances. In: Music Encoding Conference, pp.\u00a01\u20136 (2019)"},{"key":"23_CR14","unstructured":"Ji, S., Luo, J., Yang, X.: A comprehensive survey on deep music generation: multi-level representations, algorithms, evaluations, and future directions. CoRR abs\/2011.06801 (2020)"},{"key":"23_CR15","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. In: 3rd International Conference on Learning Representations, ICLR 2015, San Diego, CA, USA, 7\u20139 May 2015, Conference Track Proceedings (2015)"},{"key":"23_CR16","doi-asserted-by":"publisher","first-page":"51","DOI":"10.1146\/annurev-psych-122216-011740","volume":"69","author":"DJ Levitin","year":"2018","unstructured":"Levitin, D.J., Grahn, J.A., London, J.: The psychology of music: rhythm and movement. Annu. Rev. Psychol. 69, 51\u201375 (2018)","journal-title":"Annu. Rev. Psychol."},{"key":"23_CR17","doi-asserted-by":"publisher","first-page":"2726","DOI":"10.1109\/TIP.2022.3158546","volume":"31","author":"L Li","year":"2022","unstructured":"Li, L., Gao, X., Deng, J., Tu, Y., Zha, Z.J., Huang, Q.: Long short-term relation transformer with global gating for video captioning. IEEE Trans. Image Process. 31, 2726\u20132738 (2022)","journal-title":"IEEE Trans. Image Process."},{"issue":"3","key":"23_CR18","first-page":"3003","volume":"45","author":"X Liu","year":"2022","unstructured":"Liu, X., et al.: Entity-enhanced adaptive reconstruction network for weakly supervised referring expression grounding. IEEE Trans. Pattern Anal. Mach. Intell. 45(3), 3003\u20133018 (2022)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"4","key":"23_CR19","doi-asserted-by":"publisher","first-page":"452","DOI":"10.1016\/j.conb.2008.09.005","volume":"18","author":"JH McDermott","year":"2008","unstructured":"McDermott, J.H., Oxenham, A.J.: Music perception, pitch, and the auditory system. Curr. Opin. Neurobiol. 18(4), 452\u2013463 (2008)","journal-title":"Curr. Opin. Neurobiol."},{"key":"23_CR20","doi-asserted-by":"crossref","unstructured":"Muhamed, A., et al.: Symbolic music generation with transformer-GANs. In: AAAI, pp. 408\u2013417 (2021)","DOI":"10.1609\/aaai.v35i1.16117"},{"key":"23_CR21","unstructured":"van\u00a0den Oord, A., et al.: Wavenet: a generative model for raw audio. In: The 9th ISCA Speech Synthesis Workshop, p.\u00a0125 (2016)"},{"key":"23_CR22","doi-asserted-by":"crossref","unstructured":"Ren, Y., He, J., Tan, X., Qin, T., Zhao, Z., Liu, T.: Popmag: pop music accompaniment generation. In: ACM MM, pp. 1198\u20131206 (2020)","DOI":"10.1145\/3394171.3413721"},{"key":"23_CR23","doi-asserted-by":"crossref","unstructured":"Shih, Y., Wu, S., Zalkow, F., M\u00fcller, M., Yang, Y.: Theme transformer: symbolic music generation with theme-conditioned transformer. TMM Early Access 1\u201314 (2022)","DOI":"10.1109\/TMM.2022.3161851"},{"key":"23_CR24","unstructured":"Thickstun, J., Hall, D., Donahue, C., Liang, P.: Anticipatory music transformer. CoRR abs\/2306.08620 (2023)"},{"key":"23_CR25","doi-asserted-by":"crossref","unstructured":"Tu, Y., Li, L., Su, L., Zha, Z.J., Huang, Q.: Smart: syntax-calibrated multi-aspect relation transformer for change captioning. IEEE Trans. Pattern Anal. Mach. Intell. (2024)","DOI":"10.1109\/TPAMI.2024.3365104"},{"key":"23_CR26","unstructured":"Vaswani, A., et al.: Attention is all you need. In: NeurIPS, pp. 5998\u20136008 (2017)"},{"issue":"6","key":"23_CR27","doi-asserted-by":"publisher","first-page":"7711","DOI":"10.1109\/TPAMI.2022.3226328","volume":"45","author":"H Wang","year":"2022","unstructured":"Wang, H., Zha, Z.J., Li, L., Chen, X., Luo, J.: Semantic and relation modulation for audio-visual event localization. IEEE Trans. Pattern Anal. Mach. Intell. 45(6), 7711\u20137725 (2022)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"23_CR28","unstructured":"Wang, Z., et al.: POP909: a pop-song dataset for music arrangement generation. In: ISMIR, pp. 38\u201345 (2020)"},{"key":"23_CR29","unstructured":"Wu, S., Yang, Y.: The jazz transformer on the front line: exploring the shortcomings of AI-composed music through quantitative measures. In: ISMIR, pp. 142\u2013149 (2020)"},{"key":"23_CR30","unstructured":"Yang, R., Wang, D., Wang, Z., Chen, T., Jiang, J., Xia, G.: Deep music analogy via latent representation disentanglement. In: Proceedings of the 20th International Society for Music Information Retrieval Conference, ISMIR 2019, pp. 596\u2013603 (2019)"},{"key":"23_CR31","doi-asserted-by":"crossref","unstructured":"Zhang, B., et al.: Inductive state-relabeling adversarial active learning with heuristic clique rescaling. IEEE Trans. Pattern Anal. Mach. Intell. (2024)","DOI":"10.1109\/TPAMI.2024.3432099"},{"issue":"4","key":"23_CR32","doi-asserted-by":"publisher","first-page":"1754","DOI":"10.1109\/TNNLS.2020.2990746","volume":"34","author":"N Zhang","year":"2023","unstructured":"Zhang, N.: Learning adversarial transformer for symbolic music generation. IEEE Trans. Neural Netw. Learn. Syst. 34(4), 1754\u20131763 (2023)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"23_CR33","doi-asserted-by":"crossref","unstructured":"Zhang, Z., et al.: From speaker to dubber: movie dubbing with prosody and duration consistency learning. In: ACM Multimedia 2024 (2024)","DOI":"10.1145\/3664647.3680777"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-78498-9_23","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,27]],"date-time":"2025-04-27T14:15:57Z","timestamp":1745763357000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-78498-9_23"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,4]]},"ISBN":["9783031784972","9783031784989"],"references-count":33,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-78498-9_23","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,12,4]]},"assertion":[{"value":"4 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Kolkata","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"1 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2024.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}