{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,4]],"date-time":"2026-04-04T01:50:01Z","timestamp":1775267401258,"version":"3.50.1"},"publisher-location":"Cham","reference-count":17,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030037475","type":"print"},{"value":"9783030037482","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,11,11]],"date-time":"2018-11-11T00:00:00Z","timestamp":1541894400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019]]},"DOI":"10.1007\/978-3-030-03748-2_16","type":"book-chapter","created":{"date-parts":[[2018,11,10]],"date-time":"2018-11-10T09:45:22Z","timestamp":1541843122000},"page":"132-139","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["Two-Stage Sequence-to-Sequence Neural Voice Conversion with Low-to-High Definition Spectrogram Mapping"],"prefix":"10.1007","author":[{"given":"Sou","family":"Miyamoto","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Takashi","family":"Nose","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kazuyuki","family":"Hiroshiba","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuri","family":"Odagiri","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Akinori","family":"Ito","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,11,11]]},"reference":[{"key":"16_CR1","unstructured":"Alec, R., Luke, M., Soumith, C.: Unsupervised representation learning with deep convolutional generative adversarial networks. In: International Conference on Learning Representations (2016)"},{"key":"16_CR2","doi-asserted-by":"crossref","unstructured":"Desai, S., Raghavendra, E.V., Yegnanarayana, B., Black, A.W., Prahallad, K.: Voice conversion using artificial neural networks. In: 2009 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 3893\u20133896. IEEE (2009)","DOI":"10.1109\/ICASSP.2009.4960478"},{"issue":"8","key":"16_CR3","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"key":"16_CR4","doi-asserted-by":"crossref","unstructured":"Isola, P., Zhu, J.Y., Zhou, T., Efros, A.A.: Image-to-image translation with conditional adversarial networks. In: IEEE\/CVF International Conference on Computer Vision and Pattern Recognition (2017)","DOI":"10.1109\/CVPR.2017.632"},{"key":"16_CR5","doi-asserted-by":"crossref","unstructured":"Kain, A., Macon, M.W.: Spectral voice conversion for text-to-speech synthesis. In: 1998 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 285\u2013288. IEEE (1998)","DOI":"10.1109\/ICASSP.1998.674423"},{"key":"16_CR6","doi-asserted-by":"crossref","unstructured":"Kaneko, T., Kameoka, H., Hiramatsu, K., Kashino, K.: Sequence-to-sequence voice conversion with similarity metric learned using generative adversarial networks. In: Proceedings of the INTERSPEECH, pp. 1283\u20131287 (2017)","DOI":"10.21437\/Interspeech.2017-970"},{"key":"16_CR7","unstructured":"Kingma, D., Ba, J.: Adam: a method for stochastic optimization. In: International Conference on Learning Representations (2015)"},{"key":"16_CR8","doi-asserted-by":"crossref","unstructured":"Kobayashi, K., Toda, T.: sprocket: open-source voice conversion software. In: Proceedings of the Odyssey 2018 The Speaker and Language Recognition Workshop, pp. 203\u2013210 (2018)","DOI":"10.21437\/Odyssey.2018-29"},{"key":"16_CR9","doi-asserted-by":"crossref","unstructured":"Masanobu, A.: A segment-based approach to voice conversion. In: 1991 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), vol. 2, pp. 765\u2013768 (1991)","DOI":"10.1109\/ICASSP.1991.150451"},{"key":"16_CR10","doi-asserted-by":"crossref","unstructured":"Masci, J., Meier, U., Cire\u015fan, D., Schmidhuber, J.: Stacked convolutional auto-encoders for hierarchical feature extraction. In: International Conference on Artificial Neural Networks, pp. 52\u201359. Springer (2011)","DOI":"10.1007\/978-3-642-21735-7_7"},{"key":"16_CR11","unstructured":"Mirza, M., Osindero, S.: Conditional generative adversarial nets. arXiv preprint arXiv:1411.1784 (2014)"},{"issue":"C","key":"16_CR12","doi-asserted-by":"publisher","first-page":"65","DOI":"10.1016\/j.specom.2017.01.008","volume":"88","author":"SH Mohammadi","year":"2017","unstructured":"Mohammadi, S.H., Kain, A.: An overview of voice conversion systems. Speech Commun. 88(C), 65\u201382 (2017)","journal-title":"Speech Commun."},{"issue":"7","key":"16_CR13","doi-asserted-by":"publisher","first-page":"1877","DOI":"10.1587\/transinf.2015EDP7457","volume":"99","author":"M Morise","year":"2016","unstructured":"Morise, M., Yokomori, F., Ozawa, K.: World: a vocoder-based high-quality speech synthesis system for real-time applications. IEICE Trans. Inf. Syst. 99(7), 1877\u20131884 (2016)","journal-title":"IEICE Trans. Inf. Syst."},{"key":"16_CR14","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., Brox, T.: U-net: convolutional networks for biomedical image segmentation. In: International Conference on Medical Image Computing and Computer-assisted Intervention, pp. 234\u2013241. Springer (2015)","DOI":"10.1007\/978-3-319-24574-4_28"},{"issue":"8","key":"16_CR15","doi-asserted-by":"publisher","first-page":"1925","DOI":"10.1587\/transinf.2017EDL8034","volume":"E100.D","author":"Y Saito","year":"2017","unstructured":"Saito, Y., Takamichi, S., Saruwatari, H.: Voice conversion using input-to-output highway networks. IEICE Trans. Inf. Syst. E100.D(8), 1925\u20131928 (2017)","journal-title":"IEICE Trans. Inf. Syst."},{"key":"16_CR16","doi-asserted-by":"crossref","unstructured":"Sun, L., Kang, S., Li, K., Meng, H.: Voice conversion using deep bidirectional long short-term memory based recurrent neural networks. In: 2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 4869\u20134873. IEEE (2015)","DOI":"10.1109\/ICASSP.2015.7178896"},{"issue":"5","key":"16_CR17","doi-asserted-by":"publisher","first-page":"816","DOI":"10.1093\/ietisy\/e90-d.5.816","volume":"E90\u2013D","author":"T Toda","year":"2007","unstructured":"Toda, T., Tokuda, K.: A speech parameter generation algorithm considering global variance for hmm-based speech synthesis. IEICE Trans. Inf. Syst. E90\u2013D(5), 816\u2013824 (2007)","journal-title":"IEICE Trans. Inf. Syst."}],"container-title":["Smart Innovation, Systems and Technologies","Recent Advances in Intelligent Information Hiding and Multimedia Signal Processing"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-03748-2_16","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,4]],"date-time":"2026-04-04T00:57:58Z","timestamp":1775264278000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-030-03748-2_16"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,11,11]]},"ISBN":["9783030037475","9783030037482"],"references-count":17,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-03748-2_16","relation":{},"ISSN":["2190-3018","2190-3026"],"issn-type":[{"value":"2190-3018","type":"print"},{"value":"2190-3026","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,11,11]]},"assertion":[{"value":"IIH-MSP","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Intelligent Information Hiding and Multimedia Signal Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Sendai","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Japan","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"26 November 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"28 November 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"iih2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/iihmsp2018.github.io\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}