{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,9]],"date-time":"2026-05-09T04:03:55Z","timestamp":1778299435122,"version":"3.51.4"},"reference-count":62,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"10","license":[{"start":{"date-parts":[[2019,10,1]],"date-time":"2019-10-01T00:00:00Z","timestamp":1569888000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2019,10,1]],"date-time":"2019-10-01T00:00:00Z","timestamp":1569888000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2019,10,1]],"date-time":"2019-10-01T00:00:00Z","timestamp":1569888000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100009023","name":"Precursory Research for Embryonic Science and Technology","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100009023","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002241","name":"Japan Science and Technology Agency","doi-asserted-by":"publisher","award":["JPMJPR15D2"],"award-info":[{"award-number":["JPMJPR15D2"]}],"id":[{"id":"10.13039\/501100002241","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001691","name":"Japan Society for the Promotion of Science KAKENHI","doi-asserted-by":"crossref","award":["JP17H01995"],"award-info":[{"award-number":["JP17H01995"]}],"id":[{"id":"10.13039\/501100001691","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2019,10]]},"DOI":"10.1109\/taslp.2019.2923951","type":"journal-article","created":{"date-parts":[[2019,6,19]],"date-time":"2019-06-19T20:14:01Z","timestamp":1560975241000},"page":"1535-1548","source":"Crossref","is-referenced-by-count":23,"title":["Emotional Voice Conversion Using Dual Supervised Adversarial Networks With Continuous Wavelet Transform F0 Features"],"prefix":"10.1109","volume":"27","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4173-6319","authenticated-orcid":false,"given":"Zhaojie","family":"Luo","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3701-9026","authenticated-orcid":false,"given":"Jinhui","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5005-7679","authenticated-orcid":false,"given":"Tetsuya","family":"Takiguchi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3473-2026","authenticated-orcid":false,"given":"Yasuo","family":"Ariki","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511804441"},{"key":"ref38","first-page":"177","article-title":"Decoding with value networks for neural machine translation","author":"he","year":"0","journal-title":"Proc Neural Inf Process Syst"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/18.57199"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462342"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.23919\/EUSIPCO.2018.8553236"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.310"},{"key":"ref37","first-page":"2234","article-title":"Improved techniques for training GANs","author":"salimans","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref36","article-title":"Energy-based generative adversarial network","author":"zhao","year":"0","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref35","article-title":"Unsupervised representation learning with deep convolutional generative adversarial networks","author":"radford","year":"2016","journal-title":"ICLRE"},{"key":"ref34","first-page":"1486","article-title":"Deep generative image models using a Laplacian pyramid of adversarial networks","author":"denton","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2017.8019480"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1137\/1.9781611970104"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1175\/1520-0477(1998)079<0061:APGTWA>2.0.CO;2"},{"key":"ref28","first-page":"1857","article-title":"Learning to discover cross-domain relations with generative adversarial networks","author":"kim","year":"0","journal-title":"Proc 34th Int Conf Mach Learn"},{"key":"ref27","first-page":"820","article-title":"Dual learning for machine translation","author":"he","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.244"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1186\/1687-4722-2014-5"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2006.262725"},{"key":"ref20","first-page":"804","article-title":"Fundamental frequency modeling using wavelets for emotional voice conversion","author":"ming","year":"0","journal-title":"Affective Computing and Intelligent Interaction"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1016\/0016-7142(84)90025-5"},{"key":"ref21","first-page":"2453","article-title":"Deep bidirectional LSTM modeling of timbre and prosody for emotional voice conversion","author":"ming","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref24","first-page":"3789","article-title":"Dual supervised learning","author":"xia","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref23","first-page":"2672","article-title":"Generative adversarial nets","author":"goodfellow","year":"0","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref26","first-page":"1283","article-title":"Sequence-to-sequence voice conversion with similarity metric learned using generative adversarial networks","author":"kaneko","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7953090"},{"key":"ref50","first-page":"694","article-title":"Perceptual losses for real-time style transfer and super-resolution","author":"johnson","year":"0","journal-title":"Proc Eur Conf Comput Vision"},{"key":"ref51","first-page":"448","article-title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","author":"ioffe","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref59","first-page":"619","article-title":"Mutlimodal learning with deep Boltzmann machine for emotion prediction in user generated videos","author":"pang","year":"0","journal-title":"Proc 5th ACM Int Conf Multimedia Retrieval"},{"key":"ref58","first-page":"73","article-title":"Predicting emotions in user-generated videos","author":"jiang","year":"0","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2010.09.020"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2006.04.003"},{"key":"ref55","first-page":"702","article-title":"Precomputed real-time texture synthesis with Markovian generative adversarial networks","author":"li","year":"0","journal-title":"Proc Eur Conf Comput Vision"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref53","article-title":"Rectifier nonlinearities improve neural network acoustic models","volume":"30","author":"maas","year":"0","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref52","article-title":"Improving neural networks by preventing co-adaptation of feature detectors","author":"hinton","year":"2012"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/SLT.2012.6424242"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2009.4960478"},{"key":"ref40","article-title":"ADADELTA: An adaptive learning rate method","author":"zeiler","year":"2012"},{"key":"ref12","first-page":"369","article-title":"Voice conversion in high-order eigen space using deep belief nets","author":"nakashika","year":"0","journal-title":"Proc INTERSPEECH"},{"key":"ref13","article-title":"Information processing in dynamical systems: Foundations of harmony theory","author":"smolensky","year":"1986"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1162\/neco.2006.18.7.1527"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2014.2379589"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/FSKD.2007.347"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178904"},{"key":"ref18","first-page":"78","article-title":"Continuous wavelet transform for analysis of speech prosody","author":"vainio","year":"0","journal-title":"Proc Tools Resour Anal Speech Prosody"},{"key":"ref19","first-page":"285","article-title":"Wavelets for intonation modeling in HMM speech synthesis","author":"suni","year":"0","journal-title":"Proc ISCA Speech Synthesis Workshop"},{"key":"ref4","first-page":"254","article-title":"Phase perception of the glottal excitation of vocoded speech","author":"raitio","year":"0","journal-title":"Proc Annu Conf Int Speech Commun Assoc"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1515\/lp-2013-0003"},{"key":"ref6","first-page":"2290","article-title":"Frequency warping based on mapping formant parameters","author":"shuang","year":"0","journal-title":"Proc Int Conf Spoken Lang Process"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1186\/s13636-017-0116-2"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2007.907344"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2009.2038663"},{"key":"ref49","article-title":"JSUT corpus: Free large-scale Japanese speech corpus for end-to-end speech synthesis","author":"sonobe","year":"2017"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2041699"},{"key":"ref46","article-title":"C-RNN-GAN: Continuous recurrent neural networks with adversarial training","author":"mogren","year":"2016"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.632"},{"key":"ref48","first-page":"2401","article-title":"GMM-based voice conversion applied to emotional speech synthesis","author":"kawanami","year":"0","journal-title":"Proc Eur Conf Speech Commun Technol"},{"key":"ref47","first-page":"1558","article-title":"Autoencoding beyond pixels using a learned similarity metric","author":"larsen","year":"0","journal-title":"Proc JMLR Workshop Conf"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1250\/ast.27.349"},{"key":"ref41","article-title":"A method for stochastic optimization","author":"kinga","year":"0","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.21437\/SSW.2016-23"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298965"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/8751213\/08740871.pdf?arnumber=8740871","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,7,13]],"date-time":"2022-07-13T21:13:26Z","timestamp":1657746806000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8740871\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,10]]},"references-count":62,"journal-issue":{"issue":"10"},"URL":"https:\/\/doi.org\/10.1109\/taslp.2019.2923951","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019,10]]}}}