{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,21]],"date-time":"2025-06-21T04:03:05Z","timestamp":1750478585798,"version":"3.41.0"},"reference-count":35,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2017,6,29]],"date-time":"2017-06-29T00:00:00Z","timestamp":1498694400000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J AUDIO SPEECH MUSIC PROC."],"published-print":{"date-parts":[[2017,12]]},"DOI":"10.1186\/s13636-017-0112-6","type":"journal-article","created":{"date-parts":[[2017,6,29]],"date-time":"2017-06-29T14:38:37Z","timestamp":1498747117000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Speaker-adaptive-trainable Boltzmann machine and its application to non-parallel voice conversion"],"prefix":"10.1186","volume":"2017","author":[{"given":"Toru","family":"Nakashika","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yasuhiro","family":"Minami","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,6,29]]},"reference":[{"key":"112_CR1","doi-asserted-by":"crossref","unstructured":"A Kain, MW Macon, in ICASSP. Spectral voice conversion for text-to-speech synthesis (IEEE, 1998), pp. 285\u2013288.","DOI":"10.1109\/ICASSP.1998.674423"},{"key":"112_CR2","doi-asserted-by":"crossref","unstructured":"C Veaux, X Robet, in INTERSPEECH. Intonation conversion from neutral to expressive speech (ISCA, 2011), pp. 2765\u20132768.","DOI":"10.21437\/Interspeech.2011-692"},{"issue":"1","key":"112_CR3","doi-asserted-by":"crossref","first-page":"134","DOI":"10.1016\/j.specom.2011.07.007","volume":"54","author":"K Nakamura","year":"2012","unstructured":"K Nakamura, T Toda, H Saruwatari, K Shikano, Speaking-aid systems using GMM-based voice conversion for electrolaryngeal speech. Speech Commun.54(1), 134\u2013146 (2012).","journal-title":"Speech Commun."},{"key":"112_CR4","doi-asserted-by":"crossref","unstructured":"L Deng, A Acero, L Jiang, J Droppo, X Huang, in ICASSP. High-performance robust speech recognition using stereo training data (IEEE, 2001), pp. 301\u2013304.","DOI":"10.1109\/ICASSP.2001.940827"},{"key":"112_CR5","doi-asserted-by":"crossref","unstructured":"A Kunikoshi, Y Qiao, N Minematsu, K Hirose, in INTERSPEECH. Speech generation from hand gestures based on space mapping (ISCA, 2009), pp. 308\u2013311.","DOI":"10.21437\/Interspeech.2009-102"},{"issue":"2","key":"112_CR6","doi-asserted-by":"crossref","first-page":"4","DOI":"10.1109\/MASSP.1984.1162229","volume":"1","author":"R Gray","year":"1984","unstructured":"R Gray, Vector quantization. IEEE ASSP Mag. 1(2), 4\u201329 (1984).","journal-title":"IEEE ASSP Mag"},{"issue":"2","key":"112_CR7","doi-asserted-by":"crossref","first-page":"175","DOI":"10.1016\/0167-6393(92)90012-V","volume":"11","author":"H Valbret","year":"1992","unstructured":"H Valbret, E Moulines, J-P Tubach, Voice transformation using PSOLA technique. Speech Commun. 11(2), 175\u2013187 (1992).","journal-title":"Speech Commun"},{"issue":"2","key":"112_CR8","doi-asserted-by":"crossref","first-page":"131","DOI":"10.1109\/89.661472","volume":"6","author":"Y Stylianou","year":"1998","unstructured":"Y Stylianou, Cappe, O\u0301, E Moulines, Continuous probabilistic transform for voice conversion. IEEE Trans. Speech Audio Process. 6(2), 131\u2013142 (1998).","journal-title":"IEEE Trans. Speech Audio Process"},{"issue":"8","key":"112_CR9","doi-asserted-by":"crossref","first-page":"2222","DOI":"10.1109\/TASL.2007.907344","volume":"15","author":"T Toda","year":"2007","unstructured":"T Toda, AW Black, K Tokuda, Voice conversion based on maximum-likelihood estimation of spectral parameter trajectory. IEEE Trans. Audio Speech Lang. Process. 15(8), 2222\u20132235 (2007).","journal-title":"IEEE Trans. Audio Speech Lang. Process"},{"issue":"5","key":"112_CR10","doi-asserted-by":"crossref","first-page":"912","DOI":"10.1109\/TASL.2010.2041699","volume":"18","author":"E Helander","year":"2010","unstructured":"E Helander, T Virtanen, J Nurminen, M Gabbouj, Voice conversion using partial least squares regression. IEEE Trans. Audio Speech Lang. Process. 18(5), 912\u2013921 (2010).","journal-title":"IEEE Trans. Audio Speech Lang. Process"},{"key":"112_CR11","doi-asserted-by":"crossref","unstructured":"D Saito, H Doi, N Minematsu, K Hirose, in INTERSPEECH. Application of matrix variate Gaussian mixture model to statistical voice conversion (ISCA, 2014), pp. 2504\u20132508.","DOI":"10.1109\/ICOSP.2014.7015068"},{"key":"112_CR12","doi-asserted-by":"crossref","unstructured":"R Takashima, T Takiguchi, Y Ariki, in SLT. Exemplar-based voice conversion in noisy environment (IEEE, 2012), pp. 313\u2013317.","DOI":"10.1109\/SLT.2012.6424242"},{"key":"112_CR13","unstructured":"R Takashima, R Aihara, T Takiguchi, Y Ariki, in SSW8. Noise-robust voice conversion based on spectral mapping on sparse space (SynSIG, 2013), pp. 71\u201375."},{"key":"112_CR14","doi-asserted-by":"crossref","unstructured":"S Desai, EV Raghavendra, B Yegnanarayana, AW Black, K Prahallad, in ICASSP. Voice conversion using artificial neural networks (IEEE, 2009), pp. 3893\u20133896.","DOI":"10.1109\/ICASSP.2009.4960478"},{"key":"112_CR15","doi-asserted-by":"crossref","unstructured":"LH Chen, ZH Ling, Y Song, LR Dai, in INTERSPEECH. Joint spectral distribution modeling using restricted Boltzmann machines for voice conversion (ISCA, 2013), pp. 3052\u20133056.","DOI":"10.21437\/Interspeech.2013-666"},{"key":"112_CR16","doi-asserted-by":"crossref","unstructured":"Z Wu, ES Chng, H Li, in ChinaSIP. Conditional restricted Boltzmann machine for voice conversion (IEEE, 2013).","DOI":"10.1109\/ChinaSIP.2013.6625307"},{"key":"112_CR17","doi-asserted-by":"crossref","unstructured":"T Nakashika, R Takashima, T Takiguchi, Y Ariki, in INTERSPEECH. Voice conversion in high-order eigen space using deep belief nets (ISCA, 2013), pp. 369\u2013372.","DOI":"10.21437\/Interspeech.2013-102"},{"issue":"3","key":"112_CR18","doi-asserted-by":"crossref","first-page":"580","DOI":"10.1109\/TASLP.2014.2379589","volume":"23","author":"T Nakashika","year":"2015","unstructured":"T Nakashika, T Takiguchi, Y Ariki, Voice conversion using RNN pre-trained by recurrent temporal restricted Boltzmann machines. IEEE\/ACM Trans. Audio Speech Lang. Process. 23(3), 580\u2013587 (2015).","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process"},{"issue":"3","key":"112_CR19","doi-asserted-by":"crossref","first-page":"952","DOI":"10.1109\/TSA.2005.857790","volume":"14","author":"A Mouchtaris","year":"2006","unstructured":"A Mouchtaris, J Van der Spiegel, P Mueller, Nonparallel training for voice conversion based on a parameter adaptation approach. IEEE Trans. Audio Speech Lang. Process.14(3), 952\u2013963 (2006).","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"112_CR20","doi-asserted-by":"crossref","unstructured":"C-H Lee, C-H Wu, in INTERSPEECH. Map-based adaptation for speech conversion using adaptation data selection and non-parallel training (ISCA, 2006), pp. 2254\u20132257.","DOI":"10.21437\/Interspeech.2006-579"},{"key":"112_CR21","doi-asserted-by":"crossref","unstructured":"T Toda, Y Ohtani, K Shikano, in INTERSPEECH. Eigenvoice conversion based on Gaussian mixture model (ISCA, 2006), pp. 2446\u20132449.","DOI":"10.21437\/Interspeech.2006-613"},{"key":"112_CR22","doi-asserted-by":"crossref","unstructured":"Y Ohtani, T Toda, H Saruwatari, K Shikano, in NTERSPEECH. Many-to-many eigenvoice conversion with reference voice (ISCA, 2009), pp. 1623\u20131626.","DOI":"10.21437\/Interspeech.2009-485"},{"key":"112_CR23","doi-asserted-by":"crossref","unstructured":"D Saito, K Yamamoto, N Minematsu, K Hirose, in INTERSPEECH. One-to-many voice conversion based on tensor representation of speaker space (ISCA, 2011), pp. 653\u2013656.","DOI":"10.21437\/Interspeech.2011-268"},{"key":"112_CR24","doi-asserted-by":"crossref","unstructured":"T Masuda, M Shozakai, in ICASSP. Cost reduction of training mapping function based on multistep voice conversion (IEEE, 2007), pp. 693\u2013696.","DOI":"10.1109\/ICASSP.2007.367007"},{"key":"112_CR25","doi-asserted-by":"crossref","unstructured":"T Nakashika, T Takiguchi, Y Ariki, in MLSLP 2015. Parallel-data-free, many-to-many voice conversion using an adaptive restricted Boltzmann machine (ISCA, 2015), pp. 1\u20134.","DOI":"10.1186\/s13636-014-0044-3"},{"key":"112_CR26","doi-asserted-by":"crossref","unstructured":"K Cho, A Ilin, T Raiko, in ICANN. Improved learning of Gaussian-Bernoulli restricted Boltzmann machines (ENNS, 2011), pp. 10\u201317.","DOI":"10.1007\/978-3-642-21735-7_2"},{"key":"112_CR27","unstructured":"R Salakhutdinov, Learning and evaluating Boltzmann machines. Technical report, Technical Report UTML TR 2008-002, Department of Computer Science, University of Toronto (2008)."},{"key":"112_CR28","doi-asserted-by":"crossref","unstructured":"T Anastasakos, J McDonough, R Schwartz, J Makhoul, in ICSLP 96, 2. A compact model for speaker-adaptive training (WASET, 1996), pp. 1137\u20131140.","DOI":"10.21437\/ICSLP.1996-253"},{"issue":"7","key":"112_CR29","doi-asserted-by":"crossref","first-page":"1527","DOI":"10.1162\/neco.2006.18.7.1527","volume":"18","author":"GE Hinton","year":"2006","unstructured":"GE Hinton, S Osindero, YW Teh, A fast learning algorithm for deep belief nets. Neural Comput.18(7), 1527\u20131554 (2006).","journal-title":"Neural Comput."},{"key":"112_CR30","first-page":"287","volume-title":"Proc. the Stockholm Music Acoustics Conference (SMAC)","author":"M Morise","year":"2013","unstructured":"M Morise, in Proc. the Stockholm Music Acoustics Conference (SMAC). An attempt to develop a singing synthesizer by collaborative creation (Logos VerlagBerlin, 2013), pp. 287\u2013292."},{"issue":"3","key":"112_CR31","doi-asserted-by":"crossref","first-page":"233","DOI":"10.1250\/ast.20.233","volume":"20","author":"T Kawahara","year":"1999","unstructured":"T Kawahara, A Lee, T Kobayashi, K Takeda, N Minematsu, K Itou, A Ito, M Yamamoto, A Yamada, T Utsuro, K Shikano, Japanese dictation toolkit. J. Acoust. Soc. Japan (E). 20(3), 233\u2013239 (1999).","journal-title":"J. Acoust. Soc. Japan (E)"},{"issue":"5","key":"112_CR32","doi-asserted-by":"crossref","first-page":"930","DOI":"10.1109\/TSA.2005.848881","volume":"13","author":"M Pitz","year":"2005","unstructured":"M Pitz, H Ney, Vocal tract normalization equals linear transformation in cepstral space. IEEE Trans. Speech Audio Process. 13(5), 930\u2013944 (2005).","journal-title":"IEEE Trans. Speech Audio Process"},{"key":"112_CR33","doi-asserted-by":"crossref","unstructured":"E Variani, T Schaaf, in INTERSPEECH. VTLN in the MFCC domain: band-limited versus local interpolation (ISCA, 2011), pp. 1273\u20131276.","DOI":"10.21437\/Interspeech.2011-104"},{"issue":"5","key":"112_CR34","doi-asserted-by":"crossref","first-page":"30","DOI":"10.1002\/scj.1125","volume":"33","author":"T Emori","year":"2002","unstructured":"T Emori, K Shinoda, Vocal tract length normalization using rapid maximum-likelihood estimation for speech recognition. Syst. Comput. Japan. 33(5), 30\u201340 (2002).","journal-title":"Syst. Comput. Japan"},{"key":"112_CR35","doi-asserted-by":"crossref","unstructured":"B Milner, X Shao, in INTERSPEECH. Speech reconstruction from mel-frequency cepstral coefficients using a source-filter model (ISCA, 2002), pp. 2421\u20132424.","DOI":"10.21437\/ICSLP.2002-110"}],"container-title":["EURASIP Journal on Audio, Speech, and Music Processing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-017-0112-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1186\/s13636-017-0112-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-017-0112-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,20]],"date-time":"2025-06-20T11:27:53Z","timestamp":1750418873000},"score":1,"resource":{"primary":{"URL":"https:\/\/asmp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13636-017-0112-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,6,29]]},"references-count":35,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2017,12]]}},"alternative-id":["112"],"URL":"https:\/\/doi.org\/10.1186\/s13636-017-0112-6","relation":{},"ISSN":["1687-4722"],"issn-type":[{"type":"electronic","value":"1687-4722"}],"subject":[],"published":{"date-parts":[[2017,6,29]]},"article-number":"16"}}