{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T09:25:58Z","timestamp":1780392358589,"version":"3.54.1"},"reference-count":28,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2022,1,30]],"date-time":"2022-01-30T00:00:00Z","timestamp":1643500800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,30]],"date-time":"2022-01-30T00:00:00Z","timestamp":1643500800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2022,9]]},"DOI":"10.1007\/s11760-021-02119-6","type":"journal-article","created":{"date-parts":[[2022,1,30]],"date-time":"2022-01-30T00:03:36Z","timestamp":1643501016000},"page":"1641-1648","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Phoneme-guided Dysarthric speech conversion With non-parallel data by joint training"],"prefix":"10.1007","volume":"16","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5336-6386","authenticated-orcid":false,"given":"Xunquan","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Atsuki","family":"Oshiro","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinhui","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ryoichi","family":"Takashima","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tetsuya","family":"Takiguchi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,1,30]]},"reference":[{"key":"2119_CR1","doi-asserted-by":"crossref","unstructured":"Aihara, R., Takashima, R., Takiguchi, T., Ariki, Y.: Individuality-preserving voice conversion for articulation disorders based on non-negative matrix factorization. In: IEEE International Conference on Acoustics Speech and Signal Proceedings (ICASSP), pp. 8037\u20138040 (2013)","DOI":"10.1109\/ICASSP.2013.6639230"},{"issue":"1","key":"2119_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/1687-4722-2014-5","volume":"2014","author":"R Aihara","year":"2014","unstructured":"Aihara, R., Takashima, R., Takiguchi, T., Ariki, Y.: A preliminary demonstration of exemplar-based voice conversion for articulation disorders using an individuality-preserving dictionary. EURASIP J. Audio, Speech Music Process. 2014(1), 1\u201310 (2014)","journal-title":"EURASIP J. Audio, Speech Music Process."},{"key":"2119_CR3","doi-asserted-by":"crossref","unstructured":"Aihara, R., Takiguchi, T., Ariki, Y.: Multiple non-negative matrix factorization for many-to-many voice conversion. IEEE\/ACM Transitions on Audio Speech and Language Processing (TASLP) 24(7), 1175\u20131184 (2016)","DOI":"10.1109\/TASLP.2016.2522643"},{"key":"2119_CR4","doi-asserted-by":"crossref","unstructured":"Aihara, R., Takiguchi, T., Ariki, Y.: Phoneme-discriminative features for dysarthric speech conversion. In: Proceedings of Interspeech, pp. 3374\u20133378 (2017)","DOI":"10.21437\/Interspeech.2017-664"},{"issue":"8","key":"2119_CR5","doi-asserted-by":"publisher","first-page":"1485","DOI":"10.1007\/s11760-017-1111-x","volume":"11","author":"J Chen","year":"2017","unstructured":"Chen, J., Takiguchi, T., Ariki, Y.: Rotation-reversal invariant hog cascade for facial expression recognition. Signal, Image Video Process. (SIVP) 11(8), 1485\u20131492 (2017)","journal-title":"Signal, Image Video Process. (SIVP)"},{"key":"2119_CR6","doi-asserted-by":"crossref","unstructured":"Debnath, S., Roy, P.: Appearance and shape-based hybrid visual feature extraction: toward audio-visual automatic speech recognition, pp. 1\u20138. Signal, Image and Video Processing (SIVP) pp (2020)","DOI":"10.1007\/s11760-020-01717-0"},{"key":"2119_CR7","unstructured":"Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde- Farley, D., Ozair, S., Courville, A., Bengio, Y.: Generative adversarial nets. In: Advances in neural information processing systems, pp. 2672\u20132680 (2014)"},{"issue":"5","key":"2119_CR8","doi-asserted-by":"publisher","first-page":"912","DOI":"10.1109\/TASL.2010.2041699","volume":"18","author":"E Helander","year":"2010","unstructured":"Helander, E., Virtanen, T., Nurminen, J., Gabbouj, M.: Voice con-version using partial least squares regression. IEEE\/ACM Tran.s Audio, Speech Lang. Process. (TASLP) 18(5), 912\u2013921 (2010)","journal-title":"IEEE\/ACM Tran.s Audio, Speech Lang. Process. (TASLP)"},{"key":"2119_CR9","doi-asserted-by":"crossref","unstructured":"Kain, A., Macon, M.W.: Spectral voice conversion for text-to-speech synthesis. In: IEEE International Conference on Acoustics Speech and Signal Proc. (ICASSP), vol. 1, pp. 285\u2013288. IEEE (1998)","DOI":"10.1109\/ICASSP.1998.674423"},{"key":"2119_CR10","doi-asserted-by":"crossref","unstructured":"Kaneko, T., Kameoka, H.: Parallel-data-free voice conversion using cycle-consistent adversarial networks. arXiv preprint arXiv:1711.11293 (2017)","DOI":"10.23919\/EUSIPCO.2018.8553236"},{"key":"2119_CR11","doi-asserted-by":"crossref","unstructured":"Lai, J., Chen, B., Tan, T., Tong, S., Yu, K.: Phone-aware LSTM-RNN for voice conversion. In: IEEE International Conference on Signal Processing (ICSP), pp. 177\u2013182. IEEE (2016)","DOI":"10.1109\/ICSP.2016.7877819"},{"issue":"7","key":"2119_CR12","doi-asserted-by":"publisher","first-page":"1877","DOI":"10.1587\/transinf.2015EDP7457","volume":"99","author":"M Morise","year":"2016","unstructured":"Morise, M., Yokomori, F., Ozawa, K.: World: a vocoder-based high-quality speech synthesis system for real-time applications. IEICE Trans. Inf. Syst. 99(7), 1877\u20131884 (2016)","journal-title":"IEICE Trans. Inf. Syst."},{"issue":"3","key":"2119_CR13","doi-asserted-by":"publisher","first-page":"580","DOI":"10.1109\/TASLP.2014.2379589","volume":"23","author":"T Nakashika","year":"2014","unstructured":"Nakashika, T., Takiguchi, T., Ariki, Y.: Voice conversion using RNN pre-trained by recurrent temporal restricted Boltzmann machines. IEEE\/ACM Trans. Audio Speech Lang. Process. (TASLP) 23(3), 580\u2013587 (2014)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process. (TASLP)"},{"issue":"11","key":"2119_CR14","doi-asserted-by":"publisher","first-page":"2032","DOI":"10.1109\/TASLP.2016.2593263","volume":"24","author":"T Nakashika","year":"2016","unstructured":"Nakashika, T., Takiguchi, T., Minami, Y.: Non-parallel training in voice conversion using an adaptive restricted Boltzmann machine. IEEE\/ACM Trans. Audio Speech Lang. Process. TASLP 24(11), 2032\u20132045 (2016)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process. TASLP"},{"key":"2119_CR15","unstructured":"Oord, A.V.D., Dieleman, S., Zen, H., Simonyan, K., Vinyals, O., Graves, A., Kalchbrenner, N., Senior, A., Kavukcuoglu, K.: Wavenet: A generative model for raw audio. arXiv preprint arXiv:1609.03499 (2016)"},{"key":"2119_CR16","doi-asserted-by":"crossref","unstructured":"Park, S.w., Kim, D.y., Joe, M.c.: Cotatron: Transcription-guided speech encoder for any-to-many voice conversion without parallel data. arXiv preprint arXiv:2005.03295 (2020)","DOI":"10.21437\/Interspeech.2020-1542"},{"key":"2119_CR17","unstructured":"Qian, K., Zhang, Y., Chang, S., Yang, X., Hasegawa-Johnson, M.: Autovc: Zero-shot voice style transfer with only autoencoder loss. arXiv preprint arXiv:1905.05879 (2019)"},{"issue":"4","key":"2119_CR18","doi-asserted-by":"publisher","first-page":"523","DOI":"10.1007\/s10579-011-9145-0","volume":"46","author":"F Rudzicz","year":"2012","unstructured":"Rudzicz, F., Namasivayam, A.K., Wolff, T.: The TORGO database of acoustic and articulatory speech from speakers with dysarthria. Lang. Resour. Eval. 46(4), 523\u2013541 (2012)","journal-title":"Lang. Resour. Eval."},{"key":"2119_CR19","doi-asserted-by":"crossref","unstructured":"Saito,D., Doi,H., Minematsu,N., Hirose,K.: Application of matrix variate Gaussian mixture model to statistical voice conversion. In: 15th Annual Conference of the International Speech Communication Association, pp. 2504\u20132508","DOI":"10.21437\/Interspeech.2014-537"},{"key":"2119_CR20","doi-asserted-by":"crossref","unstructured":"Seltzer, M.L., Droppo, J.: Multi-task learning in deep neural networks for improved phoneme recognition. In: IEEE International Conference on Acoustics Speech and Signal Proceedinds (ICASSP), pp. 6965\u20136969 (2013)","DOI":"10.1109\/ICASSP.2013.6639012"},{"key":"2119_CR21","doi-asserted-by":"crossref","unstructured":"Shen, J., Pang, R., Weiss, R.J., Schuster, M., Jaitly, N., Yang, Z., Chen, Z., Zhang, Y., Wang, Y., Skerrv-Ryan, R., et\u00a0al.: Natural tts synthesis by conditioning wavenet on mel spectrogram predictions. In: 2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 4779\u20134783 (2018)","DOI":"10.1109\/ICASSP.2018.8461368"},{"issue":"2","key":"2119_CR22","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1109\/89.661472","volume":"6","author":"Y Stylianou","year":"1998","unstructured":"Stylianou, Y., Cappe, O., Moulines, E.: Continuous probabilistic transform for voice conversion. IEEE Trans. Speech Audio Process. 6(2), 131\u2013142 (1998)","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"9","key":"2119_CR23","doi-asserted-by":"publisher","first-page":"2505","DOI":"10.1109\/TASL.2012.2205241","volume":"20","author":"T Toda","year":"2012","unstructured":"Toda, T., Nakagiri, M., Shikanon, K.: Statistical voice conversion techniques for body-conducted unvoiced speech enhancement. IEEE\/ACM Trans. Audio Speech Lang. Proces. (TASLP) 20(9), 2505\u20132517 (2012)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Proces. (TASLP)"},{"key":"2119_CR24","doi-asserted-by":"crossref","unstructured":"Wan, L., Wang, Q., Papir, A., Moreno, I.L.: Generalized end-to-end loss for speaker verification. In: IEEE International Conference on Acoustics Speech and Signal Processing (ICASSP), pp. 4879\u20134883 (2018)","DOI":"10.1109\/ICASSP.2018.8462665"},{"key":"2119_CR25","doi-asserted-by":"crossref","unstructured":"Wu, Z., Valentini-Botinhao, C., Watts, O., King, S.: Deep neural networks employing multi-task learning and stacked bottleneck features for speech synthesis. In: IEEE International Conference on Acoustics Speech and Signal Proc. (ICASSP), pp. 4460\u20134464 (2015)","DOI":"10.1109\/ICASSP.2015.7178814"},{"key":"2119_CR26","doi-asserted-by":"crossref","unstructured":"Yang, S.H., Chung, M.: Improving dysarthric speech intelligibility using cycle-consistent adversarial training. arXiv preprint arXiv:2001.04260 (2020)","DOI":"10.5220\/0009163003080313"},{"issue":"10","key":"2119_CR27","doi-asserted-by":"publisher","first-page":"4349","DOI":"10.1109\/TIP.2012.2205006","volume":"21","author":"XT Yuan","year":"2012","unstructured":"Yuan, X.T., Liu, X., Yan, S.: Visual classification with multitask joint sparse representation. IEEE Trans. Image Proces. 21(10), 4349\u20134360 (2012)","journal-title":"IEEE Trans. Image Proces."},{"key":"2119_CR28","doi-asserted-by":"crossref","unstructured":"Zhou, H., Liu, Y., Liu, Z., Luo, P., Wang, X.: Talking face generation by adversarially disentangled audio-visual representation. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 33, pp. 9299\u20139306 (2019)","DOI":"10.1609\/aaai.v33i01.33019299"}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-021-02119-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-021-02119-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-021-02119-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,17]],"date-time":"2024-09-17T16:12:42Z","timestamp":1726589562000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-021-02119-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,1,30]]},"references-count":28,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2022,9]]}},"alternative-id":["2119"],"URL":"https:\/\/doi.org\/10.1007\/s11760-021-02119-6","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"value":"1863-1703","type":"print"},{"value":"1863-1711","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,1,30]]},"assertion":[{"value":"26 February 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 November 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 November 2021","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 January 2022","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}