{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,27]],"date-time":"2025-03-27T05:33:48Z","timestamp":1743053628096,"version":"3.40.3"},"publisher-location":"Cham","reference-count":31,"publisher":"Springer Nature Switzerland","isbn-type":[{"type":"print","value":"9783031781186"},{"type":"electronic","value":"9783031781193"}],"license":[{"start":{"date-parts":[[2024,12,5]],"date-time":"2024-12-05T00:00:00Z","timestamp":1733356800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,12,5]],"date-time":"2024-12-05T00:00:00Z","timestamp":1733356800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-78119-3_25","type":"book-chapter","created":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T02:01:25Z","timestamp":1733277685000},"page":"356-372","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["FCHiFi-GAN: Aggrandizing Fast Convergence with\u00a0Batchwise Normalization"],"prefix":"10.1007","author":[{"given":"Ravindrakumar M.","family":"Purohit","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Arushi","family":"Srivastava","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hemant A.","family":"Patil","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,12,5]]},"reference":[{"issue":"7","key":"25_CR1","doi-asserted-by":"publisher","first-page":"1877","DOI":"10.1587\/transinf.2015EDP7457","volume":"99","author":"M Morise","year":"2016","unstructured":"Morise, M., Yokomori, F., Ozawa, K.: WORLD: a vocoder-based high-quality speech synthesis system for real-time applications. IEICE Trans. Inf. Syst. 99(7), 1877\u20131884 (2016)","journal-title":"IEICE Trans. Inf. Syst."},{"key":"25_CR2","doi-asserted-by":"crossref","unstructured":"Griffin, D., Lim, J.: Signal estimation from modified short-time Fourier transform. IEEE Trans. Acoust. Speech Signal Process. (ICASSP) 32(2), 236\u2013243 (1984)","DOI":"10.1109\/TASSP.1984.1164317"},{"key":"25_CR3","unstructured":"Sotelo, J., et al.: Char2Wav: end-to-end speech synthesis. In: International Conference on Learning Representations (ICLR), Toulon, France (2017)"},{"key":"25_CR4","doi-asserted-by":"crossref","unstructured":"Shen, J., et al.: Natural TTS synthesis by conditioning Wavenet on MEL spectrogram predictions. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 4779\u20134783, Calgary, Alberta, Canada (2018)","DOI":"10.1109\/ICASSP.2018.8461368"},{"key":"25_CR5","unstructured":"Ping, W., Peng, K., Chen, J.: ClariNet: parallel wave generation in end-to-end text-to-speech. arXiv preprint arXiv:1807.07281 (2018). Accessed 22 Feb 2024"},{"issue":"4","key":"25_CR6","first-page":"369","volume":"19","author":"JN Kaderavek","year":"2010","unstructured":"Kaderavek, J.N., Justice, L.M.: Fidelity: an essential component of evidence-based practice in speech-language pathology. Am. Speech Lang. Hear. Assoc. (ASHA) 19(4), 369\u201379 (2010)","journal-title":"Am. Speech Lang. Hear. Assoc. (ASHA)"},{"key":"25_CR7","unstructured":"Goodfellow, I., et al.: Generative adversarial networks. In: Neural Information Processing Systems (NIPS), vol. 27, Montreal, Canada (2014)"},{"key":"25_CR8","unstructured":"van\u00a0den Oord, A., et al.: WaveNet: a generative model for raw audio. arXiv preprint arXiv:1609.03499 (2016). Accessed 22 Feb 2024"},{"key":"25_CR9","unstructured":"Van\u00a0den Oord, A., Kalchbrenner, N., Espeholt, L., Vinyals, O., Graves, A., et\u00a0al.: Conditional image generation with PixelCNN decoders. In: Advances in Neural Information Processing Systems (NeurIPS), vol. 29, pp. 4797\u20134805, Barcelona, Spain (2016)"},{"key":"25_CR10","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 770\u2013778, Las Vegas, USA (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"25_CR11","unstructured":"Kumar, K., et al.: MelGAN: generative adversarial networks for conditional waveform synthesis. In: Advances in Neural Information Processing Systems (NeurIPS), vol. 32, pp. 14910\u201314921, Vancouver, Canada (2019)"},{"key":"25_CR12","doi-asserted-by":"crossref","unstructured":"Prenger, R., Valle, R., Catanzaro, B.: WaveGlow: a flow-based generative network for speech synthesis. In: ICASSP 2019\u20132019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 3617\u20133621, Brighton, United Kingdom (2019)","DOI":"10.1109\/ICASSP.2019.8683143"},{"key":"25_CR13","doi-asserted-by":"crossref","unstructured":"Yamamoto, R., Song, E., Kim, J.-M.: Parallel WaveGAN: a fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6199\u20136203, Virtual Barcelona (2020)","DOI":"10.1109\/ICASSP40776.2020.9053795"},{"key":"25_CR14","unstructured":"Engel, J., Agrawal, K.K., Chen, S., Gulrajani, I., Donahue, C., Roberts, A.: GANSynth: adversarial neural audio synthesis. arXiv preprint arXiv:1902.08710 (2019). Accessed 22 Feb 2024"},{"key":"25_CR15","doi-asserted-by":"crossref","unstructured":"Neekhara, P., Donahue, C., Puckette, M., Dubnov, S., McAuley, J.: Expediting TTS synthesis with adversarial vocoding. arXiv preprint arXiv:1904.07944 (2019). Accessed 22 Feb 2024","DOI":"10.21437\/Interspeech.2019-3099"},{"key":"25_CR16","unstructured":"Kong, J., Kim, J., Bae, J.: HiFi-GAN: generative adversarial networks for efficient and high fidelity speech synthesis. In: Advances in Neural Information Processing Systems (NeurIPS), vol. 33, pp. 17022\u201317033, (Virtual Conference) (2020). Accessed 22 Feb 2024"},{"key":"25_CR17","unstructured":"Lee, S., Ping, W., Ginsburg, B., Catanzaro, B., Yoon, S.: BigVGAN: a universal neural vocoder with large-scale training (2022). arXiv preprint arXiv:2206.04658. Accessed 22 Feb 2024"},{"key":"25_CR18","unstructured":"Arjovsky, M., Chintala, S., Bottou, L.: Wasserstein generative adversarial networks. In: Proceedings of the 34th International Conference on Machine Learning, vol. 70, pp. 214\u2013223, Boston, USA (2017)"},{"key":"25_CR19","unstructured":"Bi\u0144kowski, M., et al.: High fidelity speech synthesis with adversarial networks (2019). Accessed 22 Feb 2024"},{"key":"25_CR20","unstructured":"Ioffe, S., Szegedy, C.: Batch normalization: accelerating deep network training by reducing internal covariate shift. In: International Conference on Machine Learning (ICML), pp. 448\u2013456, Lille, France (2015)"},{"key":"25_CR21","unstructured":"Salimans, T., Kingma, D.P.: Weight normalization: a simple reparameterization to accelerate training of deep neural networks. In: Advances in Neural Information Processing Systems (NeurIPS), vol. 29, pp. 901\u2013909. Centre Conventions International Barcelona, Spain (2016)"},{"key":"25_CR22","doi-asserted-by":"crossref","unstructured":"Wang, T.-C., Liu, M.-Y., Zhu, J.-Y., Tao, A., Kautz, J., Catanzaro, B.: High-resolution image synthesis and semantic manipulation with conditional GANs. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 8798\u20138807, Washington D.C (2018)","DOI":"10.1109\/CVPR.2018.00917"},{"key":"25_CR23","unstructured":"Ito, K., Johnson, L.: The LJ Speech Dataset. https:\/\/keithito.com\/LJ-Speech-Dataset\/. Accessed 22 Feb 2024"},{"key":"25_CR24","unstructured":"Yamagishi, J., Veaux, C., MacDonald, K.: CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92) (2019). Accessed 22 Feb 2024"},{"key":"25_CR25","doi-asserted-by":"crossref","unstructured":"Isola, P., Zhu, J.-Y., Zhou, T., Efros, A.A.: Image-to-image translation with conditional adversarial networks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1125\u20131134 (2017)","DOI":"10.1109\/CVPR.2017.632"},{"key":"25_CR26","doi-asserted-by":"publisher","first-page":"14985","DOI":"10.1109\/ACCESS.2018.2886814","volume":"7","author":"Y-J Cao","year":"2018","unstructured":"Cao, Y.-J., et al.: Recent advances of generative adversarial networks in computer vision. IEEE Access 7, 14985\u201315006 (2018)","journal-title":"IEEE Access"},{"key":"25_CR27","doi-asserted-by":"publisher","first-page":"213","DOI":"10.1007\/s00530-014-0446-1","volume":"22","author":"R Streijl","year":"2016","unstructured":"Streijl, R., Winkler, S., Hands, D.: Mean Opinion Score (MOS) revisited: methods and applications, limitations and alternatives. Multimedia Syst. 22, 213\u2013227 (2016)","journal-title":"Multimedia Syst."},{"key":"25_CR28","doi-asserted-by":"crossref","unstructured":"Kubichek, R.: Mel-cepstral distance measure for objective speech quality assessment. In: Proceedings of IEEE Pacific Rim Conference on Communications Computers and Signal Processing, vol. 1, pp. 125\u2013128 (1993)","DOI":"10.1109\/PACRIM.1993.407206"},{"key":"25_CR29","doi-asserted-by":"crossref","unstructured":"Rix, A.W., Beerends, J.G., Hollier, M.P., Hekstra, A.P.: Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs. In: IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) (Cat. No. 01CH37221), vol. 2, pp. 749\u2013752, Salt Lake City, USA (2001)","DOI":"10.1109\/ICASSP.2001.941023"},{"key":"25_CR30","unstructured":"Fu, S.-W., Liao, C.-F., Tsao, Y., Lin, S.-D.: MetricGAN: generative adversarial networks based black-box metric scores optimization for speech enhancement. In: International Conference on Machine Learning (ICML), pp. 2031\u20132041, California, United States (2019)"},{"issue":"4","key":"25_CR31","doi-asserted-by":"publisher","first-page":"578","DOI":"10.1109\/89.326616","volume":"2","author":"H Hermansky","year":"1994","unstructured":"Hermansky, H., Morgan, N.: RASTA processing of speech. IEEE Trans. Speech Audio Process. 2(4), 578\u2013589 (1994)","journal-title":"IEEE Trans. Speech Audio Process."}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-78119-3_25","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,4]],"date-time":"2024-12-04T02:07:07Z","timestamp":1733278027000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-78119-3_25"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,5]]},"ISBN":["9783031781186","9783031781193"],"references-count":31,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-78119-3_25","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024,12,5]]},"assertion":[{"value":"5 December 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Kolkata","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"1 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2024.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}