{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,17]],"date-time":"2025-10-17T14:31:23Z","timestamp":1760711483203,"version":"3.41.0"},"reference-count":74,"publisher":"Springer Science and Business Media LLC","issue":"7","license":[{"start":{"date-parts":[[2025,3,10]],"date-time":"2025-03-10T00:00:00Z","timestamp":1741564800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,3,10]],"date-time":"2025-03-10T00:00:00Z","timestamp":1741564800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Department of Science and Technology, Inspire, India","award":["DST\/INSPIRE\/04\/2020\/002163"],"award-info":[{"award-number":["DST\/INSPIRE\/04\/2020\/002163"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Circuits Syst Signal Process"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1007\/s00034-025-03036-6","type":"journal-article","created":{"date-parts":[[2025,3,10]],"date-time":"2025-03-10T18:55:37Z","timestamp":1741632937000},"page":"5010-5043","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Noise-Aware Self-Supervised Variational Autoencoder for Speech Enhancement"],"prefix":"10.1007","volume":"44","author":[{"given":"Amogh","family":"Dixit","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"K. S.","family":"Nataraj","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5361-3658","authenticated-orcid":false,"given":"Nitya","family":"Tiwari","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,3,10]]},"reference":[{"key":"3036_CR1","doi-asserted-by":"publisher","first-page":"2477","DOI":"10.1109\/TASLP.2024.3393718","volume":"32","author":"S Abdulatif","year":"2024","unstructured":"S. Abdulatif, R. Cao, B. Yang, Cmgan: conformer-based metric-gan for monaural speech enhancemen. IEEE\/ACM Trans. Audio Speech Lang. Process. 32, 2477\u20132493 (2024)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR2","unstructured":"F. Albu, N. Dumitriu, L.D. Stanciu. Speech enhancement by spectral subtraction, in Proceedings of International Symposium on Electronics and Telecommunications (1996), pp. 78\u201383"},{"key":"3036_CR3","doi-asserted-by":"publisher","first-page":"46","DOI":"10.1186\/s40537-023-00727-2","volume":"10","author":"L Alzubaidi","year":"2023","unstructured":"L. Alzubaidi, J. Bai, A. Al-Sabaawi, A survey on deep learning tools dealing with data scarcity: definitions, challenges, solutions, tips, and applications. J. Big Data 10, 46 (2023)","journal-title":"J. Big Data"},{"key":"3036_CR4","unstructured":"A. Baevski, H. Zhou, A. Mohamed et\u00a0al. Wav2vec 2.0: a framework for self-supervised learning of speech representation, in Proceedings of the 34th International Conference on Neural Information Processing Systems (NIPS \u201920) (2020), pp. 12449-12460"},{"key":"3036_CR5","doi-asserted-by":"crossref","unstructured":"Y. Bando, M. Mimura, K. Itoyama et al., Statistical speech enhancement based on probabilistic integration of variational autoencoder and non-negative matrix factorization, in 2018 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2018), pp. 716\u2013720","DOI":"10.1109\/ICASSP.2018.8461530"},{"key":"3036_CR6","doi-asserted-by":"publisher","unstructured":"Y. Bando, K. Sekiguchi, K. Yoshii. Adaptive neural speech enhancement with a denoising variational autoencoder, in Proceedings of Interspeech (2020), pp. 2437\u20132441. https:\/\/doi.org\/10.21437\/Interspeech.2020-2291","DOI":"10.21437\/Interspeech.2020-2291"},{"key":"3036_CR7","doi-asserted-by":"crossref","unstructured":"D. Barry, Q. Zhang, P.W. Sun, et\u00a0al. Go listen: An end-to-end online listening test platform (2021)","DOI":"10.5334\/jors.361"},{"key":"3036_CR8","doi-asserted-by":"publisher","unstructured":"M. Berouti, R. Schwartz, J. Makhoul. Enhancement of speech corrupted by acoustic noise, in ICASSP \u201979. IEEE International Conference on Acoustics, Speech, and Signal Processing (1979), pp. 208\u2013211. https:\/\/doi.org\/10.1109\/ICASSP.1979.1170788","DOI":"10.1109\/ICASSP.1979.1170788"},{"issue":"2","key":"3036_CR9","doi-asserted-by":"publisher","first-page":"113","DOI":"10.1109\/TASSP.1979.1163209","volume":"27","author":"S Boll","year":"1979","unstructured":"S. Boll, Suppression of acoustic noise in speech using spectral subtraction. IEEE Trans. Acoust. Speech Signal Process. 27(2), 113\u2013120 (1979). https:\/\/doi.org\/10.1109\/TASSP.1979.1163209","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"issue":"6","key":"3036_CR10","doi-asserted-by":"publisher","first-page":"1505","DOI":"10.1109\/JSTSP.2022.3188113","volume":"16","author":"S Chen","year":"2021","unstructured":"S. Chen et al., Wavlm: Large-scale self-supervised pre-training for full stack speech processing. IEEE J. Sel. Top. Signal Process. 16(6), 1505\u20131518 (2021). https:\/\/doi.org\/10.1109\/JSTSP.2022.3188113","journal-title":"IEEE J. Sel. Top. Signal Process."},{"issue":"1","key":"3036_CR11","doi-asserted-by":"publisher","first-page":"12","DOI":"10.1109\/97.988717","volume":"9","author":"I Cohen","year":"2002","unstructured":"I. Cohen, B. Berdugo, Noise estimation by minima controlled recursive averaging for robust speech enhancement. IEEE Signal Process. Lett. 9(1), 12\u201315 (2002). https:\/\/doi.org\/10.1109\/97.988717","journal-title":"IEEE Signal Process. Lett."},{"key":"3036_CR12","doi-asserted-by":"crossref","unstructured":"C. Doersch, A. Zisserman. Multi-task self-supervised visual learning, in Proceedings of the IEEE International Conference on Computer Vision (2017), pp. 2051\u20132060","DOI":"10.1109\/ICCV.2017.226"},{"key":"3036_CR13","doi-asserted-by":"crossref","unstructured":"of Electrical I, Engineers E, Ieee recommended practice for speech quality measurements. IEEE Trans. Audio Electroacoust. 17(3), 225\u2013246 (1969)","DOI":"10.1109\/TAU.1969.1162058"},{"issue":"6","key":"3036_CR14","doi-asserted-by":"publisher","first-page":"1109","DOI":"10.1109\/TASSP.1984.1164453","volume":"32","author":"Y Ephraim","year":"1984","unstructured":"Y. Ephraim, D. Malah, Speech enhancement using a minimum-mean square error short-time spectral amplitude estimator. IEEE Trans. Acoust. Speech Signal Process. 32(6), 1109\u20131121 (1984)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"issue":"2","key":"3036_CR15","doi-asserted-by":"publisher","first-page":"443","DOI":"10.1109\/TASSP.1985.1164550","volume":"33","author":"Y Ephraim","year":"1985","unstructured":"Y. Ephraim, D. Malah, Speech enhancement using a minimum mean-square error log-spectral amplitude estimator. IEEE Trans. Acoust. Speech Signal Process. 33(2), 443\u2013445 (1985)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"key":"3036_CR16","doi-asserted-by":"crossref","unstructured":"H. Fang, G. Carbajal, S. Wermter et al., Variational autoencoder for speech enhancement with a noise-aware encoder, in ICASSP 2021\u20132021 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2021), pp. 676\u2013680","DOI":"10.1109\/ICASSP39728.2021.9414060"},{"key":"3036_CR17","doi-asserted-by":"crossref","unstructured":"S.W. Fu, Y. Tsao, X. Lu, et\u00a0al. Raw waveform-based speech enhancement by fully convolutional networks, in 2017 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC) (IEEE, 2017), pp. 006\u2013012","DOI":"10.1109\/APSIPA.2017.8281993"},{"key":"3036_CR18","doi-asserted-by":"publisher","first-page":"3025","DOI":"10.1109\/TASLP.2024.3407533","volume":"32","author":"Z Guo","year":"2024","unstructured":"Z. Guo, Q. Wang, J. Du et al., A variance-preserving interpolation approach for diffusion models with applications to single channel speech enhancement and recognition. IEEE\/ACM Trans. Audio Speech Lang. Process. 32, 3025\u20133038 (2024). https:\/\/doi.org\/10.1109\/TASLP.2024.3407533","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR19","doi-asserted-by":"publisher","unstructured":"R. Hendriks, T. Gerkmann, J. Jensen, DFT-domain based single-microphone noise reduction for speech enhancement - a survey of the state of the art, vol. Synthesis (Morgan and Claypool Publishers, CA, USA, Lectures on Speech and Audio Processing, 2013). https:\/\/doi.org\/10.2200\/S00473ED1V01Y201301SAP011","DOI":"10.2200\/S00473ED1V01Y201301SAP011"},{"key":"3036_CR20","doi-asserted-by":"crossref","unstructured":"R.C. Hendriks, R. Heusdens, J. Jensen. Log-spectral magnitude mmse estimators under super-gaussian densities, in Tenth Annual Conference of the International Speech Communication Association (2009)","DOI":"10.21437\/Interspeech.2009-411"},{"key":"3036_CR21","unstructured":"H.G. Hirsch, D. Pearce. The aurora experimental framework for the performance evaluation of speech recognition systems under noisy conditions, in ASR2000-Automatic Speech Recognition: Challenges for the New Millenium ISCA Tutorial and Research Workshop (ITRW) (2000)"},{"key":"3036_CR22","doi-asserted-by":"publisher","first-page":"3451","DOI":"10.1109\/TASLP.2021.3122291","volume":"29","author":"WN Hsu","year":"2021","unstructured":"W.N. Hsu, B. Bolte, Y.H.H. Tsai et al., Hubert: Self-supervised speech representation learning by masked prediction of hidden units. IEEE\/ACM Trans. Audio Speech Lang. Process. 29, 3451\u20133460 (2021). https:\/\/doi.org\/10.1109\/TASLP.2021.3122291","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR23","doi-asserted-by":"crossref","unstructured":"Z. Huang, S. Watanabe, Y. Sw et al., Investigating self-supervised learning for speech enhancement and separation, in ICASSP 2022\u20132022 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2022), pp. 6837\u20136841","DOI":"10.1109\/ICASSP43922.2022.9746303"},{"key":"3036_CR24","doi-asserted-by":"crossref","unstructured":"K.H. Hung, S.w. Fu, H.H. Tseng, et\u00a0al. Boosting self-supervised embeddings for speech enhancement. arXiv preprint arXiv:2204.03339 (2022)","DOI":"10.21437\/Interspeech.2022-10002"},{"key":"3036_CR25","doi-asserted-by":"crossref","unstructured":"B. Irvin, M. Stamenovic, M. Kegler et al., Self-supervised learning for speech enhancement through synthesis, in ICASSP 2023\u20132023 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2023), pp. 1\u20135","DOI":"10.1109\/ICASSP49357.2023.10094705"},{"issue":"11","key":"3036_CR26","doi-asserted-by":"publisher","first-page":"2009","DOI":"10.1109\/TASLP.2016.2585878","volume":"24","author":"J Jensen","year":"2016","unstructured":"J. Jensen, C.H. Taal, An algorithm for predicting the intelligibility of speech masked by modulated noise maskers. IEEE\/ACM Trans. Audio Speech Lang. Process. 24(11), 2009\u20132022 (2016)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR27","doi-asserted-by":"publisher","unstructured":"M. Kashyap, A. Tambwekar, K. Manohara, et\u00a0al. Speech denoising without clean training data: A noise2noise approach, in Proc. Interspeech 2021, pp. 2716\u20132720 (2021) https:\/\/doi.org\/10.21437\/Interspeech.2021-1130","DOI":"10.21437\/Interspeech.2021-1130"},{"key":"3036_CR28","unstructured":"D. Kingma, M. Welling (2014a) Auto-encoding variational bayes, in Proceedings of the 2nd International Conference on Learning Representations (ICLR)"},{"key":"3036_CR29","unstructured":"D. Kingma, M. Welling (2014b) Auto-encoding variational bayes, in Proceedings of the 2nd International Conference on Learning Representations (ICLR)"},{"key":"3036_CR30","doi-asserted-by":"crossref","unstructured":"V. Kishore, N. Tiwari, P. Paramasivam. Improved speech enhancement using tcn with multiple encoder-decoder layers, in Interspeech (2020), pp. 4531\u20134535","DOI":"10.21437\/Interspeech.2020-3122"},{"key":"3036_CR31","doi-asserted-by":"crossref","unstructured":"A. Kolesnikov, X. Zhai, L. Beyer. Revisiting self-supervised visual representation learning, in Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (2019), pp. 1920\u20131929","DOI":"10.1109\/CVPR.2019.00202"},{"key":"3036_CR32","doi-asserted-by":"crossref","unstructured":"A. Kumar, D. Florencio (2016) Speech enhancement in multiple-noise conditions using deep neural networks. arXiv preprint arXiv:1605.02427","DOI":"10.21437\/Interspeech.2016-88"},{"key":"3036_CR33","doi-asserted-by":"crossref","unstructured":"B. Kumar (2021) Comparative performance evaluation of greedy algorithms for speech enhancement system. Fluctuation and Noise Letters 20(2)","DOI":"10.1142\/S0219477521500176"},{"key":"3036_CR34","doi-asserted-by":"crossref","unstructured":"S. Leglaive, L. Girin, R. Horaud. A variance modeling framework based on variational autoencoders for speech enhancement, in 2018 IEEE 28th International Workshop on Machine Learning for Signal Processing (MLSP) (IEEE, 2018), pp. 1\u20136","DOI":"10.1109\/MLSP.2018.8516711"},{"key":"3036_CR35","doi-asserted-by":"crossref","unstructured":"S. Leglaive, L. Girin, R. Horaud, Semi-supervised multichannel speech enhancement with variational autoencoders and non-negative matrix factorization, in ICASSP 2019\u20132019 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2019), pp.101\u2013105","DOI":"10.1109\/ICASSP.2019.8683704"},{"key":"3036_CR36","doi-asserted-by":"publisher","unstructured":"L. Li, S. Seki (2024) Remixed2remixed: Domain adaptation for speech enhancement by noise2noise learning with remixing, in Proceedings of IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP 2024), pp. 806\u2013810. https:\/\/doi.org\/10.1109\/ICASSP48485.2024.10446056","DOI":"10.1109\/ICASSP48485.2024.10446056"},{"issue":"12","key":"3036_CR37","doi-asserted-by":"publisher","first-page":"1586","DOI":"10.1109\/PROC.1979.11540","volume":"67","author":"J Lim","year":"1979","unstructured":"J. Lim, A. Oppenheim, Enhancement and bandwidth compression of noisy speech. Proc. IEEE 67(12), 1586\u20131604 (1979). https:\/\/doi.org\/10.1109\/PROC.1979.11540","journal-title":"Proc. IEEE"},{"key":"3036_CR38","doi-asserted-by":"crossref","unstructured":"D. Malah, R.V. Cox, A.J. Accardi. Tracking speech-presence uncertainty to improve speech enhancement in non-stationary noise environments, in 1999 IEEE International Conference on Acoustics, Speech, and Signal Processing. Proceedings. ICASSP99 (Cat. No. 99CH36258) (IEEE, 1999), pp. 789\u2013792","DOI":"10.1109\/ICASSP.1999.759789"},{"issue":"6","key":"3036_CR39","doi-asserted-by":"publisher","first-page":"1215","DOI":"10.1016\/j.sigpro.2005.07.037","volume":"86","author":"R Martin","year":"2006","unstructured":"R. Martin, Bias compensation methods for minimum statistics noise power spectral density estimation. Signal Process. 86(6), 1215\u20131229 (2006)","journal-title":"Signal Process."},{"issue":"2","key":"3036_CR40","doi-asserted-by":"publisher","first-page":"137","DOI":"10.1109\/TASSP.1980.1163394","volume":"28","author":"R McAulay","year":"1980","unstructured":"R. McAulay, M. Malpass, Speech enhancement using a soft-decision noise suppression filter. IEEE Trans. Acoust. Speech Signal Process. 28(2), 137\u2013145 (1980)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"key":"3036_CR41","unstructured":"G. Mittag. NISQA: Speech Quality and Naturalness Assessment. https:\/\/github.com\/gabrielmittag\/NISQA (2023)"},{"key":"3036_CR42","doi-asserted-by":"crossref","unstructured":"G. Mittag, B. Naderi, A. Chehadi, et\u00a0al.: Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets. arXiv preprint arXiv:2104.09494 (2021)","DOI":"10.21437\/Interspeech.2021-299"},{"issue":"8","key":"3036_CR43","doi-asserted-by":"publisher","first-page":"1006","DOI":"10.1109\/LSP.2014.2379648","volume":"22","author":"GJ Mysore","year":"2014","unstructured":"G.J. Mysore, Can we automatically transform speech recorded on common consumer devices in real-world environments into professional production quality speech?\u00e2\u20ac\u201da dataset, insights, and challenges. IEEE Signal Process. Lett. 22(8), 1006\u20131010 (2014)","journal-title":"IEEE Signal Process. Lett."},{"issue":"4","key":"3036_CR44","doi-asserted-by":"publisher","first-page":"826","DOI":"10.1109\/TASLP.2014.2312332","volume":"22","author":"A Narayanan","year":"2014","unstructured":"A. Narayanan, D. Wang, Investigation of speech separation as a front-end for noise robust speech recognition. IEEE Trans. Audio Speech Lang. Process. 22(4), 826\u2013835 (2014). https:\/\/doi.org\/10.1109\/TASLP.2014.2312332","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"10","key":"3036_CR45","doi-asserted-by":"publisher","first-page":"1345","DOI":"10.1109\/TKDE.2009.191","volume":"22","author":"SJ Pan","year":"2010","unstructured":"S.J. Pan, Q. Yang, A survey on transfer learning. IEEE Trans. Knowl. Data Eng. 22(10), 1345\u20131359 (2010). https:\/\/doi.org\/10.1109\/TKDE.2009.191","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"3036_CR46","doi-asserted-by":"crossref","unstructured":"A. Pandey, D. Wang: A new framework for supervised speech enhancement in the time domain, in Interspeech (2018), pp. 1136\u20131140","DOI":"10.21437\/Interspeech.2018-1223"},{"key":"3036_CR47","doi-asserted-by":"crossref","unstructured":"A. Pandey, D. Wang, Tcnn: Temporal convolutional neural network for real-time speech enhancement in the time domain, in ICASSP 2019\u20132019 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2019), pp. 6875\u20136879","DOI":"10.1109\/ICASSP.2019.8683634"},{"key":"3036_CR48","doi-asserted-by":"crossref","unstructured":"S.R. Park, J. Lee. A fully convolutional neural network for speech enhancement. arXiv preprint arXiv:1609.07132 (2016)","DOI":"10.21437\/Interspeech.2017-1465"},{"key":"3036_CR49","doi-asserted-by":"publisher","unstructured":"S. Pascual, A. Bonafonte, J. Serr\u2018a Segan: Speech enhancement generative adversarial network, in Proceedings of Interspeech (2017), pp. 3642\u20133646. https:\/\/doi.org\/10.48550\/arXiv.1703.09452","DOI":"10.48550\/arXiv.1703.09452"},{"key":"3036_CR50","doi-asserted-by":"crossref","unstructured":"K. Qian, Y. Zhang, S. Chang, et\u00a0al. Speech enhancement using bayesian wavenet, in Interspeech (2017), pp. 2013\u20132017","DOI":"10.21437\/Interspeech.2017-1672"},{"issue":"2","key":"3036_CR51","doi-asserted-by":"publisher","first-page":"220","DOI":"10.1016\/j.specom.2005.08.005","volume":"48","author":"S Rangachari","year":"2006","unstructured":"S. Rangachari, P.C. Loizou, A noise-estimation algorithm for highly non-stationary environments. Speech Commun. 48(2), 220\u2013231 (2006)","journal-title":"Speech Commun."},{"key":"3036_CR52","unstructured":"I. Rec. P. 830: Subjective performance assessment of digital telephone-band and wideband digital codecs. International Telecommunication Union, Geneva (Switzerland) (1996)"},{"key":"3036_CR53","doi-asserted-by":"crossref","unstructured":"R. Rehr, T. Gerkmann, An analysis of noise-aware features in combination with the size and diversity of training data for dnn-based speech enhancement, in ICASSP 2019\u20132019 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2019), pp. 601\u2013605","DOI":"10.1109\/ICASSP.2019.8682991"},{"key":"3036_CR54","doi-asserted-by":"publisher","first-page":"1937","DOI":"10.1109\/TASLP.2021.3082702","volume":"29","author":"R Rehr","year":"2021","unstructured":"R. Rehr, T. Gerkmann, Snr-based features and diverse training data for robust dnn-based speech enhancement. IEEE\/ACM Trans. Audio Speech Lang. Process. 29, 1937\u20131949 (2021)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR55","doi-asserted-by":"publisher","first-page":"2351","DOI":"10.1109\/TASLP.2023.3285241","volume":"31","author":"J Richter","year":"2023","unstructured":"J. Richter, S. Welker, J.M. Lemercier et al., Speech enhancement and dereverberation with diffusion-based generative models. IEEE\/ACM Trans. Audio Speech Lang. Process. 31, 2351\u20132364 (2023). https:\/\/doi.org\/10.1109\/TASLP.2023.3285241","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR56","unstructured":"D. Ryan (????) STOI-Net: A Deep Learning based Non-Intrusive Speech Intelligibility Assessment Model. https:\/\/github.com\/dhimasryan\/STOI-Net"},{"key":"3036_CR57","doi-asserted-by":"crossref","unstructured":"J. Salamon, C. Jacoby, J.P. Bello. A dataset and taxonomy for urban sound research, in Proceedings of the 22nd ACM International Conference on Multimedia (2014), pp. 1041\u20131044","DOI":"10.1145\/2647868.2655045"},{"issue":"6","key":"3036_CR58","doi-asserted-by":"publisher","first-page":"1342","DOI":"10.1109\/JSTSP.2022.3181782","volume":"16","author":"A Sivaraman","year":"2022","unstructured":"A. Sivaraman, M. Kim, Efficient personalized speech enhancement through self-supervised learning. IEEE J. Sel. Top. Signal Process. 16(6), 1342\u20131356 (2022)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"3036_CR59","doi-asserted-by":"publisher","unstructured":"J. Sohn, W. Sung A voice activity detector employing soft decision based noise spectrum adaptation, in Proceedings of the 1998 IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP \u201998 (Cat. No.98CH36181) (1998), pp. 365\u2013368, vol. 1. https:\/\/doi.org\/10.1109\/ICASSP.1998.674443","DOI":"10.1109\/ICASSP.1998.674443"},{"issue":"4","key":"3036_CR60","doi-asserted-by":"publisher","first-page":"478","DOI":"10.1109\/89.848229","volume":"8","author":"S Tanyer","year":"2000","unstructured":"S. Tanyer, H. Ozer, Voice activity detection in nonstationary noise. IEEE Trans. Speech Audio Process. 8(4), 478\u2013482 (2000). https:\/\/doi.org\/10.1109\/89.848229","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"4","key":"3036_CR61","first-page":"377","volume":"139","author":"R Tucker","year":"1992","unstructured":"R. Tucker, Voice activity detection using a periodicity measure. IEE Proc. I (Commun. Speech Vis.) 139(4), 377\u2013380 (1992)","journal-title":"IEE Proc. I (Commun. Speech Vis.)"},{"key":"3036_CR62","doi-asserted-by":"crossref","unstructured":"Q. Wang, J. Du, L.R. Dai, et\u00a0al. Joint noise and mask aware training for dnn-based speech enhancement with sub-band features, in 2017 Hands-free Speech Communications and Microphone Arrays (HSCMA), (IEEE, 2017), pp. 101\u2013105","DOI":"10.1109\/HSCMA.2017.7895570"},{"issue":"12","key":"3036_CR63","doi-asserted-by":"publisher","first-page":"1849","DOI":"10.1109\/TASLP.2014.2352935","volume":"22","author":"Y Wang","year":"2014","unstructured":"Y. Wang, A. Narayanan, D. Wang, On training targets for supervised speech separation. IEEE\/ACM Trans. Audio Speech Lang. Process. 22(12), 1849\u20131858 (2014)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR64","unstructured":"Y.C. Wang, S. Venkataramani, P. Smaragdis Self-supervised learning for speech enhancement. arXiv preprint arXiv:2006.10388 (2020)"},{"key":"3036_CR65","first-page":"3846","volume":"2020","author":"S Wisdom","year":"2020","unstructured":"S. Wisdom, E. Tzinis, H. Erdogan et al., Unsupervised sound separation using mixture invariant training. Proc. NeurIPS 2020, 3846\u20133857 (2020)","journal-title":"Proc. NeurIPS"},{"issue":"6","key":"3036_CR66","doi-asserted-by":"publisher","first-page":"1329","DOI":"10.1109\/JSTSP.2022.3200911","volume":"16","author":"S Wisdom","year":"2022","unstructured":"S. Wisdom, E. Tzinis, H. Erdogan et al., Remixit: continual self-training of speech enhancement models via bootstrapped remixing. IEEE J. Sel. Top. Signal Process. 16(6), 1329\u20131341 (2022). https:\/\/doi.org\/10.1109\/JSTSP.2022.3200911","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"3036_CR67","doi-asserted-by":"crossref","unstructured":"Y. Xiang, J.L. H\u00f8jvang, M.H. Rasmussen et al., A bayesian permutation training deep representation learning method for speech enhancement with variational autoencoder, in ICASSP 2022\u20132022 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2022), pp. 381\u2013385","DOI":"10.1109\/ICASSP43922.2022.9747036"},{"key":"3036_CR68","doi-asserted-by":"crossref","unstructured":"Y. Xu, J. Du, L.R. Dai, et\u00a0al. Dynamic noise aware training for speech enhancement based on deep neural networks, in Fifteenth Annual Conference of the International Speech Communication Association (2014a)","DOI":"10.21437\/Interspeech.2014-571"},{"issue":"1","key":"3036_CR69","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1109\/TASLP.2014.2364452","volume":"23","author":"Y Xu","year":"2014","unstructured":"Y. Xu, J. Du, L.R. Dai et al., A regression approach to speech enhancement based on deep neural networks. IEEE\/ACM Trans. Audio Speech Lang. Process. 23(1), 7\u201319 (2014)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"3036_CR70","doi-asserted-by":"publisher","unstructured":"S.w. Yang, P.H. Chi, Y.S. Chuang, et\u00a0al. Superb: Speech processing universal performance benchmark, in Proceedings of Interspeech (2021), pp. 1194\u20131198. https:\/\/doi.org\/10.21437\/Interspeech.2021-1775","DOI":"10.21437\/Interspeech.2021-1775"},{"key":"3036_CR71","doi-asserted-by":"publisher","unstructured":"V. Zadorozhnyy, Q. Ye, K. K. Scp-gan: Self-correcting discriminator optimization for training consistency preserving metric gan on speech enhancement tasks, in Proceedings of Interspeech (2023), pp. 2463\u20132467. https:\/\/doi.org\/10.48550\/arXiv.2210.14474","DOI":"10.48550\/arXiv.2210.14474"},{"key":"3036_CR72","unstructured":"R.E. Zezario, S.W. Fu, C.S. Fuh, et\u00a0al. Stoi-net: A deep learning based non-intrusive speech intelligibility assessment model, in 2020 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), (IEEE, 2020), pp. 482\u2013486"},{"key":"3036_CR73","doi-asserted-by":"crossref","unstructured":"H. Zhao, S. Zarar, I. Tashev et al., Convolutional-recurrent neural networks for speech enhancement, in 2018 IEEE International Conference on Acoustics. (IEEE, Speech and Signal Processing (ICASSP), 2018), pp. 2401\u20132405","DOI":"10.1109\/ICASSP.2018.8462155"},{"key":"3036_CR74","doi-asserted-by":"publisher","unstructured":"J. Zhu, T. Park, P. Isola, et\u00a0al. Unpaired image-to-image translation using cycle-consistent adversarial networks, in Proceedings of the IEEE International Conference on Computer Vision (ICCV) (2017), pp. 2242\u20132251. https:\/\/doi.org\/10.1109\/ICCV.2017.244","DOI":"10.1109\/ICCV.2017.244"}],"container-title":["Circuits, Systems, and Signal Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-025-03036-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00034-025-03036-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-025-03036-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T21:02:11Z","timestamp":1751403731000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00034-025-03036-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3,10]]},"references-count":74,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2025,7]]}},"alternative-id":["3036"],"URL":"https:\/\/doi.org\/10.1007\/s00034-025-03036-6","relation":{},"ISSN":["0278-081X","1531-5878"],"issn-type":[{"type":"print","value":"0278-081X"},{"type":"electronic","value":"1531-5878"}],"subject":[],"published":{"date-parts":[[2025,3,10]]},"assertion":[{"value":"2 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"2 February 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 February 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 March 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}