{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T19:08:54Z","timestamp":1781291334329,"version":"3.54.1"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"43-44","license":[{"start":{"date-parts":[[2020,8,29]],"date-time":"2020-08-29T00:00:00Z","timestamp":1598659200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,8,29]],"date-time":"2020-08-29T00:00:00Z","timestamp":1598659200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100002790","name":"Canadian Network for Research and Innovation in Machining Technology, Natural Sciences and Engineering Research Council of Canada","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100002790","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2020,11]]},"DOI":"10.1007\/s11042-020-09563-5","type":"journal-article","created":{"date-parts":[[2020,8,29]],"date-time":"2020-08-29T09:02:42Z","timestamp":1598691762000},"page":"32643-32663","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["A hybrid speech enhancement system with DNN based speech reconstruction and Kalman filtering"],"prefix":"10.1007","volume":"79","author":[{"given":"Hongjiang","family":"Yu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wei-Ping","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhiheng","family":"Ouyang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Benoit","family":"Champagne","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2020,8,29]]},"reference":[{"key":"9563_CR1","doi-asserted-by":"crossref","unstructured":"Donahue C, Li B, Prabhavalkar R (2018) Exploring speech enhancement with generative adversarial networks for robust speech recognition. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 5024\u20135028","DOI":"10.1109\/ICASSP.2018.8462581"},{"key":"9563_CR2","doi-asserted-by":"crossref","unstructured":"Fu SW, Hu T, Tsao Y, Lu X (2017) Complex spectrogram enhancement by convolutional neural network with multi-metrics learning. In: Machine Learning for Signal Processing (MLSP), pp 1\u20136","DOI":"10.1109\/MLSP.2017.8168119"},{"issue":"4","key":"9563_CR3","doi-asserted-by":"publisher","first-page":"373","DOI":"10.1109\/89.701367","volume":"6","author":"S Gannot","year":"1998","unstructured":"Gannot S, Burshtein D, Weinstein E (1998) Iterative and sequential Kalman filter-based speech enhancement algorithms. IEEE Transactions on Speech and Audio Processing 6(4):373\u2013385","journal-title":"IEEE Transactions on Speech and Audio Processing"},{"issue":"8","key":"9563_CR4","doi-asserted-by":"publisher","first-page":"1732","DOI":"10.1109\/78.91144","volume":"39","author":"JD Gibson","year":"1991","unstructured":"Gibson JD, Koo B, Gray SD (1991) Filtering of colored noise for speech enhancement and coding. IEEE Trans. Signal Process. 39(8):1732\u20131742","journal-title":"IEEE Trans. Signal Process."},{"key":"9563_CR5","doi-asserted-by":"crossref","unstructured":"Han W, Zhang X, Min G, Sun M, Yang J (2016) Joint optimization of audible noise suppression and deep neural networks for single-channel speech enhancement. In: IEEE International Conference on Multimedia and Expo (ICME), pp 1\u20136","DOI":"10.1109\/ICME.2016.7552957"},{"key":"9563_CR6","doi-asserted-by":"publisher","first-page":"225","DOI":"10.1109\/TAU.1969.1162058","volume":"17","author":"IEEE Subcommittee","year":"1969","unstructured":"IEEE Subcommittee (1969) IEEE recommended practice for speech quality measurements. IEEE Transactions on Audio and Electroacoustics 17:225\u2013246","journal-title":"IEEE Transactions on Audio and Electroacoustics"},{"key":"9563_CR7","unstructured":"ITU-R (2001) Perceptual evaluation of speech quality (PESQ) an objective method for end-to-end speech quality assessment of narrowband telephone networks and speech codecs. Recommendation P862"},{"issue":"3","key":"9563_CR8","doi-asserted-by":"publisher","first-page":"398","DOI":"10.4218\/etrij.17.0116.0773","volume":"39","author":"KM Jeon","year":"2017","unstructured":"Jeon KM, Park SY, Chun CJ, Park NI, Kim HK (2017) Multi-band approach to deep learning-based artificial stereo extension. ETRI J. 39(3):398\u2013405","journal-title":"ETRI J."},{"key":"9563_CR9","doi-asserted-by":"crossref","unstructured":"Kavalekalam MS, Christensen MG, Gran F, Boldt JB (2016) Kalman filter for speech enhancement in cocktail party scenarios using a codebook-based approach. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 191\u2013195","DOI":"10.1109\/ICASSP.2016.7471663"},{"issue":"12","key":"9563_CR10","doi-asserted-by":"publisher","first-page":"1931","DOI":"10.1109\/TASLP.2014.2354236","volume":"22","author":"M Krawczyk","year":"2014","unstructured":"Krawczyk M, Gerkmann T (2014) STFT phase reconstruction in voiced speech for an improved single-channel speech enhancement. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 22(12):1931\u20131940","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP)"},{"issue":"12","key":"9563_CR11","doi-asserted-by":"publisher","first-page":"1586","DOI":"10.1109\/PROC.1979.11540","volume":"67","author":"JS Lim","year":"1979","unstructured":"Lim JS, Oppenheim AV (1979) Enhancement and bandwidth compression of noisy speech. Proc. IEEE 67(12):1586\u20131604","journal-title":"Proc. IEEE"},{"key":"9563_CR12","doi-asserted-by":"crossref","unstructured":"Loweimi E, Barker J, Hain T (2017) Statistical normalisation of phase-based feature representation for robust speech recognition. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 5310\u20135314","DOI":"10.1109\/ICASSP.2017.7953170"},{"issue":"3","key":"9563_CR13","doi-asserted-by":"publisher","first-page":"448","DOI":"10.1016\/j.sigpro.2007.09.003","volume":"88","author":"IV McLoughlin","year":"2008","unstructured":"McLoughlin IV (2008) Line spectral pairs. Signal processing 88(3):448\u2013467","journal-title":"Signal processing"},{"issue":"2","key":"9563_CR14","doi-asserted-by":"publisher","first-page":"545","DOI":"10.1016\/j.aeue.2014.11.007","volume":"69","author":"T Mellahi","year":"2015","unstructured":"Mellahi T, Hamdi R (2015) LPC-based formant enhancement method in Kalman filtering for speech enhancement. AEU-International Journal of Electronics and Communications 69(2):545\u2013554","journal-title":"AEU-International Journal of Electronics and Communications"},{"key":"9563_CR15","unstructured":"Moattar MH, Homayounpour MM (2009) A simple but efficient real-time voice activity detection algorithm. In: European Signal Processing Conference (EUSIPCO), pp 2549\u20132553"},{"key":"9563_CR16","doi-asserted-by":"crossref","unstructured":"Narayanan A, Wang D (2013) Ideal ratio mask estimation using deep neural networks for robust speech recognition. In: IEEE Int. Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 7092\u20137096","DOI":"10.1109\/ICASSP.2013.6639038"},{"key":"9563_CR17","doi-asserted-by":"publisher","first-page":"44","DOI":"10.1016\/j.specom.2019.06.002","volume":"111","author":"A Nicolson","year":"2019","unstructured":"Nicolson A, Paliwal KK (2019) Deep learning for minimum mean-square error approaches to speech enhancement. Speech Comm. 111:44\u201355","journal-title":"Speech Comm."},{"key":"9563_CR18","doi-asserted-by":"crossref","unstructured":"Nie S, Liang S, Liu B, Zhang Y, Liu W, Tao J (2018) Deep noise tracking network: A hybrid signal processing\/deep learning approach to speech enhancement. In: Proceedings of Interspeech, pp 3219\u20133223","DOI":"10.21437\/Interspeech.2018-1020"},{"key":"9563_CR19","doi-asserted-by":"publisher","first-page":"13","DOI":"10.1016\/j.specom.2015.02.006","volume":"70","author":"N Nower","year":"2015","unstructured":"Nower N, Liu Y, Unoki M (2015) Restoration scheme of instantaneous amplitude and phase using Kalman filter with efficient linear prediction for speech enhancement. Speech Comm. 70:13\u201327","journal-title":"Speech Comm."},{"key":"9563_CR20","doi-asserted-by":"crossref","unstructured":"Ouyang Z, Yu H, Zhu WP, Champagne B (2018) A deep neural network based harmonic noise model for speech enhancement. In: Proceedings of Interspeech, pp 3224\u20133228","DOI":"10.21437\/Interspeech.2018-1114"},{"key":"9563_CR21","doi-asserted-by":"crossref","unstructured":"Ouyang Z, Yu H, Zhu WP, Champagne B (2019) A fully convolutional neural network for complex spectrogram processing in speech enhancement. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 5756\u20135760","DOI":"10.1109\/ICASSP.2019.8683423"},{"key":"9563_CR22","doi-asserted-by":"crossref","unstructured":"Paliwal K, Basu A (1987) A speech enhancement method based on Kalman filtering. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), vol 12, pp 177\u2013180","DOI":"10.1109\/ICASSP.1987.1169756"},{"issue":"4","key":"9563_CR23","doi-asserted-by":"publisher","first-page":"465","DOI":"10.1016\/j.specom.2010.12.003","volume":"53","author":"K Paliwal","year":"2011","unstructured":"Paliwal K, W\u00f3jcicki K, Shannon B (2011) The importance of phase in speech enhancement. Speech Comm. 53(4):465\u2013494","journal-title":"Speech Comm."},{"key":"9563_CR24","doi-asserted-by":"crossref","unstructured":"Pascual S, Bonafonte A, Serra J (2017) SEGAN: Speech enhancement generative adversarial network. In: Proceedings of Interspeech, pp 3642\u20133646","DOI":"10.21437\/Interspeech.2017-1428"},{"key":"9563_CR25","doi-asserted-by":"crossref","unstructured":"Roy SK, Zhu WP, Champagne B (2016) Single channel speech enhancement using subband iterative Kalman filter. In: IEEE International Symposium on Circuits and Systems (ISCAS), pp 762\u2013765","DOI":"10.1109\/ISCAS.2016.7527352"},{"issue":"5","key":"9563_CR26","doi-asserted-by":"publisher","first-page":"1867","DOI":"10.1109\/TSA.2005.858512","volume":"14","author":"G Shi","year":"2006","unstructured":"Shi G, Shanechi MM, Aarabi P (2006) On the importance of phase in human speech recognition. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 14(5):1867\u20131874","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP)"},{"key":"9563_CR27","doi-asserted-by":"crossref","unstructured":"So S, W\u00f3jcicki KK, Lyons JG, Stark AP, Paliwal KK (2009) Kalman fitler with phase spectrum compensation algorithm for speech enhancement. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 4405\u20134408","DOI":"10.1109\/ICASSP.2009.4960606"},{"key":"9563_CR28","doi-asserted-by":"crossref","unstructured":"Soni MH, Shah N, Patil HA (2018) Time-frequency masking-based speech enhancement using generative adversarial network. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 5039\u20135043","DOI":"10.1109\/ICASSP.2018.8462068"},{"key":"9563_CR29","unstructured":"Srivastava A, Valkov L, Russell C, Gutmann MU, Sutton C (2017) veegan: Reducing mode collapse in gans using implicit variational learning. In: Advances in Neural Information Processing Systems, pp 3308\u20133318"},{"issue":"7","key":"9563_CR30","doi-asserted-by":"publisher","first-page":"2125","DOI":"10.1109\/TASL.2011.2114881","volume":"19","author":"CH Taal","year":"2011","unstructured":"Taal CH, Hendriks RC, Heusdens R, Jensen J (2011) An algorithm for intelligibility prediction of time-frequency weighted noisy speech. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 19(7):2125\u20132136","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP)"},{"key":"9563_CR31","doi-asserted-by":"crossref","unstructured":"Tu M, Zhang X (2017) Speech enhancement based on deep neural networks with skip connections. In: IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp 5565\u20135569","DOI":"10.1109\/ICASSP.2017.7953221"},{"issue":"3","key":"9563_CR32","doi-asserted-by":"publisher","first-page":"247","DOI":"10.1016\/0167-6393(93)90095-3","volume":"12","author":"A Varga","year":"1993","unstructured":"Varga A, Steeneken HJ (1993) Assessment for automatic speech recognition: II. NOISEX-92: A database and an experiment to study the effect of additive noise on speech recognition systems. Speech Comm. 12(3):247\u2013251","journal-title":"Speech Comm."},{"key":"9563_CR33","first-page":"1","volume":"139","author":"EA Wan","year":"1999","unstructured":"Wan EA, Nelson AT (1999) Networks for speech enhancement. Handbook of neural networks for speech processing 139:1","journal-title":"Handbook of neural networks for speech processing"},{"issue":"4","key":"9563_CR34","doi-asserted-by":"publisher","first-page":"679","DOI":"10.1109\/TASSP.1982.1163920","volume":"30","author":"D Wang","year":"1982","unstructured":"Wang D, Lim J (1982) The unimportance of phase in speech enhancement. IEEE Transactions on Acoustics, Speech, and Signal Processing 30 (4):679\u2013681","journal-title":"IEEE Transactions on Acoustics, Speech, and Signal Processing"},{"key":"9563_CR35","doi-asserted-by":"crossref","unstructured":"Wang Q, Muckenhirn H, Wilson K, Sridhar P, Wu Z (2019) VoiceFilter: Targeted voice separation by speaker-conditioned spectrogram masking. In: Proceedings of Interspeech, pp 2728\u20132732","DOI":"10.21437\/Interspeech.2019-1101"},{"issue":"2","key":"9563_CR36","doi-asserted-by":"publisher","first-page":"270","DOI":"10.1109\/TASL.2012.2221459","volume":"21","author":"Y Wang","year":"2013","unstructured":"Wang Y, Han K, Wang D (2013) Exploring monaural features for classification-based speech segregation. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 21(2):270\u2013279","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP)"},{"issue":"12","key":"9563_CR37","doi-asserted-by":"publisher","first-page":"1849","DOI":"10.1109\/TASLP.2014.2352935","volume":"22","author":"Y Wang","year":"2014","unstructured":"Wang Y, Narayanan A, Wang D (2014) On training targets for supervised speech separation. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 22(12):1849\u20131858","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP)"},{"key":"9563_CR38","doi-asserted-by":"crossref","unstructured":"Williamson D, Wang D (2017) Time-frequency masking in the complex domain for speech dereverberation and denoising. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 25(7)","DOI":"10.1109\/TASLP.2017.2696307"},{"issue":"3","key":"9563_CR39","doi-asserted-by":"publisher","first-page":"483","DOI":"10.1109\/TASLP.2015.2512042","volume":"24","author":"DS Williamson","year":"2016","unstructured":"Williamson DS, Wang Y, Wang D (2016) Complex ratio masking for monaural speech separation. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 24(3):483\u2013492","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP)"},{"key":"9563_CR40","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1016\/j.neunet.2015.03.008","volume":"67","author":"Y Xia","year":"2015","unstructured":"Xia Y, Wang J (2015) Low-dimensional recurrent neural network-based Kalman filter for speech enhancement. Neural Netw. 67:131\u2013139","journal-title":"Neural Netw."},{"issue":"1","key":"9563_CR41","doi-asserted-by":"publisher","first-page":"65","DOI":"10.1109\/LSP.2013.2291240","volume":"21","author":"Y Xu","year":"2013","unstructured":"Xu Y, Du J, Dai LR, Lee CH (2013) An experimental study on speech enhancement based on deep neural networks. IEEE Signal Processing Letters 21(1):65\u201368","journal-title":"IEEE Signal Processing Letters"},{"issue":"1","key":"9563_CR42","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1109\/TASLP.2014.2364452","volume":"23","author":"Y Xu","year":"2015","unstructured":"Xu Y, Du J, Dai LR, Lee CH (2015) A regression approach to speech enhancement based on deep neural networks. IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP) 23(1):7\u201319","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing (TASLP)"},{"key":"9563_CR43","doi-asserted-by":"crossref","unstructured":"Yu H, Ouyang Z, Zhu WP, Champagne B (2019) A deep neural network based Kalman filter fortime domain speech enhancement. In: IEEE International Symposium on Circuits and Systems (ISCAS), pp 1\u20135","DOI":"10.1109\/ISCAS.2019.8702161"},{"issue":"1","key":"9563_CR44","doi-asserted-by":"publisher","first-page":"63","DOI":"10.1109\/TASLP.2018.2870742","volume":"27","author":"N Zheng","year":"2018","unstructured":"Zheng N, Zhang XL (2018) Phase-aware speech enhancement based on deep neural networks. IEEE\/ACM Transactions on Audio, Speech, and Language Processing (TASLP) 27(1):63\u201376","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing (TASLP)"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09563-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11042-020-09563-5\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-020-09563-5.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,8,28]],"date-time":"2021-08-28T23:19:31Z","timestamp":1630192771000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11042-020-09563-5"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,8,29]]},"references-count":44,"journal-issue":{"issue":"43-44","published-print":{"date-parts":[[2020,11]]}},"alternative-id":["9563"],"URL":"https:\/\/doi.org\/10.1007\/s11042-020-09563-5","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020,8,29]]},"assertion":[{"value":"10 November 2019","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 June 2020","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 August 2020","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 August 2020","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}