{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,10]],"date-time":"2025-09-10T22:07:02Z","timestamp":1757542022017,"version":"3.37.3"},"reference-count":69,"publisher":"Springer Science and Business Media LLC","issue":"10","license":[{"start":{"date-parts":[[2020,10,16]],"date-time":"2020-10-16T00:00:00Z","timestamp":1602806400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2020,10,16]],"date-time":"2020-10-16T00:00:00Z","timestamp":1602806400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"name":"Abu-Dhabi Department of Education and Knowledge (ADEK) Award for Research Excellence 2019","award":["Grant AARE19-245"],"award-info":[{"award-number":["Grant AARE19-245"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Ambient Intell Human Comput"],"published-print":{"date-parts":[[2021,10]]},"DOI":"10.1007\/s12652-020-02598-4","type":"journal-article","created":{"date-parts":[[2020,10,16]],"date-time":"2020-10-16T10:03:28Z","timestamp":1602842608000},"page":"9037-9052","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":12,"title":["Multi-objective long-short term memory recurrent neural networks for speech enhancement"],"prefix":"10.1007","volume":"12","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0010-0629","authenticated-orcid":false,"given":"Nasir","family":"Saleem","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4655-938X","authenticated-orcid":false,"given":"Muhammad Irfan","family":"Khattak","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3629-2987","authenticated-orcid":false,"given":"Mu\u2019ath","family":"Al-Hasan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Atif","family":"Jan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2020,10,16]]},"reference":[{"key":"2598_CR1","unstructured":"American National Standards Institute (1997) American National Standard: methods for calculation of the speech intelligibility index. Acoustical Society of America, New York"},{"issue":"2","key":"2598_CR2","doi-asserted-by":"publisher","first-page":"113","DOI":"10.1109\/TASSP.1979.1163209","volume":"27","author":"S Boll","year":"1979","unstructured":"Boll S (1979) Suppression of acoustic noise in speech using spectral subtraction. IEEE Trans Acoust Speech Signal Process 27(2):113\u2013120","journal-title":"IEEE Trans Acoust Speech Signal Process"},{"issue":"6","key":"2598_CR3","doi-asserted-by":"publisher","first-page":"4705","DOI":"10.1121\/1.4986931","volume":"141","author":"J Chen","year":"2017","unstructured":"Chen J, Wang D (2017) Long short-term memory for speaker generalization in supervised speech separation. J Acoust Soc Am 141(6):4705\u20134714","journal-title":"J Acoust Soc Am"},{"issue":"11","key":"2598_CR4","doi-asserted-by":"publisher","first-page":"2403","DOI":"10.1016\/S0165-1684(01)00128-1","volume":"81","author":"I Cohen","year":"2001","unstructured":"Cohen I, Berdugo B (2001) Speech enhancement for non-stationary noise environments. Signal Process 81(11):2403\u20132418","journal-title":"Signal Process"},{"issue":"2","key":"2598_CR5","doi-asserted-by":"publisher","first-page":"443","DOI":"10.1109\/TASSP.1985.1164550","volume":"33","author":"Y Ephraim","year":"1985","unstructured":"Ephraim Y, Malah D (1985) Speech enhancement using a minimum mean-square error log-spectral amplitude estimator. IEEE Trans Acoust Speech Signal Process 33(2):443\u2013445","journal-title":"IEEE Trans Acoust Speech Signal Process"},{"issue":"4","key":"2598_CR6","doi-asserted-by":"publisher","first-page":"251","DOI":"10.1109\/89.397090","volume":"3","author":"Y Ephraim","year":"1995","unstructured":"Ephraim Y, Van Trees HL (1995) A signal subspace approach for speech enhancement. IEEE Trans Speech Audio Process 3(4):251\u2013266","journal-title":"IEEE Trans Speech Audio Process"},{"key":"2598_CR7","doi-asserted-by":"publisher","first-page":"708","DOI":"10.1109\/ICASSP.2015.7178061","volume-title":"2015 IEEE international conference on acoustics, speech and signal processing (ICASSP)","author":"H Erdogan","year":"2015","unstructured":"Erdogan H, Hershey JR, Watanabe S, Le Roux J (2015) Phase-sensitive and recognition-boosted speech separation using deep recurrent neural networks. In: 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, Brisbane, QLD, pp 708\u2013712"},{"key":"2598_CR8","doi-asserted-by":"publisher","first-page":"3158","DOI":"10.1109\/ICASSP.2013.6638240","volume-title":"2013 IEEE international conference on acoustics, speech and signal processing","author":"C F\u00e9votte","year":"2013","unstructured":"F\u00e9votte C, Le Roux J, Hershey JR (2013) Non-negative dynamical system with application to speech and audio. In: 2013 IEEE international conference on acoustics, speech and signal processing. IEEE, Vancouver, BC, pp 3158\u20133162"},{"key":"2598_CR9","doi-asserted-by":"publisher","first-page":"1121","DOI":"10.1109\/ICASSP.1985.1168461","volume-title":"ICASSP\u201985. IEEE international conference on acoustics, speech, and signal processing","author":"D Friedman","year":"1985","unstructured":"Friedman D (1985) Instantaneous-frequency distribution vs. time: an interpretation of the phase structure of speech. In: ICASSP\u201985. IEEE international conference on acoustics, speech, and signal processing, vol 10. IEEE, Tampa, FL, pp 1121\u20131124"},{"key":"2598_CR10","doi-asserted-by":"publisher","unstructured":"Gao T, Du J, Dai LR, Lee CH (2016) SNR-based progressive learning of deep neural network for speech enhancement. In: INTERSPEECH, pp 3713\u20133717. https:\/\/doi.org\/10.21437\/Interspeech.2016-224","DOI":"10.21437\/Interspeech.2016-224"},{"issue":"2","key":"2598_CR11","doi-asserted-by":"publisher","first-page":"55","DOI":"10.1109\/MSP.2014.2369251","volume":"32","author":"T Gerkmann","year":"2015","unstructured":"Gerkmann T, Krawczyk-Becker M, Le Roux J (2015) Phase processing for single-channel speech enhancement: history and recent advances. IEEE Signal Process Mag 32(2):55\u201366","journal-title":"IEEE Signal Process Mag"},{"key":"2598_CR12","unstructured":"Google (2017) Cloud speech API. https:\/\/cloud.google.com\/speech\/"},{"issue":"2","key":"2598_CR13","doi-asserted-by":"publisher","first-page":"236","DOI":"10.1109\/TASSP.1984.1164317","volume":"32","author":"D Griffin","year":"1984","unstructured":"Griffin D, Lim J (1984) Signal estimation from modified short-time Fourier transform. IEEE Trans Acoust Speech Signal Process 32(2):236\u2013243","journal-title":"IEEE Trans Acoust Speech Signal Process"},{"issue":"5","key":"2598_CR14","doi-asserted-by":"publisher","first-page":"3475","DOI":"10.1121\/1.4754541","volume":"132","author":"K Han","year":"2012","unstructured":"Han K, Wang D (2012) A classification based approach to speech segregation. J Acoust Soc Am 132(5):3475\u20133483","journal-title":"J Acoust Soc Am"},{"issue":"8","key":"2598_CR15","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"issue":"12","key":"2598_CR16","doi-asserted-by":"publisher","first-page":"2136","DOI":"10.1109\/TASLP.2015.2468583","volume":"23","author":"PS Huang","year":"2015","unstructured":"Huang PS, Kim M, Hasegawa-Johnson M, Smaragdis P (2015) Joint optimization of masks and deep recurrent neural networks for monaural source separation. IEEE\/ACM Trans Audio Speech Lang Process 23(12):2136\u20132147","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"issue":"5","key":"2598_CR17","doi-asserted-by":"publisher","first-page":"1787","DOI":"10.1007\/s12652-017-0644-8","volume":"10","author":"Y Huang","year":"2019","unstructured":"Huang Y, Tian K, Wu A, Zhang G (2019) Feature fusion methods research based on deep belief networks for speech emotion recognition under noise condition. J Ambient Intell Humaniz Comput 10(5):1787\u20131798","journal-title":"J Ambient Intell Humaniz Comput"},{"issue":"11","key":"2598_CR18","doi-asserted-by":"publisher","first-page":"2009","DOI":"10.1109\/TASLP.2016.2585878","volume":"24","author":"J Jensen","year":"2016","unstructured":"Jensen J, Taal CH (2016) An algorithm for predicting the intelligibility of speech masked by modulated noise maskers. IEEE\/ACM Trans Audio Speech Lang Process 24(11):2009\u20132022","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"issue":"4","key":"2598_CR19","doi-asserted-by":"publisher","first-page":"625","DOI":"10.1109\/TASL.2008.2010633","volume":"17","author":"Z Jin","year":"2009","unstructured":"Jin Z, Wang D (2009) A supervised learning approach to monaural segregation of reverberant speech. IEEE Trans Audio Speech Lang Process 17(4):625\u2013638","journal-title":"IEEE Trans Audio Speech Lang Process"},{"issue":"1","key":"2598_CR20","doi-asserted-by":"publisher","first-page":"153","DOI":"10.1109\/TASLP.2016.2628641","volume":"25","author":"M Kolb\u00e6k","year":"2016","unstructured":"Kolb\u00e6k M, Tan ZH, Jensen J (2016) Speech intelligibility potential of general and specialized deep neural network based speech enhancement systems. IEEE\/ACM Trans Audio Speech Lang Process 25(1):153\u2013167","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"issue":"12","key":"2598_CR21","doi-asserted-by":"publisher","first-page":"1931","DOI":"10.1109\/TASLP.2014.2354236","volume":"22","author":"M Krawczyk","year":"2014","unstructured":"Krawczyk M, Gerkmann T (2014) STFT phase reconstruction in voiced speech for an improved single-channel speech enhancement. IEEE\/ACM Trans Audio Speech Lang Process 22(12):1931\u20131940","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"issue":"5","key":"2598_CR22","doi-asserted-by":"publisher","first-page":"598","DOI":"10.1109\/LSP.2014.2365040","volume":"22","author":"J Kulmer","year":"2014","unstructured":"Kulmer J, Mowlaee P (2014) Phase estimation in single channel speech enhancement using phase decomposition. IEEE Signal Process Lett 22(5):598\u2013602","journal-title":"IEEE Signal Process Lett"},{"issue":"4","key":"2598_CR23","doi-asserted-by":"publisher","first-page":"450","DOI":"10.1109\/LSP.2014.2362556","volume":"22","author":"K Kwon","year":"2014","unstructured":"Kwon K, Shin JW, Kim NS (2014) NMF-based speech enhancement using bases update. IEEE Signal Process Lett 22(4):450\u2013454","journal-title":"IEEE Signal Process Lett"},{"key":"2598_CR24","doi-asserted-by":"publisher","first-page":"35","DOI":"10.1016\/j.bspc.2018.09.010","volume":"48","author":"YH Lai","year":"2019","unstructured":"Lai YH, Zheng WZ (2019) Multi-objective learning based speech enhancement method to increase speech quality and intelligibility for hearing aid device users. Biomed Signal Process Control 48:35\u201345","journal-title":"Biomed Signal Process Control"},{"key":"2598_CR25","first-page":"10","volume":"5","author":"J Le Roux","year":"2011","unstructured":"Le Roux J (2011) Phase-controlled sound transfer based on maximally-inconsistent spectrograms. Signal 5:10","journal-title":"Signal"},{"issue":"3","key":"2598_CR26","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1109\/LSP.2012.2225617","volume":"20","author":"J Le Roux","year":"2012","unstructured":"Le Roux J, Vincent E (2012) Consistent Wiener filtering for audio source separation. IEEE Signal Process Lett 20(3):217\u2013220","journal-title":"IEEE Signal Process Lett"},{"key":"2598_CR27","doi-asserted-by":"publisher","first-page":"48464","DOI":"10.1109\/ACCESS.2020.2979554","volume":"8","author":"R Liang","year":"2020","unstructured":"Liang R, Kong F, Xie Y, Tang G, Cheng J (2020) Real-time speech enhancement algorithm based on attention LSTM. IEEE Access 8:48464\u201348476","journal-title":"IEEE Access"},{"issue":"12","key":"2598_CR28","doi-asserted-by":"publisher","first-page":"2092","DOI":"10.1109\/TASLP.2019.2941148","volume":"27","author":"Y Liu","year":"2019","unstructured":"Liu Y, Wang D (2019) Divide and conquer: a deep casa approach to talker-independent monaural speaker separation. IEEE\/ACM Trans Audio Speech Lang Process 27(12):2092\u20132102","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"2598_CR29","doi-asserted-by":"publisher","first-page":"106","DOI":"10.1016\/j.specom.2018.06.002","volume":"104","author":"HP Liu","year":"2018","unstructured":"Liu HP, Tsao Y, Fuh CS (2018) Bone-conducted speech enhancement using deep denoising autoencoder. Speech Commun 104:106\u2013112","journal-title":"Speech Commun"},{"key":"2598_CR30","doi-asserted-by":"publisher","DOI":"10.1201\/b14529","volume-title":"Speech enhancement: theory and practice","author":"PC Loizou","year":"2013","unstructured":"Loizou PC (2013) Speech enhancement: theory and practice. CRC Press, Boca Raton"},{"key":"2598_CR31","doi-asserted-by":"publisher","first-page":"4990","DOI":"10.1109\/ICASSP.2016.7472627","volume-title":"2016 IEEE international conference on acoustics, speech and signal processing (ICASSP)","author":"R Maia","year":"2016","unstructured":"Maia R, Stylianou Y (2016) Iterative estimation of phase using complex cepstrum representation. In: 2016 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, Shanghai, pp 4990\u20134994"},{"key":"2598_CR32","doi-asserted-by":"crossref","unstructured":"Mamun N, Khorram S, Hansen JH (2019) Convolutional neural network-based speech enhancement for cochlear implant recipients. arXiv preprint. arXiv:1907.02526","DOI":"10.21437\/Interspeech.2019-1850"},{"key":"2598_CR33","first-page":"1","volume-title":"2016 IEEE international workshop on acoustic signal enhancement (IWAENC)","author":"G Min","year":"2016","unstructured":"Min G, Zhang X, Zou X, Sun M (2016) Mask estimate through Itakura-Saito nonnegative RPCA for speech enhancement. In: 2016 IEEE international workshop on acoustic signal enhancement (IWAENC). IEEE, Xi\u2019an, pp 1\u20135"},{"issue":"8","key":"2598_CR34","doi-asserted-by":"publisher","first-page":"1283","DOI":"10.1109\/TASLP.2015.2430820","volume":"23","author":"P Mowlaee","year":"2015","unstructured":"Mowlaee P, Kulmer J (2015) Phase estimation in single-channel speech enhancement: limits-potential. IEEE\/ACM Trans Audio Speech Lang Process 23(8):1283\u20131294","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"2598_CR35","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.specom.2016.04.002","volume":"81","author":"P Mowlaee","year":"2016","unstructured":"Mowlaee P, Saeidi R, Stylianou Y (2016) Advances in phase-aware signal processing in speech communication. Speech Commun 81:1\u201329","journal-title":"Speech Commun"},{"key":"2598_CR36","doi-asserted-by":"publisher","first-page":"44","DOI":"10.1016\/j.specom.2019.06.002","volume":"111","author":"A Nicolson","year":"2019","unstructured":"Nicolson A, Paliwal KK (2019) Deep learning for minimum mean-square error approaches to speech enhancement. Speech Commun 111:44\u201355","journal-title":"Speech Commun"},{"issue":"4","key":"2598_CR37","doi-asserted-by":"publisher","first-page":"465","DOI":"10.1016\/j.specom.2010.12.003","volume":"53","author":"K Paliwal","year":"2011","unstructured":"Paliwal K, W\u00f3jcicki K, Shannon B (2011) The importance of phase in speech enhancement. Speech Commun 53(4):465\u2013494","journal-title":"Speech Commun"},{"issue":"7","key":"2598_CR38","doi-asserted-by":"publisher","first-page":"1179","DOI":"10.1109\/TASLP.2019.2913512","volume":"27","author":"A Pandey","year":"2019","unstructured":"Pandey A, Wang D (2019) A new framework for CNN-based speech enhancement in the time domain. IEEE\/ACM Trans Audio Speech Lang Process 27(7):1179\u20131188","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"2598_CR39","unstructured":"Pascanu R, Mikolov T, Bengio Y (2013) On the difficulty of training recurrent neural networks. In: International conference on machine learning, pp 1310\u20131318"},{"issue":"10","key":"2598_CR40","first-page":"755","volume":"50","author":"AW Rix","year":"2002","unstructured":"Rix AW, Hollier MP, Hekstra AP, Beerends JG (2002) Perceptual evaluation of speech quality (PESQ) the new ITU standard for end-to-end speech quality assessment part I-time-delay compensation. J Audio Eng Soc 50(10):755\u2013764","journal-title":"J Audio Eng Soc"},{"issue":"6","key":"2598_CR41","doi-asserted-by":"publisher","first-page":"2591","DOI":"10.1007\/s00034-017-0684-5","volume":"37","author":"N Saleem","year":"2018","unstructured":"Saleem N, Irfan M (2018) Noise reduction based on soft masks by incorporating SNR uncertainty in frequency domain. Circuits Syst Signal Process 37(6):2591\u20132612","journal-title":"Circuits Syst Signal Process"},{"key":"2598_CR42","doi-asserted-by":"publisher","DOI":"10.9781\/ijimai.2019.06.001","author":"N Saleem","year":"2019","unstructured":"Saleem N, Khattak MI (2019) Deep neural networks for speech enhancement in complex-noisy environments. Int J Interact Multimed Artif Intell. https:\/\/doi.org\/10.9781\/ijimai.2019.06.001","journal-title":"Int J Interact Multimed Artif Intell"},{"issue":"12","key":"2598_CR43","doi-asserted-by":"publisher","first-page":"1372","DOI":"10.1134\/S1064226919120155","volume":"64","author":"N Saleem","year":"2019","unstructured":"Saleem N, Khattak MI, Perez EV (2019a) Spectral phase estimation based on deep neural networks for single channel speech enhancement. J Commun Technol Electron 64(12):1372\u20131382","journal-title":"J Commun Technol Electron"},{"issue":"22","key":"2598_CR44","doi-asserted-by":"publisher","first-page":"31867","DOI":"10.1007\/s11042-019-08032-y","volume":"78","author":"N Saleem","year":"2019","unstructured":"Saleem N, Khattak MI, Witjaksono G, Ahmad G (2019b) Variance based time-frequency mask estimation for unsupervised speech enhancement. Multimed Tools Appl 78(22):31867\u201331891","journal-title":"Multimed Tools Appl"},{"key":"2598_CR45","first-page":"3","volume":"44","author":"N Saleem","year":"2019","unstructured":"Saleem N, Irfan Khattak M, Ali MY, Shafi M (2019c) Deep neural network for supervised single-channel speech enhancement. Arch Acoust 44:3\u201312","journal-title":"Arch Acoust"},{"issue":"4","key":"2598_CR46","doi-asserted-by":"publisher","first-page":"5187","DOI":"10.3233\/JIFS-190047","volume":"37","author":"N Saleem","year":"2019","unstructured":"Saleem N, Khattak MI, Qazi AB (2019d) Supervised speech enhancement based on deep neural network. J Intell Fuzzy Syst 37(4):5187\u20135201","journal-title":"J Intell Fuzzy Syst"},{"key":"2598_CR47","doi-asserted-by":"publisher","first-page":"583","DOI":"10.1016\/j.asoc.2018.10.031","volume":"74","author":"S Samui","year":"2019","unstructured":"Samui S, Chakrabarti I, Ghosh SK (2019) Time\u2013frequency masking based supervised speech enhancement framework using fuzzy deep belief network. Appl Soft Comput 74:583\u2013602","journal-title":"Appl Soft Comput"},{"issue":"1","key":"2598_CR48","doi-asserted-by":"publisher","first-page":"433","DOI":"10.1007\/s12652-019-01309-y","volume":"11","author":"S Shoba","year":"2020","unstructured":"Shoba S, Rajavel R (2020) A new Genetic Algorithm based fusion scheme in monaural CASA system to improve the performance of the speech. J Ambient Intell Humaniz Comput 11(1):433\u2013446","journal-title":"J Ambient Intell Humaniz Comput"},{"key":"2598_CR49","doi-asserted-by":"publisher","first-page":"393","DOI":"10.1109\/CERA.2017.8343362","volume-title":"2017 6th International conference on computer applications in electrical engineering-recent advances (CERA)","author":"S Singh","year":"2017","unstructured":"Singh S, Mutawa AM, Gupta M, Tripathy M, Anand RS (2017) Phase based single-channel speech enhancement using phase ratio. In: 2017 6th International conference on computer applications in electrical engineering-recent advances (CERA). IEEE, Roorkee, pp 393\u2013396"},{"key":"2598_CR50","doi-asserted-by":"publisher","first-page":"5039","DOI":"10.1109\/ICASSP.2018.8462068","volume-title":"2018 IEEE international conference on acoustics, speech and signal processing (ICASSP)","author":"MH Soni","year":"2018","unstructured":"Soni MH, Shah N, Patil HA (2018) Time-frequency masking-based speech enhancement using generative adversarial network. In: 2018 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, Calgary, AB, pp 5039\u20135043"},{"key":"2598_CR51","doi-asserted-by":"crossref","unstructured":"Stark AP, Paliwal KK (2008) Speech analysis using instantaneous frequency deviation. In: Ninth annual conference of the international speech communication association","DOI":"10.21437\/Interspeech.2008-645"},{"issue":"7","key":"2598_CR52","doi-asserted-by":"publisher","first-page":"2125","DOI":"10.1109\/TASL.2011.2114881","volume":"19","author":"CH Taal","year":"2011","unstructured":"Taal CH, Hendriks RC, Heusdens R, Jensen J (2011) An algorithm for intelligibility prediction of time\u2013frequency weighted noisy speech. IEEE Trans Audio Speech Lang Process 19(7):2125\u20132136","journal-title":"IEEE Trans Audio Speech Lang Process"},{"key":"2598_CR53","doi-asserted-by":"publisher","first-page":"535","DOI":"10.1016\/j.csl.2016.11.005","volume":"46","author":"E Vincent","year":"2017","unstructured":"Vincent E, Watanabe S, Nugraha AA, Barker J, Marxer R (2017) An analysis of environment, microphone and data simulation mismatches in robust speech recognition. Comput Speech Lang 46:535\u2013557","journal-title":"Comput Speech Lang"},{"issue":"9","key":"2598_CR54","doi-asserted-by":"publisher","first-page":"1559","DOI":"10.1109\/TASLP.2018.2831632","volume":"26","author":"Y Wakabayashi","year":"2018","unstructured":"Wakabayashi Y, Fukumori T, Nakayama M, Nishiura T, Yamashita Y (2018) Single-channel speech enhancement with phase reconstruction based on phase distortion averaging. IEEE\/ACM Trans Audio Speech Lang Process 26(9):1559\u20131569","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"2598_CR55","doi-asserted-by":"publisher","DOI":"10.1109\/9780470043387","volume-title":"Computational auditory scene analysis: principles, algorithms, and applications","author":"D Wang","year":"2006","unstructured":"Wang D, Brown GJ (2006) Computational auditory scene analysis: principles, algorithms, and applications. Wiley-IEEE Press, Piscataway"},{"issue":"2","key":"2598_CR56","doi-asserted-by":"publisher","first-page":"270","DOI":"10.1109\/TASL.2012.2221459","volume":"21","author":"Y Wang","year":"2012","unstructured":"Wang Y, Han K, Wang D (2012) Exploring monaural features for classification-based speech segregation. IEEE Trans Audio Speech Lang Process 21(2):270\u2013279","journal-title":"IEEE Trans Audio Speech Lang Process"},{"issue":"12","key":"2598_CR57","doi-asserted-by":"publisher","first-page":"1849","DOI":"10.1109\/TASLP.2014.2352935","volume":"22","author":"Y Wang","year":"2014","unstructured":"Wang Y, Narayanan A, Wang D (2014) On training targets for supervised speech separation. IEEE\/ACM Trans Audio Speech Lang Process 22(12):1849\u20131858","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"2598_CR58","doi-asserted-by":"publisher","first-page":"3709","DOI":"10.1109\/ICASSP.2014.6854294","volume-title":"2014 IEEE international conference on acoustics, speech and signal processing (ICASSP)","author":"F Weninger","year":"2014","unstructured":"Weninger F, Eyben F, Schuller B (2014) Single-channel speech separation with memory-enhanced recurrent neural networks. In: 2014 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, Florence, pp 3709\u20133713"},{"key":"2598_CR59","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1007\/978-3-319-22482-4_11","volume-title":"International conference on latent variable analysis and signal separation","author":"F Weninger","year":"2015","unstructured":"Weninger F, Erdogan H, Watanabe S, Vincent E, Le Roux J, Hershey JR, Schuller B (2015) Speech enhancement with LSTM recurrent neural networks and its application to noise-robust ASR. In: International conference on latent variable analysis and signal separation. Springer, Cham, pp 91\u201399"},{"issue":"7","key":"2598_CR60","doi-asserted-by":"publisher","first-page":"1492","DOI":"10.1109\/TASLP.2017.2696307","volume":"25","author":"DS Williamson","year":"2017","unstructured":"Williamson DS, Wang D (2017) Time\u2013frequency masking in the complex domain for speech dereverberation and denoising. IEEE\/ACM Trans Audio Speech Lang Process 25(7):1492\u20131501","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"issue":"16","key":"2598_CR61","doi-asserted-by":"publisher","first-page":"3396","DOI":"10.3390\/app9163396","volume":"9","author":"J Wu","year":"2019","unstructured":"Wu J, Hua Y, Yang S, Qin H, Qin H (2019) Speech enhancement using generative adversarial network by distilling knowledge from statistical method. Appl Sci 9(16):3396","journal-title":"Appl Sci"},{"key":"2598_CR62","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1016\/j.neunet.2015.03.008","volume":"67","author":"Y Xia","year":"2015","unstructured":"Xia Y, Wang J (2015) Low-dimensional recurrent neural network-based Kalman filter for speech enhancement. Neural Netw 67:131\u2013139","journal-title":"Neural Netw"},{"issue":"1","key":"2598_CR63","doi-asserted-by":"publisher","first-page":"65","DOI":"10.1109\/LSP.2013.2291240","volume":"21","author":"Y Xu","year":"2013","unstructured":"Xu Y, Du J, Dai LR, Lee CH (2013) An experimental study on speech enhancement based on deep neural networks. IEEE Signal Process Lett 21(1):65\u201368","journal-title":"IEEE Signal Process Lett"},{"issue":"1","key":"2598_CR64","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1109\/TASLP.2014.2364452","volume":"23","author":"Y Xu","year":"2014","unstructured":"Xu Y, Du J, Dai LR, Lee CH (2014) A regression approach to speech enhancement based on deep neural networks. IEEE\/ACM Trans Audio Speech Lang Process 23(1):7\u201319","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"issue":"9","key":"2598_CR65","doi-asserted-by":"publisher","first-page":"2281","DOI":"10.1109\/78.157227","volume":"40","author":"B Yegnanarayana","year":"1992","unstructured":"Yegnanarayana B, Murthy HA (1992) Significance of group delay functions in spectrum estimation. IEEE Trans Signal Process 40(9):2281\u20132289","journal-title":"IEEE Trans Signal Process"},{"issue":"5","key":"2598_CR66","doi-asserted-by":"publisher","first-page":"899","DOI":"10.1109\/TASLP.2014.2312541","volume":"22","author":"L Zao","year":"2014","unstructured":"Zao L, Coelho R, Flandrin P (2014) Speech enhancement with EMD and hurst-based mode selection. IEEE\/ACM Trans Audio Speech Lang Process 22(5):899\u2013911","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"issue":"5","key":"2598_CR67","doi-asserted-by":"publisher","first-page":"967","DOI":"10.1109\/TASLP.2016.2536478","volume":"24","author":"XL Zhang","year":"2016","unstructured":"Zhang XL, Wang D (2016) A deep ensemble learning method for monaural speech separation. IEEE\/ACM Trans Audio Speech Lang Process 24(5):967\u2013977","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"},{"key":"2598_CR68","doi-asserted-by":"publisher","first-page":"6525","DOI":"10.1109\/ICASSP.2016.7472934","volume-title":"2016 IEEE international conference on acoustics, speech and signal processing (ICASSP)","author":"Y Zhao","year":"2016","unstructured":"Zhao Y, Wang D, Merks I, Zhang T (2016) DNN-based enhancement of noisy and reverberant speech. In: 2016 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, Shanghai, pp 6525\u20136529"},{"issue":"1","key":"2598_CR69","doi-asserted-by":"publisher","first-page":"63","DOI":"10.1109\/TASLP.2018.2870742","volume":"27","author":"N Zheng","year":"2018","unstructured":"Zheng N, Zhang XL (2018) Phase-aware speech enhancement based on deep neural networks. IEEE\/ACM Trans Audio Speech Lang Process 27(1):63\u201376","journal-title":"IEEE\/ACM Trans Audio Speech Lang Process"}],"container-title":["Journal of Ambient Intelligence and Humanized Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s12652-020-02598-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s12652-020-02598-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s12652-020-02598-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,10,16]],"date-time":"2021-10-16T20:56:50Z","timestamp":1634417810000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s12652-020-02598-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,16]]},"references-count":69,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2021,10]]}},"alternative-id":["2598"],"URL":"https:\/\/doi.org\/10.1007\/s12652-020-02598-4","relation":{},"ISSN":["1868-5137","1868-5145"],"issn-type":[{"type":"print","value":"1868-5137"},{"type":"electronic","value":"1868-5145"}],"subject":[],"published":{"date-parts":[[2020,10,16]]},"assertion":[{"value":"25 July 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 October 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 October 2020","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}