{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,7]],"date-time":"2026-06-07T16:56:18Z","timestamp":1780851378710,"version":"3.54.1"},"reference-count":62,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2023,4,6]],"date-time":"2023-04-06T00:00:00Z","timestamp":1680739200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,4,6]],"date-time":"2023-04-06T00:00:00Z","timestamp":1680739200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Circuits Syst Signal Process"],"published-print":{"date-parts":[[2023,9]]},"DOI":"10.1007\/s00034-023-02340-3","type":"journal-article","created":{"date-parts":[[2023,4,6]],"date-time":"2023-04-06T10:03:23Z","timestamp":1680775403000},"page":"5313-5337","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":10,"title":["Estimation of Ideal Binary Mask for Audio-Visual Monaural Speech Enhancement"],"prefix":"10.1007","volume":"42","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4788-108X","authenticated-orcid":false,"given":"S.","family":"Balasubramanian","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"R.","family":"Rajavel","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Asutosh","family":"Kar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2023,4,6]]},"reference":[{"key":"2340_CR1","doi-asserted-by":"publisher","first-page":"475","DOI":"10.1109\/TASLP.2017.2783545","volume":"26","author":"AH Abdelaziz","year":"2017","unstructured":"A.H. Abdelaziz, Comparing fusion models for DNN-based audiovisual continuous speech recognition. IEEE\/ACM Trans. Audio, Speech, Lang Process 26, 475\u2013484 (2017)","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang Process"},{"key":"2340_CR2","doi-asserted-by":"publisher","first-page":"163","DOI":"10.1016\/j.inffus.2019.08.008","volume":"59","author":"A Adeel","year":"2020","unstructured":"A. Adeel, M. Gogate, A. Hussain, Contextual deep learning-based audio-visual switching for speech enhancement in real-world environments. Inf. Fusion 59, 163\u2013170 (2020)","journal-title":"Inf. Fusion"},{"key":"2340_CR3","doi-asserted-by":"publisher","first-page":"481","DOI":"10.1109\/TETCI.2019.2917039","volume":"5","author":"A Adeel","year":"2021","unstructured":"A. Adeel, M. Gogate, A. Hussain, W.M. Whitmer, Lip-Reading driven deep learning approach for speech enhancement. IEEE Trans. Emerg. Top Comput. Intell. 5, 481\u2013490 (2021). https:\/\/doi.org\/10.1109\/TETCI.2019.2917039","journal-title":"IEEE Trans. Emerg. Top Comput. Intell."},{"key":"2340_CR4","doi-asserted-by":"publisher","first-page":"1642","DOI":"10.1109\/TASL.2010.2096212","volume":"19","author":"I Almajai","year":"2010","unstructured":"I. Almajai, B. Milner, Visually derived wiener filters for speech enhancement. IEEE Trans. Audio Speech Lang. Process. 19, 1642\u20131651 (2010)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"2340_CR5","doi-asserted-by":"crossref","unstructured":"A. Arriandiaga, G. Morrone, L. Pasa, L. Badino, and C. Bartolozzi, Audio-visual target speaker enhancement on multi-talker environment using event-driven cameras. In 2021 IEEE International Symposium on Circuits and Systems (ISCAS). IEEE, pp. 1\u20135 (2021)","DOI":"10.1109\/ISCAS51556.2021.9401772"},{"key":"2340_CR6","doi-asserted-by":"publisher","first-page":"247","DOI":"10.1109\/TASSP.1979.1163237","volume":"27","author":"B Atal","year":"1979","unstructured":"B. Atal, M. Schroeder, Predictive coding of speech signals and subjective error criteria. IEEE Trans. Acoust. 27, 247\u2013254 (1979)","journal-title":"IEEE Trans. Acoust."},{"key":"2340_CR7","doi-asserted-by":"crossref","unstructured":"M. Berouti, R. Schwartz, and J. Makhoul, Enhancement of speech corrupted by acoustic noise. In: ICASSP\u201979. IEEE International Conference on Acoustics, Speech, and Signal Processing. IEEE, pp. 208\u2013211 (1979)","DOI":"10.1109\/ICASSP.1979.1170788"},{"key":"2340_CR8","doi-asserted-by":"publisher","first-page":"113","DOI":"10.1109\/TASSP.1979.1163209","volume":"27","author":"S Boll","year":"1979","unstructured":"S. Boll, Suppression of acoustic noise in speech using spectral subtraction. IEEE Trans Acoust 27, 113\u2013120 (1979)","journal-title":"IEEE Trans Acoust"},{"key":"2340_CR9","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/1970392.1970395","volume":"58","author":"EJ Cand\u00e8s","year":"2011","unstructured":"E.J. Cand\u00e8s, X. Li, Y. Ma, J. Wright, Robust principal component analysis? J ACM 58, 1\u201337 (2011)","journal-title":"J ACM"},{"key":"2340_CR10","doi-asserted-by":"crossref","unstructured":"Chen, J., Benesty, J., Huang, Y. and Diethorn, E.J., Fundamentals of noise reduction. In: Springer Handbook of Speech Processing. Springer, (2008) pp 843\u2013872","DOI":"10.1007\/978-3-540-49127-9_43"},{"key":"2340_CR11","doi-asserted-by":"publisher","first-page":"1993","DOI":"10.1109\/TASLP.2014.2359159","volume":"22","author":"J Chen","year":"2014","unstructured":"J. Chen, Y. Wang, D. Wang, A feature study for classification-based speech separation at low signal-to-Noise ratios. IEEE\/ACM Trans. Audio, Speech, Lang Process 22, 1993\u20132002 (2014). https:\/\/doi.org\/10.1109\/TASLP.2014.2359159","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang Process"},{"key":"2340_CR12","doi-asserted-by":"crossref","unstructured":"Z. Chen, S. Watanabe, H. Erdogan, and J.R. Hershey, Speech enhancement and recognition using multi-task learning of long short-term memory recurrent neural networks. In: Sixteenth Annual Conference of the International Speech Communication Association, (2015)","DOI":"10.21437\/Interspeech.2015-659"},{"key":"2340_CR13","doi-asserted-by":"publisher","first-page":"1979","DOI":"10.1109\/TIFS.2017.2678458","volume":"12","author":"Y-H Chin","year":"2017","unstructured":"Y.-H. Chin, J.-C. Wang, C.-L. Huang, K.-Y. Wang, C.-H. Wu, Speaker identification using discriminative features and sparse representation. IEEE Trans. Inf. Forensics Secur. 12, 1979\u20131987 (2017)","journal-title":"IEEE Trans. Inf. Forensics Secur."},{"key":"2340_CR14","doi-asserted-by":"crossref","unstructured":"H.S. Choi, S. Park, J.H. Lee, H. Heo, D. Jeon, and K. Lee, Real-time denoising and dereverberation wtih tiny recurrent u-net. In: CASSP 2021\u20132021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, pp. 5789\u20135793 (2021)","DOI":"10.1109\/ICASSP39728.2021.9414852"},{"key":"2340_CR15","doi-asserted-by":"publisher","first-page":"2421","DOI":"10.1121\/1.2229005","volume":"120","author":"M Cooke","year":"2006","unstructured":"M. Cooke, J. Barker, S. Cunningham, X. Shao, An audio-visual corpus for speech perception and automatic speech recognition. J. Acoust. Soc. Am. 120, 2421\u20132424 (2006)","journal-title":"J. Acoust. Soc. Am."},{"key":"2340_CR16","doi-asserted-by":"crossref","unstructured":"T. Darrell, J.W. Fisher Iii, and P. Viola, Audio-visual segmentation and \u201cthe cocktail party effect.\u201d In: International Conference on Multimodal Interfaces. Springer, pp. 32\u201340 (2000)","DOI":"10.1007\/3-540-40063-X_5"},{"key":"2340_CR17","doi-asserted-by":"crossref","unstructured":"J. Eggert, and E. Korner, Sparse coding and NMF. In: 2004 IEEE International Joint Conference on Neural Networks (IEEE Cat. No. 04CH37541). IEEE, pp. 2529\u20132533 (2004)","DOI":"10.1109\/IJCNN.2004.1381036"},{"key":"2340_CR18","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3197517.3201357","volume":"37","author":"A Ephrat","year":"2018","unstructured":"A. Ephrat, I. Mosseri, O. Lang, T. Dekel, K.W. Wilson, A. Hassidim, W.T. Freeman, M. Rubinstein, Looking to listen at the cocktail party. ACM Trans. Graph 37, 1\u201311 (2018)","journal-title":"ACM Trans. Graph"},{"key":"2340_CR19","doi-asserted-by":"crossref","unstructured":"R. Frazier, S. Samsam, L. Braida, and A. Oppenheim, Enhancement of speech by adaptive filtering. In: ICASSP\u201976. IEEE International Conference on Acoustics, Speech, and Signal Processing. Citeseer, pp. 251\u2013253 (1976)","DOI":"10.1109\/ICASSP.1976.1170118"},{"key":"2340_CR20","doi-asserted-by":"crossref","unstructured":"A. Gabbay, A. Shamir, S. Peleg, Visual speech enhancement, in Interspeech 2018. ISCA, ISCA. pp 1170\u20131174 (2018)","DOI":"10.21437\/Interspeech.2018-1955"},{"key":"2340_CR21","doi-asserted-by":"publisher","first-page":"3007","DOI":"10.1121\/1.1358887","volume":"109","author":"L Girin","year":"2001","unstructured":"L. Girin, J.-L. Schwartz, G. Feng, Audio-visual enhancement of speech in noise. J. Acoust. Soc. Am. 109, 3007\u20133020 (2001)","journal-title":"J. Acoust. Soc. Am."},{"key":"2340_CR22","doi-asserted-by":"publisher","unstructured":"M. Gogate, A. Adeel, R. Marxer, J. Barker, A. Hussain, DNN driven speaker independent audio-visual mask estimation for speech separation, in Proc Annu Conf Int Speech Commun Assoc INTERSPEECH 2018-Septe. pp 2723\u20132727 (2018). https:\/\/doi.org\/10.21437\/Interspeech.2018-2516","DOI":"10.21437\/Interspeech.2018-2516"},{"key":"2340_CR23","doi-asserted-by":"publisher","first-page":"1346","DOI":"10.1121\/10.0003557","volume":"149","author":"S Graetzer","year":"2021","unstructured":"S. Graetzer, C. Hopkins, Intelligibility prediction for speech mixed with white Gaussian noise at low signal-to-noise ratios. J. Acoust. Soc. Am. 149, 1346\u20131362 (2021)","journal-title":"J. Acoust. Soc. Am."},{"key":"2340_CR24","doi-asserted-by":"publisher","first-page":"530","DOI":"10.1109\/JSTSP.2020.2980956","volume":"14","author":"R Gu","year":"2020","unstructured":"R. Gu, S.-X. Zhang, Y. Xu, L. Chen, Y. Zou, D. Yu, Multi-modal multi-channel target speech separation. IEEE J. Sel. Top Signal Process 14, 530\u2013541 (2020)","journal-title":"IEEE J. Sel. Top Signal Process"},{"key":"2340_CR25","doi-asserted-by":"crossref","unstructured":"Y. Guo, W. Yu, J. Zhou, ZTrans: A new transformer for speech enhancement. In: 2021 4th International Conference on Information Communication and Signal Processing (ICICSP). IEEE, pp. 178\u2013182 (2021)","DOI":"10.1109\/ICICSP54369.2021.9611868"},{"key":"2340_CR26","doi-asserted-by":"crossref","unstructured":"X. Hao, X. Su, R. Horaud, X. Li, Fullsubnet: A full-band and sub-band fusion model for real-time single-channel speech enhancement. In: ICASSP 2021\u20132021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, pp. 6633\u20136637 (2021)","DOI":"10.1109\/ICASSP39728.2021.9414177"},{"key":"2340_CR27","doi-asserted-by":"publisher","first-page":"4230","DOI":"10.1121\/1.4984271","volume":"141","author":"EW Healy","year":"2017","unstructured":"E.W. Healy, M. Delfarah, J.L. Vasko, B.L. Carter, D. Wang, An algorithm to increase intelligibility for hearing-impaired listeners in the presence of a competing talker. J. Acoust. Soc. Am. 141, 4230\u20134239 (2017)","journal-title":"J. Acoust. Soc. Am."},{"key":"2340_CR28","doi-asserted-by":"publisher","first-page":"117","DOI":"10.1109\/TETCI.2017.2784878","volume":"2","author":"J-C Hou","year":"2018","unstructured":"J.-C. Hou, S.-S. Wang, Y.-H. Lai, Y. Tsao, H.-W. Chang, H.-M. Wang, Audio-visual speech enhancement using multimodal deep convolutional neural networks. IEEE Trans. Emerg. Top Comput. Intell. 2, 117\u2013128 (2018)","journal-title":"IEEE Trans. Emerg. Top Comput. Intell."},{"key":"2340_CR29","doi-asserted-by":"crossref","unstructured":"Y. Hu, P. C. Loizou, A subspace approach for enhancing speech corrupted by colored noise. In: 2002 IEEE International Conference on Acoustics, Speech, and Signal Processing. IEEE, pp. I\u2013573 (2002)","DOI":"10.1109\/ICASSP.2002.5743782"},{"key":"2340_CR30","doi-asserted-by":"crossref","unstructured":"Y. Hu, P. C. Loizou, Evaluation of objective measures for speech enhancement. In: Ninth international conference on spoken language processing, (2006)","DOI":"10.21437\/Interspeech.2006-84"},{"key":"2340_CR31","doi-asserted-by":"crossref","unstructured":"P-S. Huang, S. D. Chen, P. Smaragdis, M. Hasegawa-Johnson,Singing-voice separation from monaural recordings using robust principal component analysis. In: 2012 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, pp. 57\u201360 (2012)","DOI":"10.1109\/ICASSP.2012.6287816"},{"key":"2340_CR32","doi-asserted-by":"crossref","unstructured":"E. Ideli, B. Sharpe, I V. Baji\u0107, R.G. Vaughan, Visually assisted time-domain speech enhancement. In: 2019 IEEE Global Conference on signal and information processing (GlobalSIP). IEEE, pp. 1\u20135 (2019)","DOI":"10.1109\/GlobalSIP45357.2019.8969244"},{"key":"2340_CR33","doi-asserted-by":"publisher","first-page":"2224","DOI":"10.1121\/1.1862575","volume":"117","author":"JM Kates","year":"2005","unstructured":"J.M. Kates, K.H. Arehart, Coherence and the speech intelligibility index. J. Acoust. Soc. Am. 117, 2224\u20132237 (2005)","journal-title":"J. Acoust. Soc. Am."},{"key":"2340_CR34","doi-asserted-by":"crossref","unstructured":"K. Kinoshita, M. Delcroix, A. Ogawa, T.Nakatani, Text-informed speech enhancement with deep neural networks. In: Sixteenth Annual Conference of the International Speech Communication Association (2015)","DOI":"10.21437\/Interspeech.2015-409"},{"key":"2340_CR35","unstructured":"U. Kjems, J. Jensen, Maximum likelihood based noise covariance matrix estimation for multi-microphone speech enhancement. In: 2012 Proceedings of the 20th European signal processing conference (EUSIPCO). IEEE, pp. 295\u2013299 (2012)"},{"key":"2340_CR36","doi-asserted-by":"publisher","first-page":"153","DOI":"10.1109\/TASLP.2016.2628641","volume":"25","author":"M Kolb\u00e6k","year":"2016","unstructured":"M. Kolb\u00e6k, Z.-H. Tan, J. Jensen, Speech intelligibility potential of general and specialized deep neural network based speech enhancement systems. IEEE\/ACM Trans. Audio, Speech, Lang Process 25, 153\u2013167 (2016)","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang Process"},{"key":"2340_CR37","doi-asserted-by":"crossref","unstructured":"J. Li, D. Luo, Y. Liu, Y. Zhu, Z. Li, G. Cui, W. Tang, W. Chen, Densely Connected multi-stage model with channel wise subband feature for real-time speech enhancement. In: ICASSP 2021\u20132021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). IEEE, pp. 6638\u20136642 (2021)","DOI":"10.1109\/ICASSP39728.2021.9413967"},{"key":"2340_CR38","doi-asserted-by":"publisher","first-page":"3440","DOI":"10.1109\/TASLP.2021.3125143","volume":"29","author":"J Lin","year":"2021","unstructured":"J. Lin, A.J.D.L. Van Wijngaarden, K.C. Wang, M.C. Smith, Speech enhancement using multi-stage self-attentive temporal convolutional networks. IEEE\/ACM Trans. Audio, Speech, Lang Process 29, 3440\u20133450 (2021). https:\/\/doi.org\/10.1109\/TASLP.2021.3125143","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang Process"},{"key":"2340_CR39","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1155\/ASP.2005.1110","volume":"2005","author":"T Lotter","year":"2005","unstructured":"T. Lotter, P. Vary, Speech enhancement by MAP spectral amplitude estimation using a super-Gaussian speech model. EURASIP J. Adv. Signal Process 2005, 1\u201317 (2005)","journal-title":"EURASIP J. Adv. Signal Process"},{"key":"2340_CR40","doi-asserted-by":"crossref","unstructured":"X. Lu, Y. Tsao, S. Matsuda, C. Hori, Speech enhancement based on deep denoising autoencoder. In: Interspeech, (2013) pp 436\u2013440","DOI":"10.21437\/Interspeech.2013-130"},{"key":"2340_CR41","doi-asserted-by":"publisher","first-page":"561","DOI":"10.1109\/PROC.1975.9792","volume":"63","author":"J Makhoul","year":"1975","unstructured":"J. Makhoul, Linear prediction: a tutorial review. Proc IEEE 63, 561\u2013580 (1975)","journal-title":"Proc IEEE"},{"key":"2340_CR42","doi-asserted-by":"publisher","first-page":"1692","DOI":"10.1109\/TPAMI.2015.2461544","volume":"38","author":"N Neverova","year":"2015","unstructured":"N. Neverova, C. Wolf, G. Taylor, F. Nebout, Moddrop: adaptive multi-modal gesture recognition. IEEE Trans, Pattern Anal, Mach, Intell, 38, 1692\u20131706 (2015)","journal-title":"IEEE Trans, Pattern Anal, Mach, Intell,"},{"key":"2340_CR43","volume-title":"Objective measures of speech quality","author":"SR Quackenbush","year":"1988","unstructured":"S.R. Quackenbush, T.P. Barnwell, M.A. Clements, Objective measures of speech quality (Prentice-Hall, 1988)"},{"key":"2340_CR44","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1109\/MASSP.1986.1165342","volume":"3","author":"L Rabiner","year":"1986","unstructured":"L. Rabiner, B. Juang, An introduction to hidden Markov models. IEEE ASSP Mag 3, 4\u201316 (1986)","journal-title":"IEEE ASSP Mag"},{"key":"2340_CR45","doi-asserted-by":"crossref","unstructured":"R. Rajavel, P. S. Sathidevi, Static and dynamic features for improved HMM based visual speech recognition. In: Proceedings of the First International Conference on Intelligent Human Computer Interaction. Springer, pp. 184\u2013194 (2009)","DOI":"10.1007\/978-81-8489-203-1_17"},{"key":"2340_CR46","doi-asserted-by":"publisher","first-page":"83","DOI":"10.1007\/s11265-011-0578-x","volume":"68","author":"R Rajavel","year":"2012","unstructured":"R. Rajavel, P.S. Sathidevi, Adaptive reliability measure and optimum integration weight for decision fusion audio-visual speech recognition. J. Signal Process Syst. 68, 83\u201393 (2012)","journal-title":"J. Signal Process Syst."},{"key":"2340_CR47","doi-asserted-by":"publisher","first-page":"87","DOI":"10.1109\/89.902276","volume":"9","author":"A Rezayee","year":"2001","unstructured":"A. Rezayee, S. Gazor, An adaptive KLT approach for speech enhancement. IEEE Trans. Speech Audio Process 9, 87\u201395 (2001)","journal-title":"IEEE Trans. Speech Audio Process"},{"key":"2340_CR48","doi-asserted-by":"crossref","unstructured":"A.W. Rix, J.G. Beerends, M.P. Hollier, A.P. Hekstra, Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs. In: 2001 IEEE International Conference on Acoustics, Speech, and Signal Processing. Proceedings (Cat. No. 01CH37221). IEEE, pp. 749\u2013752 (2001)","DOI":"10.1109\/ICASSP.2001.941023"},{"key":"2340_CR49","doi-asserted-by":"crossref","unstructured":"P. Scalart, Speech enhancement based on a priori signal to noise estimation. In: 1996 IEEE International Conference on Acoustics, Speech, and Signal Processing Conference Proceedings. IEEE, pp. 629\u2013632 (1996)","DOI":"10.1109\/ICASSP.1996.543199"},{"key":"2340_CR50","doi-asserted-by":"publisher","first-page":"433","DOI":"10.1007\/s12652-019-01309-y","volume":"11","author":"S Shoba","year":"2020","unstructured":"S. Shoba, R. Rajavel, A new Genetic Algorithm based fusion scheme in monaural CASA system to improve the performance of the speech. J. Ambient. Intell. Humaniz Comput. 11, 433\u2013446 (2020)","journal-title":"J. Ambient. Intell. Humaniz Comput."},{"key":"2340_CR51","doi-asserted-by":"publisher","first-page":"186","DOI":"10.1109\/TASL.2010.2045799","volume":"19","author":"S Suhadi","year":"2010","unstructured":"S. Suhadi, C. Last, T. Fingscheidt, A data-driven approach to a priori SNR estimation. IEEE Trans. Audio Speech Lang Process 19, 186\u2013195 (2010)","journal-title":"IEEE Trans. Audio Speech Lang Process"},{"key":"2340_CR52","doi-asserted-by":"crossref","unstructured":"L. Sun, J. Du, L-R. Dai, C-H. Lee, Multiple-target deep learning for LSTM-RNN based speech enhancement. In: 2017 Hands-free Speech Communications and Microphone Arrays (HSCMA). IEEE, (2017), pp 136\u2013140","DOI":"10.1109\/HSCMA.2017.7895577"},{"key":"2340_CR53","doi-asserted-by":"crossref","unstructured":"C.H, Taal, R.C, Hendriks, R. Heusdens, J. Jensen, A short-time objective intelligibility measure for time-frequency weighted noisy speech. In: 2010 IEEE International Conference on Acoustics, Speech and Signal Processing. IEEE, pp. 4214\u20134217 (2010)","DOI":"10.1109\/ICASSP.2010.5495701"},{"key":"2340_CR54","doi-asserted-by":"publisher","first-page":"3591","DOI":"10.1121\/1.4806631","volume":"133","author":"J Thiemann","year":"2013","unstructured":"J. Thiemann, N. Ito, E. Vincent, The diverse environments multi-channel acoustic noise database: a database of multichannel environmental noise recordings. J. Acoust. Soc. Am. 133, 3591 (2013). https:\/\/doi.org\/10.1121\/1.4806631","journal-title":"J. Acoust. Soc. Am."},{"key":"2340_CR55","doi-asserted-by":"publisher","first-page":"137","DOI":"10.1023\/B:VISI.0000013087.49260.fb","volume":"57","author":"P Viola","year":"2004","unstructured":"P. Viola, M.J. Jones, Robust real-time face detection. Int. J. Comput. Vis. 57, 137\u2013154 (2004)","journal-title":"Int. J. Comput. Vis."},{"key":"2340_CR56","doi-asserted-by":"crossref","unstructured":"D. Wang, G.J. Brown, Computational auditory scene analysis: Principles, algorithms, and applications. Wiley-IEEE press, (2006)","DOI":"10.1109\/9780470043387"},{"key":"2340_CR57","doi-asserted-by":"publisher","first-page":"2122","DOI":"10.1109\/TASLP.2016.2598306","volume":"24","author":"J-C Wang","year":"2016","unstructured":"J.-C. Wang, Y.-S. Lee, C.-H. Lin, S.-F. Wang, C.-H. Shih, C.-H. Wu, Compressive sensing-based speech enhancement. IEEE\/ACM Trans. Audio, Speech, Lang Process 24, 2122\u20132131 (2016)","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang Process"},{"key":"2340_CR58","unstructured":"Weintraub, M., A theory and computational model of auditory monaural sound separation (1985)"},{"key":"2340_CR59","doi-asserted-by":"crossref","unstructured":"Wu, J., Xu, Y., Zhang, S-X., Chen, L-W., Yu, M., Xie, L., Yu, D. Time domain audio visual speech separation. In: 2019 IEEE automatic speech recognition and understanding workshop (ASRU). IEEE, (2019), pp 667\u2013673","DOI":"10.1109\/ASRU46091.2019.9003983"},{"key":"2340_CR60","doi-asserted-by":"publisher","first-page":"13","DOI":"10.1016\/j.specom.2014.02.001","volume":"60","author":"B Xia","year":"2014","unstructured":"B. Xia, C. Bao, Wiener filtering based speech enhancement with weighted denoising auto-encoder and noise classification. Speech Commun. 60, 13\u201329 (2014)","journal-title":"Speech Commun."},{"key":"2340_CR61","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1109\/TASLP.2014.2364452","volume":"23","author":"Y Xu","year":"2014","unstructured":"Y. Xu, J. Du, L.-R. Dai, C.-H. Lee, A regression approach to speech enhancement based on deep neural networks. IEEE\/ACM Trans. Audio, Speech, Lang Process 23, 7\u201319 (2014)","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang Process"},{"key":"2340_CR62","doi-asserted-by":"publisher","first-page":"1035","DOI":"10.1109\/LSP.2020.3000968","volume":"27","author":"C Yu","year":"2020","unstructured":"C. Yu, K.-H. Hung, S.-S. Wang, Y. Tsao, J. Hung, Time-domain multi-modal bone\/air conducted speech enhancement. IEEE Signal Process Lett. 27, 1035\u20131039 (2020)","journal-title":"IEEE Signal Process Lett."}],"container-title":["Circuits, Systems, and Signal Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-023-02340-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00034-023-02340-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-023-02340-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,17]],"date-time":"2024-10-17T20:52:08Z","timestamp":1729198328000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00034-023-02340-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,4,6]]},"references-count":62,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2023,9]]}},"alternative-id":["2340"],"URL":"https:\/\/doi.org\/10.1007\/s00034-023-02340-3","relation":{},"ISSN":["0278-081X","1531-5878"],"issn-type":[{"value":"0278-081X","type":"print"},{"value":"1531-5878","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,4,6]]},"assertion":[{"value":"20 July 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 February 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 February 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 April 2023","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The Authors declares that there is no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}