{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T15:45:32Z","timestamp":1783611932722,"version":"3.55.0"},"reference-count":25,"publisher":"Institute of Electronics, Information and Communications Engineers (IEICE)","issue":"11","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEICE Trans. Inf. &amp; Syst."],"published-print":{"date-parts":[[2025,11,1]]},"DOI":"10.1587\/transinf.2024edl8099","type":"journal-article","created":{"date-parts":[[2025,4,22]],"date-time":"2025-04-22T18:06:12Z","timestamp":1745345172000},"page":"1421-1426","source":"Crossref","is-referenced-by-count":3,"title":["Monaural Speech Enhancement Based on Multi-Resolution Feature Analysis"],"prefix":"10.1587","volume":"E108.D","author":[{"given":"Yuewei","family":"ZHANG","sequence":"first","affiliation":[{"name":"Department of Electronic Engineering, Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huanbin","family":"ZOU","sequence":"additional","affiliation":[{"name":"Xiaohongshu Inc."}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jie","family":"ZHU","sequence":"additional","affiliation":[{"name":"Department of Electronic Engineering, Shanghai Jiao Tong University"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"532","reference":[{"key":"1","doi-asserted-by":"crossref","unstructured":"[1] K. Tan and D. Wang, \u201cA Convolutional Recurrent Neural Network for Real-Time Speech Enhancement,\u201d Proc. Interspeech 2018, pp.3229-3233, 2018. 10.21437\/interspeech.2018-1405","DOI":"10.21437\/Interspeech.2018-1405"},{"key":"2","doi-asserted-by":"crossref","unstructured":"[2] Y. Hu, Y. Liu, S. Lv, M. Xing, S. Zhang, Y. Fu, J. Wu, B. Zhang, and L. Xie, \u201cDCCRN: Deep Complex Convolution Recurrent Network for Phase-Aware Speech Enhancement,\u201d Proc. Interspeech 2020, pp.2472-2476, 2020. 10.21437\/interspeech.2020-2537","DOI":"10.21437\/Interspeech.2020-2537"},{"key":"3","doi-asserted-by":"crossref","unstructured":"[3] A. D\u00e9fossez, G. Synnaeve, and Y. Adi, \u201cReal Time Speech Enhancement in the Waveform Domain,\u201d Proc. Interspeech 2020, pp.3291-3295, 2020. 10.21437\/interspeech.2020-2409","DOI":"10.21437\/Interspeech.2020-2409"},{"key":"4","doi-asserted-by":"publisher","unstructured":"[4] K. Tan and D.L. Wang, \u201cLearning complex spectral mapping with gated convolutional recurrent networks for monaural speech enhancement,\u201d IEEE\/ACM Trans. Audio, Speech, Lang. Process., vol.28, pp.380-390, 2020. 10.1109\/taslp.2019.2955276","DOI":"10.1109\/TASLP.2019.2955276"},{"key":"5","doi-asserted-by":"publisher","unstructured":"[5] A. Li, C. Zheng, L. Zhang, and X. Li, \u201cGlance and gaze: A collaborative learning framework for single-channel speech enhancement,\u201d Appl. Acoust., vol.187, p.108499, 2022. 10.1016\/j.apacoust.2021.108499","DOI":"10.1016\/j.apacoust.2021.108499"},{"key":"6","doi-asserted-by":"publisher","unstructured":"[6] C. Fan, H. Zhang, A. Li, W. Xiang, C. Zheng, Z. Lv, and X. Wu, \u201cCompnet: Complementary network for single-channel speech enhancement,\u201d Neural Netw., vol.168, pp.508-517, 2023. 10.1016\/j.neunet.2023.09.041","DOI":"10.1016\/j.neunet.2023.09.041"},{"key":"7","doi-asserted-by":"crossref","unstructured":"[7] Q. Zhang, M. Ge, H. Zhu, E. Ambikairajah, Q. Song, Z. Ni, and H. Li, \u201cAn empirical study on the impact of positional encoding in transformer-based monaural speech enhancement,\u201d ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.1001-1005, 2024. 10.1109\/icassp48485.2024.10446337","DOI":"10.1109\/ICASSP48485.2024.10446337"},{"key":"8","doi-asserted-by":"crossref","unstructured":"[8] W. Zhang, J.-W. Jung, and Y. Qian, \u201cImproving design of input condition invariant speech enhancement,\u201d ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.10696-10700, 2024. 10.1109\/icassp48485.2024.10448155","DOI":"10.1109\/ICASSP48485.2024.10448155"},{"key":"9","doi-asserted-by":"crossref","unstructured":"[9] H. Shi, M. Mimura, L. Wang, J. Dang, and T. Kawahara, \u201cTime-domain speech enhancement assisted by multi-resolution frequency encoder and decoder,\u201d ICASSP 2023 - 2023 IEEE Int. Conf. Acoustics, Speech and Signal Processing (ICASSP), pp.1-5, 2023. 10.1109\/icassp49357.2023.10094718","DOI":"10.1109\/ICASSP49357.2023.10094718"},{"key":"10","doi-asserted-by":"publisher","unstructured":"[10] C. Xu, W. Rao, E.S. Chng, and H. Li, \u201cSpEx: Multi-scale time domain speaker extraction network,\u201d IEEE\/ACM Trans. Audio, Speech, Lang. Process., vol.28, pp.1370-1384, 2020. 10.1109\/taslp.2020.2987429","DOI":"10.1109\/TASLP.2020.2987429"},{"key":"11","doi-asserted-by":"crossref","unstructured":"[11] N. Ahmed, T. Natarajan, and K. Rao, \u201cDiscrete cosine transform,\u201d IEEE Trans. Comput., vol.C-23, no.1, pp.90-93, 1974. 10.1109\/t-c.1974.223784","DOI":"10.1109\/T-C.1974.223784"},{"key":"12","doi-asserted-by":"crossref","unstructured":"[12] Y. Zhang, H. Zou, and J. Zhu, \u201cA two-stage framework in cross-spectrum domain for real-time speech enhancement,\u201d ICASSP 2024 - 2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp.12587-12591, 2024. 10.1109\/icassp48485.2024.10447096","DOI":"10.1109\/ICASSP48485.2024.10447096"},{"key":"13","doi-asserted-by":"crossref","unstructured":"[13] C. Valentini-Botinhao, X. Wang, S. Takaki, and J. Yamagishi, \u201cInvestigating rnn-based speech enhancement methods for noise-robust text-to-speech.,\u201d SSW, pp.146-152, 2016. 10.21437\/ssw.2016-24","DOI":"10.21437\/SSW.2016-24"},{"key":"14","doi-asserted-by":"crossref","unstructured":"[14] C. Veaux, J. Yamagishi, and S. King, \u201cThe voice bank corpus: Design, collection and data analysis of a large regional accent speech database,\u201d 2013 International Conference Oriental COCOSDA held jointly with 2013 Conference on Asian Spoken Language Research and Evaluation (O-COCOSDA\/CASLRE), pp.1-4, 2013. 10.1109\/icsda.2013.6709856","DOI":"10.1109\/ICSDA.2013.6709856"},{"key":"15","doi-asserted-by":"crossref","unstructured":"[15] J. Thiemann, N. Ito, and E. Vincent, \u201cThe Diverse Environments Multi-channel Acoustic Noise Database (DEMAND): A database of multichannel environmental noise recordings,\u201d Proc. Meet. Acoust., vol.19, no.1, p.035081, 05 2013. 10.1121\/1.4799597","DOI":"10.1121\/1.4799597"},{"key":"16","doi-asserted-by":"crossref","unstructured":"[16] S. Lv, Y. Hu, S. Zhang, and L. Xie, \u2018\u201cDCCRN+: Channel-wise subband DCCRN with SNR estimation for speech enhancement,\u201d Proc. Interspeech 2021, pp.2816-2820, 2021. 10.21437\/interspeech.2021-1482","DOI":"10.21437\/Interspeech.2021-1482"},{"key":"17","doi-asserted-by":"crossref","unstructured":"[17] J. Chen, Z. Wang, D. Tuo, Z. Wu, S. Kang, and H. Meng, \u201cFullSubNet+: Channel attention fullsubnet with complex spectrograms for speech enhancement,\u201d ICASSP 2022 - 2022 IEEE Int. Conf. Acoustics, Speech and Signal Processing (ICASSP), pp.7857-7861, 2022. 10.1109\/icassp43922.2022.9747888","DOI":"10.1109\/ICASSP43922.2022.9747888"},{"key":"18","doi-asserted-by":"publisher","unstructured":"[18] A. Li, W. Liu, C. Zheng, C. Fan, and X. Li, \u201cTwo heads are better than one: A two-stage complex spectral mapping approach for monaural speech enhancement,\u201d IEEE\/ACM Trans. Audio, Speech, Lang. Process., vol.29, pp.1829-1843, 2021. 10.1109\/taslp.2021.3079813","DOI":"10.1109\/TASLP.2021.3079813"},{"key":"19","doi-asserted-by":"crossref","unstructured":"[19] A. Rix, J. Beerends, M. Hollier, and A. Hekstra, \u201cPerceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,\u201d 2001 IEEE Int. Conf. Acoustics, Speech, and Signal Processing. Proceedings (Cat. No.01CH37221), pp.749-752 vol.2, 2001. 10.1109\/icassp.2001.941023","DOI":"10.1109\/ICASSP.2001.941023"},{"key":"20","doi-asserted-by":"publisher","unstructured":"[20] C.H. Taal, R.C. Hendriks, R. Heusdens, and J. Jensen, \u201cAn algorithm for intelligibility prediction of time-frequency weighted noisy speech,\u201d IEEE Trans. Audio, Speech, Lang. Process., vol.19, no.7, pp.2125-2136, 2011. 10.1109\/tasl.2011.2114881","DOI":"10.1109\/TASL.2011.2114881"},{"key":"21","doi-asserted-by":"publisher","unstructured":"[21] Y. Hu and P.C. Loizou, \u201cEvaluation of objective quality measures for speech enhancement,\u201d IEEE Trans. Audio, Speech, Lang. Process., vol.16, no.1, pp.229-238, 2008. 10.1109\/tasl.2007.911054","DOI":"10.1109\/TASL.2007.911054"},{"key":"22","unstructured":"[22] I.T. Recommendation, \u201cSubjective test methodology for evaluating speech communication systems that include noise suppression algorithm,\u201d ITU-T recommendation, vol.835, 2003."},{"key":"23","doi-asserted-by":"crossref","unstructured":"[23] J. Chen, W. Rao, Z. Wang, J. Lin, Z. Wu, Y. Wang, S. Shang, and H. Meng, \u201cInter-subnet: Speech enhancement with subband interaction,\u201d ICASSP 2023 - 2023 IEEE Int. Conf. Acoustics, Speech and Signal Processing (ICASSP), pp.1-5, 2023. 10.1109\/icassp49357.2023.10094858","DOI":"10.1109\/ICASSP49357.2023.10094858"},{"key":"24","doi-asserted-by":"crossref","unstructured":"[24] J. Chen, W. Rao, Z. Wang, Z. Wu, Y. Wang, T. Yu, S. Shang, and H. Meng, \u201cSpeech Enhancement with Fullband-Subband Cross-Attention Network,\u201d Proc. Interspeech 2022, pp.976-980, 2022. 10.21437\/interspeech.2022-10257","DOI":"10.21437\/Interspeech.2022-10257"},{"key":"25","doi-asserted-by":"crossref","unstructured":"[25] C.K.A. Reddy, V. Gopal, R. Cutler, E. Beyrami, R. Cheng, H. Dubey, S. Matusevych, R. Aichner, A. Aazami, S. Braun, P. Rana, S. Srinivasan, and J. Gehrke, \u201cThe INTERSPEECH 2020 Deep Noise Suppression Challenge: Datasets, Subjective Testing Framework, and Challenge Results,\u201d Proc. Interspeech 2020, pp.2492-2496, 2020. 10.21437\/interspeech.2020-3038","DOI":"10.21437\/Interspeech.2020-3038"}],"container-title":["IEICE Transactions on Information and Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E108.D\/11\/E108.D_2024EDL8099\/_pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,1]],"date-time":"2025-11-01T03:36:04Z","timestamp":1761968164000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.jstage.jst.go.jp\/article\/transinf\/E108.D\/11\/E108.D_2024EDL8099\/_article"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,1]]},"references-count":25,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2025]]}},"URL":"https:\/\/doi.org\/10.1587\/transinf.2024edl8099","relation":{},"ISSN":["0916-8532","1745-1361"],"issn-type":[{"value":"0916-8532","type":"print"},{"value":"1745-1361","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,11,1]]},"article-number":"2024EDL8099"}}