{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T04:29:54Z","timestamp":1782966594225,"version":"3.54.5"},"reference-count":43,"publisher":"Springer Science and Business Media LLC","issue":"3-4","license":[{"start":{"date-parts":[[2024,3,4]],"date-time":"2024-03-04T00:00:00Z","timestamp":1709510400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,3,4]],"date-time":"2024-03-04T00:00:00Z","timestamp":1709510400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Wireless Pers Commun"],"published-print":{"date-parts":[[2025,12]]},"DOI":"10.1007\/s11277-024-10874-1","type":"journal-article","created":{"date-parts":[[2024,3,4]],"date-time":"2024-03-04T10:01:41Z","timestamp":1709546501000},"page":"491-509","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["A Subconvolutional U-net with Gated Recurrent Unit and Efficient Channel Attention Mechanism for Real-Time Speech Enhancement"],"prefix":"10.1007","volume":"145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-0458-4060","authenticated-orcid":false,"given":"Sivaramakrishna","family":"Yechuri","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Sunnydayal","family":"Vanambathina","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,3,4]]},"reference":[{"issue":"06","key":"10874_CR1","doi-asserted-by":"publisher","first-page":"330","DOI":"10.1055\/s-0042-1748062","volume":"11","author":"J Agnew","year":"2000","unstructured":"Agnew, J., & Thornton, J. M. (2000). Just noticeable and objectionable group delays in digital hearing aids. Journal of the American Academy of Audiology, 11(06), 330\u2013336.","journal-title":"Journal of the American Academy of Audiology"},{"key":"10874_CR2","first-page":"1877","volume":"33","author":"T Brown","year":"2020","unstructured":"Brown, T., Mann, B., Ryder, N., Subbiah, M., Kaplan, J. D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., & Agarwal, S. (2020). Language models are few-shot learners. Advances in Neural Information Processing Systems, 33, 1877\u20131901.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10874_CR3","doi-asserted-by":"crossref","unstructured":"Bulut, A. E., & Koishida, K. (2020). Low-latency single channel speech enhancement using u-net convolutional neural networks. In ICASSP 2020\u20132020 IEEE international conference on acoustics (pp. 6214\u20136218). IEEE: Speech and Signal Processing (ICASSP).","DOI":"10.1109\/ICASSP40776.2020.9054563"},{"issue":"6","key":"10874_CR4","doi-asserted-by":"publisher","first-page":"4705","DOI":"10.1121\/1.4986931","volume":"141","author":"J Chen","year":"2017","unstructured":"Chen, J., & Wang, D. (2017). Long short-term memory for speaker generalization in supervised speech separation. The Journal of the Acoustical Society of America, 141(6), 4705\u20134714.","journal-title":"The Journal of the Acoustical Society of America"},{"issue":"5","key":"10874_CR5","doi-asserted-by":"publisher","first-page":"2604","DOI":"10.1121\/1.4948445","volume":"139","author":"J Chen","year":"2016","unstructured":"Chen, J., Wang, Y., Yoho, S. E., Wang, D., & Healy, E. W. (2016). Large-scale training to increase speech intelligibility for hearing-impaired listeners in novel noises. The Journal of the Acoustical Society of America, 139(5), 2604\u20132612.","journal-title":"The Journal of the Acoustical Society of America"},{"key":"10874_CR6","unstructured":"Chung, J., Gulcehre, C., Cho, K. & Bengio, Y. (2014). Empirical evaluation of gated recurrent neural networks on sequence modeling. arXiv:1412.3555."},{"key":"10874_CR7","unstructured":"CommonVoice. (2017). Mozilla. https:\/\/commonvoice.mozilla.org\/en."},{"issue":"107","key":"10874_CR8","first-page":"019","volume":"157","author":"X Cui","year":"2020","unstructured":"Cui, X., Chen, Z., & Yin, F. (2020). Speech enhancement based on simple recurrent unit network. Applied Acoustics, 157(107), 019.","journal-title":"Applied Acoustics"},{"key":"10874_CR9","doi-asserted-by":"crossref","unstructured":"Hao, X., Su, X., Wang, Z., & Zhang, H. (2020). Unetgan: A robust speech enhancement approach in time domain for extremely low signal-to-noise ratio condition. arXiv:2010.15521.","DOI":"10.21437\/Interspeech.2019-1567"},{"key":"10874_CR10","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"10874_CR11","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., & Schmidhuber, J. (1997). Long short-term memory. Neural Computation, 9(8), 1735\u20131780.","journal-title":"Neural Computation"},{"key":"10874_CR12","doi-asserted-by":"crossref","unstructured":"Hu, J., Shen, L., & Sun, G. (2018). Squeeze-and-excitation networks. In Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 7132\u20137141.","DOI":"10.1109\/CVPR.2018.00745"},{"key":"10874_CR13","doi-asserted-by":"crossref","unstructured":"Kannan, A., Wu, Y., Nguyen, P., Sainath, T. N., Chen, Z., & Prabhavalkar, R. (2018). An analysis of incorporating an external language model into a sequence-to-sequence model. In 2018 IEEE international conference on acoustics (pp. 1\u20135828). IEEE: Speech and Signal Processing (ICASSP).","DOI":"10.1109\/ICASSP.2018.8462682"},{"key":"10874_CR14","unstructured":"Kingma, D.P. (2015). & ba j.(2014). adam: A method for stochastic optimization. =arXiv:1412.6980"},{"issue":"1","key":"10874_CR15","doi-asserted-by":"publisher","first-page":"153","DOI":"10.1109\/TASLP.2016.2628641","volume":"25","author":"M Kolb\u00e6k","year":"2016","unstructured":"Kolb\u00e6k, M., Tan, Z. H., & Jensen, J. (2016). Speech intelligibility potential of general and specialized deep neural network based speech enhancement systems. IEEE\/ACM Transactions on Audio, Speech, and Language Processing, 25(1), 153\u2013167.","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"10874_CR16","first-page":"588","volume":"49","author":"P Loizou","year":"2017","unstructured":"Loizou, P., & Hu, Y. (2017). Noizeus: A noisy speech corpus for evaluation of speech enhancement algorithms. Speech Communication, 49, 588\u2013601.","journal-title":"Speech Communication"},{"key":"10874_CR17","doi-asserted-by":"crossref","unstructured":"Ma, Z., Wu, W., Zheng, Z., Guo, Y., Chen, Q., Zhang, S., & Chen, X. (2023). Leveraging speech ptm, text llm, and emotional tts for speech emotion recognition. arXiv:2309.10294.","DOI":"10.1109\/ICASSP48485.2024.10445906"},{"key":"10874_CR18","doi-asserted-by":"crossref","unstructured":"Min, Z., & Wang, J. (2023). Exploring the integration of large language models into automatic speech recognition systems: An empirical study. arXiv:2307.06530.","DOI":"10.1007\/978-981-99-8181-6_6"},{"key":"10874_CR19","first-page":"27730","volume":"35","author":"L Ouyang","year":"2022","unstructured":"Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., Zhang, C., Agarwal, S., Slama, K., Ray, A., & Schulman, J. (2022). Training language models to follow instructions with human feedback. Advances in Neural Information Processing Systems, 35, 27730\u201327744.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"10874_CR20","unstructured":"Recommendation IT (2001). Perceptual evaluation of speech quality (PESQ): An objective method for end-to-end speech quality assessment of narrow-band telephone networks and speech codecs. Rec ITU-T P 862."},{"key":"10874_CR21","doi-asserted-by":"crossref","unstructured":"Reddy, C.K., Dubey, H., Gopal, V., Cutler, R., Braun, S., Gamper, H., Aichner, R. and Srinivasan, S.,(2021). Icassp 2021 deep noise suppression challenge. ICASSP 2021\u20132021 IEEE international conference on acoustics (pp. 6623\u20136627). IEEE: Speech and Signal Processing (ICASSP).","DOI":"10.1109\/ICASSP39728.2021.9415105"},{"key":"10874_CR22","doi-asserted-by":"crossref","unstructured":"Rethage, D., Pons, J., & Serra, X. (2018). A wavenet for speech denoising. In 2018 IEEE international conference on acoustics (pp. 5069\u20135073). IEEE: Speech and Signal Processing (ICASSP).","DOI":"10.1109\/ICASSP.2018.8462417"},{"key":"10874_CR23","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V. & Rabinovich, A. (2015). Going deeper with convolutions. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 1\u20139.","DOI":"10.1109\/CVPR.2015.7298594"},{"key":"10874_CR24","doi-asserted-by":"crossref","unstructured":"Szegedy, C., Vanhoucke, V., Ioffe, S. Shlens, J., & Wojna, Z. (2016). Rethinking the inception architecture for computer vision. In: Proceedings of the IEEE conference on computer vision and pattern recognition, (pp. 2818\u20132826).","DOI":"10.1109\/CVPR.2016.308"},{"issue":"7","key":"10874_CR25","doi-asserted-by":"publisher","first-page":"2125","DOI":"10.1109\/TASL.2011.2114881","volume":"19","author":"CH Taal","year":"2011","unstructured":"Taal, C. H., Hendriks, R. C., Heusdens, R., & Jensen, J. (2011). An algorithm for intelligibility prediction of time-frequency weighted noisy speech. IEEE Transactions on Audio, Speech and Language Processing, 19(7), 2125\u20132136.","journal-title":"IEEE Transactions on Audio, Speech and Language Processing"},{"issue":"1","key":"10874_CR26","doi-asserted-by":"publisher","first-page":"189","DOI":"10.1109\/TASLP.2018.2876171","volume":"27","author":"K Tan","year":"2018","unstructured":"Tan, K., Chen, J., & Wang, D. (2018). Gated residual networks with dilated convolutions for monaural speech enhancement. IEEE\/ACM Transactions on Audio, Speech and Language Processing, 27(1), 189\u2013198.","journal-title":"IEEE\/ACM Transactions on Audio, Speech and Language Processing"},{"issue":"4","key":"10874_CR27","doi-asserted-by":"publisher","first-page":"1462","DOI":"10.1109\/TSA.2005.858005","volume":"14","author":"E Vincent","year":"2006","unstructured":"Vincent, E., Gribonval, R., & F\u00e9votte, C. (2006). Performance measurement in blind audio source separation. IEEE Transactions on Audio, Speech and Language Processing, 14(4), 1462\u20131469.","journal-title":"IEEE Transactions on Audio, Speech and Language Processing"},{"key":"10874_CR28","doi-asserted-by":"publisher","DOI":"10.1109\/9780470043387","volume-title":"Computational auditory scene analysis: Principles, algorithms, and applications","author":"D Wang","year":"2006","unstructured":"Wang, D., & Brown, G. J. (2006). Computational auditory scene analysis: Principles, algorithms, and applications. Wiley-IEEE press."},{"issue":"10","key":"10874_CR29","doi-asserted-by":"publisher","first-page":"1702","DOI":"10.1109\/TASLP.2018.2842159","volume":"26","author":"D Wang","year":"2018","unstructured":"Wang, D., & Chen, J. (2018). Supervised speech separation based on deep learning: An overview. IEEE\/ACM Transactions on Audio, Speech, and Language Processing, 26(10), 1702\u20131726.","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"10874_CR30","doi-asserted-by":"crossref","unstructured":"Wang, Q., Wu, B., Zhu, P., Li, P., Zuo, W., & Hu, Q. (2020). Eca-net: Efficient channel attention for deep convolutional neural networks. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp. 11534\u201311542.","DOI":"10.1109\/CVPR42600.2020.01155"},{"issue":"7","key":"10874_CR31","doi-asserted-by":"publisher","first-page":"1381","DOI":"10.1109\/TASL.2013.2250961","volume":"21","author":"Y Wang","year":"2013","unstructured":"Wang, Y., & Wang, D. (2013). Towards scaling up classification-based speech separation. IEEE Transactions on Audio, Speech and Language Processing, 21(7), 1381\u20131390.","journal-title":"IEEE Transactions on Audio, Speech and Language Processing"},{"issue":"12","key":"10874_CR32","doi-asserted-by":"publisher","first-page":"1849","DOI":"10.1109\/TASLP.2014.2352935","volume":"22","author":"Y Wang","year":"2014","unstructured":"Wang, Y., Narayanan, A., & Wang, D. (2014). On training targets for supervised speech separation. IEEE\/ACM Transactions on Audio, Speech, and Language Processing, 22(12), 1849\u20131858.","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"10874_CR33","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/s13634-021-00813-8","volume":"2021","author":"Y Wang","year":"2021","unstructured":"Wang, Y., Han, J., Zhang, T., & Qing, D. (2021). Speech enhancement from fused features based on deep neural network and gated recurrent unit network. EURASIP Journal on Advances in Signal Processing, 2021, 1\u201319.","journal-title":"EURASIP Journal on Advances in Signal Processing"},{"key":"10874_CR34","doi-asserted-by":"crossref","unstructured":"Woo, S., Park, J., Lee, J. & Kweon, I. S. (2018). Cbam: Convolutional block attention module. In proceedings of the European conference on computer vision (eccv), (pp. 3-19).","DOI":"10.1007\/978-3-030-01234-2_1"},{"key":"10874_CR35","doi-asserted-by":"crossref","unstructured":"Xian, Y., Sun, Y., Wang, W. & Naqvi, S. M. (2021). Multi-scale residual convolutional encoder decoder with bidirectional long short-term memory for single channel speech enhancement. In: 2020 28th European signal processing conference (EUSIPCO), (pp. 431\u2013435). IEEE","DOI":"10.23919\/Eusipco47968.2020.9287618"},{"key":"10874_CR36","doi-asserted-by":"publisher","first-page":"1455","DOI":"10.1109\/LSP.2021.3093859","volume":"28","author":"X Xiang","year":"2021","unstructured":"Xiang, X., Zhang, X., & Chen, H. (2021). A convolutional network with multi-scale and attention mechanisms for end-to-end single-channel speech enhancement. IEEE Signal Processing Letters, 28, 1455\u20131459.","journal-title":"IEEE Signal Processing Letters"},{"key":"10874_CR37","unstructured":"Xu, B., Wang, N., Chen, T. & Li, M. (2015). Empirical evaluation of rectified activations in convolutional network. arXiv preprint arXiv:1505.00853."},{"issue":"1","key":"10874_CR38","doi-asserted-by":"publisher","first-page":"65","DOI":"10.1109\/LSP.2013.2291240","volume":"21","author":"Y Xu","year":"2013","unstructured":"Xu, Y., Du, J., Dai, L. R., & Lee, C. H. (2013). An experimental study on speech enhancement based on deep neural networks. IEEE Signal Processing Letters, 21(1), 65\u201368.","journal-title":"IEEE Signal Processing Letters"},{"issue":"1","key":"10874_CR39","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1109\/TASLP.2014.2364452","volume":"23","author":"Y Xu","year":"2014","unstructured":"Xu, Y., Du, J., Dai, L. R., & Lee, C. H. (2014). A regression approach to speech enhancement based on deep neural networks. IEEE\/ACM Transactions on Audio, Speech, and Language Processing, 23(1), 7\u201319.","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"10874_CR40","doi-asserted-by":"crossref","unstructured":"Xu, Z., Elshamy, S., & Fingscheidt, T. (2020). Using separate losses for speech and noise in mask-based speech enhancement. ICASSP 2020\u20132020 IEEE international conference on acoustics (pp. 7519\u20137523). IEEE: Speech and Signal Processing (ICASSP).","DOI":"10.1109\/ICASSP40776.2020.9052968"},{"key":"10874_CR41","doi-asserted-by":"crossref","unstructured":"Yang, C. H., Qi, J., Chen, P. Y., Ma, X., & Lee, C. H. (2020). Characterizing speech adversarial examples using self-attention u-net enhancement. ICASSP 2020\u20132020 IEEE international conference on acoustics (pp. 3107\u20133111). IEEE: Speech and Signal Processing (ICASSP).","DOI":"10.1109\/ICASSP40776.2020.9053288"},{"key":"10874_CR42","doi-asserted-by":"publisher","first-page":"4051","DOI":"10.1007\/s00034-023-02300-x","volume":"42","author":"S Yechuri","year":"2023","unstructured":"Yechuri, S., & Vanambathina, S. (2023). A nested u-net with efficient channel attention and d3net for speech enhancement. Circuits, Systems, and Signal Processing, 42, 4051\u20134071.","journal-title":"Circuits, Systems, and Signal Processing"},{"key":"10874_CR43","unstructured":"Yu, J., Jiang, T., & Yu, J. (2021). Group multi-scale convolutional network for monaural speech enhancement in time-domain. In 2021 Asia-Pacific signal and information processing association annual summit and conference (APSIPA ASC), pp. 646\u2013650. IEEE."}],"container-title":["Wireless Personal Communications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11277-024-10874-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11277-024-10874-1\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11277-024-10874-1.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T08:46:53Z","timestamp":1765356413000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11277-024-10874-1"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,3,4]]},"references-count":43,"journal-issue":{"issue":"3-4","published-print":{"date-parts":[[2025,12]]}},"alternative-id":["10874"],"URL":"https:\/\/doi.org\/10.1007\/s11277-024-10874-1","relation":{},"ISSN":["0929-6212","1572-834X"],"issn-type":[{"value":"0929-6212","type":"print"},{"value":"1572-834X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,3,4]]},"assertion":[{"value":"20 January 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 March 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"There is no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}