{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,4,3]],"date-time":"2025-04-03T04:01:31Z","timestamp":1743652891610,"version":"3.40.3"},"reference-count":33,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2025,2,4]],"date-time":"2025-02-04T00:00:00Z","timestamp":1738627200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,2,4]],"date-time":"2025-02-04T00:00:00Z","timestamp":1738627200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["11804068"],"award-info":[{"award-number":["11804068"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100005046","name":"Natural Science Foundation of Heilongjiang Province","doi-asserted-by":"publisher","award":["LH2020F033"],"award-info":[{"award-number":["LH2020F033"]}],"id":[{"id":"10.13039\/501100005046","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100017961","name":"Health Commission of Heilongjiang Province","doi-asserted-by":"publisher","award":["20221111001069"],"award-info":[{"award-number":["20221111001069"]}],"id":[{"id":"10.13039\/100017961","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["SIViP"],"published-print":{"date-parts":[[2025,4]]},"DOI":"10.1007\/s11760-025-03836-y","type":"journal-article","created":{"date-parts":[[2025,2,4]],"date-time":"2025-02-04T08:08:15Z","timestamp":1738656495000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Research on DCNN-U-Net speech separation method based on Audio-Visual multimodal fusion"],"prefix":"10.1007","volume":"19","author":[{"given":"Chaofeng","family":"Lan","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rui","family":"Guo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lei","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shunbo","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Meng","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,2,4]]},"reference":[{"issue":"20","key":"3836_CR1","doi-asserted-by":"crossref","first-page":"31035","DOI":"10.1007\/s11042-023-14649-x","volume":"82","author":"J Agrawal","year":"2023","unstructured":"Agrawal, J., Gupta, M., Garg, H.: A review on speech separation in cocktail party environment: challenges and approaches. Multimedia Tools Appl. 82(20), 31035\u201331067 (2023)","journal-title":"Multimedia Tools Appl."},{"key":"3836_CR2","doi-asserted-by":"crossref","unstructured":"Shi, J., Xu, J., Liu, G.: Listen, Think and Listen Again: Capturing Top-down Auditory Attention for Speaker-independent Speech Separation. In IJCAI'18. In: Proceedings of the 27th International Joint Conference on Artificial Intelligence, pp. 4353\u20134360 (2018).","DOI":"10.24963\/ijcai.2018\/605"},{"key":"3836_CR3","doi-asserted-by":"crossref","first-page":"6054","DOI":"10.1109\/TIP.2020.2988148","volume":"29","author":"X Min","year":"2020","unstructured":"Min, X., Zhai, G., Zhou, J.: Study of subjective and objective quality assessment of audio-visual signals. IEEE Trans. Image Process. 29, 6054\u20136068 (2020)","journal-title":"IEEE Trans. Image Process."},{"key":"3836_CR4","first-page":"1104","volume":"5","author":"YY Luo","year":"2021","unstructured":"Luo, Y.Y., Wang, J., Xu, L.: Multi-stream gated and pyramidal temporal convolutional neural networks for audio-visual speech separation in multi-talker environments. Interspeech 5, 1104\u20131108 (2021)","journal-title":"Interspeech"},{"key":"3836_CR5","doi-asserted-by":"crossref","first-page":"52","DOI":"10.1016\/j.inffus.2022.03.001","volume":"85","author":"M Brousmiche","year":"2022","unstructured":"Brousmiche, M., Rouat, J., Dupont, S.: Multimodal attentive fusion network for audio-visual event recognition. Inf. Fusion 85, 52\u201359 (2022)","journal-title":"Inf. Fusion"},{"key":"3836_CR6","doi-asserted-by":"crossref","unstructured":"Yoon, Y., Wolfert, P., Kucherenko, T.: The GENEA Challenge 2022: A large evaluation of data-driven co-speech gesture generation. In: Proceedings of the 2022 International Conference on Multimodal Interaction. Bengaluru, India, pp. 736\u2013747 (2022)","DOI":"10.1145\/3536221.3558058"},{"key":"3836_CR7","doi-asserted-by":"crossref","unstructured":"Wu, Y.L., Li, C., Bai, J.: Time-domain audio-visual speech separation on low quality videos. In: Proceedings of the ICASSP 2022\u20132022 IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 256\u2013260 (2022)","DOI":"10.1109\/ICASSP43922.2022.9746866"},{"key":"3836_CR8","doi-asserted-by":"crossref","unstructured":"Gogate, M., Dashtipour, K., Bell, P.: Deep neural network driven binaural audio-visual speech separation. In: Proceedings of the 2020 international joint conference on neural networks (IJCNN). IEEE, 1\u20137 Apr (2022)","DOI":"10.1109\/IJCNN48605.2020.9207517"},{"key":"3836_CR9","doi-asserted-by":"crossref","unstructured":"Chern I, Hung K H, Chen Y T.: Audio-visual speech enhancement and separation by leveraging multimodal self-supervised embeddings. Institute of Electrical and Electronics Engineers, (2023).","DOI":"10.1109\/ICASSPW59220.2023.10193049"},{"key":"3836_CR10","doi-asserted-by":"crossref","unstructured":"Rahimi A, Afouras T, Zisserman A.: Voicevector: multimodal enrolment vectors for speaker separation. 785\u201389 (2024).","DOI":"10.1109\/ICASSPW62465.2024.10627309"},{"key":"3836_CR11","doi-asserted-by":"crossref","first-page":"104408","DOI":"10.1016\/j.bspc.2022.104408","volume":"80","author":"Y Korkmaz","year":"2023","unstructured":"Korkmaz, Y., Boyac\u0131, A.: Hybrid voice activity detection system based on LSTM and auditory speech features. Biomed. Signal Process. Control 80, 104408 (2023)","journal-title":"Biomed. Signal Process. Control"},{"key":"3836_CR12","doi-asserted-by":"crossref","unstructured":"Rahimi, A., Afouras, T., Zisserman, A.: Reading to listen at the cocktail party: Multi-modal speech separation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10493\u201310502 (2022).","DOI":"10.1109\/CVPR52688.2022.01024"},{"key":"3836_CR13","doi-asserted-by":"crossref","unstructured":"Lee S, Jung C, Jang Y, et al. Seeing through the conversation: Audio-visual speech separation based on diffusion model. In: ICASSP 2024\u20132024 IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 12632\u201312636 (2024).","DOI":"10.1109\/ICASSP48485.2024.10447679"},{"key":"3836_CR14","doi-asserted-by":"crossref","unstructured":"Li G, Deng J, Geng M, et al. Audio-visual end-to-end multi-channel speech separation, dereverberation and recognition. In: IEEE\/ACM Transactions on Audio, Speech, and Language Processing (2023).","DOI":"10.1109\/TASLP.2023.3294705"},{"key":"3836_CR15","doi-asserted-by":"crossref","first-page":"126432","DOI":"10.1016\/j.neucom.2023.126432","volume":"549","author":"Y Li","year":"2023","unstructured":"Li, Y., Zhang, X.: Lip landmark-based audio-visual speech enhancement with multimodal feature fusion network. Neurocomputing 549, 126432 (2023)","journal-title":"Neurocomputing"},{"key":"3836_CR16","doi-asserted-by":"crossref","unstructured":"Vanambathina, S.D., Nandyala, S., Jannu, C.: Speech enhancement using U-net-based progressive learning with squeeze-TCN. In: International Conference on Advances in Distributed Computing and Machine Learning. Springer Nature Singapore, Singapore, 419\u2013432 (2024).","DOI":"10.1007\/978-981-97-3523-5_31"},{"issue":"4","key":"3836_CR17","doi-asserted-by":"crossref","first-page":"2450043","DOI":"10.1142\/S0219467824500438","volume":"24","author":"C Jannu","year":"2024","unstructured":"Jannu, C., Vanambathina, S.D.: Shuffle attention u-net for speech enhancement in time domain. Int. J. Image Graph. 24(4), 2450043 (2024)","journal-title":"Int. J. Image Graph."},{"issue":"12","key":"3836_CR18","doi-asserted-by":"crossref","first-page":"7467","DOI":"10.1007\/s00034-023-02455-7","volume":"42","author":"C Jannu","year":"2023","unstructured":"Jannu, C., Vanambathina, S.D.: Multi-stage progressive learning-based speech enhancement using timefrequency attentive squeezed temporal convolutional networks. Circ. Syst. Signal Process. 42(12), 7467\u20137493 (2023)","journal-title":"Circ. Syst. Signal Process."},{"key":"3836_CR19","doi-asserted-by":"crossref","unstructured":"Gabbay, A., Ephrat, A., Halperin, T.: Seeing Through Noise: Visually Driven Speaker Separation and Enhancement. In: 2018 IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 3051\u20133055 (2018)","DOI":"10.1109\/ICASSP.2018.8462527"},{"issue":"2","key":"3836_CR20","first-page":"15","volume":"34","author":"T Afouras","year":"2018","unstructured":"Afouras, T., Chung, J.S., Zisserman, A.: The conversation: deep audio-visual speech. Enhancement 34(2), 15\u201318 (2018)","journal-title":"Enhancement"},{"issue":"2","key":"3836_CR21","doi-asserted-by":"crossref","first-page":"117","DOI":"10.1109\/TETCI.2017.2784878","volume":"2","author":"JC Hou","year":"2018","unstructured":"Hou, J.C., Wang, S.S., Lai, Y.H.: Audio-visual speech enhancement using multimodal deep convolutional neural networks. IEEE Trans. Emerg. Top. Comput. Intell. 2(2), 117\u2013128 (2018)","journal-title":"IEEE Trans. Emerg. Top. Comput. Intell."},{"issue":"1","key":"3836_CR22","first-page":"224","volume":"25","author":"Y Wang","year":"2012","unstructured":"Wang, Y., Wang, D.L.: Cocktail party processing via structured prediction. Adv. Neural. Inf. Process. Syst. 25(1), 224\u2013232 (2012)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"3836_CR23","doi-asserted-by":"crossref","first-page":"100301","DOI":"10.1016\/j.atech.2023.100301","volume":"5","author":"MI Hossain","year":"2023","unstructured":"Hossain, M.I., Jahan, S., Al Asif, M.R.: Detecting tomato leaf diseases by image processing through deep convolutional neural networks. Smart Agric. Technol. 5, 100301 (2023)","journal-title":"Smart Agric. Technol."},{"issue":"3","key":"3836_CR24","doi-asserted-by":"crossref","first-page":"542","DOI":"10.1109\/JSTSP.2020.2987209","volume":"14","author":"K Tan","year":"2020","unstructured":"Tan, K., Xu, Y., Zhang, S.X.: Audio-visual speech separation and dereverberation with a two-stage multimodal network. IEEE J. Sel. Top. Signal Process. 14(3), 542\u2013553 (2020)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"issue":"3","key":"3836_CR25","doi-asserted-by":"crossref","first-page":"530","DOI":"10.1109\/JSTSP.2020.2980956","volume":"14","author":"R Gu","year":"2020","unstructured":"Gu, R., Zhang, S.X., Xu, Y.: Multi-modal multi-channel target speech separation. IEEE J. Sel. Top. Signal Process. 14(3), 530\u2013541 (2020)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"3836_CR26","doi-asserted-by":"crossref","unstructured":"Zhang L, Pei K, Li W, et al. A New U-Net Speech Enhancement Framework Based on Correlation Characteristics of Speech. SAE Technical Paper (2024).","DOI":"10.4271\/2024-01-2015"},{"key":"3836_CR27","unstructured":"Aldarmaki I, Solorio T, Raj B, et al. RelUNet: Relative Channel Fusion U-Net for Multichannel Speech Enhancement. 2410.05019 (2024)."},{"issue":"10","key":"3836_CR28","first-page":"1799","volume":"37","author":"Xu Liang","year":"2021","unstructured":"Liang, Xu., Jing, W., Wenjing, Y., et al.: Conv-TasNet based multi-feature fusion audio-video joint speech separation algorithm. J. Signal Process. 37(10), 1799\u20131805 (2021)","journal-title":"J. Signal Process."},{"key":"3836_CR29","unstructured":"Bpiwowar. ICLR 2016: ICLR 2AV016: International Conference on Learning Representations 2016 (2018)."},{"issue":"4","key":"3836_CR30","doi-asserted-by":"crossref","first-page":"766","DOI":"10.1587\/transinf.2021EDP7020","volume":"105","author":"J Wang","year":"2022","unstructured":"Wang, J., Luo, Y., Yi, W., et al.: Speaker-independent audio-visual speech separation based on transformer in multi-talker environments. IEICE Trans. Inf. Syst. 105(4), 766\u2013777 (2022)","journal-title":"IEICE Trans. Inf. Syst."},{"issue":"4","key":"3836_CR31","doi-asserted-by":"crossref","first-page":"11.21","DOI":"10.1145\/3197517.3201357","volume":"37","author":"A Ephrat","year":"2018","unstructured":"Ephrat, A., Mosseri, I., Lang, O., et al.: Looking to listen at the cocktail party: a speaker-independent audio-visual model for speech separation. ACM Trans. Gr. 37(4), 11.21-112.11 (2018)","journal-title":"ACM Trans. Gr."},{"issue":"7","key":"3836_CR32","first-page":"1","volume":"44","author":"CF Lan","year":"2022","unstructured":"Lan, C.F., Wang, S.B., Guo, X.X.: Research on single-channel audio-visual fusion speech separation method based on DCNN and BiLSTM. Electron. J. 44(7), 1\u20138 (2022)","journal-title":"Electron. J."},{"key":"3836_CR33","doi-asserted-by":"crossref","first-page":"20814","DOI":"10.1109\/ACCESS.2023.3249967","volume":"11","author":"N Saleem","year":"2023","unstructured":"Saleem, N., Khattak, M.I., AlQahtani, S.A., Jan, A., Hussain, I., Khan, M.N., Dahshan, M.: U-shaped low-complexity type-2 fuzzy LSTM neural network for speech enhancement. IEEE Access 11, 20814\u201320826 (2023)","journal-title":"IEEE Access"}],"container-title":["Signal, Image and Video Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-03836-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11760-025-03836-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11760-025-03836-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,2]],"date-time":"2025-04-02T03:12:19Z","timestamp":1743563539000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11760-025-03836-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,2,4]]},"references-count":33,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2025,4]]}},"alternative-id":["3836"],"URL":"https:\/\/doi.org\/10.1007\/s11760-025-03836-y","relation":{},"ISSN":["1863-1703","1863-1711"],"issn-type":[{"type":"print","value":"1863-1703"},{"type":"electronic","value":"1863-1711"}],"subject":[],"published":{"date-parts":[[2025,2,4]]},"assertion":[{"value":"3 July 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 December 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 January 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 February 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Not applicable.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics approval and consent to participate"}},{"value":"The authors declare no competing interests.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"269"}}