{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T20:19:55Z","timestamp":1783109995593,"version":"3.54.6"},"publisher-location":"Singapore","reference-count":37,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819543663","type":"print"},{"value":"9789819543670","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,11,22]],"date-time":"2025-11-22T00:00:00Z","timestamp":1763769600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,11,22]],"date-time":"2025-11-22T00:00:00Z","timestamp":1763769600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-4367-0_15","type":"book-chapter","created":{"date-parts":[[2025,11,21]],"date-time":"2025-11-21T12:38:18Z","timestamp":1763728698000},"page":"214-227","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["VISE: Velocity-Guided Interpolant Diffusion for\u00a0Efficient Speech Enhancement"],"prefix":"10.1007","author":[{"given":"Gang","family":"Yang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yangjie","family":"Wei","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ben","family":"Niu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuqiao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shengling","family":"Yu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,11,22]]},"reference":[{"key":"15_CR1","doi-asserted-by":"publisher","first-page":"2550001","DOI":"10.1142\/S0219467825500019","volume":"25","author":"C Jannu","year":"2025","unstructured":"Jannu, C., Vanambathina, S.: An overview of speech enhancement based on deep learning techniques. Int. J. Image Graph. 25, 2550001 (2025)","journal-title":"Int. J. Image Graph."},{"key":"15_CR2","doi-asserted-by":"publisher","first-page":"1544","DOI":"10.1109\/JSTSP.2024.3524022","volume":"18","author":"B Gholami","year":"2025","unstructured":"Gholami, B., El-Khamy, M., Song, K.: Latent mixup knowledge distillation for single channel speech enhancement. IEEE J. Sel. Top. Signal Process. 18, 1544\u20131556 (2025)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"15_CR3","first-page":"1","volume":"73","author":"Q Zhao","year":"2024","unstructured":"Zhao, Q., Chen, Z., Yin, F.: Multiframe maximum likelihood distortionless response filter for single-channel speech enhancement. IEEE Trans. Instrum. Meas. 73, 1\u201313 (2024)","journal-title":"IEEE Trans. Instrum. Meas."},{"key":"15_CR4","doi-asserted-by":"crossref","unstructured":"Nustede, E., Anem\u00fcller, J.: On the generalization ability of complex-valued variational U-Networks for single-channel speech enhancement. IEEE\/ACM Trans. Audio Speech Lang. Process. 32, 3838\u20133849 (2024)","DOI":"10.1109\/TASLP.2024.3444492"},{"key":"15_CR5","doi-asserted-by":"publisher","first-page":"1256","DOI":"10.1109\/TASLP.2019.2915167","volume":"27","author":"Y Luo","year":"2019","unstructured":"Luo, Y., Mesgarani, N.: Conv-TasNet: surpassing ideal time\u2013frequency magnitude masking for speech separation. IEEE\/ACM Trans. Audio Speech Lang. Process. 27, 1256\u20131266 (2019)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"15_CR6","doi-asserted-by":"crossref","unstructured":"Fu, S., et al.: MetricGAN+: an improved version of metricGAN for speech enhancement. ArXiv Preprint ArXiv:2104.03538 (2021)","DOI":"10.21437\/Interspeech.2021-599"},{"key":"15_CR7","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2024.101626","volume":"86","author":"S Gul","year":"2024","unstructured":"Gul, S., Khan, M., Fazeel, M.: Single-channel speech enhancement using colored spectrograms. Comput. Speech Lang. 86, 101626 (2024)","journal-title":"Comput. Speech Lang."},{"key":"15_CR8","doi-asserted-by":"crossref","unstructured":"Wang, K., He, B., Zhu, W.: TSTNN: two-stage transformer based neural network for speech enhancement in the time domain. In: ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 7098\u20137102 (2021)","DOI":"10.1109\/ICASSP39728.2021.9413740"},{"key":"15_CR9","unstructured":"Chao, R., et al.: An investigation of incorporating mamba for speech enhancement. ArXiv Preprint ArXiv:2405.06573 (2024)"},{"key":"15_CR10","doi-asserted-by":"publisher","first-page":"1849","DOI":"10.1109\/TASLP.2014.2352935","volume":"22","author":"Y Wang","year":"2014","unstructured":"Wang, Y., Narayanan, A., Wang, D.: On training targets for supervised speech separation. IEEE\/ACM Trans. Audio Speech Lang. Process. 22, 1849\u20131858 (2014)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"15_CR11","doi-asserted-by":"crossref","unstructured":"Golmakani, A., Sadeghi, M., Alameda-Pineda, X., Serizel, R.: A weighted-variance variational autoencoder model for speech enhancement. In: ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 12451\u201312455 (2024)","DOI":"10.1109\/ICASSP48485.2024.10446294"},{"key":"15_CR12","doi-asserted-by":"publisher","first-page":"2993","DOI":"10.1109\/TASLP.2022.3207349","volume":"30","author":"X Bie","year":"2022","unstructured":"Bie, X., Leglaive, S., Alameda-Pineda, X., Girin, L.: Unsupervised speech enhancement using dynamical variational autoencoders. IEEE\/ACM Trans. Audio Speech Lang. Process. 30, 2993\u20133007 (2022)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"15_CR13","doi-asserted-by":"publisher","first-page":"69812","DOI":"10.1109\/ACCESS.2024.3397775","volume":"12","author":"S Bengesi","year":"2024","unstructured":"Bengesi, S., El-Sayed, H., Sarker, M., Houkpati, Y., Irungu, J., Oladunni, T.: Advancements in Generative AI: a comprehensive review of GANs, GPT, autoencoders, diffusion model, and transformers. IEEE Access 12, 69812\u201369837 (2024)","journal-title":"IEEE Access"},{"key":"15_CR14","doi-asserted-by":"publisher","first-page":"2225","DOI":"10.1109\/LSP.2024.3449221","volume":"31","author":"P Gonzalez","year":"2024","unstructured":"Gonzalez, P., Tan, Z., \u00d8stergaard, J., Jensen, J., Alstr\u00f8m, T., May, T.: The effect of training dataset size on discriminative and diffusion-based speech enhancement systems. IEEE Signal Process. Lett. 31, 2225\u20132229 (2024)","journal-title":"IEEE Signal Process. Lett."},{"key":"15_CR15","unstructured":"Song, Y., Sohl-Dickstein, J., Kingma, D., Kumar, A., Ermon, S., Poole, B.: Score-based generative modeling through stochastic differential equations. ArXiv Preprint ArXiv:2011.13456 (2020)"},{"key":"15_CR16","doi-asserted-by":"crossref","unstructured":"Scheibler, R., Ji, Y., Chung, S., Byun, J., Choe, S., Choi, M.: Diffusion-based generative speech source separation. In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135 (2023)","DOI":"10.1109\/ICASSP49357.2023.10095310"},{"key":"15_CR17","doi-asserted-by":"crossref","unstructured":"Tai, W., Lei, Y., Zhou, F., Trajcevski, G., Zhong, T.: Dose: diffusion dropout with adaptive prior for speech enhancement. In: Advances in Neural Information Processing Systems, vol. 36 (2024)","DOI":"10.52202\/075280-1750"},{"key":"15_CR18","doi-asserted-by":"crossref","unstructured":"Yang, Y., Trigoni, N., Markham, A.: Pre-training feature guided diffusion model for speech enhancement. ArXiv Preprint ArXiv:2406.07646 (2024)","DOI":"10.21437\/Interspeech.2024-1077"},{"key":"15_CR19","first-page":"1190","volume":"2024","author":"D Kim","year":"2024","unstructured":"Kim, D., et al.: Guided conditioning with predictive network on score-based diffusion model for speech enhancement. Proc. Interspeech 2024, 1190\u20131194 (2024)","journal-title":"Proc. Interspeech"},{"key":"15_CR20","unstructured":"Yang, Y., et al.: A survey on diffusion models for time series and spatio-temporal data. ArXiv Preprint ArXiv:2404.18886 (2024)"},{"key":"15_CR21","doi-asserted-by":"publisher","first-page":"3025","DOI":"10.1109\/TASLP.2024.3407533","volume":"32","author":"Z Guo","year":"2024","unstructured":"Guo, Z., Wang, Q., Du, J., Pan, J., Liu, Q., Lee, C.: A variance-preserving interpolation approach for diffusion models with applications to single channel speech enhancement and recognition. IEEE\/ACM Trans. Audio Speech Lang. Process. 32, 3025\u20133038 (2024)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"15_CR22","unstructured":"Song, J., Meng, C., Ermon, S. Denoising diffusion implicit models. ArXiv Preprint ArXiv:2010.02502 (2020)"},{"key":"15_CR23","doi-asserted-by":"crossref","unstructured":"Karras, T., Aittala, M., Aila, T., Laine, S.: Elucidating the design space of diffusion-based generative models. In: Advances in Neural Information Processing Systems, vol. 35, pp. 26565\u201326577 (2022)","DOI":"10.52202\/068431-1926"},{"key":"15_CR24","doi-asserted-by":"publisher","first-page":"2351","DOI":"10.1109\/TASLP.2023.3285241","volume":"31","author":"J Richter","year":"2023","unstructured":"Richter, J., Welker, S., Lemercier, J., Lay, B., Gerkmann, T.: Speech enhancement and dereverberation with diffusion-based generative models. IEEE\/ACM Trans. Audio Speech Lang. Process. 31, 2351\u20132364 (2023)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"15_CR25","doi-asserted-by":"crossref","unstructured":"Welker, S., Richter, J., Gerkmann, T.: Speech enhancement with score-based generative models in the complex STFT domain. ArXiv Preprint ArXiv:2203.17004 (2022)","DOI":"10.21437\/Interspeech.2022-10653"},{"key":"15_CR26","unstructured":"Lipman, Y., Chen, R., Ben-Hamu, H., Nickel, M., Le, M.: Flow matching for generative modeling. ArXiv Preprint ArXiv:2210.02747 (2022)"},{"key":"15_CR27","doi-asserted-by":"crossref","unstructured":"Lee, S., Cheong, S., Han, S., Shin, J.: FlowSE: flow matching-based speech enhancement. In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135 (2025)","DOI":"10.1109\/ICASSP49660.2025.10888274"},{"key":"15_CR28","doi-asserted-by":"crossref","unstructured":"Korostik, R., Nasretdinov, R., Juki?, A.: Modifying flow matching for generative speech enhancement. In: ICASSP 2025-2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 1\u20135 (2025)","DOI":"10.1109\/ICASSP49660.2025.10888705"},{"key":"15_CR29","doi-asserted-by":"crossref","unstructured":"Ma, N., Goldstein, M., Albergo, M., Boffi, N., Vanden-Eijnden, E., Xie, S.: SiT: exploring flow and diffusion-based generative models with scalable interpolant transformers. ArXiv Preprint ArXiv:2401.08740 (2024)","DOI":"10.1007\/978-3-031-72980-5_2"},{"key":"15_CR30","doi-asserted-by":"crossref","unstructured":"Peebles, W., Xie, S.: Scalable diffusion models with transformers. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 4195\u20134205 (2023)","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"15_CR31","unstructured":"Lee, K., Kim, D., Kim, J., Cho, J.: DiTTo-TTS: efficient and scalable zero-shot text-to-speech with diffusion transformer. ArXiv Preprint ArXiv:2406.11427 (2024)"},{"key":"15_CR32","doi-asserted-by":"crossref","unstructured":"Valentini-Botinhao, C., Wang, X., Takaki, S., Yamagishi, J.: Investigating RNN-based speech enhancement methods for noise-robust Text-to-Speech. In: SSW, pp. 146\u2013152 (2016)","DOI":"10.21437\/SSW.2016-24"},{"key":"15_CR33","doi-asserted-by":"crossref","unstructured":"Barker, J., Marxer, R., Vincent, E., Watanabe, S.: The third \u2018CHiME\u2019 speech separation and recognition challenge: dataset, task and baselines. In: 2015 IEEE Workshop on Automatic Speech Recognition and Understanding (ASRU), pp. 504\u2013511 (2015)","DOI":"10.1109\/ASRU.2015.7404837"},{"key":"15_CR34","unstructured":"Garofolo, J., Graff, D., Paul, D., Pallett, D.: CSR-I (WSJ0) complete. (No Title) (2007)"},{"key":"15_CR35","doi-asserted-by":"crossref","unstructured":"Rix, A., Beerends, J., Hollier, M., Hekstra, A.: Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs. In: 2001 IEEE International Conference on Acoustics, Speech, and Signal Processing. Proceedings (Cat. No. 01CH37221), vol. 2, pp. 749\u2013752 (2001)","DOI":"10.1109\/ICASSP.2001.941023"},{"key":"15_CR36","doi-asserted-by":"publisher","first-page":"2009","DOI":"10.1109\/TASLP.2016.2585878","volume":"24","author":"J Jensen","year":"2016","unstructured":"Jensen, J., Taal, C.: An algorithm for predicting the intelligibility of speech masked by modulated noise maskers. IEEE\/ACM Trans. Audio Speech Lang. Process. 24, 2009\u20132022 (2016)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"15_CR37","doi-asserted-by":"crossref","unstructured":"Le Roux, J., Wisdom, S., Erdogan, H., Hershey, J.: SDR\u2013half-baked or well done?. In: ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 626\u2013630 (2019)","DOI":"10.1109\/ICASSP.2019.8683855"}],"container-title":["Lecture Notes in Computer Science","Neural Information Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-4367-0_15","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T19:34:29Z","timestamp":1783107269000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-4367-0_15"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,22]]},"ISBN":["9789819543663","9789819543670"],"references-count":37,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-4367-0_15","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,11,22]]},"assertion":[{"value":"22 November 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICONIP","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Neural Information Processing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Okinawa","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Japan","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"20 November 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"24 November 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"32","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"iconip2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/iconip2025.apnns.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}