{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T18:38:36Z","timestamp":1776883116857,"version":"3.51.2"},"reference-count":59,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,12]],"date-time":"2025-10-12T00:00:00Z","timestamp":1760227200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,12]],"date-time":"2025-10-12T00:00:00Z","timestamp":1760227200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,12]]},"DOI":"10.1109\/waspaa66052.2025.11230982","type":"proceedings-article","created":{"date-parts":[[2025,11,14]],"date-time":"2025-11-14T18:46:47Z","timestamp":1763146007000},"page":"1-5","source":"Crossref","is-referenced-by-count":1,"title":["ReverbMiipher: Generative Speech Restoration meets Reverberation Characteristics Controllability"],"prefix":"10.1109","author":[{"given":"Wataru","family":"Nakata","sequence":"first","affiliation":[{"name":"Google DeepMind,Tokyo,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuma","family":"Koizumi","sequence":"additional","affiliation":[{"name":"Google DeepMind,Tokyo,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shigeki","family":"Karita","sequence":"additional","affiliation":[{"name":"Google DeepMind,Tokyo,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Robin","family":"Scheibler","sequence":"additional","affiliation":[{"name":"Google DeepMind,Tokyo,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Haruko","family":"Ishikawa","sequence":"additional","affiliation":[{"name":"Google DeepMind,Tokyo,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Adriana","family":"Guevara-Rukoz","sequence":"additional","affiliation":[{"name":"Google,Zurich,Switzerland"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Heiga","family":"Zen","sequence":"additional","affiliation":[{"name":"Google DeepMind,Tokyo,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Michiel","family":"Bacchiani","sequence":"additional","affiliation":[{"name":"Google DeepMind,Tokyo,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.4324\/9780203186237"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1121\/1.4987362"},{"key":"ref3","article-title":"Direct comparison of the impact of head tracking, reverberation, and individualized head-related transfer functions on the spatial perception of a virtual speech source","author":"Begault","year":"2001","journal-title":"J. AES"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-84882-733-2_8"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2023.3288409"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-84996-056-4"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TASL.2010.2052251"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2013.6701894"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6854479"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-733"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/s10772-020-09674-2"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2019.8937165"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2022-298"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA52581.2021.9632770"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2022-11026"},{"key":"ref17","article-title":"Universal speech enhancement with score-based diffusion","author":"Serr\u00e0","year":"2022"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA58266.2023.10248089"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2023.3285241"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2024.3445871"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-138"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2025.acl-long.651"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-590"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49660.2025.10890760"},{"key":"ref25","article-title":"DiTSE: High-fidelity generative speech enhancement via latent diffusion transformers","author":"Guimar\u00e3es","year":"2025"},{"key":"ref26","doi-asserted-by":"crossref","DOI":"10.1109\/WASPAA66052.2025.11230923","article-title":"Miipher-2: A universal speech restoration model for million-hour scale data restoration","author":"Karita","year":"2025"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72986-7_23"},{"key":"ref28","article-title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","author":"Blattmann","year":"2023"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1121\/1.382599"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1121\/10.0023935"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2017.2744799"},{"key":"ref32","article-title":"Learning neural acoustic fields","author":"Luo","year":"2022","journal-title":"NeurIPS"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-230"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA52581.2021.9632680"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2023-1356"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49660.2025.10888876"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2018.2842159"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2020.3042071"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178801"},{"key":"ref40","article-title":"Audio super-resolution using neural nets","volume-title":"ICLR (Workshop Track)","author":"Kuleshov"},{"key":"ref41","article-title":"Neurips 2024 competition proposal: Urgent challenge","author":"Zhang","journal-title":"NeurIPS 2024 Competition Track."},{"key":"ref42","article-title":"Google USM: Scaling automatic speech recognition beyond 100 languages","author":"Zhang","year":"2023"},{"key":"ref43","article-title":"Towards a unified view of parameter-efficient transfer learning","author":"He","year":"2022","journal-title":"ICLR"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-3015"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/SLT54892.2023.10022496"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461310"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2171"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-1356"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-153"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-2821"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1612524113"},{"key":"ref52","article-title":"Adam: A method for stochastic optimization","author":"Kingma","year":"2015","journal-title":"ICLR"},{"key":"ref53","volume-title":"Practical nonparametric statistics.","author":"Conover","year":"1999"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.2307\/2282330"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/PACRIM.1993.407206"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/icassp.2009.4960497"},{"key":"ref57","article-title":"Transfer learning from speaker verification to multispeaker text-to-speech synthesis","author":"Jia","year":"2018","journal-title":"NeurIPS"},{"key":"ref58","article-title":"Sample efficient adaptive text-to-speech","author":"Chen","year":"2019","journal-title":"ICLR"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1121\/1.1939454"}],"event":{"name":"2025 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)","location":"Tahoe City, CA, USA","start":{"date-parts":[[2025,10,12]]},"end":{"date-parts":[[2025,10,15]]}},"container-title":["2025 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11230875\/11230917\/11230982.pdf?arnumber=11230982","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T07:36:09Z","timestamp":1763192169000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11230982\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,12]]},"references-count":59,"URL":"https:\/\/doi.org\/10.1109\/waspaa66052.2025.11230982","relation":{},"subject":[],"published":{"date-parts":[[2025,10,12]]}}}