{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T16:31:46Z","timestamp":1784133106052,"version":"3.55.0"},"reference-count":33,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,4,6]],"date-time":"2025-04-06T00:00:00Z","timestamp":1743897600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,4,6]],"date-time":"2025-04-06T00:00:00Z","timestamp":1743897600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,4,6]]},"DOI":"10.1109\/icassp49660.2025.10890370","type":"proceedings-article","created":{"date-parts":[[2025,3,12]],"date-time":"2025-03-12T13:52:43Z","timestamp":1741787563000},"page":"1-5","source":"Crossref","is-referenced-by-count":4,"title":["Audio Explanation Synthesis with Generative Foundation Models"],"prefix":"10.1109","author":[{"given":"Alican","family":"Akman","sequence":"first","affiliation":[{"name":"Imperial College,GLAM,London,UK"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qiyang","family":"Sun","sequence":"additional","affiliation":[{"name":"Imperial College,GLAM,London,UK"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bj\u00f6rn W.","family":"Schuller","sequence":"additional","affiliation":[{"name":"Imperial College,GLAM,London,UK"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"why should I trust you?\u201d: Explaining the predictions of any classifier","volume-title":"CoRR","volume":"abs\/1602.04938","author":"Ribeiro","year":"2016"},{"key":"ref2","article-title":"RISE: randomized input sampling for explanation of black-box models","volume-title":"CoRR","volume":"abs\/1806.07421","author":"Petsiuk","year":"2018"},{"key":"ref3","article-title":"Visualizing and understanding convolutional networks","volume-title":"CoRR","volume":"abs\/1311.2901","author":"Zeiler","year":"2013"},{"key":"ref4","article-title":"Understanding deep networks via extremal perturbations and smooth masks","volume-title":"CoRR","volume":"abs\/1910.08485","author":"Fong","year":"2019"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0130140"},{"key":"ref6","article-title":"Axiomatic attribution for deep networks","volume-title":"CoRR","volume":"abs\/1703.01365","author":"Sundararajan","year":"2017"},{"key":"ref7","article-title":"Learning important features through propagating activation differences","volume-title":"CoRR","volume":"abs\/1704.02685","author":"Shrikumar","year":"2017"},{"key":"ref8","article-title":"Grad-cam: Why did you say that? visual explanations from deep networks via gradient-based localization","volume-title":"CoRR","volume":"abs\/1610.02391","author":"Selvaraju","year":"2016"},{"key":"ref9","article-title":"Explaining nonlinear classification decisions with deep taylor decomposition","volume-title":"CoRR","volume":"abs\/1512.02479","author":"Montavon","year":"2015"},{"key":"ref10","article-title":"A unified view of gradient-based attribution methods for deep neural networks","volume-title":"CoRR","volume":"abs\/1711.06104","author":"Ancona","year":"2017"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1145\/3462244.3479879"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/EMBC48229.2022.9871291"},{"key":"ref13","doi-asserted-by":"crossref","DOI":"10.31219\/osf.io\/4rtjs","article-title":"Listen to interpret: Post-hoc interpretability for audio networks with nmf","author":"Parekh","year":"2022"},{"key":"ref14","article-title":"Algorithms for non-negative matrix factorization","volume-title":"Advances in Neural Information Processing Systems","volume":"13","author":"Lee","year":"2000"},{"key":"ref15","article-title":"AST: audio spectrogram transformer","volume-title":"CoRR","volume":"abs\/2104.01778","author":"Gong","year":"2021"},{"key":"ref16","article-title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","volume-title":"CoRR","volume":"abs\/2106.07447","author":"Hsu","year":"2021"},{"key":"ref17","article-title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","volume-title":"CoRR","volume":"abs\/2110.13900","author":"Chen","year":"2021"},{"key":"ref18","article-title":"vq-wav2vec: Self-supervised learning of discrete speech representations","volume-title":"CoRR","volume":"abs\/1910.05453","author":"Baevski","year":"2019"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/SLT48900.2021.9383575"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053569"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/SLT48900.2021.9383605"},{"key":"ref22","article-title":"High fidelity neural audio compression","author":"D\u00e9fossez","year":"2022"},{"key":"ref23","article-title":"A multiscale visualization of attention in the transformer model","volume-title":"CoRR","volume":"abs\/1906.05714","author":"Vig","year":"2019"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TVCG.2023.3327163"},{"key":"ref25","article-title":"Quantifying attention flow in transformers","volume-title":"CoRR","volume":"abs\/2005.00928","author":"Abnar","year":"2020"},{"key":"ref26","article-title":"Interpretability beyond feature attribution: Quantitative testing with concept activation vectors (tcav)","author":"Kim","year":"2018"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.354"},{"key":"ref28","article-title":"Interpreting and explaining deep neural networks for classification of audio signals","author":"Becker","year":"2019"},{"key":"ref29","article-title":"Layer-wise relevance propagation for neural networks with local renormalization layers","volume-title":"CoRR","volume":"abs\/1604.00825","author":"Binder","year":"2016"},{"key":"ref30","article-title":"Xai-based comparison of input representations for audio event classification","author":"Frommholz","year":"2023"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2024.110309"},{"key":"ref32","article-title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","volume-title":"ArXiv e-prints","author":"Warden","year":"2018"},{"key":"ref33","article-title":"Toronto emotional speech set (TESS)","author":"Pichora-Fuller","year":"2020"}],"event":{"name":"ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Hyderabad, India","start":{"date-parts":[[2025,4,6]]},"end":{"date-parts":[[2025,4,11]]}},"container-title":["ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10887540\/10887541\/10890370.pdf?arnumber=10890370","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T05:22:17Z","timestamp":1774416137000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10890370\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4,6]]},"references-count":33,"URL":"https:\/\/doi.org\/10.1109\/icassp49660.2025.10890370","relation":{},"subject":[],"published":{"date-parts":[[2025,4,6]]}}}