{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,22]],"date-time":"2026-04-22T19:56:09Z","timestamp":1776887769296,"version":"3.51.2"},"reference-count":32,"publisher":"IEEE","license":[{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,6,6]],"date-time":"2021-06-06T00:00:00Z","timestamp":1622937600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2021,6,6]]},"DOI":"10.1109\/icassp39728.2021.9414003","type":"proceedings-article","created":{"date-parts":[[2021,5,13]],"date-time":"2021-05-13T19:53:45Z","timestamp":1620935625000},"page":"501-505","source":"Crossref","is-referenced-by-count":23,"title":["One-Shot Conditional Audio Filtering of Arbitrary Sounds"],"prefix":"10.1109","author":[{"given":"Beat","family":"Gfeller","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dominik","family":"Roblek","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Marco","family":"Tagliasacchi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref32","first-page":"2579","article-title":"Visualizing data using t-SNE","volume":"9","author":"van der maaten","year":"2008","journal-title":"Journal of Machine Learning Research"},{"key":"ref31","article-title":"A spectral energy distance for parallel speech synthesis","author":"gritsenko","year":"2020","journal-title":"CoRR"},{"key":"ref30","article-title":"DDSP: differentiable digital signal processing","author":"engel","year":"2020","journal-title":"ICLR 2020"},{"key":"ref10","article-title":"Unsupervised sound separation using mixtures of mixtures","author":"wisdom","year":"2020","journal-title":"CoRR"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3013105"},{"key":"ref12","article-title":"Wavesplit: End-to-end speech separation by speaker clustering","author":"zeghidour","year":"2020","journal-title":"CoRR"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-1101"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2014.6853860"},{"key":"ref15","first-page":"91","article-title":"Speech enhancement with LSTM recurrent neural networks and its application to noise-robust ASR","volume":"9237","author":"weninger","year":"2015","journal-title":"LVA\/ICA 2015"},{"key":"ref16","doi-asserted-by":"crossref","first-page":"800","DOI":"10.1109\/JSTSP.2019.2922820","article-title":"SpeakerBeam: Speaker aware neural network for target speaker extraction in speech mixtures","volume":"13","author":"\u017emol\u00edkov\u00e1","year":"2019","journal-title":"IEEE Journal of Selected Topics in Signal Processing"},{"key":"ref17","article-title":"Wave-U-Net: A multi-scale neural network for end-to-end audio source separation","author":"stoller","year":"0","journal-title":"ISMIR 2018"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683800"},{"key":"ref19","first-page":"878","article-title":"Audio query-based music source separation","author":"lee","year":"2019","journal-title":"ISMIR 2019"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683855"},{"key":"ref4","article-title":"Learning to denoise historical music","author":"gfeller","year":"2020","journal-title":"ISMIR 2020 - 21st International Society for Music Information Retrieval Conference"},{"key":"ref27","article-title":"Neural turing machines","author":"graves","year":"2014","journal-title":"CoRR"},{"key":"ref3","doi-asserted-by":"crossref","DOI":"10.1145\/3197517.3201357","article-title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separation","volume":"37","author":"ephrat","year":"2018","journal-title":"ACM Trans Graph"},{"key":"ref6","article-title":"FSD50K","author":"fonseca","year":"2020"},{"key":"ref29","article-title":"Free universal sound separation dataset","author":"wisdom","year":"2020"},{"key":"ref5","article-title":"AudioSet: An ontology and human-labeled dataset for audio events","author":"gemmeke","year":"2017","journal-title":"Proc IEEE ICASSP 2017"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053396"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178964"},{"key":"ref2","article-title":"Conditioned source separation for music instrument performances","author":"slizovskaia","year":"2020","journal-title":"CoRR"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053921"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2019.8937253"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00097"},{"key":"ref22","first-page":"234","article-title":"U-net: Convolutional networks for biomedical image segmentation","volume":"9351","author":"ronneberger","year":"2015","journal-title":"Medical Image Computing and Computer-Assisted Intervention (MIC-CAI)"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1563"},{"key":"ref24","article-title":"Fast and accurate deep network learning by exponential linear units (ELUs)","author":"clevert","year":"2016","journal-title":"ICLR 2016"},{"key":"ref23","first-page":"3","article-title":"Group normalization","volume":"11217","author":"wu","year":"2018","journal-title":"ECC 2018"},{"key":"ref26","first-page":"10287","article-title":"Temporal FiLM: Capturing long-range sequence dependencies with feature-wise modulations","author":"birnbaum","year":"2019","journal-title":"NeurIPS 2019"},{"key":"ref25","first-page":"3942","article-title":"FiLM: Visual reasoning with a general conditioning layer","author":"perez","year":"2018","journal-title":"AAAI 2018"}],"event":{"name":"ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"Toronto, ON, Canada","start":{"date-parts":[[2021,6,6]]},"end":{"date-parts":[[2021,6,11]]}},"container-title":["ICASSP 2021 - 2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/9413349\/9413350\/09414003.pdf?arnumber=9414003","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T15:40:58Z","timestamp":1652197258000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9414003\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,6,6]]},"references-count":32,"URL":"https:\/\/doi.org\/10.1109\/icassp39728.2021.9414003","relation":{},"subject":[],"published":{"date-parts":[[2021,6,6]]}}}