{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,30]],"date-time":"2025-10-30T07:17:03Z","timestamp":1761808623941},"reference-count":40,"publisher":"IEEE","license":[{"start":{"date-parts":[[2023,6,4]],"date-time":"2023-06-04T00:00:00Z","timestamp":1685836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,6,4]],"date-time":"2023-06-04T00:00:00Z","timestamp":1685836800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,6,4]]},"DOI":"10.1109\/icasspw59220.2023.10193208","type":"proceedings-article","created":{"date-parts":[[2023,8,2]],"date-time":"2023-08-02T17:30:54Z","timestamp":1690997454000},"page":"1-5","source":"Crossref","is-referenced-by-count":3,"title":["Audioslots: A Slot-Centric Generative Model For Audio Separation"],"prefix":"10.1109","author":[{"given":"Pradyumna","family":"Reddy","sequence":"first","affiliation":[{"name":"University College London"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Scott","family":"Wisdom","sequence":"additional","affiliation":[{"name":"Google Research"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Klaus","family":"Greff","sequence":"additional","affiliation":[{"name":"Google Research"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"John R.","family":"Hershey","sequence":"additional","affiliation":[{"name":"Google Research"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Thomas","family":"Kipf","sequence":"additional","affiliation":[{"name":"Google Research"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref13","article-title":"An efficient encoder-decoder architecture with top-down attention for speech separation","author":"li","year":"2022","journal-title":"arXiv preprint arXiv 2209 15200"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1016\/j.specom.2008.09.001"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9413901"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178964"},{"key":"ref15","article-title":"Tf-gridnet: Making time-frequency domain models great again for monaural speaker separation","author":"wang","year":"2022","journal-title":"arXiv preprint arXiv 2209 03952"},{"key":"ref37","article-title":"Separate and diffuse: Using a pretrained diffusion model for improving source separation","author":"lutati","year":"2023","journal-title":"arXiv preprint arXiv 2301 10710"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-1563"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683855"},{"key":"ref31","article-title":"Fourier features let networks learn high frequency functions in low dimensional domains","author":"tancik","year":"2020","journal-title":"NeurIPS"},{"key":"ref30","article-title":"Spatial broadcast decoder: A simple architecture for learning disentangled representations in vaes","author":"watters","year":"2019","journal-title":"arXiv preprint arXiv 1901 07152"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9054266"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7178061"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA.2019.8937170"},{"key":"ref32","article-title":"Adam: A method for stochastic optimization","author":"kingma","year":"2014","journal-title":"arXiv preprint arXiv 1412 6980"},{"key":"ref2","article-title":"Multi-object representation learning with iterative variational inference","author":"greff","year":"2019","journal-title":"ICML"},{"key":"ref1","article-title":"End-toend object detection with transformers","author":"carion","year":"2020","journal-title":"ECCV"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/WASPAA52581.2021.9632794"},{"key":"ref39","article-title":"Multi-instrument music synthesis with spectrogram diffusion","author":"hawthorne","year":"2022","journal-title":"arXiv preprint arXiv 2206 05408"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/GlobalSIP.2014.7032183"},{"key":"ref38","article-title":"Audiolm: a language modeling approach to audio generation","author":"borsos","year":"2022","journal-title":"arXiv preprint arXiv 2209 03143"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_24"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952155"},{"key":"ref24","article-title":"Deep set prediction networks","author":"zhang","year":"2019","journal-title":"NeurIPS"},{"key":"ref23","article-title":"Set transformer: A framework for attention-based permutation-invariant neural networks","author":"lee","year":"2019","journal-title":"ICML"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00310"},{"key":"ref25","article-title":"Conditional set generation with transformers","author":"kosiorek","year":"2020","journal-title":"arXiv preprint arXiv 2006 16578"},{"key":"ref20","article-title":"Unsupervised sound separation using mixture invariant training","author":"wisdom","year":"2020","journal-title":"NeurIPS"},{"key":"ref22","article-title":"Deep sets","author":"zaheer","year":"2017","journal-title":"NeurIPS"},{"key":"ref21","article-title":"Order matters: Sequence to sequence for sets","author":"vinyals","year":"2015","journal-title":"arXiv preprint arXiv 1511 06841"},{"key":"ref28","article-title":"Masked autoencoders that listen","author":"xu","year":"2022","journal-title":"arXiv preprint arXiv 2207 06405"},{"key":"ref27","article-title":"Search for concepts: Discovering visual concepts using direct optimization","author":"reddy","year":"2022","journal-title":"arXiv preprint arXiv 2210 14808"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2017.2726762"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-1176"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2019.2915167"},{"key":"ref4","article-title":"Attention is all you need","author":"vaswani","year":"2017","journal-title":"NeurIPS"},{"key":"ref3","article-title":"Object-centric learning with slot attention","author":"locatello","year":"2020","journal-title":"NeurIPS"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7471631"},{"key":"ref5","article-title":"Librimix: An open-source dataset for generalizable speech separation","author":"cosentino","year":"2020","journal-title":"arXiv preprint arXiv 2005 11084"},{"key":"ref40","article-title":"Conditional Object-Centric Learning from Video","author":"kipf","year":"2022","journal-title":"ICLRE"}],"event":{"name":"2023 IEEE International Conference on Acoustics, Speech, and Signal Processing Workshops (ICASSPW)","start":{"date-parts":[[2023,6,4]]},"location":"Rhodes Island, Greece","end":{"date-parts":[[2023,6,10]]}},"container-title":["2023 IEEE International Conference on Acoustics, Speech, and Signal Processing Workshops (ICASSPW)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/10192576\/10192577\/10193208.pdf?arnumber=10193208","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,21]],"date-time":"2023-08-21T17:42:35Z","timestamp":1692639755000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10193208\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,6,4]]},"references-count":40,"URL":"https:\/\/doi.org\/10.1109\/icasspw59220.2023.10193208","relation":{},"subject":[],"published":{"date-parts":[[2023,6,4]]}}}