{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,13]],"date-time":"2026-04-13T22:32:25Z","timestamp":1776119545982,"version":"3.50.1"},"reference-count":69,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE\/ACM Trans. Audio Speech Lang. Process."],"published-print":{"date-parts":[[2024]]},"DOI":"10.1109\/taslp.2024.3393741","type":"journal-article","created":{"date-parts":[[2024,4,25]],"date-time":"2024-04-25T17:56:58Z","timestamp":1714067818000},"page":"2555-2565","source":"Crossref","is-referenced-by-count":4,"title":["Example-Based Framework for Perceptually Guided Audio Texture Generation"],"prefix":"10.1109","volume":"32","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0351-6574","authenticated-orcid":false,"given":"Purnima","family":"Kamath","sequence":"first","affiliation":[{"name":"National University of Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1350-9095","authenticated-orcid":false,"given":"Chitralekha","family":"Gupta","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9200-1048","authenticated-orcid":false,"given":"Lonce","family":"Wyse","sequence":"additional","affiliation":[{"name":"Universitat Pompeu Fabra, Barcelona, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7441-5493","authenticated-orcid":false,"given":"Suranga","family":"Nanayakkara","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1016\/j.neuron.2011.06.032"},{"key":"ref2","first-page":"293","volume-title":"Analysis and Synthesis of Sound Textures","author":"Saint-Arnaud","year":"1998"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/6.576008"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.4324\/9781315106342-13"},{"key":"ref5","first-page":"2672","article-title":"Generative adversarial nets","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"27","author":"Goodfellow","year":"2014"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref8","article-title":"Controllable music: Supervised learning of disentangled representations for music generation","author":"Watcharasupat","year":"2021"},{"key":"ref9","article-title":"AudioGen: Textually guided audio generation","volume-title":"Proc. 11th Int. Conf. Learn. Representations","author":"Kreuk","year":"2023"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2023.3288409"},{"key":"ref11","article-title":"MusicLM: Generating music from text","author":"Agostinelli","year":"2023"},{"key":"ref12","first-page":"21450","article-title":"AudioLDM: Text-to-audio generation with latent diffusion models","volume-title":"Proc. 40th Int. Conf. Mach. Learn.","volume":"202","author":"Liu"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/icassp49357.2023.10095889"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747631"},{"key":"ref15","first-page":"157","article-title":"Audio content-based music retrieval","volume":"3","author":"Grosche","year":"2012","journal-title":"Multimodal Music Processing"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1117\/12.290336"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/1145287.1145312"},{"key":"ref18","article-title":"MUSART: Music retrieval via aural queries","volume-title":"Proc. 2nd Int. Symp. Music Inf. Retrieval","author":"Birmingham","year":"2001"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1145\/217279.215273"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654880"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8683461"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2018.2868428"},{"key":"ref23","first-page":"1068","article-title":"Neural audio synthesis of musical notes with wavenet autoencoders","volume-title":"Proc. 34th Int, Conf, Mach, Learn.","author":"Engel","year":"2017"},{"key":"ref24","article-title":"GANSynth: Adversarial neural audio synthesis","volume-title":"Int. Conf. Learn. Representations","author":"Engel","year":"2019"},{"key":"ref25","article-title":"Conditional waveGAN","author":"Lee","year":"2018"},{"key":"ref26","article-title":"DrumGAN: Synthesis of drum sounds with timbral feature conditioning using generative adversarial networks","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Nistal","year":"2020"},{"key":"ref27","article-title":"Audio commons audio extractor","author":"Group","year":"2018"},{"key":"ref28","article-title":"Essentia: Open-source c library for audio analysis and audio-based music information retrieval","author":"Group","year":"2022"},{"key":"ref29","article-title":"DDSP: Differentiable digital signal processing","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Engel","year":"2020"},{"key":"ref30","article-title":"DDSP-SFX: Acoustically-guided sound effects generation with differentiable digital signal processing","author":"Liu","year":"2023"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1207\/s15326969eco0504_2"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1207\/s15326969eco0501_1"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10096328"},{"key":"ref34","article-title":"DARKGAN: Exploiting knowledge distillation for comprehensible audio synthesis with GANs","volume-title":"Proc. Int. Soc. Music Inf. Retrieval Conf.","author":"Nistal","year":"2021"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3030497"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-03789-4_20"},{"key":"ref38","first-page":"9841","article-title":"GANSpace: Discovering interpretable gan controls","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Hrknen","year":"2020"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00158"},{"key":"ref40","article-title":"GANSpaceSynth: A hybrid generative adversarial network architecture for organising the latent space using a dimensionality reduction for real-time audio synthesis","volume-title":"Proc. 2nd Joint Conf. AI Music Creativity","author":"Tahiroglu","year":"2021"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3098764"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2020.3040797"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547972"},{"key":"ref44","article-title":"Using latent space regression to analyze and leverage compositionality in GANs","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Chai","year":"2021"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.5555\/3294996.3295163"},{"key":"ref46","volume-title":"Spectral Audio Signal Processing","author":"Smith","year":"2023"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.2307\/3680788"},{"key":"ref48","volume-title":"A System for Sound analysis\/transformation\/synthesis Based on a Deterministic Plus Stochastic Decomposition","author":"Serra","year":"1990"},{"key":"ref49","first-page":"91","article-title":"Musical sound modeling with sinusoids plus noise","volume":"2","author":"Serra","year":"1997","journal-title":"Musical Signal Process."},{"key":"ref50","volume-title":"Physical Audio Signal Processing","author":"Smith","year":"2023"},{"key":"ref51","first-page":"369","article-title":"Generative timbre spaces: Regularizing variational auto-encoders with perceptual metrics","volume-title":"Proc. Int. Conf. Digital Audio Effects (DAFx-18)","author":"Esling","year":"2018"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"ref54","first-page":"28708","article-title":"Masked autoencoders that listen","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Huang","year":"2022"},{"key":"ref55","first-page":"1","article-title":"Masked spectrogram modeling using masked autoencoders for learning general-purpose audio representation","volume-title":"Proc. HEAR: Holistic Eval. Audio Representations","author":"Niizumi","year":"2022"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00068"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.264"},{"key":"ref58","first-page":"462","article-title":"Parameter sensitivity of deep-feature based evaluation metrics for audio textures","volume-title":"Proc. 23rd Int. Soc. Music Inf. Retrieval Conf.","author":"Gupta","year":"2022"},{"key":"ref59","first-page":"4352","article-title":"Adversarial generation of time-frequency features with application in audio synthesis","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Marafioti","year":"2019"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2017.2678166"},{"key":"ref61","first-page":"159","article-title":"Signal representations for synthesizing audio textures with generative adversarial networks","volume-title":"Proc. 18th Sound Music Comput. Conf.","author":"Gupta"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.21105\/joss.00861"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2019-2219"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.243"},{"key":"ref65","article-title":"Rethinking CNN models for audio classification","author":"Palanisamy","year":"2020"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2016.7471749"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1145\/3581641.3584083"},{"key":"ref68","article-title":"Do not escape from the manifold: Discovering the local coordinates on the latent space of GANs","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Choi","year":"2022"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.21428\/92fbeb44.0fe70450"}],"container-title":["IEEE\/ACM Transactions on Audio, Speech, and Language Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6570655\/10304349\/10508390.pdf?arnumber=10508390","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,5,7]],"date-time":"2024-05-07T04:43:49Z","timestamp":1715057029000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10508390\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"references-count":69,"URL":"https:\/\/doi.org\/10.1109\/taslp.2024.3393741","relation":{},"ISSN":["2329-9290","2329-9304"],"issn-type":[{"value":"2329-9290","type":"print"},{"value":"2329-9304","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024]]}}}