{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,25]],"date-time":"2026-01-25T03:34:40Z","timestamp":1769312080075,"version":"3.49.0"},"reference-count":41,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,9,18]],"date-time":"2024-09-18T00:00:00Z","timestamp":1726617600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,9,18]],"date-time":"2024-09-18T00:00:00Z","timestamp":1726617600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,9,18]]},"DOI":"10.1109\/cbmi62980.2024.10859250","type":"proceedings-article","created":{"date-parts":[[2025,2,4]],"date-time":"2025-02-04T18:30:52Z","timestamp":1738693852000},"page":"1-7","source":"Crossref","is-referenced-by-count":2,"title":["Evaluation of Deep Audio Representations for Semantic Sound Similarity"],"prefix":"10.1109","author":[{"given":"Recep Oguz","family":"Araz","sequence":"first","affiliation":[{"name":"Universitat Pompeu Fabra,Music Technology Group,Barcelona,Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dmitry","family":"Bogdanov","sequence":"additional","affiliation":[{"name":"Universitat Pompeu Fabra,Music Technology Group,Barcelona,Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Pablo","family":"Alonso-Jim\u00e9nez","sequence":"additional","affiliation":[{"name":"Universitat Pompeu Fabra,Music Technology Group,Barcelona,Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Frederic","family":"Font","sequence":"additional","affiliation":[{"name":"Universitat Pompeu Fabra,Music Technology Group,Barcelona,Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","volume-title":"Design and evaluation of a visualization interface for querying large unstructured sound databases","author":"Font","year":"2010"},{"key":"ref2","volume-title":"Improving Sound Retrieval in Large Collaborative Collections","author":"Favory","year":"2021"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1145\/1460096.1460115"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2007.366338"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2010.5496225"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/93.556537"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/ICALIP.2010.5684543"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ISCSLP.2012.6423476"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2002.1035789"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952132"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2021-698"},{"key":"ref12","author":"Fonseca","year":"2021","journal-title":"Improving Sound Event Classification by Increasing Shift Invariance in Convolutional Neural Networks"},{"key":"ref13","article-title":"COALA: Co-Aligned Autoencoders for Learning Semantically Enriched Audio Representations","volume-title":"ICML 2020 Workshop on Self-supervision in Audio and Speech","author":"Favory","year":"2020"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461524"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ISM46123.2019.00036"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP40776.2020.9053972"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095889"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095969"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10448504"},{"key":"ref20","article-title":"Pengi: An Audio Language Model for Audio Tasks","volume-title":"Thirty-seventh Conference on Neural Information Processing Systems","author":"Deshmukh"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10097117"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1145\/2502081.2502229"},{"key":"ref23","author":"Abu-El-Haija","year":"2016","journal-title":"YouTube-8M: A Large-Scale Video Classification Benchmark"},{"key":"ref24","volume-title":"Sound classification with YAMNet | TensorFlow Hub"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2017.7952261"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3133208"},{"key":"ref27","article-title":"BEATs: audio pre-training with acoustic tokenizers","volume-title":"Proceedings of the 40th International Conference on Machine Learning. JMLR.org","author":"Chen"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2020.3030497"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746312"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747669"},{"key":"ref31","article-title":"Learning transferable visual models from natural language supervision","volume-title":"International conference on machine learning. PMLR","author":"Radford"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/icassp40776.2020.9053174"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747631"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN52387.2021.9533654"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8682475"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.73"},{"key":"ref39","article-title":"Contrastive Audio-Visual Masked Autoencoder","volume-title":"The Eleventh International Conference on Learning Representations","author":"Gong"},{"key":"ref40","volume-title":"Semantic Sound Similarity with Deep Embeddings for Freesound","author":"Araz","year":"2023"},{"key":"ref41","volume-title":"models\/research\/audioset\/yamnet at master \u2022 tensorflow\/models"}],"event":{"name":"2024 International Conference on Content-Based Multimedia Indexing (CBMI)","location":"Reykjavik, Iceland","start":{"date-parts":[[2024,9,18]]},"end":{"date-parts":[[2024,9,20]]}},"container-title":["2024 International Conference on Content-Based Multimedia Indexing (CBMI)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10858870\/10858871\/10859250.pdf?arnumber=10859250","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,5]],"date-time":"2025-02-05T06:15:10Z","timestamp":1738736110000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10859250\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,9,18]]},"references-count":41,"URL":"https:\/\/doi.org\/10.1109\/cbmi62980.2024.10859250","relation":{},"subject":[],"published":{"date-parts":[[2024,9,18]]}}}