{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,3]],"date-time":"2026-07-03T16:23:37Z","timestamp":1783095817937,"version":"3.54.6"},"reference-count":85,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2021,1,11]],"date-time":"2021-01-11T00:00:00Z","timestamp":1610323200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2021,1,11]],"date-time":"2021-01-11T00:00:00Z","timestamp":1610323200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"name":"Universit? de Recherche Paris Sciences et Lettres"},{"name":"European Research Council","award":["320959"],"award-info":[{"award-number":["320959"]}]},{"name":"National Science Foundation","award":["1633259"],"award-info":[{"award-number":["1633259"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J AUDIO SPEECH MUSIC PROC."],"published-print":{"date-parts":[[2021,12]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>Instrumentalplaying techniques such as vibratos, glissandos, and trills often denote musical expressivity, both in classical and folk contexts. However, most existing approaches to music similarity retrieval fail to describe timbre beyond the so-called \u201cordinary\u201d technique, use instrument identity as a proxy for timbre quality, and do not allow for customization to the perceptual idiosyncrasies of a new subject. In this article, we ask 31 human participants to organize 78 isolated notes into a set of timbre clusters. Analyzing their responses suggests that timbre perception operates within a more flexible taxonomy than those provided by instruments or playing techniques alone. In addition, we propose a machine listening model to recover the cluster graph of auditory similarities across instruments, mutes, and techniques. Our model relies on joint time\u2013frequency scattering features to extract spectrotemporal modulations as acoustic features. Furthermore, it minimizes triplet loss in the cluster graph by means of the large-margin nearest neighbor (LMNN) metric learning algorithm. Over a dataset of 9346 isolated notes, we report a state-of-the-art average precision at rank five (AP@5) of <jats:italic>.<\/jats:italic><jats:italic>%<\/jats:italic>. An ablation study demonstrates that removing either the joint time\u2013frequency scattering transform or the metric learning algorithm noticeably degrades performance.<\/jats:p>","DOI":"10.1186\/s13636-020-00187-z","type":"journal-article","created":{"date-parts":[[2021,1,11]],"date-time":"2021-01-11T12:19:19Z","timestamp":1610367559000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["Time\u2013frequency scattering accurately models auditory similarities between instrumental playing techniques"],"prefix":"10.1186","volume":"2021","author":[{"given":"Vincent","family":"Lostanlen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Christian","family":"El-Hajj","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mathias","family":"Rossignol","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gr\u00e9goire","family":"Lafay","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Joakim","family":"And\u00e9n","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1253-4427","authenticated-orcid":false,"given":"Mathieu","family":"Lagrange","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2021,1,11]]},"reference":[{"issue":"1","key":"187_CR1","doi-asserted-by":"publisher","first-page":"295","DOI":"10.1002\/aris.1440370108","volume":"37","author":"J. S. Downie","year":"2003","unstructured":"J. S. Downie, Music information retrieval. Ann. Rev. Inf. Sci. Technol.37(1), 295\u2013340 (2003).","journal-title":"Ann. Rev. Inf. Sci. Technol."},{"key":"187_CR2","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/978-3-030-14832-4","volume-title":"Timbre: Acoustics, Perception, and Cognition","author":"K. Siedenburg","year":"2019","unstructured":"K. Siedenburg, C. Saitis, S. McAdams, in Timbre: Acoustics, Perception, and Cognition, ed. by K. Siedenburg, C. Saitis, S. McAdams, A. N. Popper, and R. R. Fay. The Present, Past, and Future of Timbre Research (Springer International PublishingCham, 2019), pp. 1\u201319."},{"key":"187_CR3","unstructured":"A. Faure, S. McAdams, V. Nosulenko, in Proceedings of the International Conference on Music Perception and Cognition (ICMPC). Verbal correlates of perceptual dimensions of timbre, (1996), pp. 79\u201384."},{"key":"187_CR4","doi-asserted-by":"crossref","unstructured":"V. Lostanlen, J. And\u00e9n, M. Lagrange, in Proceedings of the International Conference on Digital Libraries for Musicology (DLfM). Extended playing techniques: the next milestone in musical instrument recognition (ACM, 2018), pp. 1\u201310.","DOI":"10.1145\/3273024.3273036"},{"key":"187_CR5","unstructured":"A. Antoine, E. R. Miranda, in Proceedings of the International Symposium on Musical Acoustics (ISMA). Musical Acoustics, Timbre, and Computer-Aided Orchestration Challenges, (2018), pp. 151\u2013154."},{"key":"187_CR6","unstructured":"S. Kolozali, M. Barthet, G. Fazekas, M. B. Sandler, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. Knowledge Representation Issues in Musical Instrument Ontology Design, (2011), pp. 465\u2013470."},{"key":"187_CR7","doi-asserted-by":"crossref","unstructured":"J. Calvo-Zaragoza, J. Haji\u010d Jr., A. Pacha, Understanding optical music recognition. ACM Comput. Surv., 1\u201342 (2020).","DOI":"10.1145\/3397499"},{"key":"187_CR8","volume-title":"Sound structure in music","author":"R. Erickson","year":"1975","unstructured":"R. Erickson, Sound structure in music (University of California Press, Oakland, 1975)."},{"issue":"3","key":"187_CR9","doi-asserted-by":"publisher","first-page":"1745","DOI":"10.1121\/1.5035697","volume":"143","author":"E. Thoret","year":"2018","unstructured":"E. Thoret, B. Caramiaux, P. Depalle, S. McAdams, Human dissimilarity ratings of musical instrument timbre: a computational meta-analysis. J. Acoust. Soc. Am.143(3), 1745\u20131746 (2018).","journal-title":"J. Acoust. Soc. Am."},{"issue":"1","key":"187_CR10","doi-asserted-by":"publisher","first-page":"99","DOI":"10.1080\/07494467.2013.774515","volume":"32","author":"Y. Maresz","year":"2013","unstructured":"Y. Maresz, On computer-assisted orchestration. Contemp. Music. Rev.32(1), 99\u2013109 (2013).","journal-title":"Contemp. Music. Rev."},{"key":"187_CR11","doi-asserted-by":"publisher","first-page":"100484","DOI":"10.1016\/j.swevo.2018.12.010","volume":"50","author":"M. Caetano","year":"2019","unstructured":"M. Caetano, A. Zacharakis, I. Barbancho, L. J. Tard\u00f3n, Leveraging diversity in computer-aided musical orchestration with an artificial immune system for multi-modal optimization. Swarm Evol. Comput.50:, 100484 (2019).","journal-title":"Swarm Evol. Comput."},{"key":"187_CR12","doi-asserted-by":"crossref","unstructured":"J. And\u00e9n, V. Lostanlen, S. Mallat, in Proceedings of the IEEE International Workshop on Machine Learning for Signal Processing (MLSP). Joint time-frequency scattering for audio classification (IEEE, 2015), pp. 1\u20136.","DOI":"10.1109\/MLSP.2015.7324385"},{"issue":"14","key":"187_CR13","doi-asserted-by":"publisher","first-page":"3704","DOI":"10.1109\/TSP.2019.2918992","volume":"67","author":"J. And\u00e9n","year":"2019","unstructured":"J. And\u00e9n, V. Lostanlen, S. Mallat, Joint Time\u2013Frequency Scattering. IEEE Trans. Signal Process.67(14), 3704\u20133718 (2019).","journal-title":"IEEE Trans. Signal Process."},{"issue":"1","key":"187_CR14","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1186\/s13636-018-0138-4","volume":"2018","author":"V. Lostanlen","year":"2018","unstructured":"V. Lostanlen, G. Lafay, J. And\u00e9n, M. Lagrange, Relevance-based quantization of scattering features for unsupervised mining of environmental audio. EURASIP J. Audio. Speech. Music. Process.2018(1), 15 (2018).","journal-title":"EURASIP J. Audio. Speech. Music. Process."},{"key":"187_CR15","unstructured":"J. And\u00e9n, S. Mallat, in Proceedings of the International Conference on Digital Audio Effects (DAFx). Scattering Representation of Modulated Sounds, (2012), pp. 1\u20134."},{"key":"187_CR16","first-page":"207","volume":"10","author":"K. Q. Weinberger","year":"2009","unstructured":"K. Q. Weinberger, L. K. Saul, Distance metric learning for large margin nearest neighbor classification. J. Mach. Learn. Res.10:, 207\u2013244 (2009).","journal-title":"J. Mach. Learn. Res."},{"issue":"3","key":"187_CR17","doi-asserted-by":"publisher","first-page":"177","DOI":"10.1007\/BF00419633","volume":"58","author":"S. McAdams","year":"1995","unstructured":"S. McAdams, S. Winsberg, S. Donnadieu, G. De Soete, J. Krimphoff, Perceptual scaling of synthesized musical timbres: common dimensions, specificities, and latent subject classes. Psychol. Res.58(3), 177\u2013192 (1995).","journal-title":"Psychol. Res."},{"issue":"11","key":"187_CR18","doi-asserted-by":"publisher","first-page":"e1002759","DOI":"10.1371\/journal.pcbi.1002759","volume":"8","author":"K. Patil","year":"2012","unstructured":"K. Patil, D. Pressnitzer, S. Shamma, M. Elhilali, Music in our ears: the biological bases of musical timbre perception. PLoS Comput. Biol.8(11), e1002759 (2012).","journal-title":"PLoS Comput. Biol."},{"issue":"1","key":"187_CR19","doi-asserted-by":"publisher","first-page":"174","DOI":"10.1109\/TASL.2008.2007613","volume":"17","author":"C. Joder","year":"2009","unstructured":"C. Joder, S. Essid, G. Richard, Temporal integration for audio classification with application to musical instrument classification. IEEE Trans. Audio. Speech. Lang. Process.17(1), 174\u2013186 (2009).","journal-title":"IEEE Trans. Audio. Speech. Lang. Process."},{"issue":"1","key":"187_CR20","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1080\/09298215.2015.1132737","volume":"45","author":"K. Siedenburg","year":"2016","unstructured":"K. Siedenburg, I. Fujinaga, S. McAdams, A comparison of approaches to timbre descriptors in music information retrieval and music psychology. J. New. Music. Res.45(1), 27\u201341 (2016).","journal-title":"J. New. Music. Res."},{"key":"187_CR21","unstructured":"K. D. Martin, Y. E. Kim, in Proceedings of the Acoustical Society of America. Musical instrument identification: A pattern recognition approach, (1998), pp. 1\u201312."},{"issue":"3","key":"187_CR22","doi-asserted-by":"publisher","first-page":"1933","DOI":"10.1121\/1.426728","volume":"105","author":"J. C. Brown","year":"1999","unstructured":"J. C. Brown, Computer identification of musical instruments using pattern recognition with cepstral coefficients as features. J. Acoust. Soc. Am.105(3), 1933\u20131941 (1999).","journal-title":"J. Acoust. Soc. Am."},{"key":"187_CR23","unstructured":"A. Eronen, A. Klapuri, in Proceedings of the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). Musical instrument recognition using cepstral coefficients and temporal features, (2000)."},{"issue":"1","key":"187_CR24","doi-asserted-by":"publisher","first-page":"3","DOI":"10.1076\/jnmr.32.1.3.16798","volume":"32","author":"P. Herrera Boyer","year":"2003","unstructured":"P. Herrera Boyer, G. Peeters, S. Dubnov, Automatic classification of musical instrument sounds. J. New. Music. Res.32(1), 3\u201321 (2003).","journal-title":"J. New. Music. Res."},{"issue":"3","key":"187_CR25","doi-asserted-by":"publisher","first-page":"285","DOI":"10.1023\/A:1022864925044","volume":"20","author":"A. A. Wieczorkowska","year":"2003","unstructured":"A. A. Wieczorkowska, J. M. \u017cytkow, Analysis of feature dependencies in sound description. J. Intell. Inf. Syst.20(3), 285\u2013302 (2003).","journal-title":"J. Intell. Inf. Syst."},{"key":"187_CR26","unstructured":"A. Livshin, X. Rodet, in Proceedings of the International Conference on Digital Audio Effects (DAFx). Musical instrument identification in continuous recordings, (2004)."},{"key":"187_CR27","unstructured":"A. G. Krishna, T. V. Sreenivas, in Proceedings of the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). Music instrument recognition: from isolated notes to solo phrases, (2004)."},{"issue":"2-3","key":"187_CR28","doi-asserted-by":"publisher","first-page":"199","DOI":"10.1007\/s10844-005-0323-7","volume":"24","author":"I. Kaminskyj","year":"2005","unstructured":"I. Kaminskyj, T. Czaszejko, Automatic recognition of isolated monophonic musical instrument sounds using kNNC. J. Intell. Inf. Syst.24(2-3), 199\u2013221 (2005).","journal-title":"J. Intell. Inf. Syst."},{"key":"187_CR29","unstructured":"E. Benetos, M. Kotti, C. Kotropoulos, in Proceedings of the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). Musical instrument classification using non-negative matrix factorization algorithms and subset feature selection, (2006)."},{"issue":"3","key":"187_CR30","doi-asserted-by":"publisher","first-page":"425","DOI":"10.1007\/s10844-015-0360-9","volume":"46","author":"D. G. Bhalke","year":"2016","unstructured":"D. G. Bhalke, C. B. R. Rao, D. S. Bormane, Automatic musical instrument classification using fractional Fourier transform based-MFCC features and counter propagation neural network. J. Intell. Inf. Syst.46(3), 425\u2013446 (2016).","journal-title":"J. Intell. Inf. Syst."},{"key":"187_CR31","unstructured":"E. Humphrey, S. Durand, B. McFee, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. OpenMIC-2018: an open dataset for multiple instrument recognition, (2018)."},{"key":"187_CR32","unstructured":"B. McFee, E. J. Humphrey, J. Urbano, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. A plan for sustainable MIR evaluation, (2016)."},{"key":"187_CR33","unstructured":"M. Defferrard, K. Benzi, P. Vandergheynst, X. Bresson, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. FMA: A dataset for music analysis, (2017)."},{"key":"187_CR34","unstructured":"V. Lostanlen, C. E. Cella, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. Deep convolutional networks on the pitch spiral for musical instrument recognition, (2016)."},{"key":"187_CR35","unstructured":"R. M. Bittner, J. Salamon, M. Tierney, M. Mauch, C. Cannam, J. P. Bello, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. MedleyDB: A multitrack dataset for annotation-intensive MIR research, (2014)."},{"key":"187_CR36","unstructured":"B. McFee, E. J. Humphrey, J. P. Bello, in Proceedings of the International Society on Music Information Retrieval (ISMIR). A software framework for musical data augmentation, (2015)."},{"key":"187_CR37","unstructured":"J. Pons, O. Slizovskaia, R. Gong, E. G\u00f3mez, X. Serra, in 25th European Signal Processing Conference (EUSIPCO). Timbre analysis of music audio signals with convolutional neural networks, (2017), pp. 2744\u20132748."},{"key":"187_CR38","unstructured":"S. Gururani, C. Summers, A. Lerch, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. Instrument Activity Detection in Polyphonic Music using Deep Neural Networks, (2018)."},{"key":"187_CR39","unstructured":"M. A. Loureiro, H. B. de Paula, H. C. Yehia, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. Timbre Classification Of A Single Musical Instrument, (2004)."},{"issue":"1","key":"187_CR40","doi-asserted-by":"publisher","first-page":"208","DOI":"10.1109\/TASLP.2016.2632307","volume":"25","author":"Y. Han","year":"2017","unstructured":"Y. Han, J. Kim, K. Lee, Deep convolutional neural networks for predominant instrument recognition in polyphonic music. IEEE Trans. Audio. Speech. Lang. Process.25(1), 208\u2013221 (2017).","journal-title":"IEEE Trans. Audio. Speech. Lang. Process."},{"key":"187_CR41","unstructured":"S. McAdams, B. L. Giordano, in The Oxford handbook of music psychology. The perception of musical timbre, (2009), pp. 72\u201380."},{"key":"187_CR42","doi-asserted-by":"publisher","first-page":"1977","DOI":"10.3389\/fpsyg.2015.01977","volume":"6","author":"K. Siedenburg","year":"2016","unstructured":"K. Siedenburg, K. Jones-Mollerup, S. McAdams, Acoustic and categorical dissimilarity of musical timbre: evidence from asymmetries between acoustic and chimeric sounds. Front. Psychol.6:, 1977 (2016).","journal-title":"Front. Psychol."},{"issue":"3","key":"187_CR43","doi-asserted-by":"publisher","first-page":"1220","DOI":"10.1152\/jn.2001.85.3.1220","volume":"85","author":"D. A. Depireux","year":"2001","unstructured":"D. A. Depireux, J. Z. Simon, D. J. Klein, S. A. Shamma, Spectro-temporal response field characterization with dynamic ripples in ferret primary auditory cortex. J. Neurophysiol.85(3), 1220\u20131234 (2001).","journal-title":"J. Neurophysiol."},{"issue":"2","key":"187_CR44","doi-asserted-by":"publisher","first-page":"133","DOI":"10.1007\/BF00336731","volume":"42","author":"A. M. H. J. Aertsen","year":"1981","unstructured":"A. M. H. J. Aertsen, P. I. M. Johannesma, The spectro-temporal receptive field. Biol. Cybernet.42(2), 133\u2013143 (1981).","journal-title":"Biol. Cybernet."},{"key":"187_CR45","doi-asserted-by":"publisher","first-page":"169","DOI":"10.1109\/TBME.1968.4502561","volume":"3","author":"E. De Boer","year":"1968","unstructured":"E. De Boer, P. Kuyper, Triggered correlation. IEEE Trans. Biomed. Eng.3:, 169\u2013179 (1968).","journal-title":"IEEE Trans. Biomed. Eng."},{"key":"187_CR46","volume-title":"Time-frequency\/time-scale analysis","author":"P. Flandrin","year":"1998","unstructured":"P. Flandrin, Time-frequency\/time-scale analysis (Academic press, Salt Lake City, 1998)."},{"issue":"2","key":"187_CR47","doi-asserted-by":"publisher","first-page":"177","DOI":"10.1016\/0378-5955(93)90139-R","volume":"66","author":"J. Eggermont","year":"1993","unstructured":"J. Eggermont, Wiener and Volterra analyses applied to the auditory system. Hear. Res.66(2), 177\u2013201 (1993).","journal-title":"Hear. Res."},{"issue":"1","key":"187_CR48","doi-asserted-by":"publisher","first-page":"85","DOI":"10.1023\/A:1008990412183","volume":"9","author":"D. J. Klein","year":"2000","unstructured":"D. J. Klein, D. A. Depireux, J. Z. Simon, S. A. Shamma, Robust spectrotemporal reverse correlation for the auditory system: optimizing stimulus design. J. Comput. Neurosci.9(1), 85\u2013111 (2000).","journal-title":"J. Comput. Neurosci."},{"issue":"6","key":"187_CR49","doi-asserted-by":"publisher","first-page":"2315","DOI":"10.1523\/JNEUROSCI.20-06-02315.2000","volume":"20","author":"F. E. Theunissen","year":"2000","unstructured":"F. E. Theunissen, K. Sen, A. J. Doupe, Spectral-temporal receptive fields of nonlinear auditory neurons obtained using natural sounds. J. Neurosci.20(6), 2315\u20132331 (2000).","journal-title":"J. Neurosci."},{"issue":"2","key":"187_CR50","doi-asserted-by":"publisher","first-page":"887","DOI":"10.1121\/1.1945807","volume":"118","author":"T. Chi","year":"2005","unstructured":"T. Chi, P. Ru, S. A. Shamma, Multiresolution spectrotemporal analysis of complex sounds. J. Acoust. Soc. Am.118(2), 887\u2013906 (2005).","journal-title":"J. Acoust. Soc. Am."},{"issue":"1","key":"187_CR51","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1186\/s13636-015-0070-9","volume":"2015","author":"K. Patil","year":"2015","unstructured":"K. Patil, M. Elhilali, Biomimetic spectro-temporal features for music instrument recognition in isolated notes and solo phrases. EURASIP J. Audio. Speech. Music. Process.2015(1), 27 (2015).","journal-title":"EURASIP J. Audio. Speech. Music. Process."},{"issue":"6","key":"187_CR52","doi-asserted-by":"publisher","first-page":"EL478","DOI":"10.1121\/1.4971204","volume":"140","author":"E. Thoret","year":"2016","unstructured":"E. Thoret, P. Depalle, S. McAdams, Perceptually salient spectrotemporal modulations for recognition of sustained musical instruments. J. Acoust. Soc. Am.140(6), EL478\u2013EL483 (2016).","journal-title":"J. Acoust. Soc. Am."},{"key":"187_CR53","unstructured":"S. Mishra, B. L. Sturm, S. Dixon, in Proceedings of the International Society on Music Information Retrieval (ISMIR) Conference. Understanding a Deep Machine Listening Model Through Feature Inversion, (2018), pp. 755\u2013762."},{"key":"187_CR54","doi-asserted-by":"publisher","first-page":"80","DOI":"10.3389\/fncom.2015.00080","volume":"9","author":"E. Hemery","year":"2015","unstructured":"E. Hemery, J. J. Aucouturier, One hundred ways to process time, frequency, rate and scale in the central auditory system: a pattern-recognition meta-analysis. Front. Comput. Neurosci.9:, 80 (2015).","journal-title":"Front. Comput. Neurosci."},{"issue":"60","key":"187_CR55","first-page":"1","volume":"21","author":"M. Andreux","year":"2020","unstructured":"M. Andreux, T. Angles, G. Exarchakis, R. Leonarduzzi, G. Rochette, L. Thiry, J. Zarka, S. Mallat, E. Belilovsky, J. Bruna, et al, Kymatio: Scattering Transforms in Python. J. Mach. Learn. Res.21(60), 1\u20136 (2020).","journal-title":"J. Mach. Learn. Res."},{"key":"187_CR56","unstructured":"V. Lostanlen, F. Hecker, in Proceedings of the Digital Audio Effects Conference (DAFX). The Shape of RemiXXXes to Come: Audio texture synthesis with time\u2013frequency scattering, (2019)."},{"issue":"2065","key":"187_CR57","doi-asserted-by":"publisher","first-page":"20150203","DOI":"10.1098\/rsta.2015.0203","volume":"374","author":"S. Mallat","year":"2016","unstructured":"S. Mallat, Understanding deep convolutional networks. Philos. Trans. R. Soc. A Math. Phys. Eng. Sci.374(2065), 20150203 (2016).","journal-title":"Philos. Trans. R. Soc. A Math. Phys. Eng. Sci."},{"key":"187_CR58","doi-asserted-by":"publisher","first-page":"297","DOI":"10.1007\/978-3-030-14832-4_11","volume-title":"Timbre: Acoustics, perception, and cognition","author":"M. Caetano","year":"2019","unstructured":"M. Caetano, C. Saitis, K. Siedenburg, in Timbre: Acoustics, perception, and cognition. Audio content descriptors of timbre (SpringerNew York, 2019), pp. 297\u2013333."},{"issue":"9","key":"187_CR59","doi-asserted-by":"publisher","first-page":"1457","DOI":"10.1109\/TASLP.2018.2830113","volume":"26","author":"C. -W. Wu","year":"2018","unstructured":"C. -W. Wu, C. Dittmar, C. Southall, R. Vogl, G. Widmer, J. Hockman, M. Muller, A. Lerch, A review of automatic drum transcription. IEEE Trans. Audio. Speech. Lang. Process.26(9), 1457\u20131483 (2018).","journal-title":"IEEE Trans. Audio. Speech. Lang. Process."},{"issue":"3","key":"187_CR60","doi-asserted-by":"publisher","first-page":"466","DOI":"10.3390\/app9030466","volume":"9","author":"A. Pearce","year":"2019","unstructured":"A. Pearce, T. Brookes, R. Mason, Modelling Timbral Hardness. Appl. Sci.9(3), 466 (2019).","journal-title":"Appl. Sci."},{"issue":"5","key":"187_CR61","doi-asserted-by":"publisher","first-page":"779","DOI":"10.1080\/00273171.2011.606748","volume":"46","author":"B. L. Giordano","year":"2011","unstructured":"B. L. Giordano, C. Guastavino, E. Murphy, M. Ogg, B. K. Smith, S. McAdams, Comparison of methods for collecting and modeling dissimilarity data: applications to complex sound stimuli. Multivar. Behav. Res.46(5), 779\u2013811 (2011).","journal-title":"Multivar. Behav. Res."},{"issue":"1","key":"187_CR62","doi-asserted-by":"publisher","first-page":"389","DOI":"10.1121\/1.4770244","volume":"133","author":"T. M. Elliott","year":"2013","unstructured":"T. M. Elliott, L. S. Hamilton, F. E. Theunissen, Acoustic structure of the five perceptual dimensions of timbre in orchestral instrument tones. J. Acoust. Soc. Am.133(1), 389\u2013404 (2013).","journal-title":"J. Acoust. Soc. Am."},{"issue":"2","key":"187_CR63","doi-asserted-by":"publisher","first-page":"291","DOI":"10.1002\/j.1538-7305.1970.tb01770.x","volume":"49","author":"B. W. Kernighan","year":"1970","unstructured":"B. W. Kernighan, S. Lin, An efficient heuristic procedure for partitioning graphs. Bell Syst. Tech. J.49(2), 291\u2013307 (1970).","journal-title":"Bell Syst. Tech. J."},{"key":"187_CR64","doi-asserted-by":"crossref","unstructured":"E. -H. Han, G. Karypis, V. Kumar, Eui-HongandKarypis Han George and Kumar, Scalable parallel data mining for association rules. 26(2) (1997). ACM.","DOI":"10.1145\/253262.253330"},{"issue":"Dec","key":"187_CR65","first-page":"583","volume":"3","author":"A. Strehl","year":"2002","unstructured":"A. Strehl, J. Ghosh, Cluster ensembles\u2014a knowledge reuse framework for combining multiple partitions. J. Mach. Learn. Res.3(Dec), 583\u2013617 (2002).","journal-title":"J. Mach. Learn. Res."},{"key":"187_CR66","unstructured":"C. Sch\u00f6rkhuber, A. Klapuri, in Proceedings of the Sound and Music Computing (SMC) Conference. Constant-Q transform toolbox for music processing, (2010)."},{"key":"187_CR67","doi-asserted-by":"crossref","unstructured":"V. Lostanlen, S. Sridhar, A. Farnsworth, J. P. Bello, in Proceedings of the International Conference on Acoustics, Speech, and Signal Processing (ICASSP). Learning the helix topology of musical pitch, (2020).","DOI":"10.1109\/ICASSP40776.2020.9053644"},{"issue":"10","key":"187_CR68","doi-asserted-by":"publisher","first-page":"1331","DOI":"10.1002\/cpa.21413","volume":"65","author":"S. Mallat","year":"2012","unstructured":"S. Mallat, Group invariant scattering. Commun. Pure Appl. Math.65(10), 1331\u20131398 (2012).","journal-title":"Commun. Pure Appl. Math."},{"key":"187_CR69","doi-asserted-by":"crossref","unstructured":"A. Jansen, M. Plakal, R. Pandya, D. P. W. Ellis, S. Hershey, J. Liu, R. C. Moore, R. A. Saurous, in Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Unsupervised learning of semantic audio representations (IEEE, 2018), pp. 126\u2013130.","DOI":"10.1109\/ICASSP.2018.8461684"},{"key":"187_CR70","doi-asserted-by":"publisher","DOI":"10.2200\/S00626ED1V01Y201501AIM030","volume-title":"Metric learning","author":"A. Bellet","year":"2015","unstructured":"A. Bellet, A. Habrard, M. Sebban, Metric learning (Morgan & Claypool Publishers, San Rafael, 2015)."},{"issue":"1","key":"187_CR71","doi-asserted-by":"publisher","first-page":"121","DOI":"10.1525\/mp.2001.19.1.121","volume":"19","author":"S. Handel","year":"2001","unstructured":"S. Handel, M. L. Erickson, A rule of thumb: The bandwidth for timbre invariance is one octave. Music. Percept.19(1), 121\u2013126 (2001).","journal-title":"Music. Percept."},{"issue":"5","key":"187_CR72","doi-asserted-by":"publisher","first-page":"2946","DOI":"10.1121\/1.1618239","volume":"114","author":"J. Marozeau","year":"2003","unstructured":"J. Marozeau, A. de Cheveign\u00e9, S. McAdams, S. Winsberg, The dependency of timbre on fundamental frequency. J. Acoust. Soc. Am.114(5), 2946\u20132957 (2003).","journal-title":"J. Acoust. Soc. Am."},{"issue":"3","key":"187_CR73","doi-asserted-by":"publisher","first-page":"215","DOI":"10.1525\/mp.2006.23.3.215","volume":"23","author":"K. M. Steele","year":"2006","unstructured":"K. M. Steele, A. K. Williams, Is the bandwidth for timbre invariance only one octave?Music. Percept.23(3), 215\u2013220 (2006).","journal-title":"Music. Percept."},{"key":"187_CR74","doi-asserted-by":"crossref","unstructured":"C. Wang, V. Lostanlen, E. Benetos, E. Chew, in Proceedings of the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP). Playing technique recognition by joint time\u2013frequency scattering, (2020).","DOI":"10.1109\/ICASSP40776.2020.9053474"},{"issue":"2-3","key":"187_CR75","doi-asserted-by":"publisher","first-page":"331","DOI":"10.1016\/S0167-6393(02)00134-6","volume":"41","author":"M. Elhilali","year":"2003","unstructured":"M. Elhilali, T. Chi, S. A. Shamma, A spectro-temporal modulation index (STMI) for assessment of speech intelligibility. Speech Commun.41(2-3), 331\u2013348 (2003).","journal-title":"Speech Commun."},{"key":"187_CR76","doi-asserted-by":"crossref","unstructured":"A. Bellur, M. Elhilali, in Proceedings of the Annual Conference on Information Sciences and Systems (CISS). Detection of speech tokens in noise using adaptive spectrotemporal receptive fields (IEEE, 2015), pp. 1\u20136.","DOI":"10.1109\/CISS.2015.7086834"},{"key":"187_CR77","doi-asserted-by":"crossref","unstructured":"D. Emmanouilidou, K. Patil, J. West, M. Elhilali, in Proceedings of the International Conference of the IEEE Engineering in Medicine and Biology Society (EMBS). A multiresolution analysis for detection of abnormal lung sounds (IEEE, 2012), pp. 3139\u20133142.","DOI":"10.1109\/EMBC.2012.6346630"},{"key":"187_CR78","doi-asserted-by":"publisher","DOI":"10.1093\/acref\/9780199696321.001.0001","volume-title":"A dictionary of economics","author":"J. Black","year":"2012","unstructured":"J. Black, N. Hashimzade, G. Myles, A dictionary of economics (Oxford university press, Oxford, 2012)."},{"key":"187_CR79","unstructured":"C. -E. Cella, D. Ghisi, V. Lostanlen, F. L\u00e9vy, J. Fineberg, Y. Maresz, in Proceedings of the International Computer Music Conference (ICMC). OrchideaSOL: A Dataset of Extended Instrumental Techniques for Computer-aided Orchestration, (2020)."},{"issue":"6","key":"187_CR80","doi-asserted-by":"publisher","first-page":"EL523","DOI":"10.1121\/1.5141369","volume":"146","author":"K. Siedenburg","year":"2019","unstructured":"K. Siedenburg, M. R. Sch\u00e4dler, D. H\u00fclsmeier, Modeling the onset advantage in musical instrument recognition. J. Acoust. Soc. Am.146(6), EL523\u2013EL529 (2019).","journal-title":"J. Acoust. Soc. Am."},{"key":"187_CR81","volume-title":"Florian Hecker: Halluzination, Perspektive, Synthese","author":"V. Lostanlen","year":"2019","unstructured":"V. Lostanlen, in Florian Hecker: Halluzination, Perspektive, Synthese, ed. by N. Schafhausen, V. J. M\u00fcller. On Time-frequency Scattering and Computer Music (Sternberg PressBerlin, 2019)."},{"key":"187_CR82","doi-asserted-by":"crossref","unstructured":"C. Baug\u00e9, M. Lagrange, J. And\u00e9n, S. Mallat, in Proceedings of the IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). Representing environmental sounds using the separable scattering transform (IEEE, 2013), pp. 8667\u20138671.","DOI":"10.1109\/ICASSP.2013.6639358"},{"key":"187_CR83","unstructured":"C. Wang, E. Benetos, V. Lostanlen, E. Chew, in Proceedings of the International Society for Music Information Retrieval (ISMIR) Conference. Adaptive time\u2013frequency scattering for periodic modulation recognition in music signals, (2019)."},{"issue":"4","key":"187_CR84","doi-asserted-by":"publisher","first-page":"2047","DOI":"10.1121\/1.4916618","volume":"137","author":"M. R. Sch\u00e4dler","year":"2015","unstructured":"M. R. Sch\u00e4dler, B. Kollmeier, Separable spectro-temporal Gabor filter bank features: reducing the complexity of robust features for automatic speech recognition. J. Acoust. Soc. Am.137(4), 2047\u20132059 (2015).","journal-title":"J. Acoust. Soc. Am."},{"issue":"Apr","key":"187_CR85","first-page":"1471","volume":"11","author":"Y. -W. Chang","year":"2010","unstructured":"Y. -W. Chang, C. -J. Hsieh, K. -W. Chang, M. Ringgaard, C. -J. Lin, Training and testing low-degree polynomial data mappings via linear SVM. J. Mach. Learn. Res.11(Apr), 1471\u20131490 (2010).","journal-title":"J. Mach. Learn. Res."}],"container-title":["EURASIP Journal on Audio, Speech, and Music Processing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-020-00187-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1186\/s13636-020-00187-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-020-00187-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,1,11]],"date-time":"2021-01-11T16:24:49Z","timestamp":1610382289000},"score":1,"resource":{"primary":{"URL":"https:\/\/asmp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13636-020-00187-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,1,11]]},"references-count":85,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2021,12]]}},"alternative-id":["187"],"URL":"https:\/\/doi.org\/10.1186\/s13636-020-00187-z","relation":{},"ISSN":["1687-4722"],"issn-type":[{"value":"1687-4722","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021,1,11]]},"assertion":[{"value":"23 July 2020","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 November 2020","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 January 2021","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"The authors declare that they have no competing interests.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"3"}}