{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,21]],"date-time":"2025-02-21T07:25:09Z","timestamp":1740122709585,"version":"3.37.3"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2017,8,19]],"date-time":"2017-08-19T00:00:00Z","timestamp":1503100800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"name":"DFG","award":["EXC 1077\/1 Hearing4all"],"award-info":[{"award-number":["EXC 1077\/1 Hearing4all"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Intell Inf Syst"],"published-print":{"date-parts":[[2018,12]]},"DOI":"10.1007\/s10844-017-0481-4","type":"journal-article","created":{"date-parts":[[2017,8,19]],"date-time":"2017-08-19T06:04:58Z","timestamp":1503122698000},"page":"457-475","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Environmental sound recognition using short-time feature aggregation"],"prefix":"10.1007","volume":"51","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8686-9732","authenticated-orcid":false,"given":"Gerard","family":"Roma","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Perfecto","family":"Herrera","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Waldo","family":"Nogueira","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,8,19]]},"reference":[{"key":"481_CR1","unstructured":"Alpaydin, E. (2014). Introduction to machine learning. MIT Press."},{"issue":"2","key":"481_CR2","doi-asserted-by":"publisher","first-page":"881","DOI":"10.1121\/1.2750160","volume":"122","author":"JJ Aucouturier","year":"2007","unstructured":"Aucouturier, J.J., Defreville, B., & Pachet, F. (2007). The bag-of-frames approach to audio pattern recognition: a sufficient model for urban soundscapes but not for polyphonic music. The Journal of the Acoustical Society of America, 122(2), 881.","journal-title":"The Journal of the Acoustical Society of America"},{"issue":"3","key":"481_CR3","doi-asserted-by":"publisher","first-page":"16","DOI":"10.1109\/MSP.2014.2326181","volume":"32","author":"D Barchiesi","year":"2015","unstructured":"Barchiesi, D., Giannoulis, D., Stowell, D., & Plumbley, M.D. (2015). Acoustic scene classification: classifying environments from the sounds they produce. IEEE Signal Processing Magazine, 32(3), 16\u201334.","journal-title":"IEEE Signal Processing Magazine"},{"issue":"5","key":"481_CR4","doi-asserted-by":"publisher","first-page":"1035","DOI":"10.1109\/TSA.2005.851998","volume":"13","author":"JP Bello","year":"2005","unstructured":"Bello, J.P., Daudet, L., Abdallah, S., Duxbury, C., Davies, M., & Sandler, M.B. (2005). A tutorial on onset detection in music signals. IEEE Audio, Speech Language Processing, 13(5), 1035\u20131047.","journal-title":"IEEE Audio, Speech Language Processing"},{"key":"481_CR5","doi-asserted-by":"crossref","unstructured":"Bisot, V., Serizel, R., & Essid, S. (2016). Acoustic scene classification with matrix factorization for unsupervised feature learning. In 2016 IEEE international conference on acoustics, speech and signal processing (ICASSP) (pp. 6445\u20136449). IEEE.","DOI":"10.1109\/ICASSP.2016.7472918"},{"key":"481_CR6","unstructured":"B\u00f6ck, S., & Widmer, G. (2013). Maximum filter vibrato suppression for onset detection. In Proceedings of the 16th international conference on digital audio effects (DAFx-13). Maynooth."},{"key":"481_CR7","doi-asserted-by":"publisher","first-page":"233121651455392","DOI":"10.1177\/2331216514553924","volume":"18","author":"Inge Brons","year":"2014","unstructured":"Brons, I., Houben, R., & Dreschler, W.A. (2014). Effects of noise reduction on speech intelligibility, perceived listening effort, and personal preference in hearing-impaired listeners. Trends in Hearing 18. https:\/\/doi.org\/10.1177\/2331216514553924 .","journal-title":"Trends in Hearing"},{"key":"481_CR8","doi-asserted-by":"crossref","unstructured":"Cano, P., Koppenberger, M., & Wack, N. (2005). An industrial-strength content-based music recommendation system. In Proceedings of the 28th annual international ACM SIGIR conference on research and development in information retrieval (p. 673). Salvador.","DOI":"10.1145\/1076034.1076185"},{"key":"481_CR9","first-page":"2079","volume":"11","author":"GC Cawley","year":"2010","unstructured":"Cawley, G.C., & Talbot, N.L. (2010). On over-fitting in model selection and subsequent selection bias in performance evaluation. Journal of Machine Learning Research, 11, 2079\u20132107.","journal-title":"Journal of Machine Learning Research"},{"key":"481_CR10","doi-asserted-by":"publisher","first-page":"e14","DOI":"10.1017\/ATSIP.2014.12","volume":"3","author":"S Chachada","year":"2014","unstructured":"Chachada, S., & Kuo, C.C.J. (2014). Environmental sound recognition: a survey. APSIPA Transactions on Signal and Information Processing, 3, e14.","journal-title":"APSIPA Transactions on Signal and Information Processing"},{"key":"481_CR11","unstructured":"Chang, C.C., & Lin, C.J. (2001). LIBSVM: a library for support vector machines. Software available at http:\/\/www.csie.ntu.edu.tw\/~cjlin\/libsvm ."},{"key":"481_CR12","doi-asserted-by":"crossref","unstructured":"Chechik, G., Ie, E., Rehn, M., Bengio, S., & Lyon, D. (2008). Large-scale content-based audio retrieval from text queries. In Proceedings of the 1st ACM international conference on multimedia information retrieval (MIR \u201908) (p. 105). Beijing.","DOI":"10.1145\/1460096.1460115"},{"key":"481_CR13","doi-asserted-by":"crossref","unstructured":"Chu, S., Narayanan, S., Kuo, C.C.J., & Mataric, M.J. (2006). Where am I? Scene recognition for mobile robots using audio features. In 2006 IEEE International conference on multimedia and expo (pp. 885\u2013888).","DOI":"10.1109\/ICME.2006.262661"},{"issue":"6","key":"481_CR14","doi-asserted-by":"publisher","first-page":"1142","DOI":"10.1109\/TASL.2009.2017438","volume":"17","author":"S Chu","year":"2009","unstructured":"Chu, S., Narayanan, S., & Kuo, C.C.J. (2009). Environmental sound recognition with time-frequency audio features. IEEE Audio, Speech Language Processing, 17(6), 1142\u20131158.","journal-title":"IEEE Audio, Speech Language Processing"},{"key":"481_CR15","unstructured":"Clavel, C., Ehrette, T., & Richard, G. (2005). Events detection for an audio-based surveillance system. In: IEEE International conference on multimedia and expo (ICME 2005) (pp. 1306\u20131309)."},{"issue":"4","key":"481_CR16","doi-asserted-by":"publisher","first-page":"715","DOI":"10.1109\/TSMCA.2009.2015676","volume":"39","author":"W Dargie","year":"2009","unstructured":"Dargie, W. (2009). Adaptive audio-based context recognition. IEEE Transactions on Systems, Man and Cybernetics Part A: Systems and Humans, 39(4), 715\u2013725.","journal-title":"IEEE Transactions on Systems, Man and Cybernetics Part A: Systems and Humans"},{"key":"481_CR17","unstructured":"Ellis, D.P.W. (2005). PLP and RASTA (and MFCC, and inversion) in Matlab. http:\/\/www.ee.columbia.edu\/ln\/rosa\/matlab\/rastamat\/ . Online web resource."},{"issue":"1","key":"481_CR18","doi-asserted-by":"publisher","first-page":"321","DOI":"10.1109\/TSA.2005.854103","volume":"14","author":"A Eronen","year":"2006","unstructured":"Eronen, A., Peltonen, V., Tuomi, J., Klapuri, A., Fagerlund, S., Sorsa, T., Lorho, G., & Huopaniemi, J. (2006). Audio-based context recognition. IEEE Audio, Speech Language Processing, 14(1), 321\u2013329.","journal-title":"IEEE Audio, Speech Language Processing"},{"issue":"1","key":"481_CR19","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1207\/s15326969eco0501_1","volume":"5","author":"W Gaver","year":"1993","unstructured":"Gaver, W. (1993). What in the world do we hear?: an ecological approach to auditory event perception. Ecological Psychology, 5(1), 1\u201329.","journal-title":"Ecological Psychology"},{"key":"481_CR20","unstructured":"Geiger, J.T., Schuller, B., & Rigoll, G. (2013). Recognising acoustic scenes with large-scale audio feature extraction and SVM. Tech. rep. IEEE AASP challenge: detection and classification of acoustic scenes and events."},{"key":"481_CR21","doi-asserted-by":"crossref","unstructured":"Giannoulis, D., Benetos, E., Stowell, D., Rossignol, M., Lagrange, M., & Plumbley, M.D. (2013). Detection and classification of acoustic scenes and events: an IEEE AASP challenge. In 2013 IEEE workshop on applications of signal processing to audio and acoustics (WASPAA) (pp. 1\u20134). IEEE.","DOI":"10.1109\/WASPAA.2013.6701819"},{"key":"481_CR22","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/1687-4722-2013-1","volume":"1","author":"T Heittola","year":"2013","unstructured":"Heittola, T., Mesaros, A., Eronen, A., & Virtanen, T. (2013). Context-dependent sound event detection. EURASIP Journal on Audio Speech, and Music Processing, 1, 1.","journal-title":"EURASIP Journal on Audio Speech, and Music Processing"},{"key":"481_CR23","doi-asserted-by":"crossref","unstructured":"Huang, Z., Cheng, Y.C., Li, K., Hautam\u00e4ki, V., & Lee, C.H. (2013). A blind segmentation approach to acoustic event detection based on i-vector. In Proceedings of interspeech (pp. 2282\u20132286).","DOI":"10.21437\/Interspeech.2013-535"},{"key":"481_CR24","doi-asserted-by":"crossref","unstructured":"Imoto, K., Ohishi, Y., Uematsu, H., & Ohmuro, H. (2013). Acoustic scene analysis based on latent acoustic topic and event allocation. In 2013 IEEE international workshop on machine learning for signal processing (MLSP) (pp. 1\u20136). IEEE.","DOI":"10.1109\/MLSP.2013.6661957"},{"key":"481_CR25","unstructured":"ITU-T (2010). A generic sound activity detector recommendation G.720.1. https:\/\/www.itu.int\/rec\/T-REC-G.720.1\/en ."},{"key":"481_CR26","doi-asserted-by":"crossref","unstructured":"Klapuri, A. (1999). Sound onset detection by applying psychoacoustic knowledge. In Proceedings of 1999 IEEE international conference on acoustics, speech, and signal processing, 1999. (Vol. 6, pp. 3089\u20133092). IEEE.","DOI":"10.1109\/ICASSP.1999.757494"},{"issue":"5","key":"481_CR27","doi-asserted-by":"publisher","first-page":"EL487","DOI":"10.1121\/1.4935350","volume":"138","author":"M Lagrange","year":"2015","unstructured":"Lagrange, M., Lafay, G., Defreville, B., & Aucouturier, J.J. (2015). The bag-of-frames approach: a not so sufficient model for urban soundscapes. The Journal of the Acoustical Society of America, 138(5), EL487\u2013EL492.","journal-title":"The Journal of the Acoustical Society of America"},{"key":"481_CR28","unstructured":"Lee, H., Pham, P., Largman, Y., & Ng, A.Y. (2009). Unsupervised feature learning for audio classification using convolutional deep belief networks. In Advances in neural information processing systems (pp. 1096\u20131104)."},{"issue":"6","key":"481_CR29","doi-asserted-by":"publisher","first-page":"1406","DOI":"10.1109\/TASL.2009.2034776","volume":"18","author":"K Lee","year":"2010","unstructured":"Lee, K., & Ellis, D.P.W. (2010). Audio-based semantic concept classification for consumer video. IEEE Audio, Speech and Language Processing, 18(6), 1406\u20131416.","journal-title":"IEEE Audio, Speech and Language Processing"},{"issue":"1","key":"481_CR30","first-page":"1182","volume":"94","author":"R Martin","year":"1994","unstructured":"Martin, R. (1994). Spectral subtraction based on minimum statistics. Proceedings of EUSIPCO, 94(1), 1182\u20131185.","journal-title":"Proceedings of EUSIPCO"},{"issue":"5","key":"481_CR31","doi-asserted-by":"publisher","first-page":"926","DOI":"10.1016\/j.neuron.2011.06.032","volume":"71","author":"JH McDermott","year":"2011","unstructured":"McDermott, J.H., & Simoncelli, E.P. (2011). Sound texture perception via statistics of the auditory periphery: evidence from sound synthesis. Neuron, 71(5), 926\u2013940.","journal-title":"Neuron"},{"key":"481_CR32","doi-asserted-by":"crossref","unstructured":"Pachet, F., & Roy, P. (2007). Exploring billions of audio features. In 2007 international workshop on content-based multimedia indexing (pp. 227\u2013235). IEEE.","DOI":"10.1109\/CBMI.2007.385416"},{"key":"481_CR33","doi-asserted-by":"crossref","unstructured":"Parascandolo, G., Huttunen, H., & Virtanen, T. (2016). Recurrent neural networks for polyphonic sound event detection in real life recordings. In 2016 IEEE international conference on acoustics, speech and signal processing (ICASSP) (pp. 6440\u20136444). IEEE.","DOI":"10.1109\/ICASSP.2016.7472917"},{"issue":"1","key":"481_CR34","first-page":"142","volume":"23","author":"A Rakotomamonjy","year":"2015","unstructured":"Rakotomamonjy, A., & Gasso, G. (2015). Histogram of gradients of time-frequency representations for audio scene classification. IEEE\/ACM Transactions on Audio Speech and Language Processing, 23(1), 142\u2013153.","journal-title":"IEEE\/ACM Transactions on Audio Speech and Language Processing"},{"key":"481_CR35","doi-asserted-by":"crossref","unstructured":"Roma, G., Nogueira, W., & Herrera, P. (2013). Recurrence quantification analysis features for environmental sound recognition. In 2013 IEEE workshop on applications of signal processing to audio and acoustics (WASPAA) (pp. 1\u20134). IEEE.","DOI":"10.1109\/WASPAA.2013.6701890"},{"issue":"1","key":"481_CR36","doi-asserted-by":"publisher","first-page":"588","DOI":"10.1121\/1.421129","volume":"103","author":"ED Scheirer","year":"1998","unstructured":"Scheirer, E.D. (1998). Tempo and beat analysis of acoustic musical signals. The Journal of the Acoustical Society of America, 103(1), 588\u2013601.","journal-title":"The Journal of the Acoustical Society of America"},{"issue":"9","key":"481_CR37","doi-asserted-by":"publisher","first-page":"093017","DOI":"10.1088\/1367-2630\/11\/9\/093017","volume":"11","author":"Joan Serr\u00e0","year":"2009","unstructured":"Serr\u00e0, J., Serra, X., & Andrzejak, R.G. (2009). Cross recurrence quantification for cover song identification. New Journal of Physics, 11.","journal-title":"New Journal of Physics"},{"key":"481_CR38","doi-asserted-by":"crossref","unstructured":"Serr\u00e0, J., De los Santos, C., & Andrzejak, R.G. (2011). Nonlinear audio recurrence analysis with application to genre classification. In 2011 IEEE international conference on acoustics, speech and signal processing (ICASSP) (pp. 169\u2013172). IEEE.","DOI":"10.1109\/ICASSP.2011.5946367"},{"issue":"1","key":"481_CR39","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/97.736233","volume":"6","author":"J Sohn","year":"1999","unstructured":"Sohn, J., Kim, N.S., & Sung, W. (1999). A statistical model-based voice activity detection. IEEE Signal Processing Letters, 6(1), 1\u20133.","journal-title":"IEEE Signal Processing Letters"},{"key":"481_CR40","doi-asserted-by":"crossref","unstructured":"Stowell, D., Giannoulis, D., Benetos, E., Lagrange, M., & Plumbley, M. (2015). Detection and classification of acoustic scenes and events. IEEE Transactions on Multimedia, 17(19).","DOI":"10.1109\/TMM.2015.2428998"},{"issue":"5","key":"481_CR41","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1109\/TSA.2002.800560","volume":"10","author":"G Tzanetakis","year":"2002","unstructured":"Tzanetakis, G., & Cook, P. (2002). Musical genre classification of audio signals. IEEE Audio, Speech and Language Processing, 10(5), 293\u2013302.","journal-title":"IEEE Audio, Speech and Language Processing"},{"key":"481_CR42","unstructured":"Washington, C.d.A., Assis, F.M., Neto, B.G.A., Costa, S.C., & Vieira, V.J.D. (2012). Pathological voice assessment by recurrence quantification analysis. In 2012 ISSNIP biosignals and biorobotics conference: biosignals and robotics for better and safer living (BRC) (pp. 1\u20136). IEEE."},{"issue":"2","key":"481_CR43","doi-asserted-by":"publisher","first-page":"965","DOI":"10.1152\/jappl.1994.76.2.965","volume":"76","author":"CL Webber","year":"1994","unstructured":"Webber, C.L., & Zbilut, J.P. (1994). Dynamical assessment of physiological systems and states using recurrence plot strategies. Journal of Applied Physiology, 76 (2), 965\u2013973.","journal-title":"Journal of Applied Physiology"},{"key":"481_CR44","unstructured":"Webber, Jr, C.L., & Zbilut, J.P. (2005). Recurrence quantification analysis of nonlinear dynamical systems. Tutorials in Contemporary Nonlinear Methods for the Behavioral Sciences, 26\u201394."},{"key":"481_CR45","unstructured":"Xu, M., Maddage, N., Xu, C., Kankanhalli, M., & Tian, Q. (2003). Creating audio keywords for event detection in soccer video. In Proceedings of the 2003 IEEE international conference on multimedia and expo (ICME \u201903) (Vol. 2, pp. II\u2013281)."},{"issue":"5","key":"481_CR46","doi-asserted-by":"publisher","first-page":"1061","DOI":"10.1109\/TASL.2008.921761","volume":"16","author":"DYD Yu","year":"2008","unstructured":"Yu, D.Y.D., Deng, L.D.L., Droppo, J., Wu, J.W.J., Gong, Y.G.Y., & Acero, A. (2008). Robust speech recognition using a cepstral minimum-mean-square-error-motivated noise suppressor. IEEE Audio, Speech and Language Processing, 16(5), 1061\u20131070. https:\/\/doi.org\/10.1109\/TASL.2008.921761 .","journal-title":"IEEE Audio, Speech and Language Processing"},{"key":"481_CR47","volume-title":"Wiley encyclopedia of biomedical engineering","author":"JP Zbilut","year":"2006","unstructured":"Zbilut, J.P., & Webber, C.L.J. (2006). Recurrence quantification analysis. In Akay, M. (Ed.) Wiley encyclopedia of biomedical engineering. Hoboken: Wiley."},{"key":"481_CR48","doi-asserted-by":"crossref","unstructured":"Zhang, H., McLoughlin, I., & Song, Y. (2015). Robust sound event recognition using convolutional neural networks. In 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP) (pp. 559\u2013563). IEEE.","DOI":"10.1109\/ICASSP.2015.7178031"},{"key":"481_CR49","unstructured":"Zhang, T., & Kuo, C.C.J. (1998). Hierarchical system for content-based audio classification and retrieval. In Photonics East (ISAM, VVDC, IEMB) (pp. 398\u2013409). International Society for Optics and Photonics."}],"container-title":["Journal of Intelligent Information Systems"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s10844-017-0481-4\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10844-017-0481-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s10844-017-0481-4.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,8,1]],"date-time":"2022-08-01T13:34:25Z","timestamp":1659360865000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s10844-017-0481-4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,8,19]]},"references-count":49,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2018,12]]}},"alternative-id":["481"],"URL":"https:\/\/doi.org\/10.1007\/s10844-017-0481-4","relation":{},"ISSN":["0925-9902","1573-7675"],"issn-type":[{"type":"print","value":"0925-9902"},{"type":"electronic","value":"1573-7675"}],"subject":[],"published":{"date-parts":[[2017,8,19]]},"assertion":[{"value":"29 March 2017","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 July 2017","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 July 2017","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 August 2017","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}