{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,6]],"date-time":"2026-06-06T16:38:00Z","timestamp":1780763880867,"version":"3.54.1"},"reference-count":26,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017,3]]},"DOI":"10.1109\/icassp.2017.7952131","type":"proceedings-article","created":{"date-parts":[[2017,6,20]],"date-time":"2017-06-20T17:35:36Z","timestamp":1497980136000},"page":"126-130","source":"Crossref","is-referenced-by-count":102,"title":["A comparison of Deep Learning methods for environmental sound detection"],"prefix":"10.1109","author":[{"given":"Juncheng","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wei","family":"Dai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Florian","family":"Metze","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shuhui","family":"Qu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Samarjit","family":"Das","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TSA.2004.840940"},{"key":"ref11","article-title":"The kaldi speech recognition toolkit","author":"povey","year":"2011","journal-title":"IEEE 2011 workshop"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2013.6638947"},{"key":"ref13","author":"kingma","year":"2014","journal-title":"Adam A method for stochastic optimization"},{"key":"ref14","first-page":"1504","article-title":"Equilibrated adaptive learning rates for non-convex optimization","author":"dauphin","year":"2015","journal-title":"NIPS'15"},{"key":"ref15","first-page":"2121","article-title":"Adaptive subgradient methods for online learning and stochastic optimization","volume":"12","author":"duchi","year":"2011","journal-title":"Journal of Machine Learning Research"},{"key":"ref16","author":"ioffe","year":"2015","journal-title":"Batch Normalization Accelerating Deep Network Training by Reducing Internal Covariate Shift"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref18","author":"chung","year":"2014","journal-title":"Empirical evaluation of gated recurrent neural networks on sequence modeling"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1080"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2015.7280624"},{"key":"ref3","article-title":"CP-JKU submissions for DCASE-2016: a hybrid approach using binaural i-vectors and deep convolutional neural networks","author":"eghbal-zadeh","year":"2016","journal-title":"Tech Rep DCASE2016 Challenge"},{"key":"ref6","article-title":"Acoustic scene recognition with deep neural networks (DCASE challenge 2016)","author":"dai","year":"2016","journal-title":"Tech Rep DCASE2016 Challenge"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2015.7177950"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1145\/1873951.1874246"},{"key":"ref7","article-title":"DCASE2016 baseline system","author":"heittola","year":"2016","journal-title":"Tech Rep DCASE2016 Challenge"},{"key":"ref2","article-title":"Recurrence quantification analysis features for auditory scene classification","author":"roma","year":"2013","journal-title":"DCASE Challenge Tech Rep"},{"key":"ref9","author":"mcfee","year":"2015","journal-title":"librosa 0 4 1"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1590\/S0001-37652004000200041"},{"key":"ref20","author":"hannun","year":"2014","journal-title":"Deep speech Scaling up end-to-end speech recognition"},{"key":"ref22","article-title":"Theano: A Python framework for fast computation of mathematical expressions","year":"2016","journal-title":"T development team"},{"key":"ref21","author":"simonyan","year":"2014","journal-title":"Very Deep Convolutional Networks for Large-scale Image Recognition"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1021\/ac60214a047"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1145\/1015330.1015432"},{"key":"ref26","article-title":"Convolutional neural networks for acoustic modeling of raw time signal in lvcsr","author":"golik","year":"2015","journal-title":"InterSpeech"},{"key":"ref25","author":"chorowski","year":"2014","journal-title":"End-to-end continuous speech recognition using attention-based recurrent nn First results"}],"event":{"name":"2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","location":"New Orleans, LA","start":{"date-parts":[[2017,3,5]]},"end":{"date-parts":[[2017,3,9]]}},"container-title":["2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7943262\/7951776\/07952131.pdf?arnumber=7952131","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2017,8,29]],"date-time":"2017-08-29T14:45:22Z","timestamp":1504017922000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7952131\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,3]]},"references-count":26,"URL":"https:\/\/doi.org\/10.1109\/icassp.2017.7952131","relation":{},"subject":[],"published":{"date-parts":[[2017,3]]}}}