{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,19]],"date-time":"2026-06-19T06:57:20Z","timestamp":1781852240968,"version":"3.54.5"},"reference-count":53,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2014,10,9]],"date-time":"2014-10-09T00:00:00Z","timestamp":1412812800000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2015,10]]},"DOI":"10.1007\/s00530-014-0424-7","type":"journal-article","created":{"date-parts":[[2014,10,8]],"date-time":"2014-10-08T07:35:43Z","timestamp":1412753743000},"page":"507-524","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Context-based environmental audio event recognition for scene understanding"],"prefix":"10.1007","volume":"21","author":[{"given":"Tong","family":"Lu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gongyou","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Feng","family":"Su","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2014,10,9]]},"reference":[{"key":"424_CR1","doi-asserted-by":"crossref","unstructured":"Peng, Y.T., Lin, C.Y., Sun, M.T., Tsai, K.C.: Healthcare audio event classification using hidden Markov models and hierarchical hidden Markov models. In: ICME, pp. 1218\u20131221 (2009)","DOI":"10.1109\/ICME.2009.5202720"},{"key":"424_CR2","unstructured":"Heittola, T., Mesaros, A., Virtanen, T., Eronen, A.: Sound event detection in multisource environments using source separation. In: CHiME, pp. 36\u201340 (2011)"},{"key":"424_CR3","doi-asserted-by":"crossref","unstructured":"Yang, L., Su, F.: Auditory context classification using random forests. In: ICASSP, pp. 25\u201330 (2012)","DOI":"10.1109\/ICASSP.2012.6288386"},{"key":"424_CR4","doi-asserted-by":"crossref","unstructured":"Lin, W., Lu, T., Su, F.: A novel multi-modal integration and propagation model for cross-media information retrieval. In: MMM, pp. 740\u2013749 (2012)","DOI":"10.1007\/978-3-642-27355-1_78"},{"key":"424_CR5","unstructured":"Gerosa, L., Valenzise, G., Antonacci, F., Tagliasacchi, M., Sarti, A.: Scream and gunshot detection in noisy environments. In: EUSIPCO (2007)"},{"issue":"12","key":"424_CR6","doi-asserted-by":"crossref","first-page":"1524","DOI":"10.1016\/j.patrec.2009.09.014","volume":"31","author":"R Bardeli","year":"2010","unstructured":"Bardeli, R., Wolff, D., Kurth, F., Koch, M., Tauchert, K., Frommolt, K.: Detecting bird sounds in a complex acoustic environment and application to bioacoustic monitoring. Pattern Recognit. Lett. 31(12), 1524\u20131534 (2010)","journal-title":"Pattern Recognit. Lett."},{"key":"424_CR7","doi-asserted-by":"crossref","unstructured":"Ntalampiras, S., Potamitis, I., Fakotakis, N.: On acoustic surveillance of hazardous situations. In: ICASSP, pp. 165\u2013168 (2009)","DOI":"10.1109\/ICASSP.2009.4959546"},{"key":"424_CR8","doi-asserted-by":"crossref","unstructured":"Wang, X., Rosenblum, D., Wang, Y.: A daily, activity-aware, mobile music recommemder system. In: ACM Multimedia, pp. 1313\u20131314 (2011)","DOI":"10.1145\/2393347.2396459"},{"key":"424_CR9","doi-asserted-by":"crossref","unstructured":"Rho, S., jun Han, B., Hwang, E.: SVR-based music mood classification and context-based music recommendation. In: ACM Multimedia, pp. 713\u2013716 (2009)","DOI":"10.1145\/1631272.1631395"},{"issue":"15","key":"424_CR10","doi-asserted-by":"crossref","first-page":"2895","DOI":"10.1016\/S0167-8655(03)00147-8","volume":"24","author":"M Cowling","year":"2011","unstructured":"Cowling, M., Sitte, R.: Comparison of techniques for environmental sound recognition. Pattern Recognit. Lett. 24(15), 2895\u20132907 (2011)","journal-title":"Pattern Recognit. Lett."},{"key":"424_CR11","doi-asserted-by":"crossref","unstructured":"Wang, Y., Li, B., Jiang, X., Liu, F., Wang, L.: Speaker recognition based on dynamic mfcc parameters. In: IASP, pp. 406\u2013409 (2009)","DOI":"10.1109\/IASP.2009.5054638"},{"key":"424_CR12","unstructured":"Harsha, Y.S., Vasudeva, V., Kishore, P.: Significance of anchor speaker segments for constructing extractive audio summaries of broadcast news. In: SLT, pp. 12\u201318 (2010)"},{"key":"424_CR13","doi-asserted-by":"crossref","unstructured":"Shiu, Y., Jeong, H., kuo, C.-C.J.: Similarity matrix processing for music structure analysis. In: ACM Multimedia, pp. 69\u201376 (2006)","DOI":"10.1145\/1178723.1178734"},{"issue":"3","key":"424_CR14","doi-asserted-by":"crossref","first-page":"433","DOI":"10.1007\/s11042-009-0332-6","volume":"47","author":"B jun Han","year":"2010","unstructured":"jun Han, B., Rho, S., Jun, S., Hwang, E.: Music emotion classification and context-based music recommendation. Multimed. Tools Appl. 47(3), 433\u2013460 (2010)","journal-title":"Multimed. Tools Appl."},{"issue":"10","key":"424_CR15","doi-asserted-by":"crossref","first-page":"2965","DOI":"10.1016\/j.patcog.2008.05.008","volume":"41","author":"D O\u2019Shaughnessy","year":"2011","unstructured":"O\u2019Shaughnessy, D.: Automatic speech recognition: history, methods and challenges. Pattern Recognit. 41(10), 2965\u20132979 (2011)","journal-title":"Pattern Recognit."},{"key":"424_CR16","doi-asserted-by":"crossref","unstructured":"Raj, B., Stern, R.: Missing-feature approaches in speech recognition. In: IEEE Signal Process, pp. 101\u2013116. (2005)","DOI":"10.1109\/MSP.2005.1511828"},{"key":"424_CR17","doi-asserted-by":"crossref","unstructured":"Lyon, R.: Machine hearing. In: IEEE, Signal Process, pp. 131\u2013139 (2010)","DOI":"10.1109\/MSP.2010.937498"},{"key":"424_CR18","unstructured":"Heittola, T., Mesaros, A., Virtanen, T., Eronen, A.: Audio event detection in multisource environments using source separation. In: Machine Listening in Multisource Environments (2011)"},{"key":"424_CR19","doi-asserted-by":"crossref","unstructured":"Su, F., Yang, L., Lu, T., Wang, G.: Environmental sound classification for scene recognition using local discriminant bases and HMM. In: ACM Multimedia, pp. 1389\u20131392 (2011)","DOI":"10.1145\/2072298.2072022"},{"key":"424_CR20","doi-asserted-by":"crossref","unstructured":"Lu, T., Wang, G.Y., Wen, Y.B.: Auditory movie summarization by detecting audio events and scene changes. In: ICPR (2014). (To appaer)","DOI":"10.1109\/ICPR.2014.140"},{"key":"424_CR21","doi-asserted-by":"crossref","unstructured":"Jin, Y., Lu, T., Su, F.: Movie keyframe retrieval based on cross-media correlation detection and context model. In: IEA\/AIE, pp. 816\u2013825 (2012)","DOI":"10.1007\/978-3-642-31087-4_82"},{"key":"424_CR22","doi-asserted-by":"crossref","unstructured":"Lu, T., Jin, Y.K., Su, F., Shivakumara, P., Tan, C.L.: Content-oriented multimedia document understanding through cross-media correlation. In: Multimedia Tools and Applciations (2014). (To appear)","DOI":"10.1007\/s11042-014-2044-9"},{"key":"424_CR23","unstructured":"Giannoulis, D., Stowell, D., Benetos, E., Rossignol, M., Lagrange, M., Plumbley, M.D.: A database and challenge for acoustic scene classification and event detection. In: EUSIPCO (2013)"},{"issue":"1","key":"424_CR24","doi-asserted-by":"crossref","first-page":"321","DOI":"10.1109\/TSA.2005.854103","volume":"14","author":"AJ Eronen","year":"2006","unstructured":"Eronen, A.J., Peltonen, V.T., Tuomi, J.T., Klapuri, A.P., Fagerlund, S., Sorsa, T., Lorho, G., Huopaniemi, J.: Audiobased context recogniton. IEEE Trans. Audio Speech Lang. Process. 14(1), 321\u2013329 (2006)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"424_CR25","doi-asserted-by":"crossref","unstructured":"Aleh, K.I., Elian, A.A., Kabal, P.: Frame level noise classification in mobile environments. In: ICASSP, pp. 237\u2013240 (1999)","DOI":"10.1109\/ICASSP.1999.758106"},{"key":"424_CR26","doi-asserted-by":"crossref","unstructured":"Gaunard, P., Mubikangiey, C.G., Couvreur, C., Fontaine, V.: Automatic classification of environmental noise events by hidden markov models. In: ICASSP, pp. 3609\u20133612 (1998)","DOI":"10.1109\/ICASSP.1998.679661"},{"key":"424_CR27","doi-asserted-by":"crossref","unstructured":"Scheirer, E.D., Slaney, M.: Construction and evaluation of a robust multifeature speech\/music discriminator. In: ICASSP, pp. 1331\u20131334 (1997)","DOI":"10.1109\/ICASSP.1997.596192"},{"key":"424_CR28","doi-asserted-by":"crossref","unstructured":"Han, B.-J., Hwang, E.: Environmental sound classification based on feature collaboration. In: ICME, pp. 542\u2013545 (2009)","DOI":"10.1109\/ICME.2009.5202553"},{"issue":"7","key":"424_CR29","doi-asserted-by":"crossref","first-page":"2197","DOI":"10.1109\/TASL.2011.2118753","volume":"19","author":"B Ghoraani","year":"2011","unstructured":"Ghoraani, B., Krishnan, S.S.: Time-frequency matrix feature extraction and classification of environmental audio signals. IEEE Trans. Audio Speech Lang. Process. 19(7), 2197\u20132209 (2011)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"2","key":"424_CR30","doi-asserted-by":"crossref","first-page":"308","DOI":"10.1109\/TMM.2005.843363","volume":"7","author":"K Umapathy","year":"2005","unstructured":"Umapathy, K., Krishnan, S.S., Jimaa, S.A.: Multigroup classification of audio signals using time\u2013frequency parameters. IEEE Trans. Multimed. 7(2), 308\u2013315 (2005)","journal-title":"IEEE Trans. Multimed."},{"issue":"4","key":"424_CR31","doi-asserted-by":"crossref","first-page":"1236","DOI":"10.1109\/TASL.2006.885921","volume":"15","author":"K Umapathy","year":"2006","unstructured":"Umapathy, K., Krishnan, S.S., Rao, R.K.: Audio signal feature extraction and classification using local discrimininant bases. IEEE Trans. Audio Speech Lang. Process. 15(4), 1236\u20131246 (2006)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"6","key":"424_CR32","doi-asserted-by":"crossref","first-page":"1142","DOI":"10.1109\/TASL.2009.2017438","volume":"17","author":"S Chu","year":"2009","unstructured":"Chu, S., Narayanan, S., Kuo, C.-C.J.: Environmental sound recognition with timecfrequency audio features. IEEE Trans. Audio Speech Lang. Process. 17(6), 1142\u20131158 (2009)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"424_CR33","doi-asserted-by":"crossref","unstructured":"M\u00e4kinen, T., Kiranyaz, S., Pulkkinen, J., Gabbouj, M.: Evolutionary feature generation for content-based audio classification and retrieval. In: EUSIPCO, pp. 27\u201331 (2012)","DOI":"10.1186\/1687-4722-2012-23"},{"key":"424_CR34","doi-asserted-by":"crossref","unstructured":"Niessen, M.E., Leendert, V.M., Andringa, T.C.: Disambiguating sounds through context. In: IEEE International Conference on Semantic Computing, pp. 88\u201395 (2008)","DOI":"10.1109\/ICSC.2008.27"},{"key":"424_CR35","unstructured":"Heittola, T., Mesaros, A., Eronen, A., Virtanen, T.: Audio context recognition using audio event histograms. In: European Signal Processing Conference, pp. 23\u201327 (2010)"},{"key":"424_CR36","doi-asserted-by":"crossref","unstructured":"Heittola, T., Heittola, T., Mesaros, A., Eronen, A., Virtanen, T.: Context-dependent sound event detection. EURASIP J. Audio Speech Music Process. (2013). doi: 10.1186\/1687-4722-2013-1","DOI":"10.1186\/1687-4722-2013-1"},{"issue":"1","key":"424_CR37","doi-asserted-by":"crossref","first-page":"16","DOI":"10.1109\/MIS.2010.23","volume":"25","author":"J-H Su","year":"2010","unstructured":"Su, J.-H., Yeh, H.-H., Yu, P.S., Tseng, V.S.-M.: Music recommendation using content and context information mining. IEEE Intell. Syst. 25(1), 16\u201326 (2010)","journal-title":"IEEE Intell. Syst."},{"key":"424_CR38","doi-asserted-by":"crossref","unstructured":"Park, H.-S., Yoo, J.-O., Cho, S.-B.: A context-aware music recommendation system using fuzzy bayesian networks with utility theory. In: FSKD, pp. 970\u2013979 (2006)","DOI":"10.1007\/11881599_121"},{"key":"424_CR39","doi-asserted-by":"crossref","unstructured":"Elliott, G.T., Tomlinson, B.: Personalsoundtrack: contextaware playlists that adapt to user pace. In: SIGCHI, pp. 736\u2013741 (2006)","DOI":"10.1145\/1125451.1125599"},{"key":"424_CR40","doi-asserted-by":"crossref","unstructured":"Rho, S., jun Han, B., Hwang, E.: Svr-based music mood classification and context-based music recommendation. In: ACM MM, pp. 713\u2013716 (2009)","DOI":"10.1145\/1631272.1631395"},{"issue":"2","key":"424_CR41","doi-asserted-by":"crossref","first-page":"262","DOI":"10.1109\/TNN.2009.2036174","volume":"21","author":"DT Mirikitani","year":"2010","unstructured":"Mirikitani, D.T., Nikolaev, N.: Recursive bayesian recurrent neural networks for time-series modeling. IEEE Trans. Neural Netw. 21(2), 262\u2013274 (2010)","journal-title":"IEEE Trans. Neural Netw."},{"issue":"3","key":"424_CR42","doi-asserted-by":"crossref","first-page":"1026","DOI":"10.1109\/TSA.2005.857575","volume":"14","author":"L-H Cai","year":"2006","unstructured":"Cai, L.-H., Lu, L., Hanjalic, A., Zhang, H.J.: A flexible framework for key audio effects detection and auditory context inference. IEEE Trans. Audio Speech Lang. Process. 14(3), 1026\u20131039 (2006)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"424_CR43","doi-asserted-by":"crossref","unstructured":"Wang, J.-C. C., Wang, J.-F.-F., Kuok, W.,Hsu, C.-S.: Environmental sound classification using hybrid SVM\/KNN classifier and MPEG-7 audio low-level descritpor. In: IJCNN, pp. 1731\u20131735 (2006)","DOI":"10.1109\/IJCNN.2006.246644"},{"key":"424_CR44","unstructured":"R\u00e4s\u00e4nen, O., Lepp\u00e4nen, J., Laine, U.K., Saarinen, J.P.: Comparison of classifiers in audio and acceleration based context classification in mobile phones. In: EUSIPCO, pp. 946\u2013950 (2011)"},{"key":"424_CR45","unstructured":"Kinnunen, T., Saeidi, R., Leppanen, J., Saarinen, J.P.: Audio context recognition in variable mobile environments from short segments using speaker and language recognizers. In: The Speaker and Language Recognition Workshop, pp. 301\u2013311 (2012)"},{"key":"424_CR46","doi-asserted-by":"crossref","unstructured":"Bernardin, K., Stiefelhagen, R., Waibel, A.: Probabilisitic intergration of sparse audio-visual cues for identify tracking. In: ACM Multimedia, pp. 151\u2013158 (2008)","DOI":"10.1145\/1459359.1459380"},{"key":"424_CR47","unstructured":"Mesaros, A., Heittola, T., Klapuri, A.P..: Latent semantic analysis in sound event detection. In: EUSIPCO, pp. 1307\u20131311 (2011)"},{"key":"424_CR48","unstructured":"Chu, W.-T., Cheng, W.-H., Wu, J.-L.L.: Generative and discriminative modeling toward semantic context detection in audio tracks. In: MMM, pp. 38\u201345 (2005)"},{"key":"424_CR49","doi-asserted-by":"crossref","unstructured":"Cai, R., Lu, L., Hanjalic, A.: Unsupervised content discovery in composite audio. In: ACM Multimedia, pp. 628\u2013637 (2005)","DOI":"10.1145\/1101149.1101292"},{"key":"424_CR50","doi-asserted-by":"crossref","unstructured":"Galleguillos, C., Rabinovich, A., Belongie, S.: Object categorization using co-occurrence, location and appearance. In: CVPR, pp. 1\u20138 (2008)","DOI":"10.1109\/CVPR.2008.4587799"},{"key":"424_CR51","unstructured":"http:\/\/www.sound-ideas.com\/sound-effects\/bbc-1-60-hd-sound-effects-library.html"},{"issue":"6","key":"424_CR52","doi-asserted-by":"crossref","first-page":"1142","DOI":"10.1109\/TASL.2009.2017438","volume":"17","author":"C Selina","year":"2009","unstructured":"Selina, C., Shri, N.S., Jay, K.C.-C.-C.: Environmental sound recognition with time-frequency audio features. IEEE Trans. Audio Speech Lang. Process. 17(6), 1142\u20131158 (2009)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"424_CR53","doi-asserted-by":"crossref","unstructured":"Giannoulis, D., Benetos, E., Stowell, D., Rossignol, M., Lagrange, M., Plumbley, M.D.: Detection and classification of acoustic scenes and events: an IEEE AASP challenge. In: IEEE Workshop on Applications of Signal Processing to Audio and Acoustics, pp. 1\u20134 (2013)","DOI":"10.1109\/WASPAA.2013.6701819"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-014-0424-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s00530-014-0424-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-014-0424-7","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,5]],"date-time":"2025-05-05T01:53:57Z","timestamp":1746410037000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s00530-014-0424-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014,10,9]]},"references-count":53,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2015,10]]}},"alternative-id":["424"],"URL":"https:\/\/doi.org\/10.1007\/s00530-014-0424-7","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2014,10,9]]}}}