{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,4]],"date-time":"2026-05-04T13:18:51Z","timestamp":1777900731577,"version":"3.51.4"},"reference-count":204,"publisher":"Elsevier","isbn-type":[{"value":"9780123810199","type":"print"}],"license":[{"start":{"date-parts":[[2010,1,1]],"date-time":"2010-01-01T00:00:00Z","timestamp":1262304000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2010,1,1]],"date-time":"2010-01-01T00:00:00Z","timestamp":1262304000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"}],"funder":[{"DOI":"10.13039\/501100001821","name":"Vienna Science and Technology Fund","doi-asserted-by":"publisher","award":["CI06 024"],"award-info":[{"award-number":["CI06 024"]}],"id":[{"id":"10.13039\/501100001821","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001822","name":"\u00d6sterreichischen Akademie der Wissenschaften","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001822","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001821","name":"Vienna Science and Technology Fund","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001821","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2010]]},"DOI":"10.1016\/s0065-2458(10)78003-7","type":"book-chapter","created":{"date-parts":[[2010,3,5]],"date-time":"2010-03-05T04:32:25Z","timestamp":1267763545000},"page":"71-150","source":"Crossref","is-referenced-by-count":134,"title":["Features for Content-Based Audio Retrieval"],"prefix":"10.1016","member":"78","reference":[{"key":"10.1016\/S0065-2458(10)78003-7_bib1","series-title":"Fundamentals of Speech Recognition","author":"Rabiner","year":"1993"},{"key":"10.1016\/S0065-2458(10)78003-7_bib2","doi-asserted-by":"crossref","first-page":"295","DOI":"10.1002\/aris.1440370108","article-title":"Music information retrieval","volume":"37","author":"Downie","year":"2003","journal-title":"Annu. Rev. Inform. Sci. Technol."},{"key":"10.1016\/S0065-2458(10)78003-7_bib3","series-title":"Signal Processing Methods for Music Transcription","author":"Klapuri","year":"2006"},{"issue":"15","key":"10.1016\/S0065-2458(10)78003-7_bib4","doi-asserted-by":"crossref","first-page":"2895","DOI":"10.1016\/S0167-8655(03)00147-8","article-title":"Comparison of techniques for environmental sound recognition","volume":"24","author":"Cowling","year":"2003","journal-title":"Pattern Recogn. Lett."},{"issue":"11","key":"10.1016\/S0065-2458(10)78003-7_bib5","doi-asserted-by":"crossref","first-page":"613620","DOI":"10.1145\/361219.361220","article-title":"A vector space model for automatic indexing","volume":"18","author":"Salton","year":"1975","journal-title":"Commun. ACM"},{"key":"10.1016\/S0065-2458(10)78003-7_bib6","series-title":"Principles of Visual Information Retrieval","author":"Lew","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib7","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib8","series-title":"Music Information Retrieval Evaluation Exchange","year":"2007"},{"key":"10.1016\/S0065-2458(10)78003-7_bib9","series-title":"Bioacoustical Terminology, ANSI S3.20-1995 (R2003)","year":"1995"},{"key":"10.1016\/S0065-2458(10)78003-7_bib10","first-page":"173","article-title":"Zur Tonh\u00f6henwahrnehmung von Kl\u00e4ngen. I. Psychoakustische Grundlagen","volume":"26","author":"Terhardt","year":"1972","journal-title":"Acustica"},{"key":"10.1016\/S0065-2458(10)78003-7_bib11","series-title":"Psychoacoustics: Facts and Models","author":"Zwicker","year":"1999"},{"key":"10.1016\/S0065-2458(10)78003-7_bib12","first-page":"97","article-title":"Musical instrument timbres classification with spectral features","author":"Agostini","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib13","first-page":"61","article-title":"Perceptual distance in timbre space","author":"Terasawa","year":"2005"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib14","doi-asserted-by":"crossref","first-page":"150","DOI":"10.1121\/1.1915715","article-title":"The relation of pitch to intensity","volume":"6","author":"Stevens","year":"1935","journal-title":"J. Acoust. Soc. Am."},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib15","doi-asserted-by":"crossref","first-page":"249","DOI":"10.1016\/S0306-4573(01)00033-4","article-title":"Problems of music information retrieval in the real world","volume":"38","author":"Byrd","year":"2002","journal-title":"Inform. Process. Manage."},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib16","doi-asserted-by":"crossref","first-page":"150","DOI":"10.1016\/S1047-3203(03)00019-1","article-title":"Survey of compressed-domain features used in audio\u2013visual indexing and analysis","volume":"14","author":"Wang","year":"2003","journal-title":"J. Vis. Commun. Image Represent."},{"issue":"6","key":"10.1016\/S0065-2458(10)78003-7_bib17","doi-asserted-by":"crossref","first-page":"12","DOI":"10.1109\/79.888862","article-title":"Multimedia content analysis using both audio and visual clues","volume":"17","author":"Wang","year":"2000","journal-title":"IEEE Signal Process. Mag."},{"key":"10.1016\/S0065-2458(10)78003-7_bib18","series-title":"Manipulation, Analysis and Retrieval Systems for Audio Signals","author":"Tzanetakis","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib19","first-page":"247","article-title":"Feature selection for automatic classification of musical instrument sounds","author":"Liu","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib20","series-title":"Content-Based Audio Classification and Retrieval for Audiovisual Data Parsing","author":"Zhang","year":"2001"},{"issue":"9","key":"10.1016\/S0065-2458(10)78003-7_bib21","first-page":"1374","article-title":"A physiologically inspired method for audio classification","volume":"2005","author":"Ravindran","year":"2005","journal-title":"EURASIP J. Appl. Signal Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib22","first-page":"64","article-title":"Robust speech recognition using features based on zero crossings with peak amplitudes","author":"Gajic","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib23","doi-asserted-by":"crossref","first-page":"578","DOI":"10.1109\/89.326616","article-title":"Rasta processing of speech","volume":"2","author":"Hermansky","year":"1994","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"10","key":"10.1016\/S0065-2458(10)78003-7_bib24","doi-asserted-by":"crossref","first-page":"3023","DOI":"10.1109\/TSP.2004.833861","article-title":"Modulation-scale analysis for content identification","volume":"52","author":"Sukittanon","year":"2004","journal-title":"IEEE Trans. Signal Process."},{"issue":"2\u20133","key":"10.1016\/S0065-2458(10)78003-7_bib25","doi-asserted-by":"crossref","first-page":"127","DOI":"10.1007\/s10994-005-5824-7","article-title":"Automatic feature extraction for classifying audio data","volume":"58","author":"Mierswa","year":"2005","journal-title":"Mach. Learn. J."},{"key":"10.1016\/S0065-2458(10)78003-7_bib26","first-page":"209","article-title":"The quefrency alanysis of time series for echoes: cepstrum, pseudo-autocovariance, cross-cepstrum, and saphe-cracking","author":"Bogert","year":"1963"},{"key":"10.1016\/S0065-2458(10)78003-7_bib27","first-page":"1647","article-title":"The modulation spectrogram: in pursuit of an invariant representation of speech","author":"Greenberg","year":"1997"},{"key":"10.1016\/S0065-2458(10)78003-7_bib28","first-page":"570","article-title":"Content-based organization and visualization of music archives","author":"Pampalk","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib29","doi-asserted-by":"crossref","first-page":"117","DOI":"10.1016\/S0167-6393(98)00032-6","article-title":"Robust speech recognition using the modulation spectrogram","volume":"25","author":"Kingsbury","year":"1998","journal-title":"Speech Commun."},{"key":"10.1016\/S0065-2458(10)78003-7_bib30","series-title":"Analysis of Observed Chaotic Data","author":"Abarbanel","year":"1996"},{"key":"10.1016\/S0065-2458(10)78003-7_bib31","first-page":"60","article-title":"Speech recognition using reconstructed phase space features","author":"Lindgren","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib32","doi-asserted-by":"crossref","first-page":"248","DOI":"10.1121\/1.1908630","article-title":"Subdivision of the audible frequency range into critical bands (Frequenzgruppen)","volume":"33","author":"Zwicker","year":"1961","journal-title":"J. Acoust. Soc. Am."},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib33","doi-asserted-by":"crossref","first-page":"132","DOI":"10.1121\/1.399960","article-title":"Auditory filter shapes at low center frequencies","volume":"88","author":"Moore","year":"1990","journal-title":"J. Acoust. Soc. Am."},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib34","doi-asserted-by":"crossref","first-page":"185","DOI":"10.1121\/1.1915893","article-title":"A scale for the measurement of the psychological magnitude pitch","volume":"8","author":"Stevens","year":"1937","journal-title":"J. Acoust. Soc. Am."},{"key":"10.1016\/S0065-2458(10)78003-7_bib35","series-title":"An Introduction to the Psychology of Hearing","author":"Moore","year":"2004"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib36","doi-asserted-by":"crossref","first-page":"750","DOI":"10.1121\/1.389861","article-title":"Suggested formulae for calculating auditory-filter bandwidths and excitation patterns","volume":"74","author":"Moore","year":"1983","journal-title":"J. Acoust. Soc. Am."},{"key":"10.1016\/S0065-2458(10)78003-7_bib37","doi-asserted-by":"crossref","first-page":"266","DOI":"10.1103\/PhysRev.23.266","article-title":"The auditory masking of one pure tone by another and its probable relation to the dynamics of the inner ear","volume":"23","author":"Wegel","year":"1924","journal-title":"Phys. Rev."},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib38","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1121\/1.1915637","article-title":"Loudness, its definition, measurement and calculation","volume":"5","author":"Fletcher","year":"1933","journal-title":"J. Acoust. Soc. Am."},{"key":"10.1016\/S0065-2458(10)78003-7_bib39","series-title":"International Standard 226, Acoustics\u2014Normal Equal-Loudness Level Contours","year":"1987"},{"key":"10.1016\/S0065-2458(10)78003-7_bib40","first-page":"328","article-title":"The importance of perceptive adaptation of sound features for audio content processing","author":"Pfeiffer","year":"1999"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib41","doi-asserted-by":"crossref","first-page":"153","DOI":"10.1037\/h0046162","article-title":"On the psychophysical law","volume":"64","author":"Stevens","year":"1957","journal-title":"Psychol. Rev."},{"key":"10.1016\/S0065-2458(10)78003-7_bib42","article-title":"Content-based identification of audio material using mpeg-7 low level description","author":"Allamanche","year":"2001"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib43","doi-asserted-by":"crossref","first-page":"165","DOI":"10.1109\/TSA.2003.811538","article-title":"Distortion discriminant analysis for audio fingerprinting","volume":"11","author":"Burges","year":"2003","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib44","first-page":"129","article-title":"MFCC computation from magnitude spectrum of higher lag autocorrelation coefficients for robust speech recognition","author":"Shannon","year":"2004"},{"issue":"4","key":"10.1016\/S0065-2458(10)78003-7_bib45","doi-asserted-by":"crossref","first-page":"565","DOI":"10.1109\/TSA.2005.848893","article-title":"Combination of autocorrelation-based features and projection measure technique for speaker identification","volume":"13","author":"Yuo","year":"2005","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib46","first-page":"288","article-title":"Audio matching via chroma-based statistical features","author":"M\u00fcller","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib47","first-page":"282","article-title":"A comparative study on content-based music genre classification","author":"Li","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib48","series-title":"Technical Report","article-title":"A large set of audio features for sound description (similarity and classification) in the CUIDADO project","author":"Peeters","year":"2004"},{"issue":"6","key":"10.1016\/S0065-2458(10)78003-7_bib49","doi-asserted-by":"crossref","first-page":"482","DOI":"10.1007\/s00530-002-0065-0","article-title":"Content-based audio classification and segmentation by using support vector machines","volume":"8","author":"Lu","year":"2003","journal-title":"Multimedia Syst."},{"key":"10.1016\/S0065-2458(10)78003-7_bib50","article-title":"Inferring efficient hierarchical taxonomies for MIR tasks, application to musical instruments","author":"Essid","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib51","series-title":"JSRU Report No. 1003","article-title":"An experimental automatic word recognition system","author":"Bridle","year":"1974"},{"key":"10.1016\/S0065-2458(10)78003-7_bib52","first-page":"2445","article-title":"Speech\/music discrimination for multimedia applications","author":"El-Maleh","year":"2000"},{"key":"10.1016\/S0065-2458(10)78003-7_bib53","doi-asserted-by":"crossref","first-page":"1477","DOI":"10.1109\/PROC.1986.13663","article-title":"Spectral analysis and discrimination by zero-crossings","volume":"74","author":"Kedem","year":"1986","journal-title":"IEEE Proc."},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib54","doi-asserted-by":"crossref","first-page":"155","DOI":"10.1109\/TMM.2004.840604","article-title":"A speech\/music discriminator based on RMS and zero-crossings","volume":"7","author":"Panagiotakis","year":"2005","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/S0065-2458(10)78003-7_bib55","first-page":"993","article-title":"Real-time discrimination of broadcast speech\/music","author":"Saunders","year":"1996"},{"key":"10.1016\/S0065-2458(10)78003-7_bib56","article-title":"Features for audio and music classification","author":"McKinney","year":"2003"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib57","doi-asserted-by":"crossref","first-page":"585","DOI":"10.1109\/TMM.2006.870726","article-title":"Fusion of audio and motion information on hmm-based highlight extraction for baseball games","volume":"8","author":"Cheng","year":"2006","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/S0065-2458(10)78003-7_bib58","first-page":"53","article-title":"Emotion recognition using acoustic features and textual content","author":"Chuang","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib59","first-page":"33","article-title":"Automatic singer identification","author":"Zhang","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib60","doi-asserted-by":"crossref","first-page":"1026","DOI":"10.1109\/TSA.2005.857575","article-title":"A flexible framework for key audio effects detection and auditory context inference","volume":"14","author":"Cai","year":"2006","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib61","first-page":"61","article-title":"Feature extraction based on zero-crossings with peak amplitudes for robust speech recognition in noisy environments","author":"Kim","year":"1996"},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib62","doi-asserted-by":"crossref","first-page":"55","DOI":"10.1109\/89.736331","article-title":"Auditory processing of speech signals for robust speech recognition in real-world noisy environments","volume":"7","author":"Kim","year":"1999","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib63","first-page":"133","article-title":"A noise-robust feature extraction method based on pitch-synchronous ZCPA for ASR","author":"Ghulam","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib64","first-page":"517","article-title":"Pitch-synchronous ZCPA (PS-ZCPA)-based feature extraction with auditory masking","author":"Ghulam","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib65","series-title":"Information Technology\u2014Multimedia Content Description Interface\u2014Part 4: Audio (Number 15938), ISO\/IEC, Moving Pictures Expert Group","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib66","first-page":"339","article-title":"Discrimination and retrieval of animal sounds","author":"Mitrovic","year":"2006"},{"issue":"6","key":"10.1016\/S0065-2458(10)78003-7_bib67","doi-asserted-by":"crossref","first-page":"570","DOI":"10.1007\/s00530-005-0183-6","article-title":"Toward semantic indexing and retrieval using hierarchical audio models","volume":"10","author":"Chu","year":"2005","journal-title":"Multimedia Syst."},{"key":"10.1016\/S0065-2458(10)78003-7_bib68","first-page":"131","article-title":"SVM-based audio scene classification","author":"Jiang","year":"2005"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib69","doi-asserted-by":"crossref","first-page":"2736","DOI":"10.1109\/93.556537","article-title":"Content-based classification, search, and retrieval of audio","volume":"3","author":"Wold","year":"1996","journal-title":"IEEE Multimedia"},{"issue":"1\u20132","key":"10.1016\/S0065-2458(10)78003-7_bib70","doi-asserted-by":"crossref","first-page":"61","DOI":"10.1023\/A:1008066223044","article-title":"Audio feature extraction and analysis for scene segmentation and classification","volume":"20","author":"Liu","year":"1998","journal-title":"J. VLSI Signal Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib71","series-title":"Digital Processing of Speech Signals","author":"Rabiner","year":"1978"},{"key":"10.1016\/S0065-2458(10)78003-7_bib72","first-page":"40","article-title":"The government standard linear predictive coding algorithm: LPC-10","volume":"1","author":"Tremain","year":"1982","journal-title":"Speech Technol. Mag."},{"key":"10.1016\/S0065-2458(10)78003-7_bib73","first-page":"94","article-title":"Automatic classification of speech and music using neural networks","author":"Khan","year":"2004"},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib74","doi-asserted-by":"crossref","first-page":"55","DOI":"10.1007\/s00530-006-0034-0","article-title":"Machine-learning based classification of speech and music","volume":"12","author":"Khan","year":"2006","journal-title":"Multimedia Syst."},{"key":"10.1016\/S0065-2458(10)78003-7_bib75","first-page":"339","article-title":"A study on content-based classification and retrieval of audio database","author":"Liu","year":"2001"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib76","doi-asserted-by":"crossref","first-page":"441","DOI":"10.1109\/TSA.2004.840939","article-title":"Automatic music classification and summarization","volume":"13","author":"Xu","year":"2005","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"9","key":"10.1016\/S0065-2458(10)78003-7_bib77","doi-asserted-by":"crossref","first-page":"1437","DOI":"10.1109\/5.628714","article-title":"Speaker recognition: A tutorial","volume":"85","author":"Champbell","year":"1997","journal-title":"Proc. IEEE"},{"key":"10.1016\/S0065-2458(10)78003-7_bib78","first-page":"265","article-title":"Music instrument recognition: from isolated notes to solo phrases","author":"Krishna","year":"2004"},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib79","doi-asserted-by":"crossref","first-page":"239","DOI":"10.1016\/S0165-1684(97)00221-1","article-title":"Statistical properties of line spectrum pairs","volume":"65","author":"Tourneret","year":"1998","journal-title":"Signal Process."},{"issue":"4","key":"10.1016\/S0065-2458(10)78003-7_bib80","doi-asserted-by":"crossref","first-page":"332","DOI":"10.1007\/s00530-004-0160-5","article-title":"Unsupervised speaker segmentation and tracking in real-time audio content analysis","volume":"10","author":"Lu","year":"2005","journal-title":"Multimedia Syst."},{"key":"10.1016\/S0065-2458(10)78003-7_bib81","first-page":"364","article-title":"Music artist style identification by semi-supervised learning from both lyrics and content","author":"Li","year":"2004"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib82","doi-asserted-by":"crossref","first-page":"564","DOI":"10.1109\/TMM.2006.870730","article-title":"Toward intelligent music information retrieval","volume":"8","author":"Li","year":"2006","journal-title":"IEEE Trans. Multimedia"},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib83","doi-asserted-by":"crossref","first-page":"308","DOI":"10.1109\/TMM.2005.843363","article-title":"Multigroup classification of audio signals using time-frequency parameters","volume":"7","author":"Umapathy","year":"2005","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/S0065-2458(10)78003-7_bib84","first-page":"393","article-title":"Towards robust features for classifying audio in the CueVideo system","author":"Srinivasan","year":"1999"},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib85","doi-asserted-by":"crossref","first-page":"81","DOI":"10.1109\/TSA.2005.860352","article-title":"Modeling timbre distance with temporal statistics from polyphonic music","volume":"14","author":"M\u00f6rchen","year":"2006","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib86","first-page":"1331","article-title":"Construction and evaluation of a robust multi-feature speech\/music discriminator","author":"Scheirer","year":"1997"},{"key":"10.1016\/S0065-2458(10)78003-7_bib87","first-page":"203","article-title":"A robust audio classification and segmentation method","author":"Lu","year":"2001"},{"issue":"5","key":"10.1016\/S0065-2458(10)78003-7_bib88","doi-asserted-by":"crossref","first-page":"293","DOI":"10.1109\/TSA.2002.800560","article-title":"Musical genre classification of audio signals","volume":"10","author":"Tzanetakis","year":"2002","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib89","first-page":"432","article-title":"Audio-based gender identification using bootstrapping","author":"Tzanetakis","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib90","first-page":"7","article-title":"An industrial strength audio search algorithm","author":"Wang","year":"2003"},{"issue":"8","key":"10.1016\/S0065-2458(10)78003-7_bib91","doi-asserted-by":"crossref","first-page":"44","DOI":"10.1145\/1145287.1145312","article-title":"The Shazam music recognition service","volume":"49","author":"Wang","year":"2006","journal-title":"Commun. ACM"},{"issue":"9","key":"10.1016\/S0065-2458(10)78003-7_bib92","doi-asserted-by":"crossref","first-page":"2281","DOI":"10.1109\/78.157227","article-title":"Significance of group delay functions in spectrum estimation","volume":"40","author":"Yegnanarayan","year":"1992","journal-title":"IEEE Trans. Signal Process."},{"issue":"5","key":"10.1016\/S0065-2458(10)78003-7_bib93","doi-asserted-by":"crossref","first-page":"325","DOI":"10.1109\/89.466662","article-title":"Determination of instants of significant excitation in speech using group delay function","volume":"3","author":"Smits","year":"1995","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib94","doi-asserted-by":"crossref","first-page":"275","DOI":"10.1109\/TSA.2004.841053","article-title":"Beat tracking of musical performances using low-level audio features","volume":"13","author":"Sethares","year":"2005","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib95","first-page":"715","article-title":"Evaluation of the modified group delay feature for isolated word recognition","author":"Alsteris","year":"2005"},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib96","first-page":"190","article-title":"Significance of joint features derived from the modified group delay function in speech processing","volume":"15","author":"Hegde","year":"2007","journal-title":"EURASIP J. Appl. Signal Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib97","first-page":"517","article-title":"Application of the modified group delay function to speaker identification and discrimination","author":"Hegde","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib98","first-page":"68","article-title":"The modified group delay function and its application to phoneme recognition","author":"Murthy","year":"2003"},{"issue":"17","key":"10.1016\/S0065-2458(10)78003-7_bib99","first-page":"2614","article-title":"Subband-based group delay segmentation of spontaneous speech into syllable-like units","volume":"2004","author":"Nagarajan","year":"2004","journal-title":"EURASIP J. Appl. Signal Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib100","first-page":"484","article-title":"Formant extraction from Fourier transform phase","author":"Murthy","year":"1989"},{"key":"10.1016\/S0065-2458(10)78003-7_bib101","first-page":"143","article-title":"Factors in automatic musical genre classification of audio signals","author":"Li","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib102","first-page":"321","article-title":"Harmonicity and dynamics-based features for audio","author":"Srinivasan","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib103","first-page":"1146","article-title":"Gaussian mixture modeling using short time Fourier transform features for audio fingerprinting","author":"Ramalingam","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib104","series-title":"MPEG-7 Audio and Beyond","author":"Kim","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib105","first-page":"83","article-title":"How similar do songs sound? Towards modeling human perception of musical similarity","author":"Herre","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib106","first-page":"343","article-title":"Audio feature extraction and analysis for scene classification","author":"Liu","year":"1997"},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib107","first-page":"5","article-title":"Musical instrument timbres classification with spectral features","volume":"2003","author":"Agostini","year":"2003","journal-title":"EURASIP J. Appl. Signal Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib108","first-page":"197","article-title":"Music genre classification with taxonomy","author":"Li","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib109","series-title":"Prentice-Hall Signal Processing Series","article-title":"Digital Coding of Waveforms: Principles and Applications to Speech and Video","author":"Jayant","year":"1984"},{"key":"10.1016\/S0065-2458(10)78003-7_bib110","first-page":"282","article-title":"Visualization of metre and other rhythm features","author":"Guaus","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib111","first-page":"739","article-title":"Audio content identification by using perceptual hashing","author":"Lancini","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib112","first-page":"127","article-title":"Robust matching of audio signals using spectral flatness features","author":"Herre","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib113","first-page":"193","article-title":"Spectral entropy based feature for robust ASR","author":"Misra","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib114","first-page":"253","article-title":"Multi-resolution spectral entropy feature for robust ASR","author":"Misra","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib115","series-title":"Technical Report","article-title":"Musicminer: Visualizing timbre distances of music as topographical maps","author":"M\u00f6rchen","year":"2005"},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib116","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1023\/A:1011315803415","article-title":"Scene determination based on video and audio features","volume":"15","author":"Pfeiffer","year":"2001","journal-title":"Multimedia Tools Appl."},{"key":"10.1016\/S0065-2458(10)78003-7_bib117","series-title":"Pitch Determination of Speech Signals: Algorithms and Devices","author":"Hess","year":"1983"},{"key":"10.1016\/S0065-2458(10)78003-7_bib118","first-page":"601","article-title":"A spectrally mixed excitation (SMX) vocoder with robust parameter determination","author":"Cho","year":"1998"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib119","doi-asserted-by":"crossref","first-page":"1811","DOI":"10.1121\/1.420088","article-title":"A unitary model of pitch perception","volume":"102","author":"Meddis","year":"1997","journal-title":"J. Acoust. Soc. Am."},{"key":"10.1016\/S0065-2458(10)78003-7_bib120","doi-asserted-by":"crossref","first-page":"2346","DOI":"10.1121\/1.1919362","article-title":"Circularity in judgements of relative pitch","volume":"36","author":"Shepard","year":"1964","journal-title":"J. Acoust. Soc. Am."},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib121","doi-asserted-by":"crossref","first-page":"96","DOI":"10.1109\/TMM.2004.840597","article-title":"Audio thumbnailing of popular music using chroma-based representations","volume":"7","author":"Bartsch","year":"2005","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/S0065-2458(10)78003-7_bib122","first-page":"437","article-title":"A chorus-section detecting method for musical audio signals","author":"Goto","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib123","series-title":"Information Retrieval for Music and Motion","author":"M\u00fcller","year":"2007"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib124","doi-asserted-by":"crossref","first-page":"575","DOI":"10.1109\/TMM.2006.870727","article-title":"Precise pitch profile feature extraction from musical audio for key detection","volume":"8","author":"Zhu","year":"2006","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/S0065-2458(10)78003-7_bib125","first-page":"865","article-title":"Robust singing detection in speech\/music discriminator design","author":"Chou","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib126","article-title":"Instrument description in the context of MPEG-7","author":"Peeters","year":"2000"},{"issue":"4","key":"10.1016\/S0065-2458(10)78003-7_bib127","doi-asserted-by":"crossref","first-page":"357","DOI":"10.1109\/TASSP.1980.1163420","article-title":"Comparison of parametric representations for monosyllabic word recognition in continuously spoken sentences","volume":"28","author":"Davis","year":"1980","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib128","doi-asserted-by":"crossref","first-page":"296","DOI":"10.1121\/1.1918949","article-title":"Short-time spectrum and \u201ccepstrum\u201d techniques for vocal-pitch detection","volume":"36","author":"Noll","year":"1964","journal-title":"J. Acoust. Soc. Am."},{"key":"10.1016\/S0065-2458(10)78003-7_bib129","first-page":"758","article-title":"Audio keyword generation for sports video analysis","author":"Xu","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib130","first-page":"738","article-title":"Noise robust Chinese speech recognition using feature vector normalization and higher-order cepstral coefficients","author":"Wang","year":"2000"},{"key":"10.1016\/S0065-2458(10)78003-7_bib131","first-page":"112","article-title":"Content-based music structure analysis with applications to music semantics understanding","author":"Maddage","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib132","first-page":"49","article-title":"On compensating the Mel-frequency cepstral coefficients for noisy speech recognition","author":"Choi","year":"2006"},{"key":"10.1016\/S0065-2458(10)78003-7_bib133","first-page":"619","article-title":"An auditory system-based feature for robust speech recognition","author":"Li","year":"2001"},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib134","doi-asserted-by":"crossref","first-page":"824","DOI":"10.1109\/18.119739","article-title":"Auditory representations of acoustic signals","volume":"38","author":"Yang","year":"1992","journal-title":"IEEE Trans. Inform. Theory"},{"issue":"4","key":"10.1016\/S0065-2458(10)78003-7_bib135","doi-asserted-by":"crossref","first-page":"1738","DOI":"10.1121\/1.399423","article-title":"Perceptual linear predictive (PLP) analysis of speech","volume":"87","author":"Hermansky","year":"1990","journal-title":"J. Acoust. Soc. Am."},{"issue":"6","key":"10.1016\/S0065-2458(10)78003-7_bib136","doi-asserted-by":"crossref","first-page":"1304","DOI":"10.1121\/1.1914702","article-title":"Effectiveness of linear prediction characteristics of the speech wave for automatic speaker identification and verification","volume":"55","author":"Atal","year":"1974","journal-title":"J. Acoust. Soc. Am."},{"issue":"1\u20134","key":"10.1016\/S0065-2458(10)78003-7_bib137","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/S0020-0255(01)00129-3","article-title":"A speaker identification system using a model of artificial neural networks for an elevator application","volume":"138","author":"Adami","year":"2001","journal-title":"Inform. Sci."},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib138","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1016\/0378-5955(82)90034-X","article-title":"Fluctuation strength and temporal masking patterns of amplitude-modulated broadband noise","volume":"8","author":"Fastl","year":"1982","journal-title":"Hear. Res."},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib139","doi-asserted-by":"crossref","first-page":"1069","DOI":"10.1121\/1.392224","article-title":"A review of the MTF concept in room acoustics and its use for estimating speech intelligibility in auditoria","volume":"77","author":"Houtgast","year":"1985","journal-title":"J. Acoust. Soc. Am."},{"key":"10.1016\/S0065-2458(10)78003-7_bib140","first-page":"1773","article-title":"Modulation frequency features for audio fingerprinting","author":"Sukittanon","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib141","first-page":"452","article-title":"Automatic audio segmentation using a measure of audio novelty","author":"Foote","year":"2000"},{"key":"10.1016\/S0065-2458(10)78003-7_bib142","first-page":"881","article-title":"The beat spectrum: a new approach to rhythm analysis","author":"Foote","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib143","first-page":"35","article-title":"The cyclic beat spectrum: tempo-related audio features for time-scale invariant audio identification","author":"Kurth","year":"2006"},{"issue":"1","key":"10.1016\/S0065-2458(10)78003-7_bib144","doi-asserted-by":"crossref","first-page":"588","DOI":"10.1121\/1.421129","article-title":"Tempo and beat analysis of acoustic musical signals","volume":"103","author":"Scheirer","year":"1998","journal-title":"J. Acoust. Soc. Am."},{"key":"10.1016\/S0065-2458(10)78003-7_bib145","series-title":"Music-Listening Systems","author":"Scheirer","year":"2000"},{"key":"10.1016\/S0065-2458(10)78003-7_bib146","article-title":"Audio analysis using the discrete wavelet transform","author":"Tzanetakis","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib147","first-page":"257","article-title":"Human perception and computer extraction of musical beat strength","author":"Tzanetakis","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib148","first-page":"102","article-title":"A wavelet packet representation of audio signals for music genre classification using different ensemble and feature selection techniques","author":"Grimaldi","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib149","series-title":"A Wavelet Tour of Signal Processing","author":"Mallat","year":"1999"},{"key":"10.1016\/S0065-2458(10)78003-7_bib150","article-title":"Using psycho-acoustic models and self-organizing maps to create a hierarchical structuring of music by sound similarity","author":"Rauber","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib151","doi-asserted-by":"crossref","first-page":"716","DOI":"10.1109\/TCSVT.2004.826766","article-title":"Audio classification based on MPEG-7 spectral basis representations","volume":"14","author":"Kim","year":"2004","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/S0065-2458(10)78003-7_bib152","first-page":"1021","article-title":"Extracting noise-robust features from audio data","author":"Burges","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib153","first-page":"1421","article-title":"A modulated complex lapped transform and its applications to audio processing","author":"Malvar","year":"1999"},{"issue":"6","key":"10.1016\/S0065-2458(10)78003-7_bib154","doi-asserted-by":"crossref","first-page":"1098","DOI":"10.1109\/TSA.2005.852982","article-title":"Nonlinear speech analysis using models for chaotic systems","volume":"13","author":"Kokkinos","year":"2005","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib155","first-page":"533","article-title":"Speech analysis and feature extraction using chaotic models","author":"Pitsikalis","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib156","first-page":"767","article-title":"Feature analysis and extraction for audio automatic classification","author":"Bai","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib157","first-page":"173","article-title":"A silence detection and suppression technique design for voice over IP systems","author":"Becker","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib158","first-page":"187","article-title":"Pause concepts for audio segmentation at different semantic levels","author":"Pfeiffer","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib159","first-page":"1061","article-title":"High-level feature weighted GMM network for audio stream classification","author":"Huang","year":"2004"},{"issue":"16","key":"10.1016\/S0065-2458(10)78003-7_bib160","doi-asserted-by":"crossref","first-page":"1811","DOI":"10.1016\/j.patrec.2004.07.006","article-title":"Local fuzzy PCA based GMM with dimension reduction on speaker identification","volume":"25","author":"Lee","year":"2004","journal-title":"Pattern Recogn. Lett."},{"key":"10.1016\/S0065-2458(10)78003-7_bib161","first-page":"753","article-title":"Merging segmental and rhythmic features for automatic language identification","author":"Farinas","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib162","first-page":"36","article-title":"Speaker and text independent language identification using predictive error histogram vectors","author":"Gu","year":"2003"},{"issue":"6","key":"10.1016\/S0065-2458(10)78003-7_bib163","doi-asserted-by":"crossref","first-page":"678","DOI":"10.1109\/89.943345","article-title":"Spoken language recognition\u2014a step toward multilinguality in speech processing","volume":"9","author":"Navratil","year":"2001","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"10.1016\/S0065-2458(10)78003-7_bib164","first-page":"89","article-title":"Approaches to language identification using Gaussian mixture models and shifted delta cepstral features","author":"Torres-Carrasquillo","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib165","first-page":"251","article-title":"Emotive alert: HMM-based emotion detection in voicemail messages","author":"Inanoglu","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib166","first-page":"9","article-title":"Classification of stress in speech using linear and nonlinear features","author":"Nwe","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib167","first-page":"548","article-title":"Towards automatic recognition of emotion in speech","author":"Razak","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib168","first-page":"137","article-title":"Automatic estimation of one's age with his\/her speech based upon acoustic modeling techniques of speakers","author":"Minematsu","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib169","first-page":"844","article-title":"Comparison of neural networks and support vector machines applied to optimized features extracted from patients\u2019 speech signal for classification of vocal fold inflammation","author":"Behroozmand","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib170","first-page":"633","article-title":"Non-negative component parts of sound for classification","author":"Cho","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib171","first-page":"1129","article-title":"Use of modulation spectra for representation and classification of acoustic transients from sniper fire","author":"Owsley","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib172","first-page":"158","article-title":"Audio analysis for surveillance applications","author":"Radhakrishnan","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib173","first-page":"21","article-title":"Automatic audio content analysis","author":"Pfeiffer","year":"1996"},{"key":"10.1016\/S0065-2458(10)78003-7_bib174","first-page":"591","article-title":"Robust soccer highlight generation with a novel dominant-speech feature extractor","author":"Wang","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib175","first-page":"427","article-title":"Affect-based indexing and retrieval of films","author":"Chan","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib176","first-page":"665","article-title":"Content based audio classification and retrieval using joint time-frequency analysis","author":"Esmaili","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib177","first-page":"361","article-title":"Content-based recognition of musical instruments","author":"Fanelli","year":"2004"},{"issue":"5","key":"10.1016\/S0065-2458(10)78003-7_bib178","doi-asserted-by":"crossref","first-page":"422","DOI":"10.1007\/s00530-006-0027-z","article-title":"Discrete wavelet packet transform and ensembles of lazy and eager learners for music genre classification","volume":"11","author":"Grimaldi","year":"2006","journal-title":"Multimedia Syst."},{"key":"10.1016\/S0065-2458(10)78003-7_bib179","first-page":"471","article-title":"Singing voice features by time-frequency representations","author":"Mesaros","year":"2003"},{"issue":"6","key":"10.1016\/S0065-2458(10)78003-7_bib180","doi-asserted-by":"crossref","first-page":"1028","DOI":"10.1109\/TMM.2005.858380","article-title":"The way it sounds: timbre models for analysis and retrieval of music signals","volume":"7","author":"Aucouturier","year":"2005","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/S0065-2458(10)78003-7_bib181","first-page":"311","article-title":"Hierarchical multi-class self similarities","author":"Jehan","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib182","first-page":"705","article-title":"Content-based music similarity search and emotion detection","author":"Li","year":"2004"},{"issue":"5","key":"10.1016\/S0065-2458(10)78003-7_bib183","doi-asserted-by":"crossref","first-page":"717","DOI":"10.1109\/TMM.2004.834859","article-title":"A unified approach to content-based and fault-tolerant music recognition","volume":"6","author":"Clausen","year":"2004","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/S0065-2458(10)78003-7_bib184","first-page":"275","article-title":"Repeating pattern discovery and structure analysis from acoustic music data","author":"Lu","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib185","first-page":"409","article-title":"Recognition of piano notes with the aid of FRM filters","author":"Foo","year":"2004"},{"key":"10.1016\/S0065-2458(10)78003-7_bib186","first-page":"127","article-title":"Summarizing popular music via structural similarity analysis","author":"Cooper","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib187","article-title":"Cubyhum: a fully operational query by humming system","author":"Pauws","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib188","article-title":"Enhancing sonic browsing using audio information retrieval","author":"Brazil","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib189","first-page":"497","article-title":"Improving music genre classification by short time feature integration","author":"Meng","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib190","first-page":"429","article-title":"Musical genre classification using support vector machines","author":"Changsheng","year":"2003"},{"key":"10.1016\/S0065-2458(10)78003-7_bib191","first-page":"15","article-title":"To catch a chorus: using chroma-based representations for audio thumbnailing","author":"Bartsch","year":"2001"},{"key":"10.1016\/S0065-2458(10)78003-7_bib192","article-title":"Comparison of several acoustic modeling techniques and decoding algorithms for embedded speech recognition systems","author":"Lvy","year":"2003"},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib193","doi-asserted-by":"crossref","first-page":"181","DOI":"10.1007\/s10772-005-2169-3","article-title":"Pseudo complex cepstrum using discrete cosine transform","volume":"8","author":"Muralishankar","year":"2005","journal-title":"Int. J. Speech Technol."},{"key":"10.1016\/S0065-2458(10)78003-7_bib194","first-page":"714","article-title":"Speaker adaptive speech recognition using phone pair model","author":"Baojie","year":"2000"},{"key":"10.1016\/S0065-2458(10)78003-7_bib195","first-page":"738","article-title":"Noise robust Chinese speech recognition using feature vector normalization and higher-order cepstral coefficients","author":"Wang","year":"2000"},{"key":"10.1016\/S0065-2458(10)78003-7_bib196","first-page":"377","article-title":"Modulation features for speech recognition","author":"Dimitriadis","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib197","first-page":"665","article-title":"Joint acoustic-modulation frequency for speaker recognition","author":"Kinnunen","year":"2006"},{"key":"10.1016\/S0065-2458(10)78003-7_bib198","article-title":"Evaluation of frequently used audio features for classification of music into perceptual categories","author":"Pohle","year":"2005"},{"key":"10.1016\/S0065-2458(10)78003-7_bib199","first-page":"817","article-title":"Nonlinear analysis of speech signals: generalized dimensions and Lyapunov exponents","author":"Pitsikalis","year":"2003"},{"issue":"2","key":"10.1016\/S0065-2458(10)78003-7_bib200","doi-asserted-by":"crossref","first-page":"143","DOI":"10.1076\/jnmr.32.2.143.16743","article-title":"Pitch histograms in audio and symbolic music information retrieval","volume":"32","author":"Tzanetakis","year":"2003","journal-title":"J. New Music Res."},{"key":"10.1016\/S0065-2458(10)78003-7_bib201","first-page":"639","article-title":"An audio recommendation system based on audio signature description scheme in MPEG-7 audio","author":"Huang","year":"2004"},{"issue":"3","key":"10.1016\/S0065-2458(10)78003-7_bib202","doi-asserted-by":"crossref","first-page":"269","DOI":"10.1023\/A:1012491016871","article-title":"Indexing and retrieval of audio: a survey","volume":"15","author":"Lu","year":"2001","journal-title":"Multimedia Tools Appl."},{"key":"10.1016\/S0065-2458(10)78003-7_bib203","series-title":"Technical Report","article-title":"Audio information retrieval a bibliographical study","author":"Davy","year":"2002"},{"key":"10.1016\/S0065-2458(10)78003-7_bib204","first-page":"169","article-title":"A review of algorithms for audio fingerprinting","author":"Cano","year":"2002"}],"container-title":["Advances in Computers","Advances in Computers: Improving the Web"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0065245810780037?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0065245810780037?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2025,9,24]],"date-time":"2025-09-24T07:55:43Z","timestamp":1758700543000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0065245810780037"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2010]]},"ISBN":["9780123810199"],"references-count":204,"URL":"https:\/\/doi.org\/10.1016\/s0065-2458(10)78003-7","relation":{},"ISSN":["0065-2458"],"issn-type":[{"value":"0065-2458","type":"print"}],"subject":[],"published":{"date-parts":[[2010]]}}}