{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,11]],"date-time":"2026-06-11T02:59:49Z","timestamp":1781146789809,"version":"3.54.1"},"publisher-location":"Cham","reference-count":42,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783319940298","type":"print"},{"value":"9783319940304","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,7,4]],"date-time":"2018-07-04T00:00:00Z","timestamp":1530662400000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019]]},"DOI":"10.1007\/978-3-319-94030-4_6","type":"book-chapter","created":{"date-parts":[[2018,7,3]],"date-time":"2018-07-03T08:22:48Z","timestamp":1530606168000},"page":"129-157","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Speech Analytics Based on Machine Learning"],"prefix":"10.1007","author":[{"given":"Grazina","family":"Korvel","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Adam","family":"Kurowski","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bozena","family":"Kostek","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Andrzej","family":"Czyzewski","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2018,7,4]]},"reference":[{"key":"6_CR1","doi-asserted-by":"crossref","unstructured":"Badshah. A.M., Ahmad, J., Rahim, N., Baik, S.W.: Speech Emotion Recognition from Spectrograms with Deep Convolutional Neural Network International Conference on Platform Technology and Service (PlatCon), pp. 1\u20135 (2017)","DOI":"10.1109\/PlatCon.2017.7883728"},{"issue":"7\/8","key":"6_CR2","doi-asserted-by":"publisher","first-page":"562","DOI":"10.17743\/jaes.2017.0022","volume":"65","author":"Fatemeh Noroozi","year":"2017","unstructured":"Noroozi, F., Kaminska, D., Sapinski, T., Anbarjafari, G.: Supervised vocal-based emotion recognition using multiclass support vector machine, random forests, and adaboost. J. Audio Eng. Soc. 65(7\/8), 562\u2013572 (2017). https:\/\/doi.org\/10.17743\/jaes.2017.0022","journal-title":"Journal of the Audio Engineering Society"},{"key":"6_CR3","doi-asserted-by":"crossref","unstructured":"Sainath, T.N., Mohamed, A.-R., Kingsbury, B., Ramabhadran, B.: Deep convolutional neural networks for LVCSR. In: 2013 IEEE International Conference on Acoustics, Speech and Signal Processing, pp. 8614\u20138618 (2013)","DOI":"10.1109\/ICASSP.2013.6639347"},{"issue":"1","key":"6_CR4","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1109\/TASLP.2014.2364452","volume":"23","author":"Y Xu","year":"2015","unstructured":"Xu, Y., Du, J., Dai, L.R., Lee, C.H.: A regression approach to speech enhancement based on deep neural networks. IEEE\/ACM Trans. Audio, Speech, Lang. Process. 23(1), 7\u201319 (2015)","journal-title":"IEEE\/ACM Trans. Audio, Speech, Lang. Process."},{"issue":"4","key":"6_CR5","doi-asserted-by":"publisher","first-page":"533","DOI":"10.1007\/s12559-012-9197-5","volume":"5","author":"MJ Alam","year":"2013","unstructured":"Alam, M.J., Kenny, P., O\u2019Shaughnessy, D.: Low-variance multitaper mel-frequency cepstral coefficient features for speech and speaker recognition systems. Cognit. Comput. 5(4), 533\u2013544 (2013)","journal-title":"Cognit. Comput."},{"key":"6_CR6","doi-asserted-by":"publisher","first-page":"248","DOI":"10.1002\/9781118393550","volume-title":"An Introduction To Audio Content Analysis: Applications in Signal Processing and Music Informatics","author":"A Lerch","year":"2012","unstructured":"Lerch, A.: An Introduction To Audio Content Analysis: Applications in Signal Processing and Music Informatics, p. 248. Wiley, Hoboken, N.J (2012)"},{"key":"6_CR7","doi-asserted-by":"publisher","first-page":"35","DOI":"10.1016\/j.compeleceng.2015.08.009","volume":"47","author":"Astik Biswas","year":"2015","unstructured":"Biswas, A., Sahu, P., Chandra, M.: Multiple camera in car audio\u2013visual speech recognition using phonetic and visemic information. Comput. Electr. Eng. 47, 35\u201350 (2015). https:\/\/doi.org\/10.1016\/j.compeleceng.2015.08.009","journal-title":"Computers & Electrical Engineering"},{"key":"6_CR8","doi-asserted-by":"publisher","first-page":"105","DOI":"10.1007\/978-3-642-20095-3_10","volume-title":"Human Language Technology. Challenges for Computer Science and Linguistics","author":"Bartosz Zi\u00f3\u0142ko","year":"2011","unstructured":"Zi\u00f3\u0142ko, B., Zi\u00f3\u0142ko, M.: Time durations of phonemes in Polish language for speech and speaker recognition. In: Human Language Technology, Challenges for Computer Science and Linguistics. Lecture Notes in Computer Science, vol. 6562, pp. 105\u2013114. Springer (2011)"},{"key":"6_CR9","doi-asserted-by":"publisher","unstructured":"Czy\u017cewski, A., Kostek, B., Bratoszewski, P., Kotus, J., Szykulski, M.: An audio-visual corpus for multimodal automatic speech recognition. J. Intell. Inf. Syst. 1, 1\u201327 (2017). https:\/\/doi.org\/10.1007\/s10844-016-0438-z","DOI":"10.1007\/s10844-016-0438-z"},{"key":"6_CR10","doi-asserted-by":"publisher","unstructured":"Rosner, A., Kostek, B.: Automatic music genre classification based on musical instrument track separation. J. Intell. Inf. Syst. 5 (2017). https:\/\/doi.org\/10.1007\/s10844-017-0464-5","DOI":"10.1007\/s10844-017-0464-5"},{"key":"6_CR11","doi-asserted-by":"crossref","unstructured":"Korvel, G., Kostek, B.: Examining feature vector for phoneme recognition. In: Proceeding of IEEE International Symposium on Signal Processing and Information Technology, ISSPIT 2017. Bilbao, Spain (2017)","DOI":"10.1109\/ISSPIT.2017.8388675"},{"issue":"3","key":"6_CR12","doi-asserted-by":"publisher","first-page":"375","DOI":"10.1515\/aoa-2017-0039","volume":"42","author":"G Korvel","year":"2017","unstructured":"Korvel, G., Kostek, B.: Voiceless stop consonant modelling and synthesis framework based on MISO dynamic system. Arch. Acoust. 42(3), 375\u2013383 (2017). https:\/\/doi.org\/10.1515\/aoa-2017-0039","journal-title":"Arch. Acoust."},{"issue":"4","key":"6_CR13","doi-asserted-by":"publisher","first-page":"513","DOI":"10.1515\/aoa-2015-0051","volume":"40","author":"M Plewa","year":"2015","unstructured":"Plewa, M., Kostek, B.: Music mood visualization using self-organizing maps. Arch. Acoust. 40(4), 513\u2013525 (2015). https:\/\/doi.org\/10.1515\/aoa-2015-0051","journal-title":"Arch. Acoust."},{"key":"6_CR14","doi-asserted-by":"crossref","unstructured":"Kostek, B., Kupryjanow, A., Zwan, P., Jiang, W., Ra\u015b, Z., Wojnarski, M., Swietlicka, J.: Report of the ISMIS 2011 contest: music information retrieval. Found. Intell. Syst. 715\u2013724 (2011)","DOI":"10.1007\/978-3-642-21916-0_75"},{"key":"6_CR15","doi-asserted-by":"publisher","DOI":"10.1002\/9781118142882","volume-title":"Speech and Audio Signal Processing","author":"Ben Gold","year":"2011","unstructured":"Gold, B., Morgan, N., Ellis, D.: Speech and Audio Signal Processing: Processing and Perception of Speech and Music, 2nd edn, 688 pp. Wiley, Inc., (2011)"},{"key":"6_CR16","doi-asserted-by":"publisher","DOI":"10.1201\/b15570","volume-title":"Window Functions and Their Applications in Signal Processing","author":"K Prabhu","year":"2013","unstructured":"Prabhu, K.M.M.: Window Functions and Their Applications in Signal Processing. CRC Press (2013)"},{"key":"6_CR17","unstructured":"Heinzel, G., Rudiger, A., Schilling, R.: Spectrum and spectral density estimation by the discrete Fourier transform (DFT), including a comprehensive list of window functions and some new flat-top windows. Internal Report, Max-Planck-Institut fur Gravitations physik, Hannover (2002)"},{"key":"6_CR18","doi-asserted-by":"crossref","unstructured":"Gillet, O., Richard, G.: Automatic transcription of drum loops. In: IEEE International Conference on Acoustics, Speech, and Signal Processing, (ICASSP \u201804) (2004)","DOI":"10.1109\/ICASSP.2004.1326815"},{"key":"6_CR19","doi-asserted-by":"crossref","unstructured":"Hyungsuk, K., Heo, S.W.: Time-domain calculation of spectral centroid from backscattered ultrasound signals. IEEE Trans. Ultrason. Ferroelectr. Freq. Control 59(6) (2012)","DOI":"10.1109\/TUFFC.2012.2309"},{"key":"6_CR20","volume-title":"MPEG-7 Audio and Beyond: Audio Content Indexing and Retrieval","author":"K Hyoung-Gook","year":"2005","unstructured":"Hyoung-Gook, K., Moreau, N., Sikora, T.: MPEG-7 Audio and Beyond: Audio Content Indexing and Retrieval. Wiley, Hoboken (2005)"},{"key":"6_CR21","unstructured":"Manjunath, B.S., Salembier, P., Sikora T.: Introduction to MPEG-7: Multimedia Content Description Interface. Wiley (2002)"},{"key":"6_CR22","doi-asserted-by":"crossref","unstructured":"Ma, Y., Nishihara, A.: Efficient voice activity detection algorithm using long-term spectral flatness measure. EURASIP J. Audio, Speech, Music Process 1\u201318 (2013)","DOI":"10.1186\/1687-4722-2013-21"},{"key":"6_CR23","unstructured":"Moattar, M.H., Homayounpour, M.M.: A simple but efficient real-time voice activity detection algorithm. In: 17th European Signal Processing Conference (EUSIPCO 2009). Glasgow, Scotland, Aug 24\u201328 (2009)"},{"key":"6_CR24","first-page":"374","volume-title":"Pattern Recognition and Artificial Intelligence","author":"P Mermelstein","year":"1976","unstructured":"Mermelstein, P.: Distance measures for speech recognition, psychological and instrumental. Pattern Recognition and Artificial Intelligence, pp. 374\u2013388. Academic, New York (1976)"},{"key":"6_CR25","unstructured":"Logan, B.: Mel frequency cepstral coefficients for music modeling. In: Proceedings of 1st International Symposium on Music Information Retrieval (ISMIR). Plymouth, Massachusetts, USA (2000)"},{"issue":"1","key":"6_CR26","first-page":"211","volume":"11","author":"G Nijhawan","year":"2014","unstructured":"Nijhawan, G., Soni, M.K.: Speaker recognition using MFCC and vector quantisation. J. Recent Trends Eng. Technol. 11(1), 211\u2013218 (2014)","journal-title":"J. Recent Trends Eng. Technol."},{"key":"6_CR27","doi-asserted-by":"crossref","unstructured":"Wang, Y., Lawlor, B.: Speaker recognition based on MFCC and BP neural networks. In: 28th Irish Signals and Systems Conference (2017)","DOI":"10.1109\/ISSC.2017.7983644"},{"key":"6_CR28","doi-asserted-by":"crossref","unstructured":"Ahmad, K.S., Thosar, A.S., Nirmal, J.H., Pande, V.S.: A unique approach in text independent speaker recognition using MFCC feature sets and probabilistic neural network. In: 2015 Eighth International Conference on Advances in Pattern Recognition (ICAPR), 4\u20137 Jan 2015, pp. 1\u20136 (2015)","DOI":"10.1109\/ICAPR.2015.7050669"},{"issue":"2","key":"6_CR29","doi-asserted-by":"publisher","first-page":"130","DOI":"10.1109\/LSP.2010.2100380","volume":"18","author":"J Dennis","year":"2011","unstructured":"Dennis, J., Tran, H.D., Li, H.: Spectrogram image feature for sound event classification in mismatched conditions. Signal Process. Lett. IEEE 18(2), 130\u2013133 (2011)","journal-title":"Signal Process. Lett. IEEE"},{"issue":"1","key":"6_CR30","doi-asserted-by":"publisher","first-page":"125","DOI":"10.1016\/j.ymssp.2005.08.011","volume":"21","author":"F Leonard","year":"2007","unstructured":"Leonard, F.: Phase spectrogram and frequency spectrogram as new diagnostic tools. Mech. Syst. Signal Process. 21(1), 125\u2013137 (2007)","journal-title":"Mech. Syst. Signal Process."},{"key":"6_CR31","unstructured":"Lawrence, J.R., Borden, G.J., Harris K.S.: Speech Science Primer: Physiology, Acoustics, and Perception of Speech, 6th edn, 334 pp. Lippincott Williams & Wilkins (2011)"},{"key":"6_CR32","doi-asserted-by":"crossref","unstructured":"Steuer, R., Daub, C.O., Selbig, J., Kurths, J.: Measuring distances between variables by mutual information. In: Innovations in Classification, Data Science, and Information Systems, pp. 81\u201390 (2005)","DOI":"10.1007\/3-540-26981-9_11"},{"issue":"1","key":"6_CR33","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1016\/j.csl.2013.11.004","volume":"29","author":"J Pohjalainen","year":"2015","unstructured":"Pohjalainen, J., Rasanen, O., Kadioglu, S.: Feature selection methods and their combinations in high-dimensional classification of speaker likability, intelligibility and personality traits. Comput. Speech Lang. 29(1), 145\u2013171 (2015)","journal-title":"Comput. Speech Lang."},{"key":"6_CR34","doi-asserted-by":"publisher","first-page":"1818","DOI":"10.1016\/j.patrec.2007.05.018","volume":"28","author":"S Manocha","year":"2007","unstructured":"Manocha, S., Girolami, M.A.: An empirical analysis of the probabilistic K-nearest neighbour classifier. Pattern Recogn. Lett. 28, 1818\u20131824 (2007)","journal-title":"Pattern Recogn. Lett."},{"key":"6_CR35","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/1471-2105-15-223","volume":"15","author":"R Palaniappan","year":"2014","unstructured":"Palaniappan, R., Sundaraj, K., Sundaraj, S.: A comparative study of the SVM and k-nn machine learning algorithms for the diagnosis of respiratory pathologies using pulmonary acoustic signals. BMC Bioinf. 15, 1\u20138 (2014)","journal-title":"BMC Bioinf."},{"issue":"5","key":"6_CR36","doi-asserted-by":"publisher","first-page":"3521","DOI":"10.1121\/1.4987415","volume":"141","author":"A Czy\u017cewski","year":"2017","unstructured":"Czy\u017cewski, A., Piotrowska, M., Kostek, B.: Analysis of allophones based on audio signal recordings and parameterization. J. Acoust. Soc. Am. 141(5), 3521 (2017). https:\/\/doi.org\/10.1121\/1.4987415","journal-title":"J. Acoust. Soc. Am."},{"key":"6_CR37","unstructured":"Kostek, B., Piotrowska, M., Czy\u017cewski, A.: Comparative study of self-organizing maps versus subjective evaluation of quality of allophone pronunciation for nonnative english speakers. In: 143rd Audio Engineering Society Convention, Preprint 9847. New York (2017)"},{"key":"6_CR38","unstructured":"Han, J., Kamber, M., Pei, J.: Data mining: concepts and techniques. In: The Morgan Kaufmann Series in Data Management Systems, 2nd edn, 761 pp. Morgan Kaufmann (2006)"},{"key":"6_CR39","unstructured":"Kingma, P.D., Ba, J.L.: ADAM: a method for stochastic optimization. In: International Conference on Learning Representations, ICLR 2015 (2015). https:\/\/arxiv.org\/pdf\/1412.6980.pdf . Accessed Jan 2018"},{"key":"6_CR40","unstructured":"Keras library Keras Documentation Website. http:\/\/keras.io . Accessed Jan 2018"},{"key":"6_CR41","unstructured":"TensorFlow library. TensorFlow Documentation Website. https:\/\/www.tensorflow.org\/ . Accessed Jan 2018"},{"key":"6_CR42","unstructured":"TIMIT: Acoustic-Phonetic Continuous Speech Corpus. https:\/\/catalog.ldc.upenn.edu\/ldc93s1 . Accessed Jan 2018"}],"container-title":["Intelligent Systems Reference Library","Machine Learning Paradigms"],"original-title":[],"link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-94030-4_6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,10,20]],"date-time":"2019-10-20T04:31:55Z","timestamp":1571545915000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-94030-4_6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,7,4]]},"ISBN":["9783319940298","9783319940304"],"references-count":42,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-94030-4_6","relation":{},"ISSN":["1868-4394","1868-4408"],"issn-type":[{"value":"1868-4394","type":"print"},{"value":"1868-4408","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,7,4]]}}}