{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,8]],"date-time":"2026-02-08T00:49:10Z","timestamp":1770511750534,"version":"3.49.0"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"24","license":[{"start":{"date-parts":[[2017,1,10]],"date-time":"2017-01-10T00:00:00Z","timestamp":1484006400000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimed Tools Appl"],"published-print":{"date-parts":[[2017,12]]},"DOI":"10.1007\/s11042-016-4315-0","type":"journal-article","created":{"date-parts":[[2017,1,10]],"date-time":"2017-01-10T01:31:15Z","timestamp":1484011875000},"page":"25603-25621","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":23,"title":["Efficient audio-driven multimedia indexing through similarity-based speech \/ music discrimination"],"prefix":"10.1007","volume":"76","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7232-8839","authenticated-orcid":false,"given":"Nikolaos","family":"Tsipas","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lazaros","family":"Vrysis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Charalampos","family":"Dimoulas","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"George","family":"Papanikolaou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,1,10]]},"reference":[{"key":"4315_CR1","unstructured":"Ajmera J, McCowan IA, Bourlard H (2001) Speech\/music discrimination using entropy and dynamism features in a hmm classification framewor. Tech. rep., IDIAP"},{"key":"4315_CR2","doi-asserted-by":"crossref","unstructured":"Carey MJ, Parris ES, Lloyd-Thomas H (1999) A comparison of features for speech, music discrimination. In: IEEE international conference on acoustics, speech, and signal processing, 1999. Proceedings. 1999, vol 1. IEEE, pp 149\u2013152","DOI":"10.1109\/ICASSP.1999.758084"},{"key":"4315_CR3","unstructured":"Continuous frequency activation yaafe plugin repository. https:\/\/github.com\/mcrg-fhstp\/cba-yaafe-extension . [Online; accessed 30-July-2016]"},{"issue":"3","key":"4315_CR4","doi-asserted-by":"crossref","first-page":"26","DOI":"10.1109\/MMUL.2015.33","volume":"22","author":"CA Dimoulas","year":"2015","unstructured":"Dimoulas CA, Symeonidis AL (2015) Syncing shared multimedia through audiovisual bimodal segmentation. IEEE MultiMedia 22(3):26\u201342","journal-title":"IEEE MultiMedia"},{"key":"4315_CR5","doi-asserted-by":"crossref","unstructured":"El-Maleh K, Klein M, Petrucci G, Kabal P (2000) Speech\/music discrimination for multimedia applications. In: IEEE international conference on acoustics, speech, and signal processing, 2000. ICASSP\u201900. Proceedings. 2000, vol 6. IEEE, pp 2445\u20132448","DOI":"10.1109\/ICASSP.2000.859336"},{"key":"4315_CR6","doi-asserted-by":"crossref","unstructured":"Elizalde B, Friedland G (2013) Lost in segmentation: three approaches for speech\/non-speech detection in consumer-produced videos. In: 2013 IEEE international conference on multimedia and expo (ICME). IEEE, pp 1\u20136","DOI":"10.1109\/ICME.2013.6607486"},{"key":"4315_CR7","doi-asserted-by":"crossref","unstructured":"Foote J (1999) Visualizing music and audio using self-similarity. In: Proceedings of the seventh ACM international conference on multimedia (part 1). ACM, pp 77\u201380","DOI":"10.1145\/319463.319472"},{"key":"4315_CR8","doi-asserted-by":"crossref","unstructured":"Foote J (2000) Automatic audio segmentation using a measure of audio novelty. In: IEEE international conference on multimedia and expo, 2000. ICME 2000. 2000, vol 1. IEEE, pp 452\u2013455","DOI":"10.1109\/ICME.2000.869637"},{"key":"4315_CR9","unstructured":"Gtzan music speech dataset. http:\/\/marsyasweb.appspot.com\/download\/data_sets\/ . [Online; accessed 30-July-2016]"},{"key":"4315_CR10","unstructured":"Jiang H, Lin T, Zhang H (2000) Video segmentation with the support of audio segmentation and classification. In: Proceedings of IEEE ICME"},{"issue":"1","key":"4315_CR11","doi-asserted-by":"crossref","first-page":"287","DOI":"10.1007\/s11042-013-1761-9","volume":"74","author":"S Jun","year":"2015","unstructured":"Jun S, Rho S, Hwang E (2015) Music structure analysis using self-similarity matrix and two-stage categorization. Multimedia Tools and Applications 74(1):287\u2013302","journal-title":"Multimedia Tools and Applications"},{"key":"4315_CR12","doi-asserted-by":"crossref","first-page":"71","DOI":"10.1016\/j.dsp.2015.09.005","volume":"48","author":"BK Khonglah","year":"2016","unstructured":"Khonglah BK, Prasanna SM (2016) Speech\/music classification using speech-specific features. Digital Signal Process 48:71\u201383","journal-title":"Digital Signal Process"},{"key":"4315_CR13","unstructured":"Kinnunen T, Chernenko E, Tuononen M, Fr\u00e4nti P, Li H (2007) Voice activity detection using mfcc features and support vector machine. In: International conference on speech and computer (SPECOM07), Moscow, Russia, vol 2, pp 556\u2013561"},{"issue":"6","key":"4315_CR14","doi-asserted-by":"crossref","first-page":"743","DOI":"10.1016\/j.specom.2012.01.004","volume":"54","author":"R Kotsakis","year":"2012","unstructured":"Kotsakis R, Kalliris G, Dimoulas C (2012) Investigation of broadcast-audio semantic analysis scenarios employing radio-programme-adaptive pattern classification. Speech Comm 54(6):743\u2013762","journal-title":"Speech Comm"},{"key":"4315_CR15","unstructured":"Labrosa music-speech corpus. http:\/\/labrosa.ee.columbia.edu\/sounds\/musp\/scheislan.html . [Online; accessed 30-July-2016]"},{"issue":"1","key":"4315_CR16","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1155\/2009\/239892","volume":"2009","author":"Y Lavner","year":"2009","unstructured":"Lavner Y, Ruinskiy D (2009) A decision-tree-based algorithm for speech\/music classification and segmentation. EURASIP Journal on Audio, Speech, and Music Processing 2009(1):1","journal-title":"EURASIP Journal on Audio, Speech, and Music Processing"},{"issue":"15","key":"4315_CR17","doi-asserted-by":"crossref","first-page":"5375","DOI":"10.1007\/s11042-014-1859-8","volume":"74","author":"C Lim","year":"2015","unstructured":"Lim C, Chang JH (2015) Efficient implementation techniques of an svm-based speech\/music classifier in smv. Multimedia Tools and Applications 74(15):5375\u20135400","journal-title":"Multimedia Tools and Applications"},{"key":"4315_CR18","unstructured":"Mathieu B, Essid S, Fillon T, Prado J, Richard G (2010) Yaafe, an easy to use and efficient audio feature extraction software. In: ISMIR, pp 441\u2013446"},{"issue":"3","key":"4315_CR19","doi-asserted-by":"crossref","first-page":"17","DOI":"10.1109\/93.713301","volume":"5","author":"K Minami","year":"1998","unstructured":"Minami K, Akutsu A, Hamada H, Tonomura Y (1998) Video handling with music and speech detection. IEEE Multimedia 5(3):17\u201325","journal-title":"IEEE Multimedia"},{"key":"4315_CR20","unstructured":"Mirex 2015 muspeak sample dataset. http:\/\/www.music-ir.org\/mirex\/wiki\/2015:music\/speech_classification_and_detection#dataset_2 . [Online; accessed 30-July-2016]"},{"issue":"2","key":"4315_CR21","doi-asserted-by":"crossref","first-page":"356","DOI":"10.1109\/TASL.2011.2125954","volume":"20","author":"XA Miro","year":"2012","unstructured":"Miro XA, Bozonnet S, Evans N, Fredouille C, Friedland G, Vinyals O (2012) Speaker diarization: a review of recent research. IEEE Trans Audio Speech Lang Process 20(2):356\u2013370","journal-title":"IEEE Trans Audio Speech Lang Process"},{"key":"4315_CR22","unstructured":"Moattar M, Homayounpour M (2009) A simple but efficient real-time voice activity detection algorithm. In: Signal processing conference, 2009 17th European. IEEE, pp 2549\u20132553"},{"issue":"1","key":"4315_CR23","doi-asserted-by":"crossref","first-page":"155","DOI":"10.1109\/TMM.2004.840604","volume":"7","author":"C Panagiotakis","year":"2005","unstructured":"Panagiotakis C, Tziritas G (2005) A speech\/music discriminator based on rms and zero-crossings. IEEE Trans Multimedia 7(1):155\u2013166","journal-title":"IEEE Trans Multimedia"},{"key":"4315_CR24","unstructured":"Peakutils. http:\/\/pythonhosted.org\/peakutils\/ . [Online; accessed 30-July-2016]"},{"issue":"Oct","key":"4315_CR25","first-page":"2825","volume":"12","author":"F Pedregosa","year":"2011","unstructured":"Pedregosa F, Varoquaux G, Gramfort A, Michel V, Thirion B, Grisel O, Blondel M, Prettenhofer P, Weiss R, Dubourg V et al. (2011) Scikit-learn: machine learning in python. J Mach Learn Res 12(Oct):2825\u20132830","journal-title":"J Mach Learn Res"},{"key":"4315_CR26","unstructured":"Pikrakis A, Giannakopoulos T, Theodoridis S (2006) Speech\/music discrimination for radio broadcasts using a hybrid hmm-bayesian network architecture. In: Signal processing conference, 2006 14th European. IEEE, pp 1\u20135"},{"issue":"5","key":"4315_CR27","doi-asserted-by":"crossref","first-page":"846","DOI":"10.1109\/TMM.2008.922870","volume":"10","author":"A Pikrakis","year":"2008","unstructured":"Pikrakis A, Giannakopoulos T, Theodoridis S (2008) A speech\/music discriminator of radio recordings based on dynamic programming and bayesian networks. IEEE Trans Multimedia 10(5):846\u2013857","journal-title":"IEEE Trans Multimedia"},{"key":"4315_CR28","unstructured":"Pikrakis A, Theodoridis S (2014) Speech-music discrimination: a deep learning perspective. In: 2014 22nd European signal processing conference (EUSIPCO). IEEE, pp 616\u2013620"},{"issue":"1","key":"4315_CR29","doi-asserted-by":"crossref","first-page":"34","DOI":"10.3844\/jcssp.2014.34.44","volume":"10","author":"T Ramalingam","year":"2014","unstructured":"Ramalingam T, Dhanalakshmi P (2014) Speech\/music classification using wavelet based feature extraction techniques. J Comput Sci 10(1):34\u201344","journal-title":"J Comput Sci"},{"issue":"2","key":"4315_CR30","first-page":"630","volume":"92","author":"K Sang-Kyun","year":"2009","unstructured":"Sang-Kyun K, Chang JH (2009) Speech\/music classification enhancement for 3gpp2 smv codec based on support vector machine. IEICE Trans Fundam Electron Commun Comput Sci 92(2):630\u2013632","journal-title":"IEICE Trans Fundam Electron Commun Comput Sci"},{"key":"4315_CR31","doi-asserted-by":"crossref","unstructured":"Saunders J (1996) Real-time discrimination of broadcast speech\/music. In: ICASSP, vol 96, pp 993\u2013996","DOI":"10.1109\/ICASSP.1996.543290"},{"key":"4315_CR32","doi-asserted-by":"crossref","unstructured":"Scheirer E, Slaney M (1997) Construction and evaluation of a robust multifeature speech\/music discriminator. In: IEEE international conference on acoustics, speech, and signal processing, 1997. ICASSP-97., 1997, vol 2. IEEE, pp 1331\u20131334","DOI":"10.1109\/ICASSP.1997.596192"},{"key":"4315_CR33","doi-asserted-by":"crossref","unstructured":"Sell G, Clark P (2014) Music tonality features for speech\/music discrimination. In: 2014 IEEE international conference on acoustics, speech and signal processing (ICASSP). IEEE, pp 2489\u2013 2493","DOI":"10.1109\/ICASSP.2014.6854048"},{"key":"4315_CR34","unstructured":"Seyerlehner K, Pohle T, Schedl M, Widmer G (2007) Automatic music detection in television productions. In: Proceedings of the 10th international conference on digital audio effects (DAFx\u201907). Citeseer"},{"issue":"2","key":"4315_CR35","doi-asserted-by":"crossref","first-page":"415","DOI":"10.1007\/s11042-009-0416-3","volume":"50","author":"J Shirazi","year":"2010","unstructured":"Shirazi J, Ghaemmaghami S (2010) Improvement to speech-music discrimination using sinusoidal model based features. Multimedia Tools and Applications 50(2):415\u2013435","journal-title":"Multimedia Tools and Applications"},{"key":"4315_CR36","unstructured":"Speech - music discrimination demo version 1.0. http:\/\/cgi.di.uoa.gr\/~sp_mu\/download.html . [Online; accessed 30-July-2016]"},{"key":"4315_CR37","volume-title":"Mirex 2015: Methods for speech\/music detection and classification. In: Proceedings of the music information retrieval evaluation eXchange (MIREX). Malaga","author":"N Tsipas","year":"2015","unstructured":"Tsipas N, Vrysis L, Dimoulas C, Papanikolaou G (2015) Mirex 2015: Methods for speech\/music detection and classification. In: Proceedings of the music information retrieval evaluation eXchange (MIREX). Malaga"},{"key":"4315_CR38","unstructured":"Tsipas N, Vrysis L, Dimoulas CA, Papanikolaou G (2015) Content-based music structure analysis using vector quantization. In: Audio engineering society convention 138. Audio engineering society"},{"key":"4315_CR39","doi-asserted-by":"crossref","unstructured":"Tsipas N, Zapartas P, Vrysis L, Dimoulas C (2015) Augmenting social multimedia semantic interaction through audio-enhanced web-tv services. In: Proceedings of the audio mostly 2015 on interaction with sound. ACM, p 34","DOI":"10.1145\/2814895.2814907"},{"key":"4315_CR40","doi-asserted-by":"crossref","unstructured":"Wang W, Gao W, Ying D (2003) A fast and robust speech\/music discrimination approach. In: Proceedings of the 2003 joint conference of the fourth international conference on information, communications and signal processing, 2003 and fourth pacific rim conference on multimedia, vol 3. IEEE, pp 1325\u20131329","DOI":"10.1109\/ICICS.2003.1292679"},{"key":"4315_CR41","doi-asserted-by":"crossref","unstructured":"Wieser E, Husinsky M, Seidl M (2014) Speech\/music discrimination in a large database of radio broadcasts from the wild. In: 2014 IEEE International conference on acoustics, speech and signal processing (ICASSP). IEEE, pp 2134\u20132138","DOI":"10.1109\/ICASSP.2014.6853976"},{"issue":"4","key":"4315_CR42","doi-asserted-by":"crossref","first-page":"441","DOI":"10.1109\/89.917689","volume":"9","author":"T Zhang","year":"2001","unstructured":"Zhang T, Kuo CCJ (2001) Audio content analysis for online audiovisual data segmentation and classification. IEEE Transactions on Speech and Audio Processing 9 (4):441\u2013457","journal-title":"IEEE Transactions on Speech and Audio Processing"}],"container-title":["Multimedia Tools and Applications"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11042-016-4315-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-016-4315-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11042-016-4315-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,9,17]],"date-time":"2019-09-17T06:04:39Z","timestamp":1568700279000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11042-016-4315-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,1,10]]},"references-count":42,"journal-issue":{"issue":"24","published-print":{"date-parts":[[2017,12]]}},"alternative-id":["4315"],"URL":"https:\/\/doi.org\/10.1007\/s11042-016-4315-0","relation":{},"ISSN":["1380-7501","1573-7721"],"issn-type":[{"value":"1380-7501","type":"print"},{"value":"1573-7721","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017,1,10]]}}}