{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,20]],"date-time":"2026-08-20T15:21:24Z","timestamp":1787239284880,"version":"build-2736575974"},"reference-count":60,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2022,1,10]],"date-time":"2022-01-10T00:00:00Z","timestamp":1641772800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2022,1,10]],"date-time":"2022-01-10T00:00:00Z","timestamp":1641772800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"national natural science foundation of china","doi-asserted-by":"publisher","award":["11501351"],"award-info":[{"award-number":["11501351"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2022,6]]},"DOI":"10.1007\/s00530-021-00886-3","type":"journal-article","created":{"date-parts":[[2022,1,10]],"date-time":"2022-01-10T14:02:48Z","timestamp":1641823368000},"page":"779-791","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":38,"title":["Music genre classification based on auditory image, spectral and acoustic features"],"prefix":"10.1007","volume":"28","author":[{"given":"Xin","family":"Cai","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8731-9054","authenticated-orcid":false,"given":"Hongjuan","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2022,1,10]]},"reference":[{"key":"886_CR1","doi-asserted-by":"crossref","unstructured":"Allamy, S., Koerich, A.L.: 1D CNN Architectures for Music Genre Classification. arXiv preprint arXiv:210507302 (2021)","DOI":"10.1109\/SSCI50451.2021.9659979"},{"key":"886_CR2","first-page":"781","volume":"90","author":"S Bleeck","year":"2004","unstructured":"Bleeck, S., Ives, T., Patterson, R.: Aim-mat: the auditory image model in matlab. Acta Acust. Acust. 90, 781\u2013787 (2004)","journal-title":"Acta Acust. Acust."},{"key":"886_CR3","doi-asserted-by":"publisher","unstructured":"Boser, B.E., Guyon, I.M., Vapnik, V.N.: A training algorithm for optimal margin classifiers. In: Proceedings of the Fifth Annual Workshop on Computational Learning Theory, pp 144\u2013152 (1992). https:\/\/doi.org\/10.1145\/130385.130401","DOI":"10.1145\/130385.130401"},{"key":"886_CR4","volume-title":"ISMIR 2004 Audio Description Contest. Technical Report","author":"P Cano","year":"2006","unstructured":"Cano, P., G\u00f4mez, E., Gouyon, F., Herrera, P., Koppenberger, M., Ong, B., Serra, X., Streich, S., Wack, N.: ISMIR 2004 Audio Description Contest. Technical Report. Music Technology Group, Bracelona (2006)"},{"key":"886_CR5","doi-asserted-by":"publisher","first-page":"18801","DOI":"10.1109\/ACCESS.2021.3053864","volume":"9","author":"JR Castillo","year":"2021","unstructured":"Castillo, J.R., Flores, M.J.: Web-based music genre classification for timeline song visualization and analysis. IEEE Access 9, 18801\u201318816 (2021). https:\/\/doi.org\/10.1109\/ACCESS.2021.3053864","journal-title":"IEEE Access"},{"key":"886_CR6","doi-asserted-by":"publisher","DOI":"10.1007\/s10772-020-09681-3","author":"J Chaki","year":"2020","unstructured":"Chaki, J.: Pattern analysis based acoustic signal processing: a survey of the state-of-art. Int. J. Speech Technol. (2020). https:\/\/doi.org\/10.1007\/s10772-020-09681-3","journal-title":"Int. J. Speech Technol."},{"issue":"1","key":"886_CR7","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/1471-2105-11-558","volume":"11","author":"WC Chan","year":"2010","unstructured":"Chan, W.C., Liang, P.H., Shih, Y.P., Yang, U.C., Chang Lin, W., Hsu, C.N.: Learning to predict expression efficacy of vectors in recombinant protein production. BMC Bioinform. 11(1), 1\u201312 (2010)","journal-title":"BMC Bioinform."},{"key":"886_CR8","doi-asserted-by":"publisher","unstructured":"\u00c7oban, \u00d6., \u00d6zyer, G.T.: Music genre classification from turkish lyrics. In: 2016 24th Signal Processing and Communication Application Conference (SIU), pp 101\u2013104 (2016). https:\/\/doi.org\/10.1109\/SIU.2016.7495686","DOI":"10.1109\/SIU.2016.7495686"},{"issue":"2","key":"886_CR9","doi-asserted-by":"publisher","first-page":"322","DOI":"10.19113\/sdufbed.88303","volume":"21","author":"\u00d6 \u00c7oban","year":"2017","unstructured":"\u00c7oban, \u00d6.: Turkish music genre classification using audio and lyrics features. S\u00fcleyman Demirel \u00dcniversitesi Fen Bilimleri Enstit\u00fcs\u00fc Dergisi 21(2), 322\u2013331 (2017)","journal-title":"S\u00fcleyman Demirel \u00dcniversitesi Fen Bilimleri Enstit\u00fcs\u00fc Dergisi"},{"key":"886_CR10","doi-asserted-by":"publisher","first-page":"190","DOI":"10.1016\/j.eswa.2016.04.008","volume":"60","author":"DC Corr\u00eaa","year":"2016","unstructured":"Corr\u00eaa, D.C., Rodrigues, F.A.: A survey on symbolic data-based music genre classification. Expert Syst. Appl. 60, 190\u2013210 (2016). https:\/\/doi.org\/10.1016\/j.eswa.2016.04.008","journal-title":"Expert Syst. Appl."},{"key":"886_CR11","unstructured":"Costa, Y., Oliveira, L., Koerich, A., Gouyon, F.: Music genre recognition using spectrograms. In: 2011 18th International Conference on Systems, Signals and Image Processing, pp 1\u20134 (2011)"},{"key":"886_CR12","doi-asserted-by":"publisher","first-page":"562","DOI":"10.1109\/ICSMC.2004.1398359","volume":"1","author":"CHL Costa","year":"2004","unstructured":"Costa, C.H.L., Valle, J.D., Koerich, A.L., Koerich, R.L.: Automatic classification of audio data. IEEE Trans. Syst. Man Cybernet. 1, 562\u2013567 (2004). https:\/\/doi.org\/10.1109\/ICSMC.2004.1398359","journal-title":"IEEE Trans. Syst. Man Cybernet."},{"issue":"11","key":"886_CR13","doi-asserted-by":"publisher","first-page":"2723","DOI":"10.1016\/j.sigpro.2012.04.023","volume":"92","author":"Y Costa","year":"2012","unstructured":"Costa, Y., Oliveira, L., Koerich, A., Gouyon, F., Martins, J.: Music genre classification using lbp textural features. Signal Process. 92(11), 2723\u20132737 (2012). https:\/\/doi.org\/10.1016\/j.sigpro.2012.04.023","journal-title":"Signal Process."},{"key":"886_CR14","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1007\/978-3-642-41827-3_9","volume":"8259","author":"Y Costa","year":"2013","unstructured":"Costa, Y., Oliveira, L., Koerich, A., Gouyon, F.: Music genre recognition using gabor filters and lpq texture descriptors. Progress Pattern Recogn. Image Anal. Comput. Vis. Appl. 8259, 67\u201374 (2013). https:\/\/doi.org\/10.1007\/978-3-642-41827-3_9","journal-title":"Progress Pattern Recogn. Image Anal. Comput. Vis. Appl."},{"issue":"1","key":"886_CR15","doi-asserted-by":"publisher","first-page":"21","DOI":"10.1109\/TIT.1967.1053964","volume":"13","author":"T Cover","year":"1967","unstructured":"Cover, T., Hart, P.: Nearest neighbor pattern classification. IEEE Trans. Inf. Theory 13(1), 21\u201327 (1967). https:\/\/doi.org\/10.1109\/TIT.1967.1053964","journal-title":"IEEE Trans. Inf. Theory"},{"key":"886_CR16","doi-asserted-by":"publisher","first-page":"106","DOI":"10.1016\/j.asoc.2020.106127","volume":"89","author":"JH Foleis","year":"2020","unstructured":"Foleis, J.H., Tavares, T.F.: Texture selection for automatic music genre classification. Appl. Soft Comput. 89, 106\u2013127 (2020). https:\/\/doi.org\/10.1016\/j.asoc.2020.106127","journal-title":"Appl. Soft Comput."},{"key":"886_CR17","doi-asserted-by":"crossref","unstructured":"Fu, Z., Lu, G., Ting, K., Zhang, D.: On feature combination for music classification. In: Structural, Syntactic, and Statistical Pattern Recognition, pp 453\u2013462 (2010)","DOI":"10.1007\/978-3-642-14980-1_44"},{"issue":"2","key":"886_CR18","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1109\/TMM.2010.2098858","volume":"13","author":"Z Fu","year":"2011","unstructured":"Fu, Z., Lu, G., Ting, K.M., Zhang, D.: A survey of audio-based music classification and annotation. IEEE Trans. Multimedia 13(2), 303\u2013319 (2011). https:\/\/doi.org\/10.1109\/TMM.2010.2098858","journal-title":"IEEE Trans. Multimedia"},{"issue":"1","key":"886_CR19","doi-asserted-by":"publisher","first-page":"103","DOI":"10.1016\/0378-5955(90)90170-T","volume":"47","author":"B Glasberg","year":"1990","unstructured":"Glasberg, B., Moore, B.: Derivation of auditory filter shapes from notched-noise data. Hear. Res. 47(1), 103\u2013138 (1990). https:\/\/doi.org\/10.1016\/0378-5955(90)90170-T","journal-title":"Hear. Res."},{"issue":"5","key":"886_CR20","doi-asserted-by":"publisher","first-page":"2318","DOI":"10.1121\/1.1315291","volume":"108","author":"B Glasberg","year":"2000","unstructured":"Glasberg, B., Moore, B.: Frequency selectivity as a function of level and frequency measured with uniformly exciting notched noise. J. Acoust. Soc. Am. 108(5), 2318\u20132328 (2000). https:\/\/doi.org\/10.1121\/1.1315291","journal-title":"J. Acoust. Soc. Am."},{"key":"886_CR21","first-page":"331","volume":"50","author":"B Glasberg","year":"2002","unstructured":"Glasberg, B., Moore, B.: A model of loudness applicable to time-varying sounds. J. Audio Eng. Soc. 50, 331\u2013342 (2002)","journal-title":"J. Audio Eng. Soc."},{"key":"886_CR22","doi-asserted-by":"publisher","unstructured":"Gogate, M., Dashtipour, K., Hussain, A.: Visual Speech In Real Noisy Environments (VISION): A Novel Benchmark Dataset and Deep Learning-Based Baseline System. In: Proceeding Interspeech 2020, pp 4521\u20134525 (2020b). https:\/\/doi.org\/10.21437\/Interspeech.2020-2935","DOI":"10.21437\/Interspeech.2020-2935"},{"key":"886_CR23","doi-asserted-by":"publisher","first-page":"273","DOI":"10.1016\/j.inffus.2020.04.001","volume":"63","author":"M Gogate","year":"2020","unstructured":"Gogate, M., Dashtipour, K., Adeel, A., Hussain, A.: Cochleanet: a robust language-independent audio-visual model for speech enhancement. Inf. Fus. 63, 273\u2013285 (2020). https:\/\/doi.org\/10.1016\/j.inffus.2020.04.001","journal-title":"Inf. Fus."},{"key":"886_CR24","first-page":"528","volume":"2005","author":"H Homburg","year":"2005","unstructured":"Homburg, H., Mierswa, I., M\u00f6ller, B., Morik, K., Wurst, M.: A benchmark dataset for audio classification and clustering. ISMIR 2005, 528\u2013531 (2005)","journal-title":"ISMIR"},{"key":"886_CR25","doi-asserted-by":"publisher","unstructured":"Hyder, R., Ghaffarzadegan, S., Feng, Z., Hansen, J., Hasan, T.: Acoustic Scene Classification using a CNN-Supervector System Trained with Auditory and Spectrogram Image Features. pp. 3073\u20133077 (2017). https:\/\/doi.org\/10.21437\/Interspeech.2017-431","DOI":"10.21437\/Interspeech.2017-431"},{"issue":"6","key":"886_CR26","doi-asserted-by":"publisher","first-page":"2222","DOI":"10.1109\/TASL.2006.874669","volume":"14","author":"T Irino","year":"2006","unstructured":"Irino, T., Patterson, R.: A dynamic compressive gammachirp auditory filterbank. IEEE Trans. Audio Speech Lang. Process. 14(6), 2222\u20132232 (2006). https:\/\/doi.org\/10.1109\/TASL.2006.874669","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"3","key":"886_CR27","doi-asserted-by":"publisher","first-page":"226","DOI":"10.1109\/34.667881","volume":"20","author":"J Kittler","year":"1998","unstructured":"Kittler, J., Hatef, M., Duin, R.P.W., Matas, J.: On combining classifiers. IEEE Trans. Pattern Anal. Mach. Intell. 20(3), 226\u2013239 (1998). https:\/\/doi.org\/10.1109\/34.667881","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"886_CR28","doi-asserted-by":"publisher","first-page":"670","DOI":"10.1109\/TMM.2009.2017635","volume":"11","author":"CH Lee","year":"2009","unstructured":"Lee, C.H., Shih, J.L., Yu, K.M., Lin, H.S.: Automatic music genre classification based on modulation spectral analysis of spectral and cepstral features. IEEE Trans. Multimedia 11, 670\u2013682 (2009). https:\/\/doi.org\/10.1109\/TMM.2009.2017635","journal-title":"IEEE Trans. Multimedia"},{"key":"886_CR29","doi-asserted-by":"crossref","unstructured":"Li, T.L., Chan, A.B.: Genre classification and the invariance of mfcc features to key and tempo. In: International Conference on MultiMedia Modeling, Springer, pp 317\u2013327 (2011)","DOI":"10.1007\/978-3-642-17832-0_30"},{"issue":"3","key":"886_CR30","doi-asserted-by":"publisher","first-page":"564","DOI":"10.1109\/TMM.2006.870730","volume":"8","author":"T Li","year":"2006","unstructured":"Li, T., Ogihara, M.: Toward intelligent music information retrieval. IEEE Trans. Multimedia 8(3), 564\u2013574 (2006). https:\/\/doi.org\/10.1109\/TMM.2006.870730","journal-title":"IEEE Trans. Multimedia"},{"key":"886_CR31","unstructured":"Lidy, T., Rauber, A.: Evaluation of feature extractors and psycho-acoustic transformations for music genre classification. In: Proceedings of the Sixth International Conference on Music Information Retrieval (ISMIR 2005), pp 34\u201341 (2005)"},{"issue":"4","key":"886_CR32","doi-asserted-by":"publisher","first-page":"1262","DOI":"10.1109\/TCE.2012.6414994","volume":"58","author":"S Lim","year":"2012","unstructured":"Lim, S., Lee, J., Jang, S., Lee, S., Kim, M.Y.: Music-genre classification system based on spectro-temporal features and feature selection. IEEE Trans. Consum. Electron. 58(4), 1262\u20131268 (2012). https:\/\/doi.org\/10.1109\/TCE.2012.6414994","journal-title":"IEEE Trans. Consum. Electron."},{"key":"886_CR33","first-page":"233","volume":"4","author":"JP Martens","year":"2004","unstructured":"Martens, J.P., Leman, M., Baets, B., Meyer, H.: A comparison of human and automatic musical genre classification. IEEE Int. Conf. Acoustics Speech Signal Process. 4, 233\u2013236 (2004)","journal-title":"IEEE Int. Conf. Acoustics Speech Signal Process."},{"key":"886_CR34","doi-asserted-by":"publisher","unstructured":"McKay, C., Fujinaga, I.: Improving automatic music classification performance by extracting features from different types of data. In: Proceedings of the International Conference on Multimedia Information Retrieval. pp. 257\u2013266 (2010). https:\/\/doi.org\/10.1145\/1743384.1743430","DOI":"10.1145\/1743384.1743430"},{"key":"886_CR35","doi-asserted-by":"publisher","unstructured":"Mitrovi\u0107, D., Zeppelzauer, M., Breiteneder, C.: Features for content-based audio retrieval. In: Advances in Computers: Improving the Web, vol\u00a078, Elsevier. pp .71\u2013150 (2010). https:\/\/doi.org\/10.1016\/S0065-2458(10)78003-7","DOI":"10.1016\/S0065-2458(10)78003-7"},{"key":"886_CR36","doi-asserted-by":"publisher","unstructured":"Muller, F., Mertins, A.: On using the auditory image model and invariant-integration for noise robust automatic speech recognition. In: 2012 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP). pp. 4905\u20134908 (2012). https:\/\/doi.org\/10.1109\/ICASSP.2012.6289019","DOI":"10.1109\/ICASSP.2012.6289019"},{"issue":"3","key":"886_CR37","doi-asserted-by":"publisher","first-page":"98","DOI":"10.1109\/MSP.2008.918418","volume":"25","author":"R Munkong","year":"2008","unstructured":"Munkong, R., Juang, B.: Auditory perception and cognition. IEEE Signal Process. Mag. 25(3), 98\u2013117 (2008). https:\/\/doi.org\/10.1109\/MSP.2008.918418","journal-title":"IEEE Signal Process. Mag."},{"key":"886_CR38","doi-asserted-by":"publisher","first-page":"108","DOI":"10.1016\/j.eswa.2015.09.018","volume":"45","author":"L Nanni","year":"2016","unstructured":"Nanni, L., Costa, Y., Lumini, A., Kim, M.Y., Baek, S.R.: Combining visual and acoustic features for music genre classification. Expert Syst. Appl. 45, 108\u2013117 (2016). https:\/\/doi.org\/10.1016\/j.eswa.2015.09.018","journal-title":"Expert Syst. Appl."},{"key":"886_CR39","doi-asserted-by":"publisher","first-page":"49","DOI":"10.1016\/j.patrec.2017.01.013","volume":"88","author":"L Nanni","year":"2017","unstructured":"Nanni, L., Costa, Y., Lucio, D., Silla, C., Brahnam, S.: Combining visual and acoustic features for audio classification tasks. Pattern Recogn. Lett. 88, 49\u201356 (2017). https:\/\/doi.org\/10.1016\/j.patrec.2017.01.013","journal-title":"Pattern Recogn. Lett."},{"key":"886_CR40","doi-asserted-by":"publisher","first-page":"7","DOI":"10.1016\/j.bspc.2015.12.009","volume":"27","author":"R Nonaka","year":"2016","unstructured":"Nonaka, R., Emoto, T., Abeyratne, U.R., Jinnouchi, O., Kawata, I., Ohnishi, H., Akutagawa, M., Konaka, S., Kinouchi, Y.: Automatic snore sound extraction from sleep sound recordings via auditory image modeling. Biomed. Signal Process. Control 27, 7\u201314 (2016). https:\/\/doi.org\/10.1016\/j.bspc.2015.12.009","journal-title":"Biomed. Signal Process. Control"},{"key":"886_CR41","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1007\/978-3-642-37410-4_2","volume-title":"Computer Vision - ACCV 2012 Workshops","author":"R Nosaka","year":"2013","unstructured":"Nosaka, R., Suryanto, C.H., Fukui, K.: Rotation invariant co-occurrence among adjacent lbps. In: Park, J.I., Kim, J. (eds.) Computer Vision - ACCV 2012 Workshops, pp. 15\u201325. Springer, Heidelberg (2013)"},{"issue":"7","key":"886_CR42","doi-asserted-by":"publisher","first-page":"971","DOI":"10.1109\/TPAMI.2002.1017623","volume":"24","author":"T Ojala","year":"2002","unstructured":"Ojala, T., Pietikainen, M., Maenpaa, T.: Multiresolution gray-scale and rotation invariant texture classification with local binary patterns. IEEE Trans. Pattern Anal. Mach. Intell. 24(7), 971\u2013987 (2002). https:\/\/doi.org\/10.1109\/TPAMI.2002.1017623","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"886_CR43","doi-asserted-by":"publisher","first-page":"236","DOI":"10.1007\/978-3-540-69905-7_27","volume-title":"Image and Signal Processing","author":"V Ojansivu","year":"2008","unstructured":"Ojansivu, V., Heikkil\u00e4, J.: Blur insensitive texture classification using local phase quantization. In: Elmoataz, A., Lezoray, O., Nouboud, F., Mammass, D. (eds.) Image and Signal Processing, pp. 236\u2013243. Springer, Heidelberg (2008)"},{"key":"886_CR44","doi-asserted-by":"crossref","unstructured":"Panagakis, Y., Kotropoulos, C.L., Arce, G.R.: Music genre classification using locality preserving non-negative tensor factorization and sparse representations. In: ISMIR, pp 249\u2013254 (2009)","DOI":"10.1109\/ICASSP.2010.5495984"},{"issue":"12","key":"886_CR45","doi-asserted-by":"publisher","first-page":"1905","DOI":"10.1109\/TASLP.2014.2355774","volume":"22","author":"Y Panagakis","year":"2014","unstructured":"Panagakis, Y., Kotropoulos, C.L., Arce, G.R.: Music genre classification via joint sparse low-rank representation of audio features. IEEE\/ACM Trans. Audio Speech Language Process. 22(12), 1905\u20131917 (2014). https:\/\/doi.org\/10.1109\/TASLP.2014.2355774","journal-title":"IEEE\/ACM Trans. Audio Speech Language Process."},{"key":"886_CR46","doi-asserted-by":"publisher","unstructured":"Patterson, R., Robinson, K., Holdsworth, J., McKeown, D., Zhang, C., Allerhand, M.: Complex sounds and auditory images. In: Cazals, Y., Horner, K., Demany, L. (eds) Auditory Physiology and Perception, Pergamon. pp. 429\u2013446 (1992). https:\/\/doi.org\/10.1016\/B978-0-08-041847-6.50054-X","DOI":"10.1016\/B978-0-08-041847-6.50054-X"},{"issue":"4","key":"886_CR47","doi-asserted-by":"publisher","first-page":"1890","DOI":"10.1121\/1.414456","volume":"98","author":"RD Patterson","year":"1995","unstructured":"Patterson, R.D., Allerhand, M.H., Gigu\u00e8re, C.: Time-domain modeling of peripheral auditory processing: a modular architecture and a software platform. Acoust. Soc. Am. J. 98(4), 1890\u20131894 (1995). https:\/\/doi.org\/10.1121\/1.414456","journal-title":"Acoust. Soc. Am. J."},{"key":"886_CR48","unstructured":"Perrot, D., Gjerdigen, R.: Scanning the dial: an exploration of factors in the identification of musical style. In: Proceedings of the 1999 Society for Music Perception and Cognition, p\u00a088 (1999)"},{"issue":"18","key":"886_CR49","doi-asserted-by":"publisher","first-page":"2274","DOI":"10.3390\/math9182274","volume":"9","author":"L Qiu","year":"2021","unstructured":"Qiu, L., Li, S., Sung, Y.: 3D-DCDAE: Unsupervised music latent representations learning method based on a deep 3d convolutional denoising autoencoder for music genre classification. Mathematics 9(18), 2274 (2021). https:\/\/doi.org\/10.3390\/math9182274","journal-title":"Mathematics"},{"issue":"5","key":"886_CR50","doi-asserted-by":"publisher","first-page":"530","DOI":"10.3390\/math9050530","volume":"9","author":"L Qiu","year":"2021","unstructured":"Qiu, L., Li, S., Sung, Y.: DBTMPE: Deep bidirectional transformers-based masked predictive encoder approach for music genre classification. Mathematics 9(5), 530 (2021). https:\/\/doi.org\/10.3390\/math9050530","journal-title":"Mathematics"},{"key":"886_CR51","doi-asserted-by":"publisher","unstructured":"Schindler, A., Rauber, A.: An audio-visual approach to music genre classification through affective color features. In: Hanbury A, Kazai G, Rauber A, Fuhr N (eds) Advances in Information Retrieval. pp. 61\u201367 (2015). https:\/\/doi.org\/10.1007\/978-3-319-16354-3_8","DOI":"10.1007\/978-3-319-16354-3_8"},{"key":"886_CR52","unstructured":"Sturm, B.L.: The GTZAN dataset: its contents, its faults, their effects on evaluation, and its future use. CoRR abs\/1306.1461:1\u201329 (2013)"},{"key":"886_CR53","unstructured":"Tsaptsinos, A.: Lyrics-based music genre classification using a hierarchical attention network. CoRR abs\/1707.04678 (2017)"},{"issue":"5","key":"886_CR54","doi-asserted-by":"publisher","first-page":"293","DOI":"10.1109\/TSA.2002.800560","volume":"10","author":"G Tzanetakis","year":"2002","unstructured":"Tzanetakis, G., Cook, P.: Musical genre classification of audio signals. IEEE Trans. Speech Audio Process. 10(5), 293\u2013302 (2002). https:\/\/doi.org\/10.1109\/TSA.2002.800560","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"2","key":"886_CR55","doi-asserted-by":"publisher","first-page":"210","DOI":"10.1109\/TPAMI.2008.79","volume":"31","author":"J Wright","year":"2009","unstructured":"Wright, J., Yang, A.Y., Ganesh, A., Sastry, S.S., Ma, Y.: Robust face recognition via sparse representation. IEEE Trans. Pattern Anal. Mach. Intell. 31(2), 210\u2013227 (2009). https:\/\/doi.org\/10.1109\/TPAMI.2008.79","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"886_CR56","doi-asserted-by":"publisher","unstructured":"Wu, M., Chen, Z., Jang, J.R., Ren, J., Li, Y., Lu, C.: Combining visual and acoustic features for music genre classification. In: 2011 10th International Conference on Machine Learning and Applications and Workshops, vol\u00a02, pp. 124\u2013129 (2011). https:\/\/doi.org\/10.1109\/ICMLA.2011.48","DOI":"10.1109\/ICMLA.2011.48"},{"key":"886_CR57","doi-asserted-by":"publisher","unstructured":"Yang, H., Zhang, W.Q.: Music genre classification using duplicated convolutional layers in neural networks. In: Proc. Interspeech 2019, pp. 3382\u20133386 (2019). https:\/\/doi.org\/10.21437\/Interspeech.2019-1298","DOI":"10.21437\/Interspeech.2019-1298"},{"key":"886_CR58","doi-asserted-by":"publisher","first-page":"375","DOI":"10.1007\/978-3-642-37431-9_29","volume-title":"Computer Vision - ACCV 2012","author":"J Ylioinas","year":"2013","unstructured":"Ylioinas, J., Hadid, A., Guo, Y., Pietik\u00e4inen, M.: Efficient image appearance description using dense sampling based local binary patterns. In: Lee, K.M., Matsushita, Y., Rehg, J.M., Hu, Z. (eds.) Computer Vision - ACCV 2012, pp. 375\u2013388. Springer, Heidelberg (2013)"},{"key":"886_CR59","doi-asserted-by":"publisher","first-page":"84","DOI":"10.1016\/j.neucom.2019.09.054","volume":"372","author":"Y Yu","year":"2020","unstructured":"Yu, Y., Luo, S., Liu, S., Qiao, H., Liu, Y., Feng, L.: Deep attention based music genre classification. Neurocomputing 372, 84\u201391 (2020). https:\/\/doi.org\/10.1016\/j.neucom.2019.09.054","journal-title":"Neurocomputing"},{"issue":"4","key":"886_CR60","doi-asserted-by":"publisher","first-page":"1465","DOI":"10.1109\/TIP.2011.2175739","volume":"21","author":"G Zhao","year":"2012","unstructured":"Zhao, G., Ahonen, T., Matas, J., Pietikainen, M.: Rotation-invariant image and video description with local binary pattern features. IEEE Trans. Image Process. 21(4), 1465\u20131477 (2012). https:\/\/doi.org\/10.1109\/TIP.2011.2175739","journal-title":"IEEE Trans. Image Process."}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-021-00886-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-021-00886-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-021-00886-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,4]],"date-time":"2022-05-04T06:09:29Z","timestamp":1651644569000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-021-00886-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,1,10]]},"references-count":60,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2022,6]]}},"alternative-id":["886"],"URL":"https:\/\/doi.org\/10.1007\/s00530-021-00886-3","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,1,10]]},"assertion":[{"value":"23 June 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 December 2021","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 January 2022","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}