{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,2]],"date-time":"2026-05-02T04:37:35Z","timestamp":1777696655974,"version":"3.51.4"},"reference-count":28,"publisher":"SAGE Publications","issue":"4","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IDA"],"published-print":{"date-parts":[[2024,7,17]]},"abstract":"<jats:p>Convolutional neural networks (CNNs) have been successfully applied to music genre classification tasks. With the development of diverse music, genre fusion has become common. Fused music exhibits multiple similar musical features such as rhythm, timbre, and structure, which typically arise from the temporal information in the spectrum. However, traditional CNNs cannot effectively capture temporal information, leading to difficulties in distinguishing fused music. To address this issue, this study proposes a CNN model called MusicNeXt for music genre classification. Its goal is to enhance the feature extraction method to increase focus on musical features, and increase the distinctiveness between different genres, thereby reducing classification result bias. Specifically, we construct the feature extraction module which can fully utilize temporal information, thereby enhancing its focus on music features. It exhibits an improved understanding of the complexity of fused music. Additionally, we introduce a genre-sensitive adjustment layer that strengthens the learning of differences between different genres through within-class angle constraints. This leads to increased distinctiveness between genres and provides interpretability for the classification results. Experimental results demonstrate that our proposed MusicNeXt model outperforms baseline networks and other state-of-the-art methods in music genre classification tasks, without generating category bias in the classification results.<\/jats:p>","DOI":"10.3233\/ida-230428","type":"journal-article","created":{"date-parts":[[2023,11,21]],"date-time":"2023-11-21T11:02:54Z","timestamp":1700564574000},"page":"1029-1043","source":"Crossref","is-referenced-by-count":0,"title":["MusicNeXt: Addressing category bias in fused music using musical features and genre-sensitive adjustment layer"],"prefix":"10.1177","volume":"28","author":[{"given":"Shiting","family":"Meng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qingbo","family":"Hao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yingyuan","family":"Xiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenguang","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"179","reference":[{"issue":"4","key":"10.3233\/IDA-230428_ref1","doi-asserted-by":"crossref","first-page":"913","DOI":"10.1007\/s10772-020-09681-3","article-title":"Pattern analysis based acoustic signal processing: A survey of the state-of-art","volume":"24","author":"Chaki","year":"2021","journal-title":"Int. J. Speech Technol"},{"key":"10.3233\/IDA-230428_ref3","doi-asserted-by":"crossref","first-page":"28","DOI":"10.1016\/j.asoc.2016.12.024","article-title":"An evaluation of Convolutional Neural Networks for music classification using spectrograms","volume":"52","author":"Costa","year":"2017","journal-title":"Appl. Soft Comput"},{"key":"10.3233\/IDA-230428_ref4","doi-asserted-by":"crossref","unstructured":"Z. Liu, H. Mao, C. Wu, C. Feichtenhofer, T. Darrell and S. Xie, A ConvNet for the 2020s, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR 2022, New Orleans, LA, USA, June 18\u201324, 2022, IEEE, 2022, pp.\u00a011966\u201311976.","DOI":"10.1109\/CVPR52688.2022.01167"},{"key":"10.3233\/IDA-230428_ref5","doi-asserted-by":"crossref","unstructured":"K. Choi, G. Fazekas, M.B. Sandler and K. Cho, Convolutional recurrent neural networks for music classification, in: 2017 IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2017, New Orleans, LA, USA, March 5\u20139, 2017, IEEE, 2017, pp.\u00a02392\u20132396.","DOI":"10.1109\/ICASSP.2017.7952585"},{"key":"10.3233\/IDA-230428_ref6","doi-asserted-by":"crossref","unstructured":"X. Zhang, J. Qian, Y. Yu, Y. Sun and W. Li, Singer Identification Using Deep Timbre Feature Learning with KNN-NET, in: IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2021, Toronto, ON, Canada, June 6\u201311, 2021, IEEE, 2021, pp.\u00a03380\u20133384.","DOI":"10.1109\/ICASSP39728.2021.9413774"},{"issue":"12","key":"10.3233\/IDA-230428_ref7","doi-asserted-by":"crossref","first-page":"3150","DOI":"10.1109\/TMM.2019.2918739","article-title":"Bidirectional convolutional recurrent sparse network (BCRSN): An efficient model for music emotion recognition","volume":"21","author":"Dong","year":"2019","journal-title":"IEEE Trans. Multim"},{"key":"10.3233\/IDA-230428_ref8","doi-asserted-by":"crossref","unstructured":"W. Bian, J. Wang, B. Zhuang, J. Yang, S. Wang and J. Xiao, Audio-Based Music Classification with DenseNet and Data Augmentation, in: PRICAI 2019: Trends in Artificial Intelligence \u2013 16th Pacific Rim International Conference on Artificial Intelligence, Cuvu, Yanuca Island, Fiji, August 26\u201330, 2019, Proceedings, Part III, Springer, 2019, pp.\u00a056\u201365.","DOI":"10.1007\/978-3-030-29894-4_5"},{"key":"10.3233\/IDA-230428_ref9","doi-asserted-by":"crossref","first-page":"84","DOI":"10.1016\/j.neucom.2019.09.054","article-title":"Deep attention based music genre classification","volume":"372","author":"Yu","year":"2020","journal-title":"Neurocomputing"},{"key":"10.3233\/IDA-230428_ref10","doi-asserted-by":"crossref","unstructured":"P. Chang, Y. Chen and C. Lee, MS-SincResNet: Joint Learning of 1D and 2D Kernels Using Multi-scale SincNet and ResNet for Music Genre Classification, in: ICMR \u201921: International Conference on Multimedia Retrieval, Taipei, Taiwan, August 21\u201324, 2021, ACM, 2021, pp.\u00a029\u201336.","DOI":"10.1145\/3460426.3463619"},{"issue":"5","key":"10.3233\/IDA-230428_ref11","doi-asserted-by":"crossref","first-page":"7313","DOI":"10.1007\/s11042-020-09643-6","article-title":"Bottom-up broadcast neural network for music genre classification","volume":"80","author":"Liu","year":"2021","journal-title":"Multim. Tools Appl"},{"key":"10.3233\/IDA-230428_ref12","doi-asserted-by":"crossref","unstructured":"X. Zhang, J. Qian, Y. Yu, Y. Sun and W. Li, Singer Identification Using Deep Timbre Feature Learning with KNN-NET, in: IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2021, Toronto, ON, Canada, June 6\u201311, 2021, IEEE, 2021, pp.\u00a03380\u20133384.","DOI":"10.1109\/ICASSP39728.2021.9413774"},{"key":"10.3233\/IDA-230428_ref13","unstructured":"B. Logan, Mel Frequency Cepstral Coefficients for Music Modeling, in: ISMIR 2000, 1st International Symposium on Music Information Retrieval, Plymouth, Massachusetts, USA, October 23\u201325, 2000, Proceedings, IEEE, 2000, pp.\u00a0293\u2013302."},{"issue":"6","key":"10.3233\/IDA-230428_ref14","doi-asserted-by":"crossref","first-page":"482","DOI":"10.1007\/s00530-002-0065-0","article-title":"Content-based audio classification and segmentation by using support vector machines","volume":"8","author":"Lu","year":"2003","journal-title":"Multim. Syst"},{"issue":"3","key":"10.3233\/IDA-230428_ref16","doi-asserted-by":"crossref","first-page":"564","DOI":"10.1109\/TMM.2006.870730","article-title":"Toward intelligent music information retrieval","volume":"8","author":"Li","year":"2006","journal-title":"IEEE Trans. Multim"},{"issue":"5","key":"10.3233\/IDA-230428_ref17","doi-asserted-by":"crossref","first-page":"293","DOI":"10.1109\/TSA.2002.800560","article-title":"Musical genre classification of audio signals","volume":"10","author":"Tzanetakis","year":"2002","journal-title":"IEEE Trans. Speech Audio Process"},{"key":"10.3233\/IDA-230428_ref18","doi-asserted-by":"crossref","unstructured":"S. Dieleman and B. Schrauwen, End-to-end learning for music audio, in: IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2014, Florence, Italy, May 4\u20139, 2014, IEEE, 2014, pp.\u00a06964\u20136968.","DOI":"10.1109\/ICASSP.2014.6854950"},{"key":"10.3233\/IDA-230428_ref19","doi-asserted-by":"crossref","unstructured":"K. Choi, G. Fazekas, M.B. Sandler and K. Cho, Convolutional recurrent neural networks for music classification, in: 2017 IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2017, New Orleans, LA, USA, March 5\u20139, 2017, IEEE, 2017, pp.\u00a02392\u20132396.","DOI":"10.1109\/ICASSP.2017.7952585"},{"key":"10.3233\/IDA-230428_ref20","doi-asserted-by":"crossref","unstructured":"H. Liang, W. Lei, P.Y. Chan, Z. Yang, M. Sun and T. Chua, PiRhDy: Learning Pitch-, Rhythm-, and Dynamics-aware Embeddings for Symbolic Music, in: MM \u201920: The 28th ACM International Conference on Multimedia, Virtual Event\/Seattle, WA, USA, October 12\u201316, 2020, ACM, 2020, pp.\u00a0574\u2013582.","DOI":"10.1145\/3394171.3414032"},{"issue":"3","key":"10.3233\/IDA-230428_ref21","doi-asserted-by":"crossref","first-page":"779","DOI":"10.1007\/s00530-021-00886-3","article-title":"Music genre classification based on auditory image, spectral and acoustic features","volume":"28","author":"Cai","year":"2022","journal-title":"Multim. Syst"},{"key":"10.3233\/IDA-230428_ref22","unstructured":"D. Clevert, T. Unterthiner and S. Hochreiter, Fast and Accurate Deep Network Learning by Exponential Linear Units (ELUs), in: 4th International Conference on Learning Representations, ICLR 2016, San Juan, Puerto Rico, May 2\u20134, 2016, Conference Track Proceedings, arXiv preprint, 2016, pp. arXiv:1511.07289."},{"key":"10.3233\/IDA-230428_ref23","doi-asserted-by":"crossref","unstructured":"J. Kim, M. Won, X. Serra and C.C.S. Liem, Transfer Learning of Artist Group Factors to Musical Genre Classification, in: Companion of the The Web Conference 2018 on The Web Conference 2018, WWW 2018, Lyon, France, April 23\u201327, 2018, ACM, 2018, pp.\u00a01929\u20131934.","DOI":"10.1145\/3184558.3191823"},{"key":"10.3233\/IDA-230428_ref24","doi-asserted-by":"crossref","unstructured":"G. Zhong, H. Wang and W. Jiao, MusicCNNs: A New Benchmark on Content-Based Music Recommendation, in: Neural Information Processing \u2013 25th International Conference, ICONIP 2018, Siem Reap, Cambodia, December 13\u201316, 2018, Proceedings, Part I, Springer, 2018, pp.\u00a0394\u2013405.","DOI":"10.1007\/978-3-030-04167-0_36"},{"key":"10.3233\/IDA-230428_ref26","unstructured":"U. Marchand and G. Peeters, The Extended Ballroom Dataset, in: ISMIR 2016 Late-Breaking Session, 2016, pp. https:\/\/hal.science\/hal\u201301374567\/file\/ISMIR2016LBD-ExtendedBallroom.pdf."},{"key":"10.3233\/IDA-230428_ref27","doi-asserted-by":"crossref","first-page":"152713","DOI":"10.1109\/ACCESS.2020.3017661","article-title":"Multi-level local feature coding fusion for music genre recognition","volume":"8","author":"Ng","year":"2020","journal-title":"IEEE Access"},{"key":"10.3233\/IDA-230428_ref28","doi-asserted-by":"crossref","unstructured":"H. Zhao, C. Zhang, B. Zhu, Z. Ma and K. Zhang, S3T: Self-Supervised Pre-Training with Swin Transformer For Music Classification, in: IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP 2022, Virtual and Singapore, 23\u201327 May 2022, IEEE, 2022, pp.\u00a0606\u2013610.","DOI":"10.1109\/ICASSP43922.2022.9746056"},{"issue":"13","key":"10.3233\/IDA-230428_ref29","doi-asserted-by":"crossref","first-page":"10337","DOI":"10.1007\/s00521-022-06896-0","article-title":"Combined angular margin and cosine margin softmax loss for music classification based on spectrograms","volume":"34","author":"Li","year":"2022","journal-title":"Neural Comput. Appl"},{"key":"10.3233\/IDA-230428_ref30","doi-asserted-by":"crossref","first-page":"106073","DOI":"10.1016\/j.asoc.2020.106073","article-title":"Masked Conditional Neural Networks for sound classification","volume":"90","author":"Medhat","year":"2020","journal-title":"Appl. Soft Comput"},{"key":"10.3233\/IDA-230428_ref31","doi-asserted-by":"crossref","unstructured":"Y. Liang, Y. Zhou, T. Wan and X. Shu, Deep Neural Networks with Depthwise Separable Convolution for Music Genre Classification, in: 2019 IEEE 2nd International Conference on Information Communication and Signal Processing (ICICSP), 2019, pp.\u00a0267\u2013270.","DOI":"10.1109\/ICICSP48821.2019.8958603"}],"container-title":["Intelligent Data Analysis"],"original-title":[],"link":[{"URL":"https:\/\/content.iospress.com\/download?id=10.3233\/IDA-230428","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T09:20:37Z","timestamp":1777454437000},"score":1,"resource":{"primary":{"URL":"https:\/\/journals.sagepub.com\/doi\/full\/10.3233\/IDA-230428"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,7,17]]},"references-count":28,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.3233\/ida-230428","relation":{},"ISSN":["1088-467X","1571-4128"],"issn-type":[{"value":"1088-467X","type":"print"},{"value":"1571-4128","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,7,17]]}}}