{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,19]],"date-time":"2026-01-19T07:41:18Z","timestamp":1768808478525,"version":"3.49.0"},"reference-count":38,"publisher":"Springer Science and Business Media LLC","issue":"9","license":[{"start":{"date-parts":[[2023,4,28]],"date-time":"2023-04-28T00:00:00Z","timestamp":1682640000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,4,28]],"date-time":"2023-04-28T00:00:00Z","timestamp":1682640000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Hunan Key Laboratory of Intelligent Logistics Technology","award":["2019TP1015"],"award-info":[{"award-number":["2019TP1015"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Circuits Syst Signal Process"],"published-print":{"date-parts":[[2023,9]]},"DOI":"10.1007\/s00034-023-02339-w","type":"journal-article","created":{"date-parts":[[2023,4,28]],"date-time":"2023-04-28T15:01:57Z","timestamp":1682694117000},"page":"5289-5312","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Environmental Sound Classification Based on CAR-Transformer Neural Network Model"],"prefix":"10.1007","volume":"42","author":[{"given":"Huaicheng","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8917-8398","authenticated-orcid":false,"given":"Aibin","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jizheng","family":"Yi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenjie","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Daowu","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guoxiong","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weixiong","family":"Peng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,4,28]]},"reference":[{"issue":"136","key":"2339_CR1","doi-asserted-by":"publisher","first-page":"252","DOI":"10.1016\/j.eswa.2019.06.040","volume":"1","author":"S Abdoli","year":"2019","unstructured":"S. Abdoli, P. Cardinal, A.L. Koerich, End-to-end environmental sound classification using a 1D convolutional neural network. Expert Syst. Appl. 1(136), 252\u2013263 (2019)","journal-title":"Expert Syst. Appl."},{"key":"2339_CR2","doi-asserted-by":"publisher","first-page":"15494","DOI":"10.1109\/ACCESS.2018.2805845","volume":"6","author":"Z Ali","year":"2018","unstructured":"Z. Ali, M. Talha, Innovative method for unsupervised voice activity detection and classification of audio segments. Ieee Access 6, 15494\u201315504 (2018)","journal-title":"Ieee Access"},{"key":"2339_CR3","doi-asserted-by":"publisher","first-page":"2048","DOI":"10.1016\/j.procs.2017.08.250","volume":"112","author":"V Boddapati","year":"2017","unstructured":"V. Boddapati, A. Petef, J. Rasmusson, L. Lundberg, Classifying environmental sounds using image recognition networks. Procedia Comput. Sci. 112, 2048\u20132056 (2017)","journal-title":"Procedia Comput. Sci."},{"key":"2339_CR4","unstructured":"K. Choi, G. Fazekas, M. Sandler, K. Cho. Transfer learning for music classification and regression tasks. In 18th International Society for Music Information Retrieval Conference, ISMIR 2017. pp. 141\u2013149(2017)"},{"issue":"4","key":"2339_CR5","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/2871183","volume":"48","author":"M Crocco","year":"2016","unstructured":"M. Crocco, M. Cristani, A. Trucco, V. Murino, Audio surveillance: a systematic review. ACM Comput. Surv. (CSUR) 48(4), 1\u201346 (2016)","journal-title":"ACM Comput. Surv. (CSUR)"},{"key":"2339_CR6","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2020.107520","volume":"170","author":"F Demir","year":"2020","unstructured":"F. Demir, M. Turkoglu, M. Aslan, A. Sengur, A new pyramidal concatenated CNN approach for environmental sound classification. Appl. Acoust. 170, 107520 (2020)","journal-title":"Appl. Acoust."},{"key":"2339_CR7","doi-asserted-by":"publisher","first-page":"125714","DOI":"10.1109\/ACCESS.2020.3007906","volume":"8","author":"X Dong","year":"2020","unstructured":"X. Dong, B. Yin, Y. Cong, Z. Du, X. Huang, Environment sound event classification with a two-stream convolutional neural network. IEEE Access. 8, 125714\u2013125721 (2020)","journal-title":"IEEE Access."},{"key":"2339_CR8","unstructured":"D. Elliott, C. E. Otero, S. Wyatt, E. Martino. Tiny transformers for environmental sound classification at the edge. arXiv preprint arXiv:2103.12157. (2021)"},{"key":"2339_CR9","unstructured":"S. Ewert. Chroma Toolbox: MATLAB implementations for extracting variants of chroma-based audio features. In Proc. ISMIR. (2011)"},{"key":"2339_CR10","doi-asserted-by":"crossref","unstructured":"T. Giannakopoulos, E. Spyrou, S. J. Perantonis. Recognition of urban sound events using deep context-aware feature extractors and handcrafted features. In Artificial Intelligence Applications and Innovations: AIAI 2019 IFIP WG 12.5 International Workshops: MHDW and 5G-PINE 2019, Hersonissos, Crete, Greece, May 24\u201326, 2019, Proceedings 15. pp. 184\u2013195. Springer International Publishing. (2019)","DOI":"10.1007\/978-3-030-19909-8_16"},{"key":"2339_CR11","doi-asserted-by":"crossref","unstructured":"C. Harte, M. Sandler, M. Gasser. Detecting harmonic change in musical audio. In Proceedings of the 1st ACM workshop on Audio and music computing multimedia. pp. 21\u201326 (2006, October)","DOI":"10.1145\/1178723.1178727"},{"key":"2339_CR12","doi-asserted-by":"crossref","unstructured":"K. He, X. Zhang, S. Ren, J. Sun. Deep residual learning for image recognition. In Proceedings of the IEEE conference on computer vision and pattern recognition. pp. 770\u2013778(2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"2339_CR13","doi-asserted-by":"crossref","unstructured":"Q. Hou, D. Zhou, J. Feng. Coordinate attention for efficient mobile network design. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 13713\u201313722(2021)","DOI":"10.1109\/CVPR46437.2021.01350"},{"key":"2339_CR14","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2020.107243","volume":"164","author":"Z Huang","year":"2020","unstructured":"Z. Huang, C. Liu, H. Fei, W. Li, J. Yu, Y. Cao, Urban sound classification based on 2-order dense convolutional network using dual features. Appl. Acoust. 164, 107243 (2020)","journal-title":"Appl. Acoust."},{"key":"2339_CR15","unstructured":"D. N. Jiang, L. Lu, H. J. Zhang, J. H. Tao, L. H. Cai. Music type classification by spectral contrast feature. In Proceedings. IEEE International Conference on Multimedia and Expo. Vol. 1, pp. 113\u2013116(2002, August)"},{"key":"2339_CR16","unstructured":"N. Kitaev, \u0141. Kaiser, A. Levskaya. Reformer: the efficient transformer. arXiv preprint arXiv:2001.04451.(2020)"},{"key":"2339_CR17","unstructured":"J. Lee, Y. Lee, J. Kim, A. Kosiorek, S. Choi, Y. W. Teh. Set transformer: A framework for attention-based permutation-invariant neural networks. In International conference on machine learning. pp. 3744\u20133753 (2019)"},{"key":"2339_CR18","doi-asserted-by":"crossref","unstructured":"H. Li, S. Ishikawa, Q. Zhao, M. Ebana, H. Yamamoto, J. Huang. Robot navigation and sound based position identification. In 2007 IEEE International Conference on Systems, Man and Cybernetics. pp. 2449\u20132454(2007)","DOI":"10.1109\/ICSMC.2007.4413757"},{"issue":"7","key":"2339_CR19","doi-asserted-by":"publisher","first-page":"1152","DOI":"10.3390\/app8071152","volume":"8","author":"S Li","year":"2018","unstructured":"S. Li, Y. Yao, J. Hu, G. Liu, X. Yao, J. Hu, An ensemble stacked convolutional neural network model for environmental event sound recognition. Appl. Sci. 8(7), 1152 (2018)","journal-title":"Appl. Sci."},{"key":"2339_CR20","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2020.107819","volume":"175","author":"JS Luz","year":"2021","unstructured":"J.S. Luz, M.C. Oliveira, F.H. Araujo, D.M. Magalh\u00e3es, Ensemble of handcrafted and deep features for urban sound classification. Appl. Acoust. 175, 107819 (2021)","journal-title":"Appl. Acoust."},{"key":"2339_CR21","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2020.106073","volume":"90","author":"F Medhat","year":"2020","unstructured":"F. Medhat, D. Chesmore, J. Robinson, Masked conditional neural networks for sound classification. Appl. Soft Comput. 90, 106073 (2020)","journal-title":"Appl. Soft Comput."},{"key":"2339_CR22","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2020.107389","volume":"167","author":"Z Mushtaq","year":"2020","unstructured":"Z. Mushtaq, S.F. Su, Environmental sound classification using a regularized deep convolutional neural network with data augmentation. Appl. Acoust. 167, 107389 (2020)","journal-title":"Appl. Acoust."},{"key":"2339_CR23","doi-asserted-by":"publisher","first-page":"411","DOI":"10.1109\/LSP.2020.2975422","volume":"27","author":"H Park","year":"2020","unstructured":"H. Park, C.D. Yoo, CNN-based learnable gammatone filterbank and equal-loudness normalization for environmental sound classification. IEEE Signal Process. Lett. 27, 411\u2013415 (2020)","journal-title":"IEEE Signal Process. Lett."},{"key":"2339_CR24","unstructured":"N. Parmar, A. Vaswani, J. Uszkoreit, L. Kaiser, N. Shazeer, A. Ku, D. Tran. Image transformer. In International conference on machine learning. pp. 4055\u20134064. PMLR. (2018, July)"},{"key":"2339_CR25","doi-asserted-by":"publisher","first-page":"191100","DOI":"10.1109\/ACCESS.2020.3032226","volume":"8","author":"N Peng","year":"2020","unstructured":"N. Peng, A. Chen, G. Zhou, W. Chen, W. Zhang, J. Liu, F. Ding, Environment sound classification based on visual multi-feature fusion and GRU-AWS. IEEE Access 8, 191100\u2013191114 (2020)","journal-title":"IEEE Access"},{"key":"2339_CR26","doi-asserted-by":"crossref","unstructured":"K. J. Piczak. ESC: Dataset for environmental sound classification. In Proceedings of the 23rd ACM international conference on Multimedia. pp. 1015\u20131018(2015, October)","DOI":"10.1145\/2733373.2806390"},{"key":"2339_CR27","doi-asserted-by":"crossref","unstructured":"K. J. Piczak. Environmental sound classification with convolutional neural networks. In 2015 IEEE 25th international workshop on machine learning for signal processing (MLSP). pp. 1\u20136(2015, September)","DOI":"10.1109\/MLSP.2015.7324337"},{"key":"2339_CR28","doi-asserted-by":"crossref","unstructured":"J. Salamon, C. Jacoby, J. P. Bello. A dataset and taxonomy for urban sound research. In Proceedings of the 22nd ACM international conference on Multimedia. pp. 1041\u20131044 (2014, November)","DOI":"10.1145\/2647868.2655045"},{"key":"2339_CR29","doi-asserted-by":"crossref","unstructured":"J. Sharma, O. C. Granmo, M. Goodwin. Environment Sound Classification Using Multiple Feature Channels and Attention Based Deep Convolutional Neural Network. In Interspeech. Vol. 2020, pp. 1186\u20131190(2020, October)","DOI":"10.21437\/Interspeech.2020-1303"},{"issue":"7","key":"2339_CR30","doi-asserted-by":"publisher","first-page":"1733","DOI":"10.3390\/s19071733","volume":"19","author":"Y Su","year":"2019","unstructured":"Y. Su, K. Zhang, J. Wang, K. Madani, Environment sound classification using a two-stream CNN based on decision-level fusion. Sensors 19(7), 1733 (2019)","journal-title":"Sensors"},{"key":"2339_CR31","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2019.107050","volume":"158","author":"Y Su","year":"2020","unstructured":"Y. Su, K. Zhang, J. Wang, D. Zhou, K. Madani, Performance analysis of multiple aggregated acoustic features for environment sound classification. Appl. Acoust. 158, 107050 (2020)","journal-title":"Appl. Acoust."},{"key":"2339_CR32","doi-asserted-by":"crossref","unstructured":"Y. Tokozume, T. Harada. Learning environmental sounds with end-to-end convolutional neural network. In 2017 IEEE international conference on acoustics, speech and signal processing (ICASSP). pp. 2721\u20132725(2017, March)","DOI":"10.1109\/ICASSP.2017.7952651"},{"key":"2339_CR33","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2020.107508","volume":"170","author":"T Tuncer","year":"2020","unstructured":"T. Tuncer, A. Subasi, F. Ertam, S. Dogan, A novel spiral pattern and 2D M4 pooling based environmental sound classification method. Appl. Acoust. 170, 107508 (2020)","journal-title":"Appl. Acoust."},{"key":"2339_CR34","unstructured":"A. Vaswani, N. Shazeer, N. Parmar, J. Uszkoreit, L. Jones, A. N. Gomez, ..., I. Polosukhin. Attention is all you need. In Advances in neural information processing systems. pp. 5998\u20136008(2017)"},{"key":"2339_CR35","doi-asserted-by":"publisher","unstructured":"N. Yamakawa, T. Takahashi, T. Kitahara, T. Ogata, H.G. Okuno. Environmental Sound Recognition for Robot Audition Using Matching-Pursuit. In: Mehrotra, K.G., Mohan, C.K., Oh, J.C., Varshney, P.K., Ali, M. (eds.). Modern Approaches in Applied Intelligence. IEA\/AIE 2011. Lecture Notes in Computer Science, vol 6704. Springer, Berlin, Heidelberg (2011). Doi: https:\/\/doi.org\/10.1007\/978-3-642-21827-9_1","DOI":"10.1007\/978-3-642-21827-9_1"},{"issue":"1","key":"2339_CR36","doi-asserted-by":"publisher","first-page":"126","DOI":"10.1109\/TETC.2017.2700843","volume":"8","author":"J Ye","year":"2017","unstructured":"J. Ye, T. Kobayashi, X. Wang, H. Tsuda, M. Murakawa, Audio data mining for anthropogenic disaster identification: an automatic taxonomy approach. IEEE Trans. Emerg. Top. Comput. 8(1), 126\u2013136 (2017)","journal-title":"IEEE Trans. Emerg. Top. Comput."},{"key":"2339_CR37","doi-asserted-by":"crossref","unstructured":"H. Zhang, I. Mcloughlin, Y. Song. Robust sound event recognition using convolutional neural networks. In IEEE International Conference on Acoustics, Speech and Signal Processing. pp. 559\u2013563 (2015)","DOI":"10.1109\/ICASSP.2015.7178031"},{"key":"2339_CR38","doi-asserted-by":"crossref","unstructured":"Z. Zhang, S. Xu, S. Cao, S. Zhang. Deep convolutional neural network with mixup for environmental sound classification. In Chinese conference on pattern recognition and computer vision (prcv). pp. 356\u2013367. Springer, Cham. (2018, November)","DOI":"10.1007\/978-3-030-03335-4_31"}],"container-title":["Circuits, Systems, and Signal Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-023-02339-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00034-023-02339-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-023-02339-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,19]],"date-time":"2024-10-19T12:04:19Z","timestamp":1729339459000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00034-023-02339-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,4,28]]},"references-count":38,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2023,9]]}},"alternative-id":["2339"],"URL":"https:\/\/doi.org\/10.1007\/s00034-023-02339-w","relation":{},"ISSN":["0278-081X","1531-5878"],"issn-type":[{"value":"0278-081X","type":"print"},{"value":"1531-5878","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,4,28]]},"assertion":[{"value":"3 March 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 February 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 February 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 April 2023","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}