{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,5]],"date-time":"2026-01-05T22:07:32Z","timestamp":1767650852359,"version":"3.40.1"},"reference-count":46,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2024,11,27]],"date-time":"2024-11-27T00:00:00Z","timestamp":1732665600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,27]],"date-time":"2024-11-27T00:00:00Z","timestamp":1732665600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Circuits Syst Signal Process"],"published-print":{"date-parts":[[2025,3]]},"DOI":"10.1007\/s00034-024-02921-w","type":"journal-article","created":{"date-parts":[[2024,11,27]],"date-time":"2024-11-27T10:57:31Z","timestamp":1732705051000},"page":"2145-2166","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["Robust DOA Estimation: Cross-Branch Fused Multi-stream Network with Feature Enhancement"],"prefix":"10.1007","volume":"44","author":[{"given":"Yuting","family":"Yan","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6332-895X","authenticated-orcid":false,"given":"Qinghua","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,27]]},"reference":[{"key":"2921_CR1","doi-asserted-by":"crossref","unstructured":"T.D. Abhayapala, H. Bhatta, Coherent broadband source localization by modal space processing, in Proceedings of the IEEE 10th International Conference on Telecommunications (2003), pp. 1617\u20131623","DOI":"10.1109\/ICTEL.2003.1191676"},{"issue":"5","key":"2921_CR2","doi-asserted-by":"publisher","first-page":"337","DOI":"10.1109\/LSP.2006.888292","volume":"14","author":"Y Avargel","year":"2007","unstructured":"Y. Avargel, I. Cohen, On multiplicative transfer function approximation in the short-time fourier transform domain. IEEE Signal Process. Lett. 14(5), 337\u2013340 (2007)","journal-title":"IEEE Signal Process. Lett."},{"key":"2921_CR3","doi-asserted-by":"crossref","unstructured":"M.R. Celsi, S. Scardapane, D. Comminiello, Quaternion neural networks for 3D sound source localization in reverberant environments, in 2020 IEEE 30th International Workshop on Machine Learning for Signal Processing (MLSP), Espoo, Finland (2020), pp. 1\u20136","DOI":"10.1109\/MLSP49062.2020.9231809"},{"key":"2921_CR4","doi-asserted-by":"crossref","unstructured":"S. Chakrabarty, E.A.P. Habets, Broadband DoA estimation using convolutional neural networks trained with noise signals, in Proceedings of the WASPAA, October 19, New Paltz, NY, pp. 136\u2013140","DOI":"10.1109\/WASPAA.2017.8170010"},{"key":"2921_CR5","unstructured":"S. Chakrabarty, E.A.P. Habets, Multi-speaker localization using convolutional neural network trained with noise, arXiv:1712.04276"},{"issue":"1","key":"2921_CR6","doi-asserted-by":"publisher","first-page":"8","DOI":"10.1109\/JSTSP.2019.2901664","volume":"13","author":"S Chakrabarty","year":"2019","unstructured":"S. Chakrabarty, E.A.P. Habets, Multi-speaker DOA estimation using deep convolutional networks trained with noise signals. IEEE J. Sel. Top. Signal Process. 13(1), 8\u201321 (2019)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"2921_CR7","doi-asserted-by":"publisher","first-page":"102907","DOI":"10.1109\/ACCESS.2020.2997466","volume":"8","author":"Y Chen","year":"2020","unstructured":"Y. Chen, X. Zhang, W. Chen, Y. Li, J. Wang, \u2018Research on recognition of fly species based on improved RetinaNet and CBAM.\u2019 IEEE Access 8, 102907\u2013102919 (2020)","journal-title":"IEEE Access"},{"key":"2921_CR8","doi-asserted-by":"crossref","unstructured":"P. Dwivedi, G. Routray, R.M. Hegde, Hybrid SH-CNN-MP approach for super resolution DOA estimation, in 2022 56th Asilomar Conference on Signals, Systems, and Computers, Pacific Grove, CA, USA (2022), pp. 96\u2013100","DOI":"10.1109\/IEEECONF56349.2022.10051862"},{"key":"2921_CR9","doi-asserted-by":"crossref","unstructured":"P. Dwivedi, G. Routray, R.M. Hegde, DOA estimation using multiclass-SVM in spherical harmonics domain, in 2022 IEEE International Conference on Signal Processing and Communications (SPCOM), Bangalore, India (2022), pp. 1\u20135","DOI":"10.1109\/SPCOM55316.2022.9840848"},{"key":"2921_CR10","doi-asserted-by":"crossref","unstructured":"P. Dwivedi, R.P. Gohil, G. Routray, V. Varanasiy, R.M. Hegde, Joint DOA estimation in spherical harmonics domain using low complexity CNN, in 2022 IEEE International Conference on Signal Processing and Communications (SPCOM), Bangalore, India (2022), pp. 1\u20135","DOI":"10.1109\/SPCOM55316.2022.9840853"},{"key":"2921_CR11","doi-asserted-by":"crossref","unstructured":"P.A. Grumiaux, S. Kit\u00edc, L. Girin, A. Gu\u00e9rin, Improved feature extraction for CRNN-based multiple sound source localization, in Proceedings of IEEE 29th European Signal Processing Conference (2021), pp. 231\u2013235","DOI":"10.23919\/EUSIPCO54536.2021.9616124"},{"key":"2921_CR12","unstructured":"M. Guan, Y. Wang, G. Ma, et al., Multi-stream keypoint attention network for sign language recognition and translation (2024), arxiv:2405.05672"},{"key":"2921_CR13","unstructured":"T. Hirvonen, Classification of spatial audio location and content using convolutional neural networks, in Proceedings of the AES Convention, May 7\u201310, Warsaw, Poland"},{"key":"2921_CR14","doi-asserted-by":"publisher","first-page":"3120","DOI":"10.1109\/TASLP.2022.3209947","volume":"30","author":"Y Hu","year":"2022","unstructured":"Y. Hu, P.N. Samarasinghe, S. Gannot, T.D. Abhayapala, Decoupled multiple speaker direction-of-arrival estimator under reverberant environments. IEEE\/ACM Trans. Audio Speech Lang. Process. 30, 3120\u20133133 (2022)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"11","key":"2921_CR15","doi-asserted-by":"publisher","first-page":"2045","DOI":"10.1109\/TASLP.2017.2737235","volume":"25","author":"Q Huang","year":"2017","unstructured":"Q. Huang, L. Zhang, Y. Fang, Two-stage decoupled DOA estimation based on real spherical harmonics for spherical arrays. IEEE\/ACM Trans. Audio Speech Lang. Process. 25(11), 2045\u20132058 (2017)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"2921_CR16","doi-asserted-by":"publisher","first-page":"103765","DOI":"10.1016\/j.dsp.2022.103765","volume":"131","author":"Q Huang","year":"2022","unstructured":"Q. Huang, W. Fang, DOA estimation using two independent convolutional neural networks with residual blocks. Digit. Signal Process. 131, 103765 (2022)","journal-title":"Digit. Signal Process."},{"issue":"3","key":"2921_CR17","doi-asserted-by":"publisher","first-page":"1462","DOI":"10.1121\/1.4740497","volume":"132","author":"DP Jarrett","year":"2012","unstructured":"D.P. Jarrett, E.A.P. Habets, M.R.P. Thomas, P.A. Naylor, Rigid sphere room impulse response simulation: algorithm and applications. J. Acoust. Soc. Am. 132(3), 1462\u20131472 (2012)","journal-title":"J. Acoust. Soc. Am."},{"issue":"8","key":"2921_CR18","doi-asserted-by":"publisher","first-page":"1181","DOI":"10.1109\/LSP.2018.2811740","volume":"25","author":"J Kim","year":"2018","unstructured":"J. Kim, M. Hahn, Voice activity detection using an adaptive context attention model. IEEE Signal Process. Lett. 25(8), 1181\u20131185 (2018)","journal-title":"IEEE Signal Process. Lett."},{"key":"2921_CR19","unstructured":"A. Krizhevsky, I. Sutskever, G.E. Hinton, Imagenet classification with deep convolutional neural networks, in Proceedings of Advances in Neural Information Processing System (2012), pp. 1097\u20131105"},{"key":"2921_CR20","doi-asserted-by":"crossref","unstructured":"R. Levorato, E. Pagello, DOA acoustic source localization in mobile robot sensor networks, in Proceedings of the IEEE IEEE International Conference on Autonomous Robot Systems and Competitions (2015), pp. 71\u201376","DOI":"10.1109\/ICARSC.2015.15"},{"key":"2921_CR21","doi-asserted-by":"crossref","unstructured":"H.W. L\u00f6llmann et al., The LOCATA challenge data corpus for acoustic source localization and tracking, in Proceedings of the IEEE Sensor Array and Multichannel Signal Processing Workshop (2018), pp. 410\u2013414","DOI":"10.1109\/SAM.2018.8448644"},{"key":"2921_CR22","doi-asserted-by":"publisher","first-page":"876","DOI":"10.1109\/TASLP.2023.3237167","volume":"31","author":"E Loweimi","year":"2023","unstructured":"E. Loweimi, Z. Yue, P. Bell, S. Renals, Z. Cvetkovic, Multi-stream acoustic modelling using raw real and imaginary parts of the Fourier transform. IEEE\/ACM Trans. Audio, Speech Lang. Process. 31, 876\u2013890 (2023)","journal-title":"IEEE\/ACM Trans. Audio, Speech Lang. Process."},{"issue":"1","key":"2921_CR23","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1109\/JSTSP.2018.2885930","volume":"13","author":"L Madmoni","year":"2019","unstructured":"L. Madmoni, B. Rafaely, Direction of arrival estimation for reverberant speech based on enhanced decomposition of the direct sound. IEEE J. Sel. Top. Signal Process. 13(1), 131\u2013142 (2019)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"issue":"10","key":"2921_CR24","doi-asserted-by":"publisher","first-page":"1494","DOI":"10.1109\/TASLP.2014.2337846","volume":"22","author":"O Nadiri","year":"2014","unstructured":"O. Nadiri, B. Rafaely, Localization of multiple speakers under high reverberation using a spherical microphone array and the direct-path dominance test. IEEE\/ACM Trans. Audio Speech Lang. Process. 22(10), 1494\u20131505 (2014)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"2921_CR25","doi-asserted-by":"crossref","unstructured":"T. Nagai, K. Kondo, M. Kaneko, A. Kurematsu, Estimation of source location based on 2-D MUSIC and its application to speech recognition in cars, in Proceedings of the IEEE International Conference on Acoustics, Speech, and Signal Processing (2001), pp. 3041\u20133044","DOI":"10.1109\/ICASSP.2001.940299"},{"key":"2921_CR26","doi-asserted-by":"crossref","unstructured":"V. Panayotov, G. Chen, D. Povey, and S. Khudanpur, Librispeech: an ASR corpus based on public domain audio books, in Proceedings of the IEEE International Conference on Acoustics, Speech, and Signal Processing (2015), pp. 5206\u20135210","DOI":"10.1109\/ICASSP.2015.7178964"},{"key":"2921_CR27","doi-asserted-by":"crossref","unstructured":"L. Perotin, A. D\u00e9fossez, E. Vincent, R. Serizel, A. Gu\u00e9rin, Regression versus classification for neural network based audio source localization, in 2019 IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA), New Paltz, NY, USA (2019), pp. 343\u2013347","DOI":"10.1109\/WASPAA.2019.8937277"},{"key":"2921_CR28","doi-asserted-by":"crossref","unstructured":"L. Perotin, R. Serizel, E. Vincent, A. Gu\u00e9rin, CRNN-based joint azimuth and elevation localization with the ambisonics intensity vector, in International Workshop on Acoustic Signal Enhancement (2018), pp. 241\u2013245","DOI":"10.1109\/IWAENC.2018.8521403"},{"issue":"1","key":"2921_CR29","doi-asserted-by":"publisher","first-page":"135","DOI":"10.1109\/TSA.2004.839244","volume":"13","author":"B Rafaely","year":"2005","unstructured":"B. Rafaely, Analysis and design of spherical microphone arrays. IEEE Trans. Speech Audio Process. 13(1), 135\u2013143 (2005)","journal-title":"IEEE Trans. Speech Audio Process."},{"issue":"4","key":"2921_CR30","doi-asserted-by":"publisher","first-page":"2149","DOI":"10.1121\/1.1792643","volume":"116","author":"B Rafaely","year":"2004","unstructured":"B. Rafaely, Plane-wave decomposition of the pressure on a sphere by spherical convolution. J. Acoust. Soc. Am. 116(4), 2149\u20132157 (2004)","journal-title":"J. Acoust. Soc. Am."},{"issue":"7","key":"2921_CR31","doi-asserted-by":"publisher","first-page":"984","DOI":"10.1109\/29.32276","volume":"37","author":"R Roy","year":"1989","unstructured":"R. Roy, T. Kailath, ESPRIT-estimation of signal parameters via rotational invariance techniques. IEEE Trans. Acoust. Speech Signal Process. 37(7), 984\u2013995 (1989)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"issue":"2","key":"2921_CR32","doi-asserted-by":"publisher","first-page":"130","DOI":"10.23919\/JCIN.2020.9130429","volume":"5","author":"B Shi","year":"2020","unstructured":"B. Shi, X. Ma, W. Zhang, H. Shao, Q. Shi, J. Lin, Complex-valued convolutional neural networks design and its application on UAV DOA estimation in urban environments. J. Commun. Inf. Netw. 5(2), 130\u2013137 (2020)","journal-title":"J. Commun. Inf. Netw."},{"key":"2921_CR33","doi-asserted-by":"publisher","first-page":"2475","DOI":"10.1109\/TASLP.2022.3190723","volume":"30","author":"K SongGong","year":"2022","unstructured":"K. SongGong, W. Wang, H. Chen, Acoustic source localization in the circular harmonic domain using deep learning architecture. IEEE\/ACM Trans. Audio Speech Lang. Process. 30, 2475\u20132491 (2022)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"2921_CR34","doi-asserted-by":"crossref","unstructured":"H. Sun, H. Teutsch, E. Mabande, W. Kellermann, Robust localization of multiple sources in reverberant environments using EB-ESPRIT with spherical microphone arrays, in Proceedings of the IEEE International Conference on Acoustics, Speech, and Signal Processing (2011), pp. 117\u2013120","DOI":"10.1109\/ICASSP.2011.5946342"},{"key":"2921_CR35","doi-asserted-by":"crossref","unstructured":"Tang, Z., et al. Regression and classification for direction-of-arrival estimation with convolutional recurrent neural networks. Interspeech (2019)","DOI":"10.21437\/Interspeech.2019-1111"},{"issue":"9","key":"2921_CR36","doi-asserted-by":"publisher","first-page":"1727","DOI":"10.1109\/TNNLS.2014.2313869","volume":"25","author":"K Terabayashi","year":"2014","unstructured":"K. Terabayashi, R. Natsuaki, A. Hirose, Ultrawideband direction-of-arrival estimation using complex-valued spatiotemporal neural networks. IEEE Trans. Neural Netw. Learn. Syst. 25(9), 1727\u20131732 (2014)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"2921_CR37","unstructured":"The eigenmike microphone array (2013). http:\/\/www.mhacoustics.com\/"},{"issue":"12","key":"2921_CR38","doi-asserted-by":"publisher","first-page":"2054","DOI":"10.1109\/TASLP.2019.2939782","volume":"27","author":"V Varanasi","year":"2019","unstructured":"V. Varanasi, A. Agarwal, R.M. Hegde, Near-field acoustic source localization using spherical harmonic features. IEEE\/ACM Trans. Audio Speech Lang. Process. 27(12), 2054\u20132066 (2019)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"2921_CR39","doi-asserted-by":"publisher","first-page":"1248","DOI":"10.1109\/TASLP.2020.2984852","volume":"28","author":"V Varanasi","year":"2020","unstructured":"V. Varanasi, H. Gupta, R.M. Hegde, A deep learning framework for robust DOA estimation using spherical harmonic decomposition. IEEE\/ACM Trans. Audio Speech Lang. Process. 28, 1248\u20131259 (2020)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"21","key":"2921_CR40","doi-asserted-by":"publisher","first-page":"20828","DOI":"10.1109\/JSEN.2022.3207660","volume":"22","author":"L Wang","year":"2022","unstructured":"L. Wang, A. Cavallaro, Deep-learning-assisted sound source localization from a flying drone. IEEE Sens. J. 22(21), 20828\u201320838 (2022)","journal-title":"IEEE Sens. J."},{"issue":"5","key":"2921_CR41","doi-asserted-by":"publisher","first-page":"513","DOI":"10.1109\/LSP.2004.826501","volume":"11","author":"AJ Weiss","year":"2004","unstructured":"A.J. Weiss, Direct position determination of narrowband radio frequency transmitters. IEEE Signal Process. Lett. 11(5), 513\u2013516 (2004)","journal-title":"IEEE Signal Process. Lett."},{"key":"2921_CR42","volume-title":"Fourier Acoustics: Sound Radiation and Nearfield Acoustical Holography","author":"EG Williams","year":"1999","unstructured":"E.G. Williams, Fourier Acoustics: Sound Radiation and Nearfield Acoustical Holography (Academic Press, Cambridge, 1999)"},{"issue":"7","key":"2921_CR43","doi-asserted-by":"publisher","first-page":"6840","DOI":"10.1109\/JSEN.2022.3151768","volume":"22","author":"M-Y You","year":"2022","unstructured":"M.-Y. You, A unified two-dimensional direction finding approach for sensor arrays based on deep neural networks with inhomogeneous angle and frequency partition. IEEE Sens. J. 22(7), 6840\u20136850 (2022)","journal-title":"IEEE Sens. J."},{"key":"2921_CR44","doi-asserted-by":"crossref","unstructured":"S. Zhao, S. Ahmed, Y. Liang, K. Rupnow, D. Chen, D.L. Jones, A real-time 3D sound localization system with miniature microphone array for virtual reality, in Proceedings of the IEEE Conference on Industrial Electronics and Applications (ICIEA) (2012), pp. 1853\u20131857","DOI":"10.1109\/ICIEA.2012.6361029"},{"issue":"12","key":"2921_CR45","doi-asserted-by":"publisher","first-page":"20064","DOI":"10.1109\/JSEN.2024.3388154","volume":"24","author":"M Zhang","year":"2015","unstructured":"M. Zhang, Z. Quan, W. Wang, Z. Chen, X. Guo, Y. Li, ASMGCN: attention-based semantic-guided multistream graph convolution network for skeleton action recognition. IEEE Sens. J. 24(12), 20064\u201320075 (2015)","journal-title":"IEEE Sens. J."},{"key":"2921_CR46","doi-asserted-by":"crossref","unstructured":"X. Zhang, X. Zhou, M. Lin, J. Sun, ShuffleNet: an extremely efficient convolutional neural network for mobile devices, in Proceedings of IEEE Conference on Computer Vision and Pattern Recognition (2018), pp. 6848\u20136856","DOI":"10.1109\/CVPR.2018.00716"}],"container-title":["Circuits, Systems, and Signal Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-024-02921-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00034-024-02921-w\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-024-02921-w.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,3,17]],"date-time":"2025-03-17T19:27:48Z","timestamp":1742239668000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00034-024-02921-w"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,27]]},"references-count":46,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2025,3]]}},"alternative-id":["2921"],"URL":"https:\/\/doi.org\/10.1007\/s00034-024-02921-w","relation":{},"ISSN":["0278-081X","1531-5878"],"issn-type":[{"type":"print","value":"0278-081X"},{"type":"electronic","value":"1531-5878"}],"subject":[],"published":{"date-parts":[[2024,11,27]]},"assertion":[{"value":"3 February 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 November 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 November 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"27 November 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no known conflict to finterest that could have appeared to influence the work reported in this study.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"This manuscript is approved by all authors for publication.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent to Participate"}},{"value":"This article does not contain any studies with human participants or animals performed by any of the authors.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical Approval"}},{"value":"Informed consent was obtained from all individual participants included in the study.","order":5,"name":"Ethics","group":{"name":"EthicsHeading","label":"Informed Consent"}}]}}