{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T05:17:23Z","timestamp":1778822243844,"version":"3.51.4"},"reference-count":59,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2025,2,1]],"date-time":"2025-02-01T00:00:00Z","timestamp":1738368000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2025,2,1]],"date-time":"2025-02-01T00:00:00Z","timestamp":1738368000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100001659","name":"Deutsche Forschungsgemeinschaft","doi-asserted-by":"publisher","award":["352015383"],"award-info":[{"award-number":["352015383"]}],"id":[{"id":"10.13039\/501100001659","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100019559","name":"Carl von Ossietzky Universit\u00e4t Oldenburg","doi-asserted-by":"crossref","id":[{"id":"10.13039\/100019559","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J AUDIO SPEECH MUSIC PROC."],"abstract":"<jats:title>Abstract<\/jats:title>\n          <jats:p>Deep neural network-based direction of arrival (DOA) estimation systems often rely on spatial features as input to learn a mapping for estimating the DOA of multiple talkers. Aiming to improve the accuracy of multi-talker DOA estimation for binaural hearing aids with a known number of active talkers, we investigate the usage of periodicity features as a footprint of speech signals in combination with spatial features as input to a convolutional neural network (CNN). In particular, we propose a multi-talker DOA estimation system employing a two-stage CNN architecture that utilizes cross-power spectrum (CPS) phase as spatial features and an auditory-inspired periodicity feature called periodicity degree (PD) as spectral features. The two-stage CNN incorporates a PD feature reduction stage prior to the joint processing of PD and CPS phase features. We investigate different design choices for the CNN architecture, including varying temporal reduction strategies and spectro-temporal filtering approaches. The performance of the proposed system is evaluated in static source scenarios with 2\u20133 talkers in two reverberant environments under varying signal-to-noise ratios using recorded background noises. To evaluate the benefit of combining PD features with CPS phase features, we consider baseline systems that utilize either only CPS phase features or combine CPS phase and magnitude spectrogram features. Results show that combining PD and CPS phase features in the proposed system consistently improves DOA estimation accuracy across all conditions, outperforming the two baseline systems. Additionally, the PD feature reduction stage in the proposed system improves DOA estimation accuracy while significantly reducing computational complexity compared to a baseline system without this stage, demonstrating its effectiveness for multi-talker DOA estimation.<\/jats:p>","DOI":"10.1186\/s13636-025-00392-8","type":"journal-article","created":{"date-parts":[[2025,2,1]],"date-time":"2025-02-01T09:25:11Z","timestamp":1738401911000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Improving multi-talker binaural DOA estimation by combining periodicity and spatial features in convolutional neural networks"],"prefix":"10.1186","volume":"2025","author":[{"ORCID":"https:\/\/orcid.org\/0009-0009-0076-2148","authenticated-orcid":false,"given":"Reza","family":"Varzandeh","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Simon","family":"Doclo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Volker","family":"Hohmann","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,2,1]]},"reference":[{"issue":"4","key":"392_CR1","doi-asserted-by":"publisher","first-page":"692","DOI":"10.1109\/TASLP.2016.2647702","volume":"25","author":"S Gannot","year":"2017","unstructured":"S. Gannot, E. Vincent, S. Markovich-Golan, A. Ozerov, A consolidated perspective on multimicrophone speech enhancement and source separation. IEEE\/ACM Trans. Audio Speech Lang. Process. 25(4), 692\u2013730 (2017)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"2","key":"392_CR2","doi-asserted-by":"publisher","first-page":"18","DOI":"10.1109\/MSP.2014.2366780","volume":"32","author":"S Doclo","year":"2015","unstructured":"S. Doclo, W. Kellermann, S. Makino, S.E. Nordholm, Multichannel signal enhancement algorithms for assisted listening devices: Exploiting spatial diversity using multiple microphones. IEEE Signal Process. Mag. 32(2), 18\u201330 (2015)","journal-title":"IEEE Signal Process. Mag."},{"key":"392_CR3","unstructured":"D. Wang, G.J. Brown, Computational auditory scene analysis: Principles, algorithms, and applications (Wiley-IEEE press, New Jersey, 2006)"},{"key":"392_CR4","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-37762-4","volume-title":"The technology of binaural listening","author":"J Blauert","year":"2013","unstructured":"J. Blauert, The technology of binaural listening (Springer-Verlag, Germany, 2013)"},{"key":"392_CR5","first-page":"397","volume-title":"Binaural Localization and Detection of Speakers in Complex Acoustic Scenes","author":"T May","year":"2013","unstructured":"T. May, S. van de Par, A. Kohlrausch, Binaural localization and detection of speakers in complex acoustic scenes (Springer-Verlag, Germany, 2013), pp.397\u2013425"},{"issue":"1","key":"392_CR6","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TASL.2010.2042128","volume":"19","author":"T May","year":"2011","unstructured":"T. May, S. van de Par, A. Kohlrausch, A probabilistic model for robust localization based on a binaural auditory front-end. IEEE Trans. Audio Speech Lang. Process. 19(1), 1\u201313 (2011)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"4","key":"392_CR7","doi-asserted-by":"publisher","first-page":"320","DOI":"10.1109\/TASSP.1976.1162830","volume":"24","author":"C Knapp","year":"1976","unstructured":"C. Knapp, G. Carter, The generalized correlation method for estimation of time delay. IEEE Trans. Acoust. Speech Signal Process. 24(4), 320\u2013327 (1976)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"issue":"1","key":"392_CR8","doi-asserted-by":"publisher","first-page":"68","DOI":"10.1109\/TASL.2009.2023644","volume":"18","author":"M Raspaud","year":"2010","unstructured":"M. Raspaud, H. Viste, G. Evangelista, Binaural source localization by joint estimation of ILD and ITD. IEEE Trans. Audio Speech Lang. Process. 18(1), 68\u201377 (2010)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"5","key":"392_CR9","doi-asserted-by":"publisher","first-page":"592","DOI":"10.1016\/j.specom.2010.05.006","volume":"53","author":"M Dietz","year":"2011","unstructured":"M. Dietz, S.D. Ewert, V. Hohmann, Auditory model based direction estimation of concurrent speakers from binaural signals. Speech Commun. 53(5), 592\u2013605 (2011)","journal-title":"Speech Commun."},{"key":"392_CR10","doi-asserted-by":"crossref","unstructured":"S. Braun, W. Zhou, E.A.P. Habets, Narrowband direction-of-arrival estimation for binaural hearing aids using relative transfer functions. in Proc. IEEE Workshop on Applications of Signal Processing to Audio and Acoustics (WASPAA) (IEEE, New Paltz, 2015), pp. 1\u20135","DOI":"10.1109\/WASPAA.2015.7336917"},{"issue":"7","key":"392_CR11","doi-asserted-by":"publisher","first-page":"1275","DOI":"10.1109\/TASLP.2018.2825110","volume":"26","author":"M Farmani","year":"2018","unstructured":"M. Farmani, M.S. Pedersen, Z. Tan, J. Jensen, Bias-compensated informed sound source localization using relative transfer functions. IEEE\/ACM Trans. Audio Speech Lang. Process. 26(7), 1275\u20131289 (2018)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"392_CR12","doi-asserted-by":"crossref","unstructured":"D. Fejgin, S. Doclo, Assisted RTF-vector-based binaural direction of arrival estimation exploiting a calibrated external microphone array. in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (IEEE, Rhodes Island, 2023), pp. 1\u20135","DOI":"10.1109\/ICASSP49357.2023.10095634"},{"issue":"1","key":"392_CR13","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1121\/10.0011809","volume":"152","author":"PA Grumiaux","year":"2022","unstructured":"P.A. Grumiaux, S. Kiti\u0107, L. Girin, A. Gu\u00e9rin, A survey of sound source localization with deep learning methods. J. Acoust. Soc. Am. 152(1), 107\u2013151 (2022)","journal-title":"J. Acoust. Soc. Am."},{"issue":"12","key":"392_CR14","doi-asserted-by":"publisher","first-page":"2444","DOI":"10.1109\/TASLP.2017.2750760","volume":"25","author":"N Ma","year":"2017","unstructured":"N. Ma, T. May, G.J. Brown, Exploiting deep neural networks and head movements for robust binaural localization of multiple sources in reverberant environments. IEEE\/ACM Trans. Audio Speech Lang. Process. 25(12), 2444\u20132453 (2017)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"1","key":"392_CR15","doi-asserted-by":"publisher","first-page":"8","DOI":"10.1109\/JSTSP.2019.2901664","volume":"13","author":"S Chakrabarty","year":"2019","unstructured":"S. Chakrabarty, E.A.P. Habets, Multi-speaker DOA estimation using deep convolutional networks trained with noise signals. IEEE J. Sel. Top. Signal Process. 13(1), 8\u201321 (2019)","journal-title":"IEEE J. Sel. Top. Signal Process."},{"key":"392_CR16","doi-asserted-by":"crossref","unstructured":"S. Adavanne, A. Politis, T. Virtanen, Direction of arrival estimation for multiple sound sources using convolutional recurrent neural network, in 2018 26th European Signal Processing Conference (EUSIPCO) (IEEE, Rome, 2018), pp. 1462\u20131466","DOI":"10.23919\/EUSIPCO.2018.8553182"},{"key":"392_CR17","doi-asserted-by":"crossref","unstructured":"W. He, P. Motlicek, J. Odobez, Deep neural networks for multiple speaker detection and localization. in Proc. IEEE International Conference on Robotics and Automation (ICRA) (IEEE, Brisbane, 2018), pp. 74\u201379","DOI":"10.1109\/ICRA.2018.8461267"},{"issue":"1","key":"392_CR18","doi-asserted-by":"publisher","first-page":"178","DOI":"10.1109\/TASLP.2018.2876169","volume":"27","author":"ZQ Wang","year":"2019","unstructured":"Z.Q. Wang, X. Zhang, D. Wang, Robust speaker localization guided by deep learning-based time-frequency masking. IEEE\/ACM Trans. Audio Speech Lang. Process. 27(1), 178\u2013188 (2019)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"392_CR19","doi-asserted-by":"crossref","unstructured":"P. Vecchiotti, N. Ma, S. Squartini, G.J. Brown, End-to-end binaural sound localisation from the raw waveform. in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (IEEE, Brighton, 2019), pp. 451\u2013455","DOI":"10.1109\/ICASSP.2019.8683732"},{"key":"392_CR20","doi-asserted-by":"publisher","first-page":"40725","DOI":"10.1109\/ACCESS.2019.2905617","volume":"7","author":"C Pang","year":"2019","unstructured":"C. Pang, H. Liu, X. Li, Multitask learning of time-frequency CNN for sound source localization. IEEE Access 7, 40725\u201340737 (2019)","journal-title":"IEEE Access"},{"issue":"1","key":"392_CR21","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/s13636-020-0171-y","volume":"2020","author":"J Wang","year":"2020","unstructured":"J. Wang, J. Wang, K. Qian, X. Xie, J. Kuang, Binaural sound localization based on deep neural network and affinity propagation clustering in mismatched HRTF condition. EURASIP J. Audio Speech Music Process. 2020(1), 1\u201316 (2020)","journal-title":"EURASIP J. Audio Speech Music Process."},{"issue":"4","key":"392_CR22","doi-asserted-by":"publisher","first-page":"2625","DOI":"10.1121\/10.0001155","volume":"147","author":"J Ding","year":"2020","unstructured":"J. Ding, Y. Ke, L. Cheng, C. Zheng, X. Li, Joint estimation of binaural distance and azimuth by exploiting deep neural networks. J. Acoust. Soc. Am. 147(4), 2625\u20132635 (2020)","journal-title":"J. Acoust. Soc. Am."},{"key":"392_CR23","doi-asserted-by":"crossref","unstructured":"L. Wang, Z. Jiao, Q. Zhao, J. Zhu, Y. Fu, Framewise multiple sound source localization and counting using binaural spatial audio signals. in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (IEEE, Rhodes Island, 2023), pp. 1\u20135","DOI":"10.1109\/ICASSP49357.2023.10096463"},{"issue":"1","key":"392_CR24","doi-asserted-by":"publisher","first-page":"359","DOI":"10.1109\/TMC.2022.3222821","volume":"23","author":"Q Yang","year":"2024","unstructured":"Q. Yang, Y. Zheng, Deepear: Sound localization with binaural microphones. IEEE Trans. Mob. Comput. 23(1), 359\u2013375 (2024)","journal-title":"IEEE Trans. Mob. Comput."},{"key":"392_CR25","doi-asserted-by":"publisher","first-page":"3491","DOI":"10.1109\/TASLP.2021.3120641","volume":"29","author":"B Yang","year":"2021","unstructured":"B. Yang, H. Liu, X. Li, Learning deep direct-path relative transfer function for binaural sound source localization. IEEE\/ACM Trans. Audio Speech Lang. Process. 29, 3491\u20133503 (2021)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"1","key":"392_CR26","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/s13636-021-00203-w","volume":"2021","author":"H Hammer","year":"2021","unstructured":"H. Hammer, S.E. Chazan, J. Goldberger, S. Gannot, Dynamically localizing multiple speakers based on the time-frequency domain. EURASIP J. Audio Speech Music Process. 2021(1), 1\u201310 (2021)","journal-title":"EURASIP J. Audio Speech Music Process."},{"key":"392_CR27","doi-asserted-by":"publisher","first-page":"1652","DOI":"10.1109\/TASLP.2023.3268734","volume":"31","author":"P Goli","year":"2023","unstructured":"P. Goli, S. van de Par, Deep learning-based speech specific source localization by using binaural and monaural microphone arrays in hearing aids. IEEE\/ACM Trans. Audio Speech Lang. Process. 31, 1652\u20131666 (2023)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"392_CR28","doi-asserted-by":"publisher","first-page":"101360","DOI":"10.1016\/j.csl.2022.101360","volume":"75","author":"AS Subramanian","year":"2022","unstructured":"A.S. Subramanian, C. Weng, S. Watanabe, M. Yu, D. Yu, Deep learning based multi-source localization with source splitting and its effectiveness in multi-talker speech recognition. Comput. Speech Lang. 75, 101360 (2022)","journal-title":"Comput. Speech Lang."},{"key":"392_CR29","doi-asserted-by":"publisher","first-page":"1594","DOI":"10.1109\/TASLP.2021.3067113","volume":"29","author":"A Bohlender","year":"2021","unstructured":"A. Bohlender, A. Spriet, W. Tirry, N. Madhu, Exploiting temporal context in CNN based multisource DOA estimation. IEEE\/ACM Trans. Audio Speech Lang. Process. 29, 1594\u20131608 (2021)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"key":"392_CR30","unstructured":"P. Cooreman, A. Bohlender, N. Madhu, CRNN-based multi-DOA estimator: Comparing classification and regression. in Speech Communication; 15th ITG Conference (VDE, Aachen, 2023), pp. 156\u2013160"},{"key":"392_CR31","doi-asserted-by":"crossref","unstructured":"H. Sundar, W. Wang, M. Sun, C. Wang, Raw waveform based end-to-end deep convolutional network for spatial localization of multiple acoustic sources. in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (IEEE, Barcelona, 2020), pp. 4642\u20134646","DOI":"10.1109\/ICASSP40776.2020.9054090"},{"key":"392_CR32","doi-asserted-by":"crossref","unstructured":"X. Xiao, S. Zhao, X. Zhong, D.L. Jones, E.S. Chng, H. Li, A learning-based approach to direction of arrival estimation in noisy and reverberant environments. in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (IEEE, South Brisbane, 2015), pp. 2814\u20132818","DOI":"10.1109\/ICASSP.2015.7178484"},{"key":"392_CR33","doi-asserted-by":"crossref","unstructured":"F.B. Gelderblom, Y. Liu, J. Kvam, T.A. Myrvoll, Synthetic data for DNN-based DOA estimation of indoor speech. in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (IEEE, Toronto, 2021), pp. 4390\u20134394","DOI":"10.1109\/ICASSP39728.2021.9414415"},{"key":"392_CR34","unstructured":"R. Roden, N. Moritz, S. Gerlach, S. Weinzierl, S. Goetze, On sound source localization of speech signals using deep neural networks. in Deutsche Jahrestagung Akustik (DAGA) (DEGA, Nuremberg, 2015), pp. 1510\u20131513"},{"issue":"8","key":"392_CR35","doi-asserted-by":"publisher","first-page":"1335","DOI":"10.1109\/TASLP.2019.2919378","volume":"27","author":"J Pak","year":"2019","unstructured":"J. Pak, J.W. Shin, Sound localization based on phase difference enhancement using deep neural networks. IEEE\/ACM Trans. Audio Speech Lang. Process. 27(8), 1335\u20131345 (2019)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"2","key":"392_CR36","doi-asserted-by":"publisher","first-page":"71","DOI":"10.1007\/s42401-019-00026-w","volume":"2","author":"W Ma","year":"2019","unstructured":"W. Ma, X. Liu, Phased microphone array for sound source localization with deep learning. Aerosp. Syst. 2(2), 71\u201381 (2019)","journal-title":"Aerosp. Syst."},{"key":"392_CR37","doi-asserted-by":"crossref","unstructured":"R. Varzandeh, S. Doclo, V. Hohmann, A two-stage CNN with feature reduction for speech-aware binaural DOA estimation. in 2023 31st European Signal Processing Conference (EUSIPCO) (IEEE, Helsinki, 2023), pp. 241\u2013245","DOI":"10.23919\/EUSIPCO58844.2023.10290054"},{"key":"392_CR38","doi-asserted-by":"crossref","unstructured":"R. Varzandeh, S. Doclo, V. Hohmann, Speech-aware binaural DOA estimation utilizing periodicity and spatial features in convolutional neural networks. IEEE\/ACM Trans. Audio Speech Lang. Process. 32, 1198\u20131213 (2024)","DOI":"10.1109\/TASLP.2024.3356987"},{"key":"392_CR39","doi-asserted-by":"crossref","unstructured":"R. Varzandeh, K. Adilo\u011flu, S. Doclo, V. Hohmann, Exploiting periodicity features for joint detection and DOA estimation of speech sources using convolutional neural networks. in Proc. IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) (IEEE, Barcelona, 2020), pp. 566\u2013570","DOI":"10.1109\/ICASSP40776.2020.9054754"},{"key":"392_CR40","doi-asserted-by":"crossref","unstructured":"R. Gu, S.X. Zhang, M. Yu, D. Yu, 3D spatial features for multi-channel target speech separation. in Proc. IEEE Automatic Speech Recognition and Understanding Workshop (ASRU) (IEEE, Cartagena, 2021), pp. 996\u20131002","DOI":"10.1109\/ASRU51503.2021.9688198"},{"key":"392_CR41","doi-asserted-by":"publisher","first-page":"996","DOI":"10.1109\/TASLP.2023.3346297","volume":"32","author":"DA Krause","year":"2024","unstructured":"D.A. Krause, G. Garc\u00eda-Barrios, A. Politis, A. Mesaros, Binaural sound source distance estimation and localization for a moving listener. IEEE\/ACM Trans. Audio Speech Lang. Process. 32, 996\u20131011 (2024)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"5","key":"392_CR42","doi-asserted-by":"publisher","first-page":"1503","DOI":"10.1109\/TASL.2012.2183869","volume":"20","author":"J Woodruff","year":"2012","unstructured":"J. Woodruff, D. Wang, Binaural localization of multiple sources in reverberant and noisy environments. IEEE Trans. Audio Speech Lang. Process. 20(5), 1503\u20131512 (2012)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"issue":"1","key":"392_CR43","doi-asserted-by":"publisher","first-page":"35","DOI":"10.1121\/1.4990375","volume":"142","author":"A Josupeit","year":"2017","unstructured":"A. Josupeit, V. Hohmann, Modeling speech localization, talker identification, and word recognition in a multi-talker setting. J. Acoust. Soc. Am. 142(1), 35\u201354 (2017)","journal-title":"J. Acoust. Soc. Am."},{"issue":"1","key":"392_CR44","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1038\/s41467-018-04551-8","volume":"9","author":"S Popham","year":"2018","unstructured":"S. Popham, D. Boebinger, D.P. Ellis, H. Kawahara, J.H. McDermott, Inharmonic speech reveals the role of harmonicity in the cocktail party problem. Nat. Commun. 9(1), 1\u201313 (2018)","journal-title":"Nat. Commun."},{"issue":"11","key":"392_CR45","first-page":"1904","volume":"23","author":"Z Chen","year":"2015","unstructured":"Z. Chen, V. Hohmann, Online monaural speech enhancement based on periodicity analysis and a priori SNR estimation. IEEE\/ACM Trans. Audio Speech Lang. Process. 23(11), 1904\u20131916 (2015)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"5","key":"392_CR46","doi-asserted-by":"publisher","first-page":"2911","DOI":"10.1121\/1.4950699","volume":"139","author":"A Josupeit","year":"2016","unstructured":"A. Josupeit, N. Kop\u010do, V. Hohmann, Modeling of speech localization in a multi-talker mixture using periodicity and energy-based auditory features. J. Acoust. Soc. Am. 139(5), 2911\u20132923 (2016)","journal-title":"J. Acoust. Soc. Am."},{"issue":"2","key":"392_CR47","doi-asserted-by":"publisher","first-page":"712","DOI":"10.1121\/10.0009337","volume":"151","author":"J Luberadzka","year":"2022","unstructured":"J. Luberadzka, H. Kayser, V. Hohmann, Making sense of periodicity glimpses in a prediction-update-loop-A computational model of attentive voice tracking. J. Acoust. Soc. Am. 151(2), 712\u2013737 (2022)","journal-title":"J. Acoust. Soc. Am."},{"key":"392_CR48","doi-asserted-by":"publisher","first-page":"101363","DOI":"10.1016\/j.csl.2022.101363","volume":"75","author":"W Mack","year":"2022","unstructured":"W. Mack, J. Wechsler, E.A. Habets, Signal-aware direction-of-arrival estimation using attention mechanisms. Comput. Speech Lang. 75, 101363 (2022)","journal-title":"Comput. Speech Lang."},{"key":"392_CR49","unstructured":"J.O. Smith, X. Serra, PARSHL: An analysis\/synthesis program for non-harmonic sounds based on a sinusoidal representation. in Proc. International Computer Music Conference (ICMC) (Michigan Publishing, Champaign\/Urbana, 1987), pp. 290\u2013297"},{"key":"392_CR50","unstructured":"J.L. Ba, J.R. Kiros, G.E. Hinton, Layer normalization. 2016. arXiv\u00a0preprint\u00a0arXiv:1607.06450"},{"key":"392_CR51","doi-asserted-by":"crossref","unstructured":"C. Szegedy, W. Liu, Y. Jia, P. Sermanet, S. Reed, D. Anguelov, D. Erhan, V. Vanhoucke, A. Rabinovich, Going deeper with convolutions. in Proc. IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (IEEE, Boston, 2015), pp. 1\u20139","DOI":"10.1109\/CVPR.2015.7298594"},{"issue":"7","key":"392_CR52","doi-asserted-by":"publisher","first-page":"1830","DOI":"10.1109\/TSP.2004.828896","volume":"52","author":"O Yilmaz","year":"2004","unstructured":"O. Yilmaz, S. Rickard, Blind separation of speech mixtures via time-frequency masking. IEEE Trans. Signal Process. 52(7), 1830\u20131847 (2004)","journal-title":"IEEE Trans. Signal Process."},{"key":"392_CR53","unstructured":"J.S. Garofolo, L.F. Lamel, W.M. Fisher, J.G. Fiscus, D.S. Pallett, N.L. Dahlgren, V. Zue, TIMIT acoustic-phonetic continuous speech corpus. LDC93S1, Linguist. Data Consortium (1993)"},{"issue":"1","key":"392_CR54","doi-asserted-by":"publisher","first-page":"298605","DOI":"10.1155\/2009\/298605","volume":"2009","author":"H Kayser","year":"2009","unstructured":"H. Kayser, S.D. Ewert, J. Anem\u00fcller, T. Rohdenburg, V. Hohmann, B. Kollmeier, Database of multichannel in-ear and behind-the-ear head-related and binaural room impulse responses. EURASIP J. Adv. Signal Process. 2009(1), 298605 (2009)","journal-title":"EURASIP J. Adv. Signal Process."},{"issue":"3","key":"392_CR55","doi-asserted-by":"publisher","first-page":"148","DOI":"10.3109\/00206090109073110","volume":"40","author":"WA Dreschler","year":"2001","unstructured":"W.A. Dreschler, H. Verschuure, C. Ludvigsen, S. Westermann, ICRA noises: Artificial noise signals with speech-like spectral and temporal properties for hearing instrument assessment. Audiology 40(3), 148\u2013157 (2001)","journal-title":"Audiology"},{"key":"392_CR56","unstructured":"A. Paszke, S. Gross, F. Massa, A. Lerer, J. Bradbury, G. Chanan, T. Killeen, Z. Lin, N. Gimelshein, L. Antiga, A. Desmaison, A. Kopf, E. Yang, Z. DeVito, M. Raison, A. Tejani, S. Chilamkurthy, B. Steiner, L. Fang, J. Bai, S. Chintala, PyTorch: An imperative style, high-performance deep learning library. in Proc. Advances in Neural Information Processing Systems (NeurIPS), vol. 32 (Curran Associates, Vancouver, 2019), pp. 8026\u20138037"},{"key":"392_CR57","unstructured":"D.P. Kingma, J. Ba, Adam: A method for stochastic optimization. in Proc. International Conference on Learning Representations (ICLR) (San Diego, 2015)"},{"issue":"1\u20132","key":"392_CR58","doi-asserted-by":"publisher","first-page":"83","DOI":"10.1002\/nav.3800020109","volume":"2","author":"HW Kuhn","year":"1955","unstructured":"H.W. Kuhn, The Hungarian method for the assignment problem. Nav. Res. Logist. Q. 2(1\u20132), 83\u201397 (1955)","journal-title":"Nav. Res. Logist. Q."},{"key":"392_CR59","doi-asserted-by":"publisher","first-page":"1620","DOI":"10.1109\/TASLP.2020.2990485","volume":"28","author":"C Evers","year":"2020","unstructured":"C. Evers, H.W. L\u00f6llmann, H. Mellmann, A. Schmidt, H. Barfuss, P.A. Naylor, W. Kellermann, The LOCATA challenge: Acoustic source localization and tracking. IEEE\/ACM Trans. Audio Speech Lang. Process. 28, 1620\u20131643 (2020)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."}],"container-title":["EURASIP Journal on Audio, Speech, and Music Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-025-00392-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1186\/s13636-025-00392-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-025-00392-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,1]],"date-time":"2025-02-01T09:25:27Z","timestamp":1738401927000},"score":1,"resource":{"primary":{"URL":"https:\/\/asmp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13636-025-00392-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,2,1]]},"references-count":59,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2025,12]]}},"alternative-id":["392"],"URL":"https:\/\/doi.org\/10.1186\/s13636-025-00392-8","relation":{},"ISSN":["1687-4722"],"issn-type":[{"value":"1687-4722","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,2,1]]},"assertion":[{"value":"30 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 January 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 February 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"5"}}