{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T16:11:53Z","timestamp":1783181513309,"version":"3.54.6"},"reference-count":43,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2024,10,8]],"date-time":"2024-10-08T00:00:00Z","timestamp":1728345600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2024,10,8]],"date-time":"2024-10-08T00:00:00Z","timestamp":1728345600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"name":"JSPS KAKENHI","award":["23H0342"],"award-info":[{"award-number":["23H0342"]}]},{"name":"JST SPRING","award":["JPMJSP2128"],"award-info":[{"award-number":["JPMJSP2128"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J AUDIO SPEECH MUSIC PROC."],"abstract":"<jats:title>Abstract<\/jats:title><jats:p>This paper proposes novel\u00a0methods for extracting a single Speech signal of Interest (SOI) from a multichannel observed signal in underdetermined situations, i.e., when the observed signal contains more speech signals than microphones. It focuses on extracting the SOI using prior knowledge of the SOI\u2019s Direction of Arrival (DOA). Conventional beamformers (BFs) and Blind Source Separation (BSS) with spatial regularization struggle to suppress interference speech signals in such situations. Although Switching Minimum Power Distortionless Response BF (Sw-MPDR) can handle underdetermined situations using a switching mechanism, its estimation accuracy significantly decreases when it relies on a steering vector determined by the SOI\u2019s DOA. Spatially-Regularized Independent Vector Extraction (SRIVE) can robustly enhance the SOI based solely on its DOA using spatial regularization, but its performance degrades in underdetermined situations. This paper extends these conventional methods to overcome their limitations. First, we introduce a time-varying Gaussian (TVG) source model to Sw-MPDR to effectively enhance the SOI based solely on the DOA. Second, we introduce the switching mechanism to SRIVE to improve its speech enhancement performance in underdetermined situations. These two proposed methods are called Switching weighted MPDR (Sw-wMPDR) and Switching SRIVE (Sw-SRIVE). We experimentally demonstrate that both surpass conventional methods in enhancing the SOI using the DOA in underdetermined situations.<\/jats:p>","DOI":"10.1186\/s13636-024-00373-3","type":"journal-article","created":{"date-parts":[[2024,10,8]],"date-time":"2024-10-08T08:02:46Z","timestamp":1728374566000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["DOA-informed switching independent vector extraction and beamforming for speech enhancement in underdetermined situations"],"prefix":"10.1186","volume":"2024","author":[{"ORCID":"https:\/\/orcid.org\/0009-0007-0158-6356","authenticated-orcid":false,"given":"Tetsuya","family":"Ueda","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tomohiro","family":"Nakatani","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rintaro","family":"Ikeshita","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shoko","family":"Araki","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shoji","family":"Makino","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,10,8]]},"reference":[{"issue":"8","key":"373_CR1","doi-asserted-by":"publisher","first-page":"926","DOI":"10.1109\/PROC.1972.8817","volume":"60","author":"OL Frost","year":"1972","unstructured":"O.L. Frost, An algorithm for linearly constrained adaptive array processing. Proc. IEEE 60(8), 926\u2013935 (1972)","journal-title":"Proc. IEEE"},{"issue":"2","key":"373_CR2","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1109\/53.665","volume":"5","author":"BD Van Veen","year":"1988","unstructured":"B.D. Van Veen, K.M. Buckley, Beamforming: a versatile approach to spatial filtering. IEEE ASSP Mag. 5(2), 4\u201324 (1988)","journal-title":"IEEE ASSP Mag."},{"issue":"6","key":"373_CR3","doi-asserted-by":"publisher","first-page":"352","DOI":"10.1109\/TSA.2002.803443","volume":"10","author":"LC Parra","year":"2002","unstructured":"L.C. Parra, C.V. Alvino, Geometric source separation: merging convolutive source separation with geometric beamforming. IEEE Trans. Speech Audio Process. 10(6), 352\u2013362 (2002)","journal-title":"IEEE Trans. Speech Audio Process."},{"key":"373_CR4","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1155\/S1110865704402303","volume":"2004","author":"F Asano","year":"2004","unstructured":"F. Asano, K. Yamamoto, I. Hara, J. Ogata, T. Yoshimura, Y. Motomura, N. Ichimura, H. Asoh, Detection and separation of speech event using audio and video information fusion and its application to robust speech interface. EURASIP J. Adv. Signal Process. 2004, 1\u201312 (2004)","journal-title":"EURASIP J. Adv. Signal Process."},{"key":"373_CR5","doi-asserted-by":"crossref","unstructured":"K. Yamaoka, A. Brendel, N. Ono, S. Makino, M. Buerger, T. Yamada, W. Kellermann, in Proc. EUSIPCO. Time-frequencybin-wise beamformer selection and masking for speech enhancement in underdetermined noisy scenarios (IEEE, Piscataway, 2018), pp. 1582\u20131586","DOI":"10.23919\/EUSIPCO.2018.8553299"},{"key":"373_CR6","first-page":"3461","volume":"29","author":"K Yamaoka","year":"2021","unstructured":"K. Yamaoka, N. Ono, S. Makino, Time-frequency-bin-wise linear combination of beamformers for distortionless signal enhancement. IEEE\/ACM Trans. ASLP 29, 3461\u20133475 (2021)","journal-title":"IEEE\/ACM Trans. ASLP"},{"key":"373_CR7","doi-asserted-by":"publisher","first-page":"399","DOI":"10.1109\/LSP.2021.3056279","volume":"28","author":"R Ikeshita","year":"2021","unstructured":"R. Ikeshita, N. Kamo, T. Nakatani, Blind signal dereverberation based on mixture of weighted prediction error models. IEEE Signal Process. Lett. 28, 399\u2013403 (2021)","journal-title":"IEEE Signal Process. Lett."},{"key":"373_CR8","doi-asserted-by":"publisher","first-page":"1580","DOI":"10.1109\/LSP.2021.3099715","volume":"28","author":"R Ikeshita","year":"2021","unstructured":"R. Ikeshita, K. Kinoshita, N. Kamo, T. Nakatani, Online speech dereverberation using mixture of multichannel linear prediction models. IEEE Signal Process. Lett. 28, 1580\u20131584 (2021)","journal-title":"IEEE Signal Process. Lett."},{"key":"373_CR9","first-page":"1032","volume":"30","author":"T Nakatani","year":"2022","unstructured":"T. Nakatani, R. Ikeshita, K. Kinoshita, H. Sawada, N. Kamo, S. Araki, Switching independent vector analysis and its extension to blind and spatially guided convolutional beamforming algorithms. IEEE\/ACM Trans. ASLP 30, 1032\u20131047 (2022)","journal-title":"IEEE\/ACM Trans. ASLP"},{"key":"373_CR10","unstructured":"T. Nakatani, R. Ikeshita, K. Kinoshita, H. Sawada, N. Kamo, S. Araki, in Proc. ICA. Switching independent vector extraction and its joint optimization with weighted prediction error dereverberation (Springer, Cham, 2022)"},{"issue":"6","key":"373_CR11","doi-asserted-by":"publisher","first-page":"903","DOI":"10.1109\/LSP.2019.2911179","volume":"26","author":"T Nakatani","year":"2019","unstructured":"T. Nakatani, K. Kinoshita, A unified convolutional beamformer for simultaneous denoising and dereverberation. IEEE Signal Process. Lett. 26(6), 903\u2013907 (2019)","journal-title":"IEEE Signal Process. Lett."},{"issue":"9","key":"373_CR12","doi-asserted-by":"publisher","first-page":"1398","DOI":"10.1109\/LSP.2019.2932848","volume":"26","author":"BJ Cho","year":"2019","unstructured":"B.J. Cho, J.M. Lee, H.M. Park, A beamforming algorithm based on maximum likelihood of a complex Gaussian distribution with time-varying variances for robust speech recognition. IEEE Signal Process. Lett. 26(9), 1398\u20131402 (2019)","journal-title":"IEEE Signal Process. Lett."},{"key":"373_CR13","doi-asserted-by":"crossref","unstructured":"C. Boeddeker, T. Nakatani, K. Kinoshita, R. Haeb-Umbach, in Proc. ICASSP. Jointly optimal dereverberation and beamforming (IEEE, Piscataway, 2020), pp. 216\u2013220","DOI":"10.1109\/ICASSP40776.2020.9054393"},{"issue":"4\u20135","key":"373_CR14","doi-asserted-by":"publisher","first-page":"411","DOI":"10.1016\/S0893-6080(00)00026-5","volume":"13","author":"A Hyv\u00e4rinen","year":"2000","unstructured":"A. Hyv\u00e4rinen, E. Oja, Independent component analysis: algorithms and applications. Neural Netw. 13(4\u20135), 411\u2013430 (2000)","journal-title":"Neural Netw."},{"issue":"1","key":"373_CR15","first-page":"70","volume":"15","author":"T Kim","year":"2007","unstructured":"T. Kim, H.T. Attias, S.Y. Lee, T.W. Lee, Blind source separation exploiting higher-order frequency dependencies. IEEE Trans. ASLP 15(1), 70\u201379 (2007)","journal-title":"IEEE Trans. ASLP"},{"key":"373_CR16","doi-asserted-by":"crossref","unstructured":"A. Hiroe, in Proc. ICA. Solution of permutation problem in frequency domain ICA, using multivariate probability density functions (Springer, Cham, 2006), pp. 601\u2013608","DOI":"10.1007\/11679363_75"},{"key":"373_CR17","doi-asserted-by":"crossref","unstructured":"N. Ono, S. Miyabe, in Proc. LVA\/ICA. Auxiliary-function-based independent component analysis for super-Gaussian sources (Springer, Cham, 2010), pp. 165\u2013172","DOI":"10.1007\/978-3-642-15995-4_21"},{"issue":"4","key":"373_CR18","doi-asserted-by":"publisher","first-page":"1050","DOI":"10.1109\/TSP.2018.2887185","volume":"67","author":"Z Koldovsky","year":"2018","unstructured":"Z. Koldovsky, P. Tichavsky, Gradient algorithms for complex non-Gaussian independent component\/vector extraction, question of convergence. IEEE Trans. Signal Process. 67(4), 1050\u20131064 (2018)","journal-title":"IEEE Trans. Signal Process."},{"key":"373_CR19","doi-asserted-by":"crossref","unstructured":"R. Scheibler, N. Ono, in Proc. WASPAA. Independent vector analysis with more microphones than sources (IEEE, Piscataway, 2019), pp. 185\u2013189","DOI":"10.1109\/WASPAA.2019.8937080"},{"key":"373_CR20","doi-asserted-by":"publisher","first-page":"3252","DOI":"10.1109\/TSP.2021.3076884","volume":"69","author":"R Ikeshita","year":"2021","unstructured":"R. Ikeshita, T. Nakatani, S. Araki, Block coordinate descent algorithms for auxiliary-function-based independent vector extraction. IEEE Trans. Signal Process. 69, 3252\u20133267 (2021)","journal-title":"IEEE Trans. Signal Process."},{"key":"373_CR21","doi-asserted-by":"crossref","unstructured":"A.H. Khan, M. Taseska, E.A. Habets, in Proc. LVA\/ICA. A geometrically constrained independent vector analysis algorithm for online source extraction (Springer, Cham, 2015), pp. 396\u2013403","DOI":"10.1007\/978-3-319-22482-4_46"},{"key":"373_CR22","doi-asserted-by":"crossref","unstructured":"L. Li, K. Koishida, in Proc. ICASSP. Geometrically constrained independent vector analysis for directional speech enhancement (IEEE, Piscataway, 2020), pp. 846\u2013850","DOI":"10.1109\/ICASSP40776.2020.9053649"},{"key":"373_CR23","doi-asserted-by":"publisher","first-page":"3545","DOI":"10.1109\/TSP.2020.3000199","volume":"68","author":"A Brendel","year":"2020","unstructured":"A. Brendel, T. Haubner, W. Kellermann, A unified probabilistic view on spatially informed source separation and extraction based on independent vector analysis. IEEE Trans. Signal Process. 68, 3545\u20133558 (2020)","journal-title":"IEEE Trans. Signal Process."},{"key":"373_CR24","doi-asserted-by":"crossref","unstructured":"K. Goto, T. Ueda, L. Li, T. Yamada, S. Makino, in Proc. EUSIPCO. Geometrically constrained independent vector analysis with auxiliary function approach and iterative source steering (IEEE, Piscataway, 2022), pp. 757\u2013761","DOI":"10.23919\/EUSIPCO55093.2022.9909912"},{"key":"373_CR25","doi-asserted-by":"crossref","unstructured":"Y. Mitsui, N. Takamune, D. Kitamura, H. Saruwatari, Y. Takahashi, K. Kondo, in Proc. ICASSP. Vectorwise coordinate descent algorithm for spatially regularized independent low-rank matrix analysis (IEEE, Piscataway, 2018), pp. 746\u2013750","DOI":"10.1109\/ICASSP.2018.8462657"},{"key":"373_CR26","first-page":"1157","volume":"32","author":"T Ueda","year":"2024","unstructured":"T. Ueda, T. Nakatani, R. Ikeshita, K. Kinoshita, S. Araki, S. Makino, Blind and spatially-regularized online joint optimization of source separation, dereverberation, and noise reduction. IEEE\/ACM Trans. ASLP 32, 1157\u20131172 (2024)","journal-title":"IEEE\/ACM Trans. ASLP"},{"key":"373_CR27","doi-asserted-by":"crossref","unstructured":"T. Ueda, T. Nakatani, R. Ikeshita, S. Araki, S. Makino, in Proc. APSIPA. Spatially-regularized switching independent vector analysis (IEEE, Piscataway, 2023), pp. 2040\u20132046","DOI":"10.1109\/APSIPAASC58517.2023.10317538"},{"key":"373_CR28","doi-asserted-by":"crossref","unstructured":"T. Nakatani, R. Ikeshita, N. Kamo, K. Kinoshita, S. Araki, H. Sawada, in Proc. EUSIPCO. Switching convolutional beamformer (IEEE, Piscataway, 2021), pp. 266\u2013270","DOI":"10.23919\/EUSIPCO54536.2021.9616357"},{"key":"373_CR29","doi-asserted-by":"crossref","unstructured":"J. Bitzer, K.U. Simmer, in Microphone Arrays: Signal Processing Techniques and Applications. Superdirective microphone arrays (Springer, Cham, 2001), pp. 19\u201338","DOI":"10.1007\/978-3-662-04619-7_2"},{"issue":"7","key":"373_CR30","first-page":"1830","volume":"18","author":"NQ Duong","year":"2010","unstructured":"N.Q. Duong, E. Vincent, R. Gribonval, Under-determined reverberant audio source separation using a full-rank spatial covariance model. IEEE Trans. ASLP 18(7), 1830\u20131840 (2010)","journal-title":"IEEE Trans. ASLP"},{"key":"373_CR31","first-page":"1950","volume":"29","author":"N Ito","year":"2021","unstructured":"N. Ito, R. Ikeshita, H. Sawada, T. Nakatani, A joint diagonalization based efficient approach to underdetermined blind audio source separation using the multichannel wiener filter. IEEE\/ACM Trans. ASLP 29, 1950\u20131965 (2021)","journal-title":"IEEE\/ACM Trans. ASLP"},{"key":"373_CR32","doi-asserted-by":"crossref","unstructured":"F. Grondin, J.S. Lauzon, J. Vincent, F. Michaud, in Proc. Interspeech. GEV beamforming supported by DOA-based masks generated on pairs of microphones (IEEE, Piscataway, 2020), pp. 3341\u20133345","DOI":"10.21437\/Interspeech.2020-2687"},{"issue":"4","key":"373_CR33","doi-asserted-by":"publisher","first-page":"943","DOI":"10.1121\/1.382599","volume":"65","author":"JB Allen","year":"1979","unstructured":"J.B. Allen, D.A. Berkley, Image method for efficiently simulating small-room acoustics. J. Acoust. Soc. Am. 65(4), 943\u2013950 (1979)","journal-title":"J. Acoust. Soc. Am."},{"key":"373_CR34","doi-asserted-by":"crossref","unstructured":"T. Taniguchi, N. Ono, A. Kawamura, S. Sagayama, in Proc. HSCMA. An auxiliary-function approach to online independent vector analysis for real-time blind source separation (IEEE, Piscataway, 2014), pp. 107\u2013111","DOI":"10.1109\/HSCMA.2014.6843261"},{"key":"373_CR35","doi-asserted-by":"crossref","unstructured":"T. Nakatani, K. Kinoshita, in Proc. EUSIPCO. Maximum likelihood convolutional beamformer for simultaneous denoising and dereverberation (IEEE, Piscataway, 2019), pp. 1\u20135","DOI":"10.23919\/EUSIPCO.2019.8902753"},{"key":"373_CR36","unstructured":"J. S. Garofolo, L. F. Lamel, W. M. Fisher, J. G. Fiscus, D. S. Pallett, N. L. Dahlgren, V. Zue, TIMIT acoustic-phonetic continuous speech corpus, in Linguistic Data Consortium (Philadelphia), 1993"},{"key":"373_CR37","unstructured":"S. Nakamura, K. Hiyane, F. Asano, T. Nishiura, T. Yamada, in Proc. LREC. Acoustical sound database in real environments for sound scene understanding and hands-free speech recognition (ELCA,\u00a0France, 2000), pp. 965\u2013968.\u00a0https:\/\/www.elra.eu\/"},{"key":"373_CR38","doi-asserted-by":"crossref","unstructured":"J. Barker, R. Marxer, E. Vincent, S. Watanabe, in 2015 IEEE Workshop on Automatic Speech Recognition and Understanding (ASRU). The third \u2018CHiME\u2019 speech separation and recognition challenge: dataset, task and baselines (IEEE, Piscataway, 2015), pp. 504\u2013511","DOI":"10.1109\/ASRU.2015.7404837"},{"issue":"1\u20134","key":"373_CR39","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/S0925-2312(00)00345-3","volume":"41","author":"N Murata","year":"2001","unstructured":"N. Murata, S. Ikeda, A. Ziehe, An approach to blind source separation based on temporal structure of speech signals. Neurocomputing 41(1\u20134), 1\u201324 (2001)","journal-title":"Neurocomputing"},{"issue":"4","key":"373_CR40","first-page":"1462","volume":"14","author":"E Vincent","year":"2006","unstructured":"E. Vincent, R. Gribonval, C. F\u00e9votte, Performance measurement in blind audio source separation. IEEE Trans. ASLP 14(4), 1462\u20131469 (2006)","journal-title":"IEEE Trans. ASLP"},{"key":"373_CR41","doi-asserted-by":"crossref","unstructured":"A. W. Rix, J. G. Beerends, M. P. Hollier, A. P. Hekstra, in Proc. ICASSP. Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs (IEEE, Piscataway, 2001), vol. 2, pp. 749\u2013752.","DOI":"10.1109\/ICASSP.2001.941023"},{"key":"373_CR42","unstructured":"Museval. https:\/\/github.com\/sigsep\/sigsep-mus-eval. Accessed 15 Feb 2024"},{"key":"373_CR43","doi-asserted-by":"crossref","unstructured":"J. Le Roux, S. Wisdom, H. Erdogan, J.R. Hershey, in Proc. ICASSP. Sdr\u2013half-baked or well done? (IEEE, 2019), pp. 626\u2013630","DOI":"10.1109\/ICASSP.2019.8683855"}],"container-title":["EURASIP Journal on Audio, Speech, and Music Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-024-00373-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1186\/s13636-024-00373-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13636-024-00373-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,10,8]],"date-time":"2024-10-08T08:06:13Z","timestamp":1728374773000},"score":1,"resource":{"primary":{"URL":"https:\/\/asmp-eurasipjournals.springeropen.com\/articles\/10.1186\/s13636-024-00373-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,8]]},"references-count":43,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2024,12]]}},"alternative-id":["373"],"URL":"https:\/\/doi.org\/10.1186\/s13636-024-00373-3","relation":{},"ISSN":["1687-4722"],"issn-type":[{"value":"1687-4722","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,10,8]]},"assertion":[{"value":"29 February 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"19 September 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 October 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"SM is an editor of the collection \u201cAdvanced Signal Processing and Machine Learning for Acoustic Scene Analysis and Signal Enhancement,\u201d where this manuscript is submitted.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"52"}}