{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T16:16:15Z","timestamp":1772727375732,"version":"3.50.1"},"reference-count":38,"publisher":"Springer Science and Business Media LLC","issue":"7","license":[{"start":{"date-parts":[[2025,3,9]],"date-time":"2025-03-09T00:00:00Z","timestamp":1741478400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,3,9]],"date-time":"2025-03-09T00:00:00Z","timestamp":1741478400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Circuits Syst Signal Process"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1007\/s00034-025-03055-3","type":"journal-article","created":{"date-parts":[[2025,3,9]],"date-time":"2025-03-09T17:12:37Z","timestamp":1741540357000},"page":"5220-5234","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Enhancing Voice Activity Detection in Noisy Environments Using Deep Neural Networks"],"prefix":"10.1007","volume":"44","author":[{"given":"B. G.","family":"Nagaraja","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3266-9732","authenticated-orcid":false,"given":"G. Thimmaraja","family":"Yadava","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,3,9]]},"reference":[{"key":"3055_CR1","doi-asserted-by":"crossref","unstructured":"J. Aguiar-Pontes, M. Intriago-Pazmino, Voice activity detection using convolutional recurrent neural networks, In: Future Technology Conference, pp. 232\u2013243 (2023)","DOI":"10.1007\/978-3-031-47451-4_17"},{"key":"3055_CR2","doi-asserted-by":"crossref","unstructured":"S. Ding, R. Rikhye, Q. Liang, Y. He, Q. Wang, A. Narayanan, T. O\u2019Malley, I. McGraw, Personal VAD 2.0: Optimizing personal voice activity detection for on-device speech recognition, arXiv:2204.03793 (2022)","DOI":"10.21437\/Interspeech.2022-856"},{"key":"3055_CR3","doi-asserted-by":"publisher","first-page":"1542","DOI":"10.1109\/TASLP.2021.3073596","volume":"29","author":"H Dinkel","year":"2021","unstructured":"H. Dinkel, S. Wang, X. Xu, M. Wu, K. Yu, Voice activity detection in the wild: A data-driven approach using teacher-student training. IEEE\/ACM Trans. Audio Speech Lang. Process. 29, 1542\u20131555 (2021)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."},{"issue":"2","key":"3055_CR4","doi-asserted-by":"publisher","first-page":"252","DOI":"10.1109\/LSP.2015.2495219","volume":"23","author":"T Drugman","year":"2015","unstructured":"T. Drugman, Y. Stylianou, Y. Kida, M. Akamine, Voice activity detection: Merging source and filter-based information. IEEE Signal Process. Lett. 23(2), 252\u2013256 (2015)","journal-title":"IEEE Signal Process. Lett."},{"key":"3055_CR5","doi-asserted-by":"crossref","unstructured":"H. Dubey, A. Sangwan, J.H.L. Hansen, Robust feature clustering for unsupervised speech activity detection, In: Proceeding IEEE International Conference on Acoustics, Speech Signal Process. (ICASSP), pp. 2726\u20132730 (2018)","DOI":"10.1109\/ICASSP.2018.8461652"},{"key":"3055_CR6","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/s13636-018-0135-7","volume":"2018","author":"S Dwijayanti","year":"2018","unstructured":"S. Dwijayanti, K. Yamamori, M. Miyoshi, Enhancement of speech dynamics for voice activity detection using DNN. EURASIP J. Audio Speech Music Process. 2018, 1\u201315 (2018)","journal-title":"EURASIP J. Audio Speech Music Process."},{"key":"3055_CR7","doi-asserted-by":"crossref","unstructured":"H. Erdogan, J.R. Hershey, S. Watanabe, J. Le Roux, Phase-sensitive and recognition-boosted speech separation using deep recurrent neural networks, In: Proceeding IEEE International Conference on Acoustics, Speech Signal Process. (ICASSP), pp. 708\u2013712 (2015)","DOI":"10.1109\/ICASSP.2015.7178061"},{"key":"3055_CR8","doi-asserted-by":"crossref","unstructured":"D. Friedman, Instantaneous-frequency distribution vs. time: An interpretation of the phase structure of speech, In: Proceeding IEEE IInternational Conference on Acoustics, Speech Signal Process. (ICASSP), 10, 1121\u20131124 (1985)","DOI":"10.1109\/ICASSP.1985.1168461"},{"issue":"2","key":"3055_CR9","doi-asserted-by":"publisher","first-page":"55","DOI":"10.1109\/MSP.2014.2369251","volume":"32","author":"T Gerkmann","year":"2015","unstructured":"T. Gerkmann, M. Krawczyk-Becker, J. Le Roux, Phase processing for single-channel speech enhancement: History and recent advances. IEEE Signal Process. Mag. 32(2), 55\u201366 (2015)","journal-title":"IEEE Signal Process. Mag."},{"issue":"3","key":"3055_CR10","doi-asserted-by":"publisher","first-page":"600","DOI":"10.1109\/TASL.2010.2052803","volume":"19","author":"PK Ghosh","year":"2010","unstructured":"P.K. Ghosh, A. Tsiartas, S. Narayanan, Robust voice activity detection using long-term signal variability. IEEE Trans. Audio Speech Lang. Process. 19(3), 600\u2013613 (2010)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"3055_CR11","doi-asserted-by":"publisher","first-page":"588","DOI":"10.1016\/j.specom.2006.12.006","volume":"49","author":"Y Hu","year":"2007","unstructured":"Y. Hu, P.C. Loizou, Subjective evaluation and comparison of speech enhancement algorithms. Speech Commun. 49, 588\u2013601 (2007)","journal-title":"Speech Commun."},{"issue":"1","key":"3055_CR12","doi-asserted-by":"publisher","first-page":"229","DOI":"10.1109\/TASL.2007.911054","volume":"16","author":"Y Hu","year":"2007","unstructured":"Y. Hu, P.C. Loizou, Evaluation of objective quality measures for speech enhancement. IEEE Trans. Audio Speech Lang. Process. 16(1), 229\u2013238 (2007)","journal-title":"IEEE Trans. Audio Speech Lang. Process."},{"key":"3055_CR13","doi-asserted-by":"crossref","unstructured":"P.S. Huang, M. Kim, M. Hasegawa-Johnson, P. Smaragdis, Deep learning for monaural speech separation, In: Proceeding IEEE International Conference on Acoustics, Speech Signal Process. (ICASSP), pp. 1562\u20131566 (2014)","DOI":"10.1109\/ICASSP.2014.6853860"},{"issue":"12","key":"3055_CR14","doi-asserted-by":"publisher","first-page":"1987","DOI":"10.1109\/29.45547","volume":"37","author":"S Kay","year":"1989","unstructured":"S. Kay, A fast and accurate single frequency estimator. IEEE Trans. Acoust. Speech Signal Process. 37(12), 1987\u20131990 (1989)","journal-title":"IEEE Trans. Acoust. Speech Signal Process."},{"key":"3055_CR15","doi-asserted-by":"crossref","unstructured":"T. Kinnunen, P. Rajan, A practical, self-adaptive voice activity detector for speaker verification with noisy telephone and microphone data, In: Proceeding IEEE International Conference on Acoustics, Speech Signal Process. (ICASSP), pp. 7229\u20137233 (2013)","DOI":"10.1109\/ICASSP.2013.6639066"},{"key":"3055_CR16","doi-asserted-by":"publisher","DOI":"10.1016\/j.bspc.2022.104408","volume":"80","author":"Y Korkmaz","year":"2023","unstructured":"Y. Korkmaz, A. Boyac\u0131, Hybrid voice activity detection system based on LSTM and auditory speech features. Biomed. Signal Process. Control 80, 104408 (2023)","journal-title":"Biomed. Signal Process. Control"},{"issue":"6","key":"3055_CR17","first-page":"1401","volume":"84","author":"YC Lee","year":"2001","unstructured":"Y.C. Lee, S.-S. Ahn, An improved voice activity detection algorithm employing speech enhancement preprocessing, IEICE Trans. Fundam. Electron. Commun. Comput. Sci. 84(6), 1401\u20131405 (2001)","journal-title":"Fundam. Electron. Commun. Comput. Sci."},{"key":"3055_CR18","doi-asserted-by":"publisher","DOI":"10.1016\/j.apacoust.2022.108802","volume":"195","author":"S Li","year":"2022","unstructured":"S. Li, Y. Li, T. Feng, J. Shi, P. Zhang, Voice activity detection using a local-global attention model. Appl. Acoust. 195, 108802 (2022)","journal-title":"Appl. Acoust."},{"key":"3055_CR19","doi-asserted-by":"crossref","unstructured":"Y. Luo, Z. Chen, J.R. Hershey, J. Le Roux, N. Mesgarani, Deep clustering and conventional networks for music separation: Stronger together, In: Proceeding IEEE International Conference on Acoustics Speech Signal Process. (ICASSP), pp. 61\u201365 (2017)","DOI":"10.1109\/ICASSP.2017.7952118"},{"issue":"5","key":"3055_CR20","doi-asserted-by":"publisher","first-page":"3387","DOI":"10.1121\/1.3097493","volume":"125","author":"J Ma","year":"2009","unstructured":"J. Ma, Y. Hu, P.C. Loizou, Objective measures for predicting speech intelligibility in noisy conditions based on new band-importance functions. J. Acoust. Soc. Am. 125(5), 3387\u20133405 (2009)","journal-title":"J. Acoust. Soc. Am."},{"key":"3055_CR21","doi-asserted-by":"crossref","unstructured":"L. Mateju, P. Cerva, J. Zdansky, J. Malek, Speech activity detection in online broadcast transcription using deep neural networks and weighted finite state transducers, In: Proceeding IEEE International Conference on Acoustics, Speech Signal Process. (ICASSP), pp. 5460\u20135464 (2017)","DOI":"10.1109\/ICASSP.2017.7953200"},{"key":"3055_CR22","doi-asserted-by":"publisher","first-page":"753","DOI":"10.1007\/s10772-018-9525-6","volume":"21","author":"H Mukherjee","year":"2018","unstructured":"H. Mukherjee, S.M. Obaidullah, K.C. Santosh, S. Phadikar, K. Roy, Line spectral frequency-based features and extreme learning machine for voice activity detection from audio signal. Int. J. Speech Technol. 21, 753\u2013760 (2018)","journal-title":"Int. J. Speech Technol."},{"key":"3055_CR23","doi-asserted-by":"publisher","unstructured":"B.G. Nagaraja, H.S. Jayanna, Multilingual Speaker Identification with the Constraint of Limited Data Using Multitaper MFCC, In: Proceeding International Conference Recent Trends in Computer Networks and Distributed Systems Security (SNDS), 335 (2012). https:\/\/doi.org\/10.1007\/978-3-642-34135-9_13","DOI":"10.1007\/978-3-642-34135-9_13"},{"key":"3055_CR24","doi-asserted-by":"publisher","unstructured":"B.G. Nagaraja, H.S. Jayanna, Combination of features for crosslingual speaker identification with the constraint of limited data, In: Proceeding International Conference Signal Image Process. (ICSIP), pp. 143\u2013148 (2012). https:\/\/doi.org\/10.1007\/978-81-322-0997-3_13","DOI":"10.1007\/978-81-322-0997-3_13"},{"issue":"3","key":"3055_CR25","doi-asserted-by":"publisher","first-page":"241","DOI":"10.1515\/jisys-2013-0038","volume":"22","author":"BG Nagaraja","year":"2013","unstructured":"B.G. Nagaraja, H.S. Jayanna, Multilingual Speaker Identification by Combining Evidence from LPR and Multitaper MFCC. J. Intell. Syst. 22(3), 241\u2013251 (2013). https:\/\/doi.org\/10.1515\/jisys-2013-0038","journal-title":"J. Intell. Syst."},{"key":"3055_CR26","doi-asserted-by":"crossref","unstructured":"V.W. Neo, S. Weiss, S.W. McKnight, A.O.T. Hogg, P.A. Naylor, Polynomial eigenvalue decomposition-based target speaker voice activity detection in the presence of competing talkers, In: Proceeding International Workshop Acoustics. Signal Enhanc. (IWAENC), 1\u20135 (2022)","DOI":"10.1109\/IWAENC53105.2022.9914796"},{"key":"3055_CR27","unstructured":"N. Parihar, J. Picone, D. Pearce, H.-G. Hirsch, Performance analysis of the Aurora large vocabulary baseline system, In: Proceeding 12th Eur. Signal Processing Conference, pp. 553\u2013556 (2004)"},{"key":"3055_CR28","unstructured":"L.S. Pritam, S.J. Jainar, B.G. Nagaraja, A comparison of features for multilingual speaker identification-A review and some experimental results, Int. J. Recent Technol. Eng., (2018)"},{"key":"3055_CR29","doi-asserted-by":"crossref","unstructured":"S. Shimauchi, S. Kudo, Y. Koizumi, K. Furuya, On relationships between amplitude and phase of short-time Fourier transform, In: Proceeding IEEE International Conference on Acoustics Speech Signal Process. (ICASSP), pp. 676\u2013680 (2017)","DOI":"10.1109\/ICASSP.2017.7952241"},{"issue":"11","key":"3055_CR30","doi-asserted-by":"publisher","first-page":"1486","DOI":"10.1016\/j.specom.2006.09.003","volume":"48","author":"S Srinivasan","year":"2006","unstructured":"S. Srinivasan, N. Roman, D. Wang, Binary and ratio time-frequency masks for robust speech recognition. Speech Commun. 48(11), 1486\u20131501 (2006)","journal-title":"Speech Commun."},{"key":"3055_CR31","doi-asserted-by":"crossref","unstructured":"A.P. Stark, K.K. Paliwal, Speech analysis using instantaneous frequency deviation, In: Proceeding INTERSPEECH, pp. 2602\u20132605 (2008)","DOI":"10.21437\/Interspeech.2008-645"},{"key":"3055_CR32","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.csl.2019.06.005","volume":"59","author":"ZH Tan","year":"2020","unstructured":"Z.H. Tan, N. Dehak et al., rVAD: An unsupervised segment-based robust voice activity detection method. Comput. Speech Lang. 59, 1\u201321 (2020)","journal-title":"Comput. Speech Lang."},{"key":"3055_CR33","doi-asserted-by":"crossref","unstructured":"X. Tan, X.-L. Zhang, Speech enhancement aided end-to-end multi-task learning for voice activity detection, In: Proceeding IEEE International Conference on Acoustics Speech Signal Process. (ICASSP), pp. 6823\u20136827 (2021)","DOI":"10.1109\/ICASSP39728.2021.9414445"},{"key":"3055_CR34","doi-asserted-by":"publisher","first-page":"623","DOI":"10.1007\/s10772-016-9355-3","volume":"19","author":"H Wei","year":"2016","unstructured":"H. Wei, Y. Long, H. Mao, Improvements on self-adaptive voice activity detector for telephone data. Int. J. Speech Technol. 19, 623\u2013630 (2016)","journal-title":"Int. J. Speech Technol."},{"key":"3055_CR35","doi-asserted-by":"crossref","unstructured":"T. Xu, H. Zhang, X. Zhang, Joint training ResCNN-based voice activity detection with speech enhancement, In: Proceeding Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC), pp. 1157\u20131162 (2019)","DOI":"10.1109\/APSIPAASC47483.2019.9023101"},{"issue":"7","key":"3055_CR36","doi-asserted-by":"publisher","first-page":"4041","DOI":"10.1007\/s00034-022-01973-0","volume":"41","author":"GT Yadava","year":"2022","unstructured":"G.T. Yadava, B.G. Nagaraja, H.S. Jayanna, Enhancements in continuous Kannada ASR system by background noise elimination. Circuits Syst. Signal Process. 41(7), 4041\u20134067 (2022)","journal-title":"Circuits Syst. Signal Process."},{"key":"3055_CR37","doi-asserted-by":"publisher","unstructured":"G.T. Yadava, B.G. Nagaraja, H.S. Jayanna, Performance evaluation of spectral subtraction with VAD and time\u2013frequency filtering for speech enhancement, In: Emerging Research in Computing Information Communication and Applications, pp. 407\u2013414 (2023). https:\/\/doi.org\/10.1007\/978-981-19-5482-5_35","DOI":"10.1007\/978-981-19-5482-5_35"},{"issue":"2","key":"3055_CR38","doi-asserted-by":"publisher","first-page":"252","DOI":"10.1109\/TASLP.2015.2505415","volume":"24","author":"XL Zhang","year":"2015","unstructured":"X.L. Zhang, D. Wang, Boosting contextual information for deep neural network based voice activity detection. IEEE\/ACM Trans. Audio Speech Lang. Process. 24(2), 252\u2013264 (2015)","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process."}],"container-title":["Circuits, Systems, and Signal Processing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-025-03055-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00034-025-03055-3\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00034-025-03055-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T21:02:20Z","timestamp":1751403740000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00034-025-03055-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3,9]]},"references-count":38,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2025,7]]}},"alternative-id":["3055"],"URL":"https:\/\/doi.org\/10.1007\/s00034-025-03055-3","relation":{},"ISSN":["0278-081X","1531-5878"],"issn-type":[{"value":"0278-081X","type":"print"},{"value":"1531-5878","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,3,9]]},"assertion":[{"value":"24 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 February 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 February 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"9 March 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors of this manuscript have no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}