{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T00:00:16Z","timestamp":1783555216633,"version":"3.55.0"},"reference-count":308,"publisher":"Emerald","issue":"3-4","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,11,27]]},"abstract":"<jats:p>The rise of audio deepfakes presents a significant security threat that undermines trust in digital communications and media. These synthetic audio technologies can convincingly mimic a person\u2019s voice, enabling malicious activities like impersonation, fraud, and misinformation. Addressing this growing threat requires robust detection systems to ensure the authenticity of digital content.<\/jats:p>\n                  <jats:p>In this survey, we provide a comprehensive analysis of the state-of-the-art techniques in audio deepfake generation and detection. We examine various methods used to generate audio deepfakes, including Text-to-Speech (TTS) and Voice Conversion (VC) technologies, and discuss their capabilities in producing highly realistic synthetic audio. On the detection front, we explore a wide range of approaches, encompassing traditional machine learning and deep learning models for feature extraction and classification. The importance of publicly available datasets for training and evaluating these models is emphasized, showcasing their role in advancing detection capabilities.<\/jats:p>\n                  <jats:p>Additionally, the integration of audio and video deepfake detection systems is discussed, providing a comprehensive defense against sophisticated attacks. This survey critically assesses existing methods and datasets, highlighting challenges like the high realism of deepfakes, limited data diversity, and the need for models that generalize well. It aims to guide future research in enhancing detection and safeguarding digital media integrity.<\/jats:p>","DOI":"10.1561\/3300000048","type":"journal-article","created":{"date-parts":[[2024,11,27]],"date-time":"2024-11-27T05:11:01Z","timestamp":1732684261000},"page":"153-345","source":"Crossref","is-referenced-by-count":13,"title":["Navigating the Soundscape of Deception: A Comprehensive Survey on Audio Deepfake Generation, Detection, and Future Horizons"],"prefix":"10.1108","volume":"6","author":[{"given":"Taiba Majid","family":"Wani","sequence":"first","affiliation":[{"name":"Sapienza University of Rome ,","place":["Italy"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Syed Asif Ahmad","family":"Qadri","sequence":"additional","affiliation":[{"name":"National Tsing Hua University ,","place":["Taiwan"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Farooq Ahmad","family":"Wani","sequence":"additional","affiliation":[{"name":"Sapienza University of Rome ,","place":["Italy"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Irene","family":"Amerini","sequence":"additional","affiliation":[{"name":"Sapienza University of Rome ,","place":["Italy"]}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"140","published-online":{"date-parts":[[2024,11,27]]},"reference":[{"issue":"3","key":"2026033014313617900_ref001","doi-asserted-by":"crossref","first-page":"1659","DOI":"10.11591\/ijeecs.v28.i3.pp1659-1667","article-title":"Analysis of the current state of deepfake techniques-creation and detection methods","volume":"28","author":"Abu-Ein","year":"2022","journal-title":"Indonesian Journal of Electrical Engineer- ing and Computer Science"},{"key":"2026033014313617900_ref002","first-page":"1","article-title":"Gammatone wavelet cepstral coefficients for robust speech recognition","author":"Adiga","year":"2013","journal-title":"2013 IEEE International Conference of IEEE Region 10 (TENCON 2013)"},{"issue":"3","key":"2026033014313617900_ref003","doi-asserted-by":"crossref","first-page":"544","DOI":"10.51594\/csitrj.v5i3.860","article-title":"Legal challenges of artificial intelligence and robotics: a comprehensive review","volume":"5","author":"Akpuokwe","year":"2024","journal-title":"Computer Science &IT Research Journal"},{"key":"2026033014313617900_ref004","doi-asserted-by":"crossref","first-page":"101","DOI":"10.23919\/EUSIPCO.2017.8081177","article-title":"Spoofing detection employing infi- nite impulse response\u2014constant Q transform-based feature repre- sentations","author":"Alam","year":"2017","journal-title":"2017 25Th european signal processing conference (EUSIPCO)"},{"key":"2026033014313617900_ref005","first-page":"104","article-title":"Detecting AI-Synthesized Speech Using Bispectral Analysis","author":"AlBadawy","year":"2019","journal-title":"CVPR workshops"},{"key":"2026033014313617900_ref006","doi-asserted-by":"crossref","first-page":"102510","DOI":"10.1016\/j.ijinfomgt.2022.102510","article-title":"Social media platforms and social enterprise: Bibliometric analysis and systematic review","volume":"69","author":"Ali","year":"2023","journal-title":"International Journal of Information Management"},{"issue":"6","key":"2026033014313617900_ref007","doi-asserted-by":"crossref","first-page":"757","DOI":"10.1016\/j.jvoice.2015.08.010","article-title":"Automatic voice pathology detection with running speech by using estimation of auditory spectrum and cepstral coefficients based on the all-pole model","volume":"30","author":"Ali","year":"2016","journal-title":"Journal of voice"},{"issue":"1","key":"2026033014313617900_ref008","doi-asserted-by":"crossref","first-page":"20","DOI":"10.1007\/s13278-022-01020-5","article-title":"Machine learning-based social media bot detection: a comprehensive literature review","volume":"13","author":"Aljabri","year":"2023","journal-title":"Social Network Analysis and Mining"},{"issue":"5","key":"2026033014313617900_ref009","first-page":"155","article-title":"A review of modern audio deepfake detection methods: challenges and future directions","volume":"15","author":"Almutairi","year":"2022","journal-title":"Al- gorithms"},{"key":"2026033014313617900_ref010","doi-asserted-by":"crossref","first-page":"72134","DOI":"10.1109\/ACCESS.2023.3286864","article-title":"Detecting fake audio of Arabic speakers using self-supervised deep learning","volume":"11","author":"Almutairi","year":"2023","journal-title":"IEEE Access"},{"key":"2026033014313617900_ref011","article-title":"Deep resid- ual neural networks for audio spoofing detection","author":"Alzantot","year":"2019","journal-title":"arXiv preprint arXiv:1907.00501"},{"issue":"4","key":"2026033014313617900_ref012","doi-asserted-by":"crossref","first-page":"309","DOI":"10.1561\/0600000096","article-title":"Deep learning for multimedia forensics","volume":"12","author":"Amerini","year":"2021","journal-title":"Foundations and Trends\u00ae in Computer Graphics and Vision"},{"key":"2026033014313617900_ref013","article-title":"Audio spoofing verification using deep convolutional neural networks by transfer learning","author":"Aravind","year":"2020","journal-title":"arXiv preprint arXiv:2008.03464"},{"key":"2026033014313617900_ref014","doi-asserted-by":"publisher","first-page":"162857","DOI":"10.1109\/ACCESS.2021.3133134","article-title":"Voice Spoofing Countermeasure for Logical Access Attacks Detection","volume":"9","author":"Arif","year":"2021","journal-title":"IEEE Access"},{"key":"2026033014313617900_ref015","first-page":"195","article-title":"Deep voice: Real-time neural text-to-speech","author":"Ar\u0131k","year":"2017","journal-title":"International conference on machine learning"},{"key":"2026033014313617900_ref016","article-title":"Combining automatic speaker verification and prosody analysis for synthetic speech detection","author":"Attorresi","year":"2022","journal-title":"arXiv preprint arXiv:2210.17222"},{"key":"2026033014313617900_ref017","doi-asserted-by":"crossref","first-page":"84229","DOI":"10.1109\/ACCESS.2019.2923806","article-title":"Toward robust audio spoofing detection: A detailed comparison of traditional and learned features","volume":"7","author":"Balamurali","year":"2019","journal-title":"IEEE Access"},{"key":"2026033014313617900_ref018","first-page":"29","article-title":"A dataset of histograms of original and fake voice recordings (H-Voice)","author":"Ballesteros","year":"2020","journal-title":"Data in brief"},{"key":"2026033014313617900_ref019","doi-asserted-by":"crossref","first-page":"146","DOI":"10.1145\/3600211.3604686","article-title":"The ethical implications of generative audio mod- els: A systematic literature review","author":"Barnett","year":"2023","journal-title":"Proceedings of the 2023 AAAI\/ACM Conference on AI, Ethics, and Society"},{"key":"2026033014313617900_ref020","article-title":"SeamlessM4T-Massively Multilingual & Multimodal Ma- chine Translation","author":"Barrault","year":"2023","journal-title":"arXiv preprint arXiv:2308.11596"},{"key":"2026033014313617900_ref021","article-title":"DeepSpeak Dataset v1. 0","author":"Barrington","year":"2024","journal-title":"arXiv preprint arXiv:2408.05366"},{"key":"2026033014313617900_ref022","article-title":"Frequency domain-based detection of generated audio","author":"Bartusiak","year":"2022","journal-title":"arXiv preprint arXiv:2205.01806"},{"key":"2026033014313617900_ref023","doi-asserted-by":"crossref","first-page":"101132","DOI":"10.1016\/j.csl.2020.101132","article-title":"Voice spoofing detection corpus for single and multi-order audio replays","volume":"65","author":"Baumann","year":"2021","journal-title":"Computer Speech &Language"},{"issue":"7","key":"2026033014313617900_ref024","first-page":"55","article-title":"Cortana-intelligent personal digital assistant: A review","volume":"8","author":"Bhat","year":"2017","journal-title":"International Journal of Ad- vanced Research in Computer Science"},{"key":"2026033014313617900_ref025","article-title":"Detection of AI Synthesized Hindi Speech","author":"Bhatia","year":"2022","journal-title":"arXiv preprint arXiv:2203.03706"},{"key":"2026033014313617900_ref026","doi-asserted-by":"crossref","first-page":"3303","DOI":"10.1007\/s11277-021-08181-0","article-title":"Feature extraction techniques with analysis of confusing words for speech recognition in the Hindi language","volume":"118","author":"Bhatt","year":"2021","journal-title":"Wireless Personal Communications"},{"key":"2026033014313617900_ref027","article-title":"High fidelity speech synthesis with adversarial networks","author":"Bi\u0144kowski","year":"2019","journal-title":"arXiv preprint arXiv:1909.11646"},{"key":"2026033014313617900_ref028","first-page":"2691","article-title":"Who Are You (I Really Wanna Know)? Detecting Audio {DeepFakes} Through Vocal Tract Recon- struction","author":"Blue","year":"2022","journal-title":"31st USENIX Security Symposium (USENIX Security 22)"},{"issue":"3","key":"2026033014313617900_ref029","doi-asserted-by":"crossref","first-page":"235","DOI":"10.3390\/electronics10030235","article-title":"Speech processing for language learning: A practical approach to computer-assisted pronunciation teaching","volume":"10","author":"Bogach","year":"2021","journal-title":"Electronics"},{"issue":"1","key":"2026033014313617900_ref030","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1186\/s13635-021-00116-3","article-title":"Synthetic speech detection through short-term and long-term pre- diction traces","volume":"2021","author":"Borrelli","year":"2021","journal-title":"EURASIP Journal on Information Security"},{"key":"2026033014313617900_ref031","doi-asserted-by":"crossref","first-page":"100503","DOI":"10.1016\/j.mlwa.2023.100503","article-title":"Voice spoofing detection for multiclass attack classification using deep learning","volume":"14","author":"Boyd","year":"2023","journal-title":"Machine Learning with Applications"},{"key":"2026033014313617900_ref032","article-title":"The Biometric Vox system for the ASVspoof 2021 challenge","author":"C\u00e1ceres","year":"2021","journal-title":"Proc. ASVspoof2021 Workshop"},{"key":"2026033014313617900_ref033","doi-asserted-by":"crossref","first-page":"38","DOI":"10.1007\/978-3-030-86702-7_4","article-title":"Fake speech recognition using deep learning","author":"Camacho","year":"2021","journal-title":"Applied Computer Sciences in Engineering: 8th Workshop on Engineering Applications, WEA 2021, Medell\u00edn, Colombia, October 6\u20138, 2021, Proceedings 8"},{"key":"2026033014313617900_ref034","doi-asserted-by":"crossref","DOI":"10.1109\/LSP.2024.3439469","article-title":"NeuralVC: Any-to-Any Voice Conversion Using Neural Networks Decoder For Real-Time Voice Conversion","author":"Cao","year":"2024","journal-title":"IEEE Signal Processing Letters"},{"key":"2026033014313617900_ref035","first-page":"4011","article-title":"Siri on-device deep learning-guided unit selection text-to-speech system","author":"Capes","year":"2017","journal-title":"Interspeech"},{"key":"2026033014313617900_ref036","first-page":"2709","article-title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone","author":"Casanova","year":"2022","journal-title":"International Conference on Machine Learning"},{"key":"2026033014313617900_ref037","article-title":"Toward Robust Real-World Audio Deepfake Detection: Closing the Explainability Gap","author":"Channing","year":"2024","journal-title":"arXiv preprint arXiv:2410.07436"},{"key":"2026033014313617900_ref038","doi-asserted-by":"crossref","first-page":"2287","DOI":"10.1145\/3292500.3330723","article-title":"Gmail smart compose: Real- time assisted writing","author":"Chen","year":"2019","journal-title":"Proceedings of the 25th ACM SIGKDD International Conference on Knowledge Discovery &Data Mining"},{"key":"2026033014313617900_ref039","article-title":"Adaspeech: Adaptive text to speech for custom voice","author":"Chen","year":"2021","journal-title":"arXiv preprint arXiv:2103.00993"},{"key":"2026033014313617900_ref040","article-title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","author":"Chen","year":"2024","journal-title":"arXiv preprint arXiv:2406.05370"},{"key":"2026033014313617900_ref041","doi-asserted-by":"crossref","first-page":"107643","DOI":"10.1016\/j.chb.2022.107643","article-title":"Spread of misinformation on social media: What contributes to it and how to combat it","volume":"141","author":"Chen","year":"2023","journal-title":"Computers in Human Behavior"},{"key":"2026033014313617900_ref042","doi-asserted-by":"crossref","first-page":"132","DOI":"10.21437\/Odyssey.2020-19","article-title":"Generalization of Audio Deepfake Detection","author":"Chen","year":"2020","journal-title":"Odyssey"},{"key":"2026033014313617900_ref043","doi-asserted-by":"crossref","first-page":"540","DOI":"10.1109\/APSIPAASC47483.2019.9023158","article-title":"Replay detection using CQT-based modified group delay feature and ResNeWt network in ASVspoof 2019","author":"Cheng","year":"2019","journal-title":"2019 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)"},{"key":"2026033014313617900_ref044","article-title":"Deep fakes: A looming crisis for national security, democracy and privacy","author":"Chesney","year":"2018","journal-title":"The Lawfare Blog"},{"issue":"5","key":"2026033014313617900_ref045","doi-asserted-by":"crossref","first-page":"1024","DOI":"10.1109\/JSTSP.2020.2999185","article-title":"Recurrent convolutional structures for audio spoof and video deepfake detection","volume":"14","author":"Chintha","year":"2020","journal-title":"IEEE Journal of Selected Topics in Signal Processing"},{"issue":"16","key":"2026033014313617900_ref046","doi-asserted-by":"crossref","first-page":"17862","DOI":"10.1609\/aaai.v38i16.29740","article-title":"Dddm-vc: Decoupled denoising diffusion models with disentangled representation and prior mixup for verified robust voice conversion","volume":"38","author":"Choi","year":"2024","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"2026033014313617900_ref047","author":"Christensen","year":"2022","journal-title":"Multi-pitch estimation"},{"key":"2026033014313617900_ref048","first-page":"9","article-title":"Photo tampering throughout history","author":"Conner","year":"2015","journal-title":"Four and Six. Accessed"},{"key":"2026033014313617900_ref049","doi-asserted-by":"crossref","first-page":"8962","DOI":"10.1109\/ICASSP43922.2022.9747186","article-title":"Deepfake speech detection through emotion recognition: a semantic approach","author":"Conti","year":"2022","journal-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"issue":"3","key":"2026033014313617900_ref050","doi-asserted-by":"crossref","first-page":"219","DOI":"10.1007\/s13735-022-00241-w","article-title":"A literature review and perspectives in deepfakes: generation, detection, and applications","volume":"11","author":"Dagar","year":"2022","journal-title":"International journal of multimedia information retrieval"},{"key":"2026033014313617900_ref051","doi-asserted-by":"crossref","first-page":"1018","DOI":"10.1109\/ASRU46091.2019.9003845","article-title":"Long range acoustic and deep features perspective on ASVspoof 2019","author":"Das","year":"2019","journal-title":"2019 IEEE Automatic Speech Recognition and Understanding Workshop (ASRU)"},{"key":"2026033014313617900_ref052","doi-asserted-by":"crossref","first-page":"6589","DOI":"10.1109\/ICASSP40776.2020.9053086","article-title":"Assessing the scope of gener- alized countermeasures for anti-spoofing","author":"Das","year":"2020","journal-title":"ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref053","first-page":"370","article-title":"Synthetic Speech Discrimination using Pitch Pattern Statistics Derived from Image Analysis","author":"De","year":"2012","journal-title":"Interspeech"},{"key":"2026033014313617900_ref054","author":"Deepart.io","year":"2022"},{"key":"2026033014313617900_ref055","author":"DeepFakeLab","year":"2020"},{"key":"2026033014313617900_ref056","article-title":"ASVspoof 2017 Version 2.0: meta- data analysis and baseline enhancements","author":"Delgado","year":"2018","journal-title":"Odyssey 2018-The Speaker and Language Recognition Workshop"},{"key":"2026033014313617900_ref057","article-title":"GLGAN-VC: A guided loss-based generative adversarial network for many-to-many voice conversion","author":"Dhar","year":"2023","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"2026033014313617900_ref058","article-title":"Review of audio deepfake detection techniques: Issues and prospects","volume":"e13322","author":"Dixit","year":"2023","journal-title":"Expert Systems"},{"key":"2026033014313617900_ref059","doi-asserted-by":"crossref","first-page":"29","DOI":"10.1145\/3595353.3595883","article-title":"GAN Discriminator based Audio Deepfake Detection","author":"Doan","year":"2023","journal-title":"Proceedings of the 2nd Workshop on Security Implications of Deepfakes and Cheapfakes"},{"key":"2026033014313617900_ref060","first-page":"1","article-title":"BTS-E: Au- dio Deepfake Detection Using Breathing-Talking-Silence Encoder","author":"Doan","year":"2023","journal-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref061","article-title":"Adversarial audio synthesis","author":"Donahue","year":"2018","journal-title":"arXiv preprint arXiv:1802.04208"},{"key":"2026033014313617900_ref062","doi-asserted-by":"crossref","first-page":"766","DOI":"10.1137\/1.9781611974331.ch55","article-title":"Clustering time series under the Fr\u00e9chet distance","author":"Driemel","year":"2016","journal-title":"Proceedings of the twenty-seventh annual ACM-SIAM symposium on Discrete algorithms"},{"key":"2026033014313617900_ref063","doi-asserted-by":"crossref","DOI":"10.1007\/978-94-011-5730-8","article-title":".","volume":"3","author":"Dutoit","year":"1997","journal-title":"An introduction to text-to-speech synthesis"},{"key":"2026033014313617900_ref064","doi-asserted-by":"crossref","first-page":"101994","DOI":"10.1016\/j.ijinfomgt.2019.08.002","article-title":"Artificial Intelligence (AI): Multidisciplinary perspectives on emerging chal- lenges, opportunities, and agenda for research, practice and policy","volume":"57","author":"Dwivedi","year":"2021","journal-title":"International Journal of Information Management"},{"issue":"3","key":"2026033014313617900_ref065","doi-asserted-by":"crossref","first-page":"333","DOI":"10.1017\/S1351324914000175","article-title":"The Kestrel TTS text normalization system","volume":"21","author":"Ebden","year":"2015","journal-title":"Natural Language Engineering"},{"key":"2026033014313617900_ref066","article-title":"Parallel Tacotron 2: A non-autoregressive neural TTS model with differentiable duration modeling","author":"Elias","year":"2021","journal-title":"arXiv preprint arXiv:2103.14574"},{"key":"2026033014313617900_ref067","doi-asserted-by":"crossref","first-page":"5709","DOI":"10.1109\/ICASSP39728.2021.9414718","article-title":"Parallel tacotron: Non-autoregressive and controllable tts","author":"Elias","year":"2021","journal-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref068","doi-asserted-by":"crossref","DOI":"10.1016\/j.heliyon.2023.e15090","article-title":"Deepfakes as a threat to a speaker and facial recognition: An overview of tools and attack vectors","author":"Firc","year":"2023","journal-title":"Heliyon"},{"key":"2026033014313617900_ref069","author":"Forbes.","year":"2019","journal-title":"A Voice Deepfake Was Used To Scam A CEO Out Of $243,000."},{"key":"2026033014313617900_ref070","article-title":"Wavefake: A data set to facilitate audio deepfake detection","author":"Frank","year":"2021","journal-title":"arXiv preprint arXiv:2111.02813"},{"key":"2026033014313617900_ref071","article-title":"Nancy Pelosi doesn\u2019t drink so why do false claims about her being drunk keep going viral?","author":"Funke","year":"2020"},{"key":"2026033014313617900_ref072","first-page":"28","article-title":"The Emergence of Deepfakes and its Societal Implications: A Systematic Review","author":"Gamage","year":"2021","journal-title":"TTO"},{"key":"2026033014313617900_ref073","article-title":"Raw differentiable architecture search for speech deepfake and spoofing detection","author":"Ge","year":"2021","journal-title":"arXiv preprint arXiv:2107.12212"},{"key":"2026033014313617900_ref074","first-page":"30","article-title":"Deep voice 2: Multi-speaker neural text-to-speech","author":"Gibiansky","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"2026033014313617900_ref075","first-page":"27","article-title":"Generative adversarial nets","author":"Goodfellow","year":"2014","journal-title":"Advances in neural information processing systems"},{"key":"2026033014313617900_ref076","article-title":"Deep- fake audio detection and justification with Explainable Artificial Intelligence (XAI)","author":"Govindu","year":"2023"},{"key":"2026033014313617900_ref077","article-title":"Exploiting syntactic features in a parsed tree to improve end-to-end TTS","author":"Guo","year":"2019","journal-title":"arXiv preprint arXiv:1904.04764"},{"key":"2026033014313617900_ref078","doi-asserted-by":"crossref","first-page":"403","DOI":"10.1109\/SLT48900.2021.9383460","article-title":"Conver- sational end-to-end tts for voice agents","author":"Guo","year":"2021","journal-title":"2021 IEEE Spoken Language Technology Workshop (SLT)"},{"key":"2026033014313617900_ref079","doi-asserted-by":"crossref","first-page":"134018","DOI":"10.1109\/ACCESS.2022.3231480","article-title":"Deepfake audio detection via MFCC features using machine learning","volume":"10","author":"Hamza","year":"2022","journal-title":"IEEE Access"},{"key":"2026033014313617900_ref080","first-page":"1","article-title":"Uncovering Human Traits in Determining Real and Spoofed Audio: Insights from Blind and Sighted Individuals","author":"Han","year":"2024","journal-title":"Proceedings of the CHI Conference on Human Factors in Computing Systems"},{"issue":"3","key":"2026033014313617900_ref081","doi-asserted-by":"crossref","first-page":"149","DOI":"10.1089\/cyber.2021.29208.jth","article-title":"The Social Impact of Deep- fakes","volume":"24","author":"Hancock","year":"2021","journal-title":"Cyberpsychology, Behavior, and Social Networking"},{"key":"2026033014313617900_ref082","article-title":"Classi- fiers for synthetic speech detection: A comparison","author":"Hanil\u00e7i","year":"2015"},{"issue":"3","key":"2026033014313617900_ref083","doi-asserted-by":"crossref","first-page":"e209","DOI":"10.1002\/spy2.209","article-title":"Adversarial learning techniques for security and privacy preservation: A comprehensive review","volume":"5","author":"Hathaliya","year":"2022","journal-title":"Security and Privacy"},{"issue":"2","key":"2026033014313617900_ref084","first-page":"e1520","article-title":"Deep- fake detection using deep learning methods: A systematic and com- prehensive review","volume":"14","author":"Heidari","year":"2024","journal-title":"Wiley Interdisciplinary Reviews: Data Mining and Knowledge Discovery"},{"key":"2026033014313617900_ref085","article-title":"Voice conversion from unaligned corpora using variational autoen- coding wasserstein generative adversarial networks","author":"Hsu","year":"2017","journal-title":"arXiv preprint arXiv:1704.00849"},{"key":"2026033014313617900_ref086","first-page":"1","article-title":"Audio replay spoofing attack detection using deep learning feature and long-short-term memory recurrent neural network","author":"Huang","year":"2021","journal-title":"AIIPCC 2021; The Second International Con- ference on Artificial Intelligence, Information Processing and Cloud Computing"},{"key":"2026033014313617900_ref087","article-title":"Voice transformer network: Sequence-to-sequence voice conversion using transformer with text-to-speech pretraining","author":"Huang","year":"2019","journal-title":"arXiv preprint arXiv:1912.06813"},{"key":"2026033014313617900_ref088","doi-asserted-by":"crossref","first-page":"373","DOI":"10.1109\/ICASSP.1996.541110","article-title":"Unit selection in a concate- native speech synthesis system using a large speech database","volume":"1","author":"Hunt","year":"1996","journal-title":"1996 IEEE international conference on acoustics, speech, and signal processing conference proceedings"},{"issue":"3","key":"2026033014313617900_ref089","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3464307","article-title":"Exposing vulnerabilities of deepfake detection systems with robust attacks","volume":"3","author":"Hussain","year":"2022","journal-title":"Digital Threats: Research and Practice (DTRAP)"},{"key":"2026033014313617900_ref090","doi-asserted-by":"crossref","first-page":"110124","DOI":"10.1016\/j.asoc.2023.110124","article-title":"AVFakeNet: A unified end- to-end Dense Swin Transformer deep learning model for audio\u2013visual deepfakes detection","volume":"136","author":"Ilyas","year":"2023","journal-title":"Applied Soft Computing"},{"key":"2026033014313617900_ref091","article-title":"Deepfake Audio Detection Via Feature Engineering And Machine Learning","author":"Iqbal","year":"2022","journal-title":"CIKM Workshops"},{"key":"2026033014313617900_ref092","article-title":"The LJ Speech Dataset","author":"Ito","year":"2017"},{"key":"2026033014313617900_ref093","article-title":"Universal melgan: A robust neural vocoder for high-fidelity waveform generation in multiple domains","author":"Jang","year":"2020","journal-title":"arXiv preprint arXiv:2011.09631"},{"key":"2026033014313617900_ref094","first-page":"4223","article-title":"Self- Supervised Spoofing Audio Detection Scheme","author":"Jiang","year":"2020","journal-title":"INTERSPEECH"},{"issue":"3","key":"2026033014313617900_ref095","doi-asserted-by":"crossref","first-page":"33","DOI":"10.1145\/3447255","article-title":"What to do about deep- fakes","volume":"64","author":"Johnson","year":"2021","journal-title":"Communications of the ACM"},{"key":"2026033014313617900_ref096","article-title":"WWW: Where, Which and Whatever Enhancing Interpretability in Multimodal Deepfake Detection","author":"Jung","year":"2024","journal-title":"arXiv preprint arXiv:2408.02954"},{"key":"2026033014313617900_ref097","doi-asserted-by":"crossref","first-page":"e1252","DOI":"10.7717\/peerj-cs.1252","article-title":"The rising trend of Metaverse in education: Challenges, opportunities, and ethical considerations","volume":"9","author":"Kaddoura","year":"2023","journal-title":"PeerJ Computer Science"},{"key":"2026033014313617900_ref098","doi-asserted-by":"crossref","first-page":"29","DOI":"10.1007\/978-3-030-93802-4_4","article-title":"From GANs to deepfakes: get- ting the characteristics right","author":"Kalpokas","year":"2022","journal-title":"Deepfakes: A Realistic Assessment of Potentials, Risks, and Policy Regulation"},{"key":"2026033014313617900_ref099","doi-asserted-by":"crossref","first-page":"266","DOI":"10.1109\/SLT.2018.8639535","article-title":"Stargan-vc: Non-parallel many-to-many voice conversion using star generative adversarial networks","author":"Kameoka","year":"2018","journal-title":"2018 IEEE Spoken Language Technology Workshop (SLT)"},{"key":"2026033014313617900_ref100","article-title":"Fasts2s-vc: Streaming non-autoregressive sequence-to-sequence voice conversion","author":"Kameoka","year":"2021","journal-title":"arXiv preprint arXiv:2104.06900"},{"key":"2026033014313617900_ref101","doi-asserted-by":"crossref","first-page":"2100","DOI":"10.23919\/EUSIPCO.2018.8553236","article-title":"Cyclegan-vc: Non-parallel voice conversion using cycle-consistent adversarial networks","author":"Kaneko","year":"2018","journal-title":"2018 26th European Signal Processing Conference (EUSIPCO)"},{"key":"2026033014313617900_ref102","doi-asserted-by":"crossref","first-page":"6820","DOI":"10.1109\/ICASSP.2019.8682897","article-title":"Cyclegan- vc2: Improved cyclegan-based non-parallel voice conversion","author":"Kaneko","year":"2019","journal-title":"ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"issue":"3","key":"2026033014313617900_ref103","doi-asserted-by":"crossref","first-page":"138","DOI":"10.1109\/TTS.2020.3001312","article-title":"Artificial intelligence in digital media: The era of deepfakes","volume":"1","author":"Karnouskos","year":"2020","journal-title":"IEEE Transactions on Technology and Society"},{"key":"2026033014313617900_ref104","article-title":"MIS-AVioDD: Modality invariant and specific representation for audio-visual deepfake de- tection","author":"Katamneni","year":"2023","journal-title":"arXiv preprint arXiv:2310.02234"},{"key":"2026033014313617900_ref105","doi-asserted-by":"crossref","first-page":"792","DOI":"10.1109\/TrustCom56396.2022.00111","article-title":"Specrnet: Towards faster and more accessible audio deepfake detection","author":"Kawa","year":"2022","journal-title":"2022 IEEE Interna- tional Conference on Trust, Security and Privacy in Computing and Communications (TrustCom)"},{"key":"2026033014313617900_ref106","first-page":"633","article-title":"Clarifying the Probable Cause Standard in the Internet Age for Crimes Involving Child Pornography","volume":"69","author":"Kenyon","year":"2020","journal-title":"Cath. UL Rev."},{"key":"2026033014313617900_ref107","article-title":"Trump Campaign Ad Manipulates Three Images to Put Biden in a\u2019Basement\u2019","author":"Kessler","year":"2020"},{"key":"2026033014313617900_ref108","article-title":"Voice Spoofing Countermeasures: Taxonomy, State-of-the-art, experimen- tal analysis of generalizability, open challenges, and the way forward","author":"Khan","year":"2022","journal-title":"arXiv preprint arXiv:2210.00417"},{"key":"2026033014313617900_ref109","doi-asserted-by":"crossref","first-page":"1001063","DOI":"10.3389\/fdata.2022.1001063","article-title":"Audio deepfakes: A survey","volume":"5","author":"Khanjani","year":"2023","journal-title":"Frontiers in Big Data"},{"key":"2026033014313617900_ref110","doi-asserted-by":"crossref","first-page":"429","DOI":"10.55549\/epstem.1371792","article-title":"Impact of Deepfake Technology on Social Media: Detection, Misinformation and Societal Implications","volume":"23","author":"Al-Khazraji","year":"2023","journal-title":"The Eurasia Proceedings of Science Technology Engineering and Mathematics"},{"key":"2026033014313617900_ref111","first-page":"1","article-title":"A deep learning framework for audio deepfake detection","author":"Khochare","year":"2021","journal-title":"Arabian Journal for Science and Engineering"},{"issue":"2","key":"2026033014313617900_ref112","doi-asserted-by":"crossref","first-page":"135","DOI":"10.1016\/j.bushor.2019.11.006","article-title":"Deepfakes: Trick or treat?","volume":"63","author":"Kietzmann","year":"2020","journal-title":"Business Horizons"},{"issue":"2","key":"2026033014313617900_ref113","doi-asserted-by":"crossref","first-page":"301","DOI":"10.59534\/jcss.1358318","article-title":"Current Usage Areas of Deepfake Applications with Artificial Intelligence Technology","volume":"3","author":"Kili\u00e7","year":"2023","journal-title":"\u0130leti\u015fim ve Toplum Ara\u015ft\u0131rmalar\u0131 Dergisi"},{"key":"2026033014313617900_ref114","first-page":"5530","article-title":"Conditional variational autoen- coder with adversarial learning for end-to-end text-to-speech","author":"Kim","year":"2021","journal-title":"International Conference on Machine Learning"},{"key":"2026033014313617900_ref115","first-page":"31","article-title":"Glow: Generative flow with invertible 1x1 convolutions","author":"Kingma","year":"2018","journal-title":"Advances in neural information pro-cessing systems"},{"issue":"7","key":"2026033014313617900_ref116","doi-asserted-by":"crossref","first-page":"10165","DOI":"10.1007\/s11042-022-13100-x","article-title":"Emergence of deepfakes and video tampering detection approaches: A survey","volume":"82","author":"Kingra","year":"2023","journal-title":"Multimedia Tools and Applications"},{"key":"2026033014313617900_ref117","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2017-1111","article-title":"The ASVspoof 2017 challenge: Assessing the limits of replay spoofing attack detection","author":"Kinnunen","year":"2017"},{"key":"2026033014313617900_ref118","doi-asserted-by":"crossref","first-page":"5395","DOI":"10.1109\/ICASSP.2017.7953187","article-title":"Reddots replayed: A new replay spoofing attack cor- pus for text-dependent speaker verification research","author":"Kinnunen","year":"2017","journal-title":"2017 IEEInternational conference on acoustics, speech and signal processing (ICASSP)"},{"key":"2026033014313617900_ref119","article-title":"Source tracing of audio deepfake systems","author":"Klein","year":"2024","journal-title":"arXiv preprint arXiv:2407.08016"},{"key":"2026033014313617900_ref120","first-page":"17022","article-title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","volume":"33","author":"Kong","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"2026033014313617900_ref121","article-title":"Deepfakes: a new threat to face recognition?","author":"Korshunov","year":"2018","journal-title":"arXiv preprint arXiv:1812.08685"},{"key":"2026033014313617900_ref122","first-page":"1","article-title":"Overview of BTAS 2016 speaker anti- spoofing competition","author":"Korshunov","year":"2016","journal-title":"2016 IEEE 8th international conference on biometrics theory, applications and systems (BTAS)"},{"key":"2026033014313617900_ref123","first-page":"32","article-title":"Melgan: Generative adversarial networks for conditional waveform synthesis","author":"Kumar","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"2026033014313617900_ref124","article-title":"Obamanet: Photo-realistic lip-sync from text","author":"Kumar","year":"2017","journal-title":"arXiv preprint arXiv:1801.01442"},{"issue":"15s","key":"2026033014313617900_ref125","first-page":"565","article-title":"Neural Network Pruning Techniques for Efficient Model Compression","volume":"12","author":"Kumari","year":"2024","journal-title":"International Journal of Intelligent Systems and Applications in Engineering"},{"key":"2026033014313617900_ref126","first-page":"10744","article-title":"Kodf: A large-scale korean deepfake detection dataset","author":"Kwon","year":"2021","journal-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision"},{"key":"2026033014313617900_ref127","article-title":"ASSERT: Anti-spoofing with squeeze-excitation and residual networks","author":"Lai","year":"2019","journal-title":"arXiv preprint arXiv:1904.01120"},{"key":"2026033014313617900_ref128","article-title":"BASE TTS: Lessons from building a billion-parameter text-to- speech model on 100K hours of data","author":"\u0141ajszczak","year":"2024","journal-title":"arXiv preprint arXiv:2402.08093"},{"key":"2026033014313617900_ref129","doi-asserted-by":"crossref","first-page":"106503","DOI":"10.1016\/j.dib.2020.106503","article-title":"Ar-DAD: Arabic diversified audio dataset","volume":"33","author":"Lataifeh","year":"2020","journal-title":"Data in Brief"},{"key":"2026033014313617900_ref130","doi-asserted-by":"crossref","first-page":"172","DOI":"10.1007\/978-3-319-52920-2_17","article-title":"Anti-spoofing methods for automatic speaker verification system","author":"Lavrentyeva","year":"2017","journal-title":"Analysis of Images, Social Networks and Texts: 5th International Conference, AIST 2016, Yekaterinburg, Russia, April 7-9, 2016, Revised Selected Papers 5"},{"key":"2026033014313617900_ref131","first-page":"1116","article-title":"Siamese Convolutional Neural Network Using Gaussian Probability Feature for Spoofing Speech Detection","author":"Lei","year":"2020","journal-title":"INTERSPEECH"},{"key":"2026033014313617900_ref132","article-title":"Dollars, Deception, and Deepfakes: An Analysis of Deepfakes and Synthetic Media Fraud","author":"Levine","year":"2020","journal-title":"PhD thesis"},{"issue":"14","key":"2026033014313617900_ref133","doi-asserted-by":"crossref","first-page":"8488","DOI":"10.3390\/app13148488","article-title":"Voice Deepfake Detection Using the Self-Supervised Pre-Training Model HuBERT","volume":"13","author":"Li","year":"2023","journal-title":"Applied Sciences"},{"key":"2026033014313617900_ref134","doi-asserted-by":"crossref","first-page":"35","DOI":"10.1145\/3552466.3556523","article-title":"A Comparative Study on Physical and Perceptual Features for Deepfake Audio Detection","author":"Li","year":"2022","journal-title":"Proceedings of the 1st International Workshop on Deepfake Detection for Audio Multimedia"},{"key":"2026033014313617900_ref135","doi-asserted-by":"crossref","first-page":"6354","DOI":"10.1109\/ICASSP39728.2021.9413828","article-title":"Replay and synthetic speech detection with res2net architecture","author":"Li","year":"2021","journal-title":"ICASSP 2021-2021 IEEE international conference on acoustics, speech and signal processing (ICASSP)"},{"key":"2026033014313617900_ref136","doi-asserted-by":"crossref","first-page":"920","DOI":"10.1109\/SLT54892.2023.10022498","article-title":"Styletts-vc: One-shot voice conversion by knowledge transfer from style-based tts models","author":"Li","year":"2023","journal-title":"2022 IEEE Spoken Language Technology Workshop (SLT)"},{"issue":"2","key":"2026033014313617900_ref137","doi-asserted-by":"crossref","first-page":"1455","DOI":"10.1007\/s10639-022-11255-6","article-title":"I am Alexa, your virtual tutor!: The effects of Amazon Alexa\u2019s text-to-speech voice enthusiasm in a multimedia learning environment","volume":"28","author":"Liew","year":"2023","journal-title":"Education and information technologies"},{"issue":"8","key":"2026033014313617900_ref138","doi-asserted-by":"crossref","first-page":"3926","DOI":"10.3390\/app12083926","article-title":"Detecting deepfake voice using explainable deep learning techniques","volume":"12","author":"Lim","year":"2022","journal-title":"Applied Sciences"},{"key":"2026033014313617900_ref139","doi-asserted-by":"crossref","first-page":"1470","DOI":"10.1109\/LSP.2020.3016564","article-title":"Modeling prosodic phrasing with multi-task learning in tacotron-based TTS","volume":"27","author":"Liu","year":"2020","journal-title":"IEEE Signal Processing Letters"},{"key":"2026033014313617900_ref140","doi-asserted-by":"crossref","first-page":"102257","DOI":"10.1016\/j.inffus.2024.102257","article-title":"Multi-space channel representa- tion learning for mono-to-binaural conversion based audio deepfake detection","volume":"105","author":"Liu","year":"2024","journal-title":"Information Fusion"},{"issue":"7","key":"2026033014313617900_ref141","doi-asserted-by":"crossref","first-page":"263","DOI":"10.3390\/info12070263","article-title":"Identification of fake stereo audio using SVM and CNN","volume":"12","author":"Liu","year":"2021","journal-title":"Information"},{"issue":"1","key":"2026033014313617900_ref142","first-page":"857","article-title":"Self-supervised learning: Generative or contrastive","volume":"35","author":"Liu","year":"2021","journal-title":"IEEE transactions on knowledge and data engineering"},{"key":"2026033014313617900_ref143","article-title":"Asvspoof 2021: Towards spoofed and deepfake speech detection in the wild","author":"Liu","year":"2023","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"2026033014313617900_ref144","first-page":"1","article-title":"Diffvoice: Text-to-speech with latent diffusion","author":"Liu","year":"2023","journal-title":"ICASSP 2023-2023 IEEE International Confer- ence on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref145","doi-asserted-by":"crossref","first-page":"6359","DOI":"10.1109\/ICASSP39728.2021.9414670","article-title":"A capsule network based approach for detection of audio spoofing attacks","author":"Luo","year":"2021","journal-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref146","doi-asserted-by":"crossref","first-page":"9231","DOI":"10.1109\/ICASSP43922.2022.9747605","article-title":"Fake audio detection based on unsupervised pretraining models","author":"Lv","year":"2022","journal-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref147","article-title":"Continual learning for fake audio detection","author":"Ma","year":"2021","journal-title":"arXiv preprint arXiv:2104.07286"},{"key":"2026033014313617900_ref148","article-title":"FAD: A Chinese dataset for fake audio detection","author":"Ma","year":"2022","journal-title":"arXiv preprint arXiv:2207.12308"},{"key":"2026033014313617900_ref149","first-page":"1","article-title":"A Lightweight and Efficient Model for Audio Anti-Spoofing","author":"Ma","year":"2023","journal-title":"Proceedings of the 5th ACM International Conference on Multimedia in Asia"},{"key":"2026033014313617900_ref150","article-title":"The malicious and forensic uses of Adobe software","author":"Macharyas","year":"2015","journal-title":"PhD thesis"},{"issue":"4","key":"2026033014313617900_ref151","doi-asserted-by":"crossref","first-page":"415","DOI":"10.1080\/23268743.2020.1757499","article-title":"\u2018A Deepfake Porn Plot Intended to Silence Me\u2019: exploring continuities between pornographic and \u2018political\u2019deep fakes","volume":"7","author":"Maddocks","year":"2020","journal-title":"Porn Studies"},{"key":"2026033014313617900_ref152","doi-asserted-by":"crossref","first-page":"512","DOI":"10.1109\/MIPR.2019.00104","article-title":"Securing voice-driven interfaces against fake (cloned) audio attacks","author":"Malik","year":"2019","journal-title":"2019 IEEE Conference on Multimedia Informa- tion Processing and Retrieval (MIPR)"},{"key":"2026033014313617900_ref153","doi-asserted-by":"crossref","first-page":"9241","DOI":"10.1109\/ICASSP43922.2022.9747768","article-title":"The vicomtech audio deepfake detection system based on wav2vec2 for the 2022 add challenge","author":"Mart\u00edn-Do\u00f1as","year":"2022","journal-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref154","article-title":"Exploring Self-supervised Embeddings and Syn- thetic Data Augmentation for Robust Audio Deepfake Detection","volume":"2024","author":"Mart\u0131n-Donas","year":"2024","journal-title":"Proc. Interspeech"},{"issue":"4","key":"2026033014313617900_ref155","doi-asserted-by":"crossref","first-page":"3974","DOI":"10.1007\/s10489-022-03766-z","article-title":"Deepfakes generation and detection: State-of-the-art, open challenges, countermeasures, and way forward","volume":"53","author":"Masood","year":"2023","journal-title":"Applied intelligence"},{"key":"2026033014313617900_ref156","doi-asserted-by":"crossref","first-page":"61","DOI":"10.1109\/ICASSP.2019.8682744","article-title":"Deep griffin\u2013lim iteration","author":"Masuyama","year":"2019","journal-title":"ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref157","article-title":"A Deep Dive into Artificial Intelligence and Its Integration into Cybersecurity","author":"Mateo","year":"2023","journal-title":"PhD thesis"},{"issue":"1","key":"2026033014313617900_ref158","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3425780","article-title":"The creation and detection of deepfakes: A survey","volume":"54","author":"Mirsky","year":"2021","journal-title":"ACM Computing Surveys (CSUR)"},{"key":"2026033014313617900_ref159","first-page":"1","article-title":"Implementation of google assistant on rasberry pi","author":"Mischie","year":"2018","journal-title":"2018 International Symposium on Electronics and Telecommunications (ISETC)"},{"key":"2026033014313617900_ref160","doi-asserted-by":"crossref","first-page":"2823","DOI":"10.1145\/3394171.3413570","article-title":"Emotions don\u2019t lie: An audio-visual deepfake detection method using affective cues","author":"Mittal","year":"2020","journal-title":"Proceedings of the 28th ACM international conference on multimedia"},{"key":"2026033014313617900_ref161","doi-asserted-by":"crossref","first-page":"65","DOI":"10.1016\/j.specom.2017.01.008","article-title":"An overview of voice conversion systems","volume":"88","author":"Mohammadi","year":"2017","journal-title":"Speech Communication"},{"key":"2026033014313617900_ref162","doi-asserted-by":"crossref","DOI":"10.1109\/ACCESS.2023.3344653","article-title":"A Survey on the Detection and Impacts of Deepfakes in Visual, Audio, and Textual Formats","author":"Mubarak","year":"2023","journal-title":"IEEE Access"},{"key":"2026033014313617900_ref163","article-title":"Integrating audio-visual fea- tures for multimodal deepfake detection","author":"Muppalla","year":"2023","journal-title":"arXiv preprint arXiv:2310. 03827"},{"key":"2026033014313617900_ref164","article-title":"China\u2019s Red-Hot Face-Swapping App Provokes Privacy Concern","author":"Murphy","year":"2019"},{"key":"2026033014313617900_ref165","first-page":"70","article-title":"Zero-Shot Singing Voice Conversion","author":"Nercessian","year":"2020","journal-title":"ISMIR"},{"key":"2026033014313617900_ref166","doi-asserted-by":"crossref","first-page":"7012","DOI":"10.1109\/ICASSP43922.2022.9747020","article-title":"Nvc-net: End-to-end adversar- ial voice conversion","author":"Nguyen","year":"2022","journal-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref167","doi-asserted-by":"crossref","first-page":"103525","DOI":"10.1016\/j.cviu.2022.103525","article-title":"Deep learning for deepfakes creation and detection: A survey","volume":"223","author":"Nguyen","year":"2022","journal-title":"Computer Vision and Image Understanding"},{"key":"2026033014313617900_ref168","doi-asserted-by":"crossref","first-page":"5475","DOI":"10.1109\/ICASSP.2016.7472724","article-title":"STC anti-spoofing systems for the ASVspoof 2015 challenge","author":"Novoselov","year":"2016","journal-title":"2016 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"issue":"1","key":"2026033014313617900_ref169","doi-asserted-by":"crossref","first-page":"20","DOI":"10.1007\/s44163-023-00065-5","article-title":"NLP techniques for automat- ing responses to customer queries: a systematic review","volume":"3","author":"Olujimi","year":"2023","journal-title":"Discover Artificial Intelligence"},{"key":"2026033014313617900_ref170","article-title":".","author":"Oord","year":"2018","journal-title":"Par- allel wavenet: Fast high-fidelity speech synthesis"},{"key":"2026033014313617900_ref171","article-title":"Wavenet: A generative model for raw audio","author":"Oord","year":"2016","journal-title":"arXiv preprint arXiv:1609.03499"},{"issue":"8","key":"2026033014313617900_ref172","doi-asserted-by":"crossref","first-page":"430","DOI":"10.3390\/info14080430","article-title":"Development of Technologies for the Detection of (Cyber) Bullying Actions: The BullyBuster Project","volume":"14","author":"Orr\u00f9","year":"2023","journal-title":"Information"},{"key":"2026033014313617900_ref173","first-page":"1","article-title":"Capsule net- work based end-to-end system for detection of replay attacks","author":"Ouyang","year":"2021","journal-title":"2021 12th International Symposium on Chinese Spoken Language Processing (ISCSLP)"},{"key":"2026033014313617900_ref174","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1016\/j.csl.2017.10.001","article-title":"Synthetic speech detection using fundamental frequency variation and spectral features","volume":"48","author":"Pal","year":"2018","journal-title":"Computer Speech &Language"},{"key":"2026033014313617900_ref175","first-page":"4202","article-title":"Speaker recognition-assisted robust audio deepfake detection.","author":"Pan","year":"2022","journal-title":"INTERSPEECH"},{"key":"2026033014313617900_ref176","article-title":"From puppet-master creation to false detection","author":"Panteli\u0107","year":"2022"},{"key":"2026033014313617900_ref177","article-title":"Cotatron: Transcription- guided speech encoder for any-to-many voice conversion without parallel data","author":"Park","year":"2020","journal-title":"arXiv preprint arXiv:2005.03295"},{"key":"2026033014313617900_ref178","article-title":"Easy, Interpretable, Effective: openSMILE for voice deepfake detection","author":"Pascu","year":"2024","journal-title":"arXiv preprint arXiv:2408.15775"},{"key":"2026033014313617900_ref179","article-title":"Combining evidences from mel cepstral, cochlear filter cepstral and instantaneous frequency features for detection of natural vs. spoofed speech","author":"Patel","year":"2015","journal-title":"Sixteenth annual conference of the international speech communication association"},{"key":"2026033014313617900_ref180","doi-asserted-by":"crossref","first-page":"5105","DOI":"10.1109\/ICASSP.2016.7472650","article-title":"Effectiveness of fundamental frequency (f 0) and strength of excitation (soe) for spoofed speech detection","author":"Patel","year":"2016","journal-title":"2016 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref181","doi-asserted-by":"crossref","first-page":"374","DOI":"10.23919\/EUSIPCO55093.2022.9909946","article-title":"Non- Cepstral Uncertainty Vector for Replay Spoofed Speech Detection","author":"Patil","year":"2022","journal-title":"2022 30th European Signal Processing Conference (EUSIPCO)"},{"issue":"4","key":"2026033014313617900_ref182","doi-asserted-by":"crossref","first-page":"605","DOI":"10.1109\/JSTSP.2017.2684705","article-title":"Spectral features for syn- thetic speech detection","volume":"11","author":"Paul","year":"2017","journal-title":"IEEE journal of selected topics in signal processing"},{"issue":"2","key":"2026033014313617900_ref183","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1007\/s44206-022-00010-6","article-title":"Deepfakes and democracy (theory): how synthetic audio-visual media for disinformation and hate speech threaten core democratic functions","volume":"1","author":"Pawelec","year":"2022","journal-title":"Digital society"},{"issue":"1","key":"2026033014313617900_ref184","doi-asserted-by":"crossref","first-page":"32","DOI":"10.1093\/jiplp\/jpz164","article-title":"Fake it till you make it: an exam- ination of the US and English approaches to persona protection as applied to deepfakes on social media","volume":"15","author":"Perot","year":"2020","journal-title":"Journal of Intellectual Property Law &Practice"},{"issue":"5","key":"2026033014313617900_ref185","doi-asserted-by":"crossref","first-page":"677","DOI":"10.1001\/jamaoncol.2021.8202","article-title":"Oncological applications of deep learning generative adversarial networks","volume":"8","author":"Phillips","year":"2022","journal-title":"JAMA oncology"},{"key":"2026033014313617900_ref186","article-title":"Heterogeneity over Homogeneity: Investigating Multilingual Speech Pre-Trained Models for Detecting Audio Deepfake","author":"Phukan","year":"2024","journal-title":"arXiv preprint arXiv:2404.00809"},{"key":"2026033014313617900_ref187","first-page":"1","article-title":"Deepfake audio detection by speaker verification","author":"Pianese","year":"2022","journal-title":"2022 IEEE International Workshop on Information Forensics and Security (WIFS)"},{"key":"2026033014313617900_ref188","article-title":"Deep voice 3: Scaling text- to-speech with convolutional sequence learning","author":"Ping","year":"2017","journal-title":"arXiv preprint arXiv:1710.07654"},{"key":"2026033014313617900_ref189","doi-asserted-by":"crossref","first-page":"3617","DOI":"10.1109\/ICASSP.2019.8683143","article-title":"Waveglow: A flow- based generative network for speech synthesis","author":"Prenger","year":"2019","journal-title":"ICASSP 2019- 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref190","first-page":"1","article-title":"Deep- fake Audio Detection with Neural Networks Using Audio Features","author":"Qais","year":"2022","journal-title":"2022 International Conference on Intelligent Controller and Computing for Smart Power (ICICCSP)"},{"key":"2026033014313617900_ref191","doi-asserted-by":"crossref","DOI":"10.1109\/ACCESS.2024.3399264","article-title":"Machine Learning-Based Opinion Spam Detection: A Sys- tematic Literature Review","author":"Qazi","year":"2024","journal-title":"IEEE Access"},{"key":"2026033014313617900_ref192","doi-asserted-by":"crossref","first-page":"123941","DOI":"10.1016\/j.eswa.2024.123941","article-title":"Audio-deepfake de- tection: Adversarial attacks and countermeasures","volume":"250","author":"Rabhi","year":"2024","journal-title":"Expert Systems with Applications"},{"key":"2026033014313617900_ref193","doi-asserted-by":"crossref","first-page":"115742","DOI":"10.1016\/j.eswa.2021.115742","article-title":"A review on social spam detection: challenges, open issues, and future directions","volume":"186","author":"Rao","year":"2021","journal-title":"Expert Systems with Applications"},{"key":"2026033014313617900_ref194","first-page":"993","article-title":"Multimodaltrace: Deepfake detection using audiovisual representation learning","author":"Raza","year":"2023","journal-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition"},{"key":"2026033014313617900_ref195","first-page":"1","article-title":"For: A dataset for synthetic speech detection","author":"Reimao","year":"2019","journal-title":"2019 International Conference on Speech Technology and Human-Computer Dialogue (SpeD)"},{"key":"2026033014313617900_ref196","first-page":"1","article-title":"WESPER: Zero-shot and realtime whisper to normal voice conversion for whisper-based speech interactions","author":"Rekimoto","year":"2023","journal-title":"Proceedings of the 2023 CHI Conference on Human Factors in Computing Systems"},{"key":"2026033014313617900_ref197","doi-asserted-by":"crossref","first-page":"3907","DOI":"10.1109\/ICIP42928.2021.9506427","article-title":"Recalibrated bandpass filtering on temporal waveform for audio spoof detection","author":"Ren","year":"2021","journal-title":"2021 IEEE international conference on image processing (ICIP)"},{"key":"2026033014313617900_ref198","article-title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","author":"Ren","year":"2020","journal-title":"arXiv preprint arXiv:2006.04558"},{"key":"2026033014313617900_ref199","first-page":"32","article-title":"Fastspeech: Fast, robust and controllable text to speech","author":"Ren","year":"2019","journal-title":"Advances in neural information processing systems"},{"key":"2026033014313617900_ref200","first-page":"3","article-title":"A machine learning model to detect fake voice","author":"Rodr\u00edguez-Ortega","year":"2020","journal-title":"International Conference on Applied Informatics"},{"issue":"7","key":"2026033014313617900_ref201","doi-asserted-by":"crossref","first-page":"3811","DOI":"10.1007\/s00034-022-01957-0","article-title":"Generative and discrimi- native modelling of linear energy sub-bands for spoof detection in speaker verification systems","volume":"41","author":"Rupesh Kumar","year":"2022","journal-title":"Circuits, Systems, and Signal Process- ing"},{"key":"2026033014313617900_ref202","article-title":"Cyberbullying Detection on Social Media Using Deep Learning Models","author":"Sachdeva","year":"2021","journal-title":"PhD thesis"},{"key":"2026033014313617900_ref203","article-title":"Exploring Green AI for Audio Deepfake Detection","author":"Saha","year":"2024","journal-title":"arXiv preprint arXiv:2403.14290"},{"key":"2026033014313617900_ref204","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2015-472","article-title":"A comparison of features for synthetic speech detection","author":"Sahidullah","year":"2015"},{"key":"2026033014313617900_ref205","article-title":"Unsupervised Filterbank Learning Using Convolutional Restricted Boltzmann Machine for Environmental Sound Classification.","author":"Sailor","year":"2017","journal-title":"InterSpeech"},{"key":"2026033014313617900_ref206","doi-asserted-by":"crossref","DOI":"10.1109\/ACCESS.2023.3276480","article-title":"TIMIT-TTS: a Text-to-Speech Dataset for Multimodal Synthetic Media Detection","author":"Salvi","year":"2023","journal-title":"IEEE Access"},{"issue":"6","key":"2026033014313617900_ref207","doi-asserted-by":"crossref","first-page":"122","DOI":"10.3390\/jimaging9060122","article-title":"A robust approach to multimodal deepfake detection","volume":"9","author":"Salvi","year":"2023","journal-title":"Journal of Imaging"},{"key":"2026033014313617900_ref208","doi-asserted-by":"crossref","first-page":"199","DOI":"10.1007\/978-3-642-01793-3_21","article-title":"Multi-region probabilistic histograms for robust and scalable identity inference","author":"Sanderson","year":"2009","journal-title":"Advances in Biometrics: Third International Conference, ICB 2009, Alghero, Italy, June 2-5, 2009. Proceedings 3"},{"key":"2026033014313617900_ref209","author":"Saxena","year":"2023","journal-title":"Multiple Aspects of Artificial Intelligence"},{"issue":"3","key":"2026033014313617900_ref210","doi-asserted-by":"crossref","first-page":"274","DOI":"10.1198\/004017001316975880","article-title":"Parametric statistical modeling by minimum integrated square error","volume":"43","author":"Scott","year":"2001","journal-title":"Technometrics"},{"key":"2026033014313617900_ref211","article-title":"A Cross-Verification Approach for Protecting World Leaders from Fake and Tampered Audio","author":"Shan","year":"2020","journal-title":"arXiv preprint arXiv:2010.12173"},{"key":"2026033014313617900_ref212","doi-asserted-by":"crossref","first-page":"107020","DOI":"10.1016\/j.apacoust.2019.107020","article-title":"Trends in audio signal feature extraction methods","volume":"158","author":"Sharma","year":"2020","journal-title":"Applied Acoustics"},{"key":"2026033014313617900_ref213","article-title":"Non-attentive tacotron: Robust and controllable neural tts synthesis including unsupervised duration modeling","author":"Shen","year":"2020","journal-title":"arXiv preprint arXiv:2010.04301"},{"key":"2026033014313617900_ref214","doi-asserted-by":"crossref","first-page":"4779","DOI":"10.1109\/ICASSP.2018.8461368","article-title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions","author":"Shen","year":"2018","journal-title":"2018 IEEE international conference on acoustics, speech and signal processing (ICASSP)"},{"key":"2026033014313617900_ref215","article-title":"Aishell-3: A multi- speaker mandarin tts corpus and the baselines","author":"Shi","year":"2020","journal-title":"arXiv preprint arXiv:2010.11567"},{"issue":"3","key":"2026033014313617900_ref216","doi-asserted-by":"crossref","first-page":"437","DOI":"10.3758\/BF03194716","article-title":"Pitch strength and Stevens\u2019s power law","volume":"64","author":"Shofner","year":"2002","journal-title":"Perception &psychophysics"},{"issue":"5-6","key":"2026033014313617900_ref217","doi-asserted-by":"crossref","first-page":"941","DOI":"10.1163\/15718123-bja10083","article-title":"Updating the authentication of digital evidence in the international criminal court","volume":"22","author":"Silva","year":"2021","journal-title":"International Criminal Law Review"},{"key":"2026033014313617900_ref218","doi-asserted-by":"crossref","first-page":"412","DOI":"10.1109\/MIPR51284.2021.00076","article-title":"Detection of ai-synthesized speech using cepstral &bispectral statistics","author":"Singh","year":"2021","journal-title":"2021 IEEE 4th Inter- national Conference on Multimedia Information Processing and Retrieval (MIPR)"},{"key":"2026033014313617900_ref219","doi-asserted-by":"crossref","first-page":"101599","DOI":"10.1016\/j.csl.2023.101599","article-title":"Improving self-supervised learning model for audio spoofing detection with layer-conditioned embedding fusion","volume":"86","author":"Sinha","year":"2024","journal-title":"Computer Speech &Language"},{"key":"2026033014313617900_ref220","article-title":"Wavelet Analysis of Speaker Dependent and Independent Prosody for Voice Conversion.","author":"Sisman","year":"2018","journal-title":"Interspeech"},{"key":"2026033014313617900_ref221","doi-asserted-by":"crossref","first-page":"132","DOI":"10.1109\/TASLP.2020.3038524","article-title":"An overview of voice conversion and its challenges: From statistical modeling to deep learning","volume":"29","author":"Sisman","year":"2020","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"2026033014313617900_ref222","doi-asserted-by":"crossref","first-page":"449","DOI":"10.1007\/s10579-019-09449-5","article-title":"Air traffic control communication (ATCC) speech corpora and their use for ASR and TTS development","volume":"53","author":"\u0160m\u00eddl","year":"2019","journal-title":"Language Resources and Evaluation"},{"key":"2026033014313617900_ref223","article-title":"The M-AILABS speech dataset","author":"Solak","year":"2019"},{"key":"2026033014313617900_ref224","doi-asserted-by":"crossref","first-page":"107917","DOI":"10.1016\/j.chb.2023.107917","article-title":"Providing detection strategies to improve human detection of deepfakes: An experimental study","volume":"149","author":"Somoray","year":"2023","journal-title":"Computers in Human Behavior"},{"key":"2026033014313617900_ref225","doi-asserted-by":"crossref","DOI":"10.1109\/ICASSP49357.2023.10095105","article-title":"Dspgan: a gan-based universal vocoder for high-fidelity tts by time-frequency domain supervision from dsp","author":"Song","year":"2023","journal-title":"ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref226","article-title":".","author":"Sotelo","year":"2017","journal-title":"Char2wav: End-to-end speech synthesis"},{"key":"2026033014313617900_ref227","article-title":"Snap Confirms Acquisition of Deepfakes Startup AI Factory, Used to Power\u2019Cameos\u2019 Selfie Videos","author":"Spangler","year":"2020"},{"issue":"08","key":"2026033014313617900_ref228","article-title":"Fraudsters used AI to mimic CEO\u2019s voice in unusual cybercrime case","volume":"30","author":"Stupp","year":"2019","journal-title":"The Wall Street Journal"},{"issue":"04","key":"2026033014313617900_ref229","doi-asserted-by":"crossref","first-page":"5859","DOI":"10.1609\/aaai.v34i04.6044","article-title":"Learning efficient representations for fake speech detection","volume":"34","author":"Subramani","year":"2020","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"key":"2026033014313617900_ref230","first-page":"1","article-title":"Employing transfer-learning based CNN architectures to enhance the generalizability of deepfake detection","author":"Suratkar","year":"2020","journal-title":"2020 11th in- ternational conference on computing, communication and networking technologies (ICCCNT)"},{"issue":"1","key":"2026033014313617900_ref231","first-page":"8","article-title":"AI Based Assistance for Visually Im- paired People Using TTS (Text To Speech)","volume":"1","author":"Swetha","year":"2021","journal-title":"International Journal of Innovative Research in Science and Technology"},{"key":"2026033014313617900_ref232","article-title":".","author":"Tak","year":"2022","journal-title":"arXiv preprint arXiv:2202.12233"},{"key":"2026033014313617900_ref233","doi-asserted-by":"crossref","first-page":"6805","DOI":"10.1109\/ICASSP.2019.8683282","article-title":"AttS2S- VC: Sequence-to-sequence voice conversion with attention and con- text preservation mechanisms","author":"Tanaka","year":"2019","journal-title":"ICASSP 2019-2019 IEEE In- ternational Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref234","article-title":".","author":"Taylor","year":"2009","journal-title":"Text-to-speech synthesis"},{"key":"2026033014313617900_ref235","article-title":"Deep Learning for Siri\u2019s Voice: On-device Deep Mixture Density Networks for Hybrid Unit Selection Synthesis. Retrieved May 10, 2020","author":"Team","year":"2017"},{"key":"2026033014313617900_ref236","author":"TechCrunch.","year":"2016","journal-title":"AdobesProjectVoCo"},{"key":"2026033014313617900_ref237","doi-asserted-by":"crossref","first-page":"611","DOI":"10.1109\/ChinaSIP.2015.7230476","article-title":"Detect- ing synthetic speech using long term magnitude and phase informa- tion","author":"Tian","year":"2015","journal-title":"2015 IEEE China Summit and International Conference on Signal and Information Processing (ChinaSIP)"},{"key":"2026033014313617900_ref238","doi-asserted-by":"crossref","first-page":"2119","DOI":"10.1109\/ICASSP.2016.7472051","article-title":"Spoofing detection from a feature representation perspective","author":"Tian","year":"2016","journal-title":"2016 IEEE International conference on acoustics, speech and signal processing (ICASSP)"},{"key":"2026033014313617900_ref239","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2017.08.015","article-title":"Speaker identification features extraction methods: A systematic","author":"Tirumala","year":"2017"},{"key":"2026033014313617900_ref240","doi-asserted-by":"crossref","first-page":"516","DOI":"10.1016\/j.csl.2017.01.001","article-title":"Constant Q cepstral coefficients: A spoofing countermeasure for automatic speaker verifi- cation","volume":"45","author":"Todisco","year":"2017","journal-title":"Computer Speech &Language"},{"key":"2026033014313617900_ref241","first-page":"283","article-title":"A New Feature for Automatic Speaker Verification Anti-Spoofing: Constant Q Cepstral Coefficients.","volume":"2016","author":"Todisco","year":"2016","journal-title":"Odyssey"},{"issue":"5","key":"2026033014313617900_ref242","doi-asserted-by":"crossref","first-page":"2211","DOI":"10.1007\/s11760-022-02436-4","article-title":"Mel spectrogram- based audio forgery detection using CNN","volume":"17","author":"Ustubioglu","year":"2023","journal-title":"Signal, Image and Video Processing"},{"key":"2026033014313617900_ref243","doi-asserted-by":"crossref","first-page":"6189","DOI":"10.1109\/ICASSP40776.2020.9054556","article-title":"Mellotron: Mul- tispeaker expressive voice synthesis by conditioning on rhythm, pitch and global style tokens","author":"Valle","year":"2020","journal-title":"ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref244","article-title":"Tensor2tensor for neural machine translation","author":"Vaswani","year":"2018","journal-title":"arXiv preprint arXiv:1803.07416"},{"issue":"5","key":"2026033014313617900_ref245","doi-asserted-by":"crossref","first-page":"910","DOI":"10.1109\/JSTSP.2020.3002101","article-title":"Media forensics and deepfakes: an overview","volume":"14","author":"Verdoliva","year":"2020","journal-title":"IEEE Journal of Selected Topics in Signal Processing"},{"key":"2026033014313617900_ref246","article-title":"Spoofing detection with DNN and one-class SVM for the ASVspoof 2015 challenge","author":"Villalba","year":"2015","journal-title":"Sixteenth annual conference of the international speech communication association"},{"issue":"5","key":"2026033014313617900_ref247","doi-asserted-by":"crossref","first-page":"3100","DOI":"10.3390\/app13053100","article-title":"Overview of Voice Conversion Methods Based on Deep Learning","volume":"13","author":"Walczyna","year":"2023","journal-title":"Applied Sciences"},{"key":"2026033014313617900_ref248","doi-asserted-by":"crossref","first-page":"1406","DOI":"10.1109\/ICASSP48485.2024.10448095","article-title":"Multi-Scale Permutation Entropy for Audio Deepfake Detection","author":"Wang","year":"2024","journal-title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref249","doi-asserted-by":"crossref","article-title":"Detection of Cross-Dataset Fake Audio Based on Prosodic and Pronunciation","author":"Wang","DOI":"10.21437\/Interspeech.2023-1254"},{"key":"2026033014313617900_ref250","article-title":"Detection of Cross-Dataset Fake Audio Based on Prosodic and Pronunciation Features","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv:2305.13700"},{"key":"2026033014313617900_ref251","article-title":"Neural codec language models are zero- shot text to speech synthesizers","author":"Wang","year":"2023","journal-title":"arXiv preprint arXiv:2301.02111"},{"key":"2026033014313617900_ref252","doi-asserted-by":"crossref","first-page":"1207","DOI":"10.1145\/3394171.3413716","article-title":"Deepsonar: Towards effective and robust detection of ai-synthesized fake voices","author":"Wang","year":"2020","journal-title":"Proceedings of the 28th ACM international conference on multimedia"},{"key":"2026033014313617900_ref253","article-title":"Investigating self-supervised front ends for speech spoofing countermeasures","author":"Wang","year":"2021","journal-title":"arXiv preprint arXiv:2111.07725"},{"key":"2026033014313617900_ref254","doi-asserted-by":"crossref","first-page":"101114","DOI":"10.1016\/j.csl.2020.101114","article-title":"ASVspoof 2019: A large-scale public database of synthesized, con- verted and replayed speech","volume":"64","author":"Wang","year":"2020","journal-title":"Computer Speech &Language"},{"key":"2026033014313617900_ref255","first-page":"4004","article-title":"Robust audio anti-spoofing countermeasure with joint training of front-end and back-end models","volume":"2023","author":"Wang","year":"2023","journal-title":"Proc. INTERSPEECH"},{"key":"2026033014313617900_ref256","article-title":"Tacotron: Towards end-to-end speech synthesis","author":"Wang","year":"2017","journal-title":"arXiv preprint arXiv:1703.10135"},{"key":"2026033014313617900_ref257","first-page":"1352","article-title":"Densely connected convolutional network for audio spoofing detection","author":"Wang","year":"2020","journal-title":"2020 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)"},{"key":"2026033014313617900_ref258","first-page":"156","article-title":"Deepfakes Audio Detection Lever- aging Audio Spectrogram and Convolutional Neural Networks","author":"Wani","year":"2023","journal-title":"International Conference on Image Analysis and Processing"},{"key":"2026033014313617900_ref259","first-page":"2464","article-title":"ABC-CapsNet: Attention based Cascaded Capsule Network for Audio Deepfake De- tection","author":"Wani","year":"2024","journal-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition"},{"key":"2026033014313617900_ref260","doi-asserted-by":"crossref","first-page":"271","DOI":"10.1145\/3658664.3659647","article-title":"Detecting Audio Deepfakes: Integrating CNN and BiLSTM with Multi-Feature Concatenation","author":"Wani","year":"2024","journal-title":"Proceedings of the 2024 ACM Workshop on Information Hiding and Multimedia Security"},{"key":"2026033014313617900_ref261","doi-asserted-by":"crossref","first-page":"100040","DOI":"10.1016\/j.csa.2024.100040","article-title":"A Secure Deepfake Mitigation Framework: Architecture, Issues, Challenges, and Societal Impact","volume":"2","author":"Wazid","year":"2024","journal-title":"Cyber Security and Applications"},{"key":"2026033014313617900_ref262","first-page":"192","article-title":"Deepfake audio detection: a deep learning based solution for group conversations","author":"Wijethunga","year":"2020","journal-title":"2020 2nd Inter- national Conference on Advancements in Computing (ICAC)"},{"issue":"CSCW1","key":"2026033014313617900_ref263","first-page":"1","article-title":"Privacy Legisla- tion as Business Risks: How GDPR and CCPA are Represented in Technology Companies\u2019 Investment Risk Disclosures","volume":"7","author":"Wong","year":"2023","journal-title":"Proceedings of the ACM on Human-Computer Interaction"},{"key":"2026033014313617900_ref264","article-title":"Adaspeech 4: Adaptive text to speech in zero-shot scenarios","author":"Wu","year":"2022","journal-title":"arXiv preprint arXiv:2204.00436"},{"key":"2026033014313617900_ref265","article-title":"Light convolutional neural network with feature genuinization for detection of synthetic speech attacks","author":"Wu","year":"2020","journal-title":"arXiv preprint arXiv:2009.09637"},{"issue":"4","key":"2026033014313617900_ref266","doi-asserted-by":"crossref","first-page":"768","DOI":"10.1109\/TASLP.2016.2526653","article-title":"Anti-spoofing for text-independent speaker verification: An initial database, comparison of countermeasures, and human performance","volume":"24","author":"Wu","year":"2016","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Process- ing"},{"key":"2026033014313617900_ref267","doi-asserted-by":"crossref","first-page":"130","DOI":"10.1016\/j.specom.2014.10.005","article-title":"Spoofing and countermeasures for speaker verification: A survey","volume":"66","author":"Wu","year":"2015","journal-title":"speech communication"},{"key":"2026033014313617900_ref268","article-title":"ASVspoof 2015: the first automatic speaker verification spoofing and countermeasures challenge","author":"Wu","year":"2015","journal-title":"Sixteenth annual conference of the international speech communication associ-ation"},{"key":"2026033014313617900_ref269","doi-asserted-by":"crossref","first-page":"202","DOI":"10.21437\/SSW.2016-33","article-title":"Merlin: An Open Source Neural Network Speech Synthesis System.","author":"Wu","year":"2016","journal-title":"SSW"},{"key":"2026033014313617900_ref270","doi-asserted-by":"crossref","first-page":"7234","DOI":"10.1109\/ICASSP.2013.6639067","article-title":"Synthetic speech detection using temporal modulation feature","author":"Wu","year":"2013","journal-title":"2013 IEEE In- ternational Conference on Acoustics, Speech and Signal Processing"},{"key":"2026033014313617900_ref271","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.ins.2023.03.006","article-title":"Manipula- tion detection of key populations under information measurement","volume":"634","author":"Xiao","year":"2023","journal-title":"Information Sciences"},{"key":"2026033014313617900_ref272","article-title":"Spoof- ing speech detection using high dimensional magnitude and phase features: the NTU approach for ASVspoof 2015 challenge.","author":"Xiao","year":"2015","journal-title":"In- terspeech"},{"key":"2026033014313617900_ref273","article-title":"Domain Generalization Via Aggregation and Separation for Audio Deepfake Detection","author":"Xie","year":"2023","journal-title":"IEEE Transactions on Information Forensics and Security"},{"key":"2026033014313617900_ref274","first-page":"2808","article-title":"Learning A Self- Supervised Domain-Invariant Feature Representation for General- ized Audio Deepfake Detection","author":"Xie","year":"2023","journal-title":"Proc. INTERSPEECH"},{"key":"2026033014313617900_ref275","doi-asserted-by":"crossref","DOI":"10.1109\/TTS.2024.3365421","article-title":"Analyzing Fair- ness in Deepfake Detection With Massively Annotated Databases","author":"Xu","year":"2024","journal-title":"IEEE Transactions on Technology and Society"},{"key":"2026033014313617900_ref276","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1145\/3552466.3556526","article-title":"Audio deepfake detection based on a combination of f0 information and real plus imaginary spectrogram features","author":"Xue","year":"2022","journal-title":"Proceedings of the 1st International Workshop on Deepfake Detection for Audio Multimedia"},{"key":"2026033014313617900_ref277","article-title":"Foundationtts: Text-to-speech for asr customization with generative language model","author":"Xue","year":"2023","journal-title":"arXiv preprint arXiv:2303.02939"},{"key":"2026033014313617900_ref278","article-title":"ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection","author":"Yamagishi","year":"2021","journal-title":"arXiv preprint arXiv:2109.00537"},{"key":"2026033014313617900_ref279","doi-asserted-by":"crossref","first-page":"6199","DOI":"10.1109\/ICASSP40776.2020.9053795","article-title":"Parallel WaveGAN: A fast waveform generation model based on generative adversarial networks with multi-resolution spectrogram","author":"Yamamoto","year":"2020","journal-title":"ICASSP 2020-2020 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref280","doi-asserted-by":"crossref","first-page":"9226","DOI":"10.1109\/ICASSP43922.2022.9746820","article-title":"Audio deepfake detection system with neural stitching for add 2022","author":"Yan","year":"2022","journal-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"issue":"2","key":"2026033014313617900_ref281","first-page":"767","article-title":"Deep Dive into Deepfakes\u2014Safeguarding Our Digital Identity","volume":"48","author":"Yan","year":"2023","journal-title":"Brooklyn Journal of International Law"},{"key":"2026033014313617900_ref282","doi-asserted-by":"crossref","first-page":"6613","DOI":"10.1109\/ICASSP39728.2021.9414872","article-title":"Adaspeech 2: Adaptive text to speech with untranscribed data","author":"Yan","year":"2021","journal-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref283","article-title":"Adaspeech 3: Adaptive text to speech for spontaneous style","author":"Yan","year":"2021","journal-title":"arXiv preprint arXiv:2107.02530"},{"key":"2026033014313617900_ref284","article-title":"Feature with Complementarity of Statistics and Principal Information for Spoofing Detection.","author":"Yang","year":"2018","journal-title":"INTERSPEECH"},{"key":"2026033014313617900_ref285","doi-asserted-by":"crossref","first-page":"492","DOI":"10.1109\/SLT48900.2021.9383551","article-title":"Multi- band melgan: Faster waveform generation for high-quality text-to- speech","author":"Yang","year":"2021","journal-title":"2021 IEEE Spoken Language Technology Workshop (SLT)"},{"key":"2026033014313617900_ref286","doi-asserted-by":"crossref","first-page":"102622","DOI":"10.1016\/j.dsp.2019.102622","article-title":"Long-term high frequency features for synthetic speech detection","volume":"97","author":"Yang","year":"2020","journal-title":"Digital Signal Processing"},{"issue":"12","key":"2026033014313617900_ref287","doi-asserted-by":"crossref","first-page":"2373","DOI":"10.1109\/TASLP.2019.2946897","article-title":"Extraction of octave spectra information for spoofing attack detection","volume":"27","author":"Yang","year":"2019","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"2026033014313617900_ref288","article-title":"VocGAN: A high- fidelity real-time vocoder with a hierarchically-nested adversarial network","author":"Yang","year":"2020","journal-title":"arXiv preprint arXiv:2007.15256"},{"key":"2026033014313617900_ref289","doi-asserted-by":"crossref","first-page":"11016","DOI":"10.1109\/ICASSP48485.2024.10446863","article-title":"StreamVC: Real-Time Low-Latency Voice Conver- sion","author":"Yang","year":"2024","journal-title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref290","article-title":"Half-truth: A partially fake audio detection dataset","author":"Yi","year":"2021","journal-title":"arXiv preprint arXiv:2104.03617"},{"key":"2026033014313617900_ref291","doi-asserted-by":"crossref","DOI":"10.1109\/ICASSP43922.2022.9746939","article-title":"Add 2022: the first audio deep synthesis detection challenge","author":"Yi","year":"2022","journal-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref292","article-title":"ADD 2023: the Second Audio Deepfake Detection Challenge","author":"Yi","year":"2023","journal-title":"arXiv preprint arXiv:2305.13774"},{"key":"2026033014313617900_ref293","doi-asserted-by":"crossref","first-page":"100250","DOI":"10.1016\/j.osnem.2023.100250","article-title":"Session-based cyberbullying detection in social media: A survey","volume":"36","author":"Yi","year":"2023","journal-title":"Online Social Networks and Media"},{"issue":"10","key":"2026033014313617900_ref294","doi-asserted-by":"crossref","first-page":"4633","DOI":"10.1109\/TNNLS.2017.2771947","article-title":"Spoofing detection in automatic speaker verification systems using DNN classifiers and dynamic acoustic features","volume":"29","author":"Yu","year":"2017","journal-title":"IEEE transactions on neural networks and learning systems"},{"key":"2026033014313617900_ref295","doi-asserted-by":"crossref","first-page":"4779","DOI":"10.1109\/ACCESS.2017.2687041","article-title":"DNN filter bank cepstral coefficients for spoofing detection","volume":"5","author":"Yu","year":"2017","journal-title":"Ieee Access"},{"key":"2026033014313617900_ref296","article-title":"Pvass- mdd: predictive visual-audio alignment self-supervision for multi- modal deepfake detection","author":"Yu","year":"2023","journal-title":"IEEE Transactions on Circuits and Systems for Video Technology"},{"issue":"5","key":"2026033014313617900_ref297","first-page":"5609","article-title":"Deep learning for face anti-spoofing: A survey","volume":"45","author":"Yu","year":"2022","journal-title":"IEEE transactions on pattern analysis and machine intelligence"},{"key":"2026033014313617900_ref298","doi-asserted-by":"crossref","first-page":"383","DOI":"10.1109\/UBMK52708.2021.9558993","article-title":"A review of spam detection in social media","author":"Yurtseven","year":"2021","journal-title":"2021 6th International Conference on Computer Science and Engineering (UBMK)"},{"issue":"7","key":"2026033014313617900_ref299","doi-asserted-by":"crossref","first-page":"317","DOI":"10.3390\/a16070317","article-title":"Audio Anti-Spoofing Based on Audio Feature Fusion","volume":"16","author":"Zhang","year":"2023","journal-title":"Algorithms"},{"key":"2026033014313617900_ref300","doi-asserted-by":"crossref","first-page":"1290","DOI":"10.1109\/TASLP.2021.3066047","article-title":"Transfer learning from speech synthesis to voice conversion with non-parallel training data","volume":"29","author":"Zhang","year":"2021","journal-title":"IEEE\/ACM Transactions on Audio, Speech, and Language Processing"},{"key":"2026033014313617900_ref301","first-page":"41819","article-title":"Do you remember?","author":"Zhang","year":"2023","journal-title":"International Conference on Machine Learning"},{"issue":"17","key":"2026033014313617900_ref302","doi-asserted-by":"crossref","first-page":"19569","DOI":"10.1609\/aaai.v38i17.29929","article-title":"What to remember: Self-adaptive continual learning for audio deep- fake detection","volume":"38","author":"Zhang","year":"2024","journal-title":"Proceedings of the AAAI Conference on Artificial Intelligence"},{"issue":"5","key":"2026033014313617900_ref303","first-page":"1","article-title":"Joint Audio-Visual Attention with Contrastive Learning for More General Deepfake Detection","volume":"20","author":"Zhang","year":"2024","journal-title":"ACM Transactions on Multimedia Computing, Communications and Applications"},{"key":"2026033014313617900_ref304","doi-asserted-by":"crossref","first-page":"7237","DOI":"10.1109\/ICASSP43922.2022.9747664","article-title":"Visinger: Variational inference with adversarial learning for end-to-end singing voice synthesis","author":"Zhang","year":"2022","journal-title":"ICASSP 2022-2022 IEEE International Confer- ence on Acoustics, Speech and Signal Processing (ICASSP)"},{"key":"2026033014313617900_ref305","doi-asserted-by":"crossref","first-page":"13","DOI":"10.1145\/3437880.3460408","article-title":"Fake speech detection using residual network with transformer encoder","author":"Zhang","year":"2021","journal-title":"Proceedings of the 2021 ACM workshop on information hiding and multimedia security"},{"key":"2026033014313617900_ref306","article-title":"Gazev: Gan-based zero-shot voice conversion over non-parallel speech corpus","author":"Zhang","year":"2020","journal-title":"arXiv preprint arXiv:2010.12788"},{"key":"2026033014313617900_ref307","doi-asserted-by":"crossref","first-page":"1035","DOI":"10.1109\/ITNEC52019.2021.9587053","article-title":"IVCGAN: An Improved GAN for Voice Conversion","volume":"5","author":"Zhao","year":"2021","journal-title":"2021 IEEE 5th Informa- tion Technology, Networking, Electronic and Automation Control Conference (ITNEC)"},{"key":"2026033014313617900_ref308","first-page":"14800","article-title":"Joint audio-visual deepfake detec- tion","author":"Zhou","year":"2021","journal-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision"}],"container-title":["Foundations and Trends\u00ae in Privacy and Security"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.emerald.com\/ftsec\/article-pdf\/6\/3-4\/153\/11046542\/3300000048en.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/www.emerald.com\/ftsec\/article-pdf\/6\/3-4\/153\/11046542\/3300000048en.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T18:53:13Z","timestamp":1777488793000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.emerald.com\/ftsec\/article\/6\/3-4\/153\/1328587\/Navigating-the-Soundscape-of-Deception-A"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,27]]},"references-count":308,"journal-issue":{"issue":"3-4","published-print":{"date-parts":[[2024,11,27]]}},"URL":"https:\/\/doi.org\/10.1561\/3300000048","relation":{},"ISSN":["2474-1558","2474-1566"],"issn-type":[{"value":"2474-1558","type":"print"},{"value":"2474-1566","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,27]]}}}