{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,5]],"date-time":"2026-08-05T07:48:54Z","timestamp":1785916134930,"version":"3.56.0"},"reference-count":155,"publisher":"Frontiers Media SA","license":[{"start":{"date-parts":[[2023,1,9]],"date-time":"2023-01-09T00:00:00Z","timestamp":1673222400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["frontiersin.org"],"crossmark-restriction":true},"short-container-title":["Front. Big Data"],"abstract":"<jats:p>A deepfake is content or material that is synthetically generated or manipulated using artificial intelligence (AI) methods, to be passed off as real and can include audio, video, image, and text synthesis. The key difference between manual editing and deepfakes is that deepfakes are AI generated or AI manipulated and closely resemble authentic artifacts. In some cases, deepfakes can be fabricated using AI-generated content in its entirety. Deepfakes have started to have a major impact on society with more generation mechanisms emerging everyday. This article makes a contribution in understanding the landscape of deepfakes, and their detection and generation methods. We evaluate various categories of deepfakes especially in audio. The purpose of this survey is to provide readers with a deeper understanding of (1) different deepfake categories; (2) how they could be created and detected; (3) more specifically, how audio deepfakes are created and detected in more detail, which is the main focus of this paper. We found that generative adversarial networks (GANs), convolutional neural networks (CNNs), and deep neural networks (DNNs) are common ways of creating and detecting deepfakes. In our evaluation of over 150 methods, we found that the majority of the focus is on video deepfakes, and, in particular, the generation of video deepfakes. We found that for text deepfakes, there are more generation methods but very few robust methods for detection, including fake news detection, which has become a controversial area of research because of the potential heavy overlaps with human generation of fake content. Our study reveals a clear need to research audio deepfakes and particularly detection of audio deepfakes. This survey has been conducted with a different perspective, compared to existing survey papers that mostly focus on just video and image deepfakes. This survey mainly focuses on audio deepfakes that are overlooked in most of the existing surveys. This article's most important contribution is to critically analyze and provide a unique source of audio deepfake research, mostly ranging from 2016 to 2021. To the best of our knowledge, this is the first survey focusing on audio deepfakes generation and detection in English.<\/jats:p>","DOI":"10.3389\/fdata.2022.1001063","type":"journal-article","created":{"date-parts":[[2023,1,10]],"date-time":"2023-01-10T15:51:39Z","timestamp":1673365899000},"update-policy":"https:\/\/doi.org\/10.3389\/crossmark-policy","source":"Crossref","is-referenced-by-count":108,"title":["Audio deepfakes: A survey"],"prefix":"10.3389","volume":"5","author":[{"given":"Zahra","family":"Khanjani","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gabrielle","family":"Watson","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Vandana P.","family":"Janeja","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"1965","published-online":{"date-parts":[[2023,1,9]]},"reference":[{"key":"B1","doi-asserted-by":"publisher","first-page":"71","DOI":"10.1250\/ast.11.71","article-title":"Voice conversion through vector quantization","volume":"11","author":"Abe","year":"1990","journal-title":"J. Acoust. Soc. Jpn"},{"key":"B2","author":"Ajder","year":"2019","journal-title":"The State of Deepfakes: Landscape, Threats, and Impact, Deeptrace"},{"key":"B3","doi-asserted-by":"crossref","first-page":"367","DOI":"10.1007\/978-3-319-28658-7_32","article-title":"\u201cInterconversion of emotions in speech using td-psola,\u201d","volume-title":"Advances in Signal Processing and Intelligent Recognition Systems","author":"Akanksh","year":"2016"},{"key":"B4","doi-asserted-by":"publisher","first-page":"155","DOI":"10.3390\/a15050155","article-title":"A review of modern audio deepfake detection methods: challenges and future directions","volume":"15","author":"Almutairi","year":"2022","journal-title":"Algorithms"},{"key":"B5","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-3174","article-title":"Deep residual neural networks for audio spoofing detection","author":"Alzantot","year":"2019","journal-title":"arXiv:1907.00501 [cs"},{"key":"B6","doi-asserted-by":"publisher","first-page":"162857","DOI":"10.1109\/ACCESS.2021.3133134","article-title":"Voice spoofing countermeasure for logical access attacks detection","volume":"9","author":"Arif","year":"2021","journal-title":"IEEE Access"},{"key":"B7","first-page":"195","article-title":"\u201cDeep voice: Real-time neural text-to-speech,\u201d","author":"Ar\u0131k","year":"2017","journal-title":"International Conference on Machine Learning (PMLR)"},{"key":"B8","doi-asserted-by":"publisher","first-page":"110861","DOI":"10.1016\/j.chaos.2021.110861","article-title":"Forecasting of COVID-19 using deep layer recurrent neural networks (RNNs) with gated recurrent units (GRUs) and long short-term memory (LSTM) cells","volume":"146","author":"ArunKumar","year":"2021","journal-title":"Chaos Solitons Fractals"},{"key":"B9","year":""},{"key":"B10","doi-asserted-by":"publisher","first-page":"84229","DOI":"10.1109\/ACCESS.2019.2923806","article-title":"Toward robust audio spoofing detection: a detailed comparison of traditional and learned features","volume":"7","author":"Balamurali","year":"2019","journal-title":"IEEE Access"},{"key":"B11","article-title":"\u201cGenerative adversarial nets,\u201d","author":"Bengio","year":"2014","journal-title":"Advances in Neural Information Processing Systems"},{"key":"B12","first-page":"2691","article-title":"\u201cWho are you (I Really Wanna Know)? Detecting audio DeepFakes through vocal tract reconstruction,\u201d","author":"Blue","year":"2022","journal-title":"31st USENIX Security Symposium (USENIX Security 22)"},{"key":"B13","first-page":"5932","article-title":"\u201cEverybody dance now,\u201d","volume-title":"2019 IEEE\/CVF International Conference on Computer Vision (ICCV), Computer Vision (ICCV), 2019 IEEE\/CVF International Conference on","author":"Chan","year":"2019"},{"key":"B14","first-page":"771","article-title":"Establishing environment setup for preventing deepfakes using blockchain technology","volume":"9","author":"Chauhan","year":"2020","journal-title":"Mukt Shabd J"},{"key":"B15","doi-asserted-by":"crossref","first-page":"132","DOI":"10.1109\/ICCSA.2019.00011","article-title":"\u201cA trusting news ecosystem against fake news from humanity and technology perspectives,\u201d","volume-title":"2019 19th International Conference on Computational Science and Its Applications (ICCSA)","author":"Chen","year":"2019"},{"key":"B16","doi-asserted-by":"publisher","DOI":"10.21437\/Odyssey.2020-19","article-title":"\u201cGeneralization of audio deepfake detection,\u201d","author":"Chen","year":"2020","journal-title":"Odyssey"},{"key":"B17","doi-asserted-by":"publisher","first-page":"491","DOI":"10.1016\/j.neucom.2020.03.011","article-title":"Probabilistic forecasting with temporal convolutional neural network","volume":"399","author":"Chen","year":"2020","journal-title":"Neurocomputing"},{"key":"B18","doi-asserted-by":"crossref","first-page":"102","DOI":"10.21437\/Interspeech.2017-1085","article-title":"\u201cResNet and model fusion for automatic spoofing detection,\u201d","volume-title":"Interspeech 2017","author":"Chen","year":"2017"},{"key":"B19","doi-asserted-by":"publisher","first-page":"1024","DOI":"10.1109\/JSTSP.2020.2999185","article-title":"Recurrent convolutional structures for audio spoof and video deepfake detection","volume":"14","author":"Chintha","year":"2020","journal-title":"IEEE J. Sel. Top. Signal Process"},{"key":"B20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00916","article-title":"StarGAN: unified generative adversarial networks for multi-domain image-to-image translation","author":"Choi","year":"2018","journal-title":"arXiv:1711.09020 [cs"},{"key":"B21","doi-asserted-by":"publisher","first-page":"1086","DOI":"10.21437\/Interspeech.2018-1929","article-title":"VoxCeleb2: deep speaker recognition","volume":"2018","author":"Chung","year":"2018","journal-title":"Interspeech"},{"key":"B22","doi-asserted-by":"publisher","first-page":"2493","DOI":"10.48550\/arXiv.1103.0398","article-title":"Natural language processing (almost) from scratch","volume":"12","author":"Collobert","year":"2012","journal-title":"J. Mach. Learn. Res"},{"key":"B23","unstructured":"ConstineJ.\n          Instagram Hides False Content Behind Warnings, Except for Politicians2019"},{"key":"B24","year":"2021","journal-title":"Ctrl shift face. YouTube"},{"key":"B25","doi-asserted-by":"publisher","first-page":"61","DOI":"10.1016\/j.csl.2014.09.005","article-title":"A survey on the application of recurrent neural networks to statistical language modeling","volume":"30","author":"De Mulder","year":"2015","journal-title":"Comput. Speech Lang"},{"key":"B26","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2021.108098","article-title":"A survey on text generation using generative adversarial networks","author":"de Rosa","year":"2021","journal-title":"Pattern Recognit"},{"key":"B27","unstructured":"DelgadoH.\n            EvansN.\n            KinnunenT.\n            LeeK. A.\n            LiuX.\n            NautschA.\n          ASVspoof 2021: Automatic Speaker Verification Spoofing and Countermeasures Challenge, v0.32021"},{"key":"B28","doi-asserted-by":"publisher","first-page":"197","DOI":"10.1561\/2000000039","article-title":"Deep learning: Methods and applications","volume":"7","author":"Deng","year":"2014","journal-title":"Foundat. Trends"},{"key":"B29","year":""},{"key":"B30","unstructured":"EnglerA.\n          Fighting Deepfakes When Detection Fails2019"},{"key":"B31","year":""},{"key":"B32","doi-asserted-by":"crossref","first-page":"5279","DOI":"10.1109\/ICASSP.2018.8462342","article-title":"\u201cHigh-quality nonparallel voice conversion based on cycle-consistent adversarial network,\u201d","volume-title":"2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Fang","year":"2018"},{"key":"B33","doi-asserted-by":"publisher","first-page":"920","DOI":"10.1016\/j.specom.2008.11.004","article-title":"Foreign accent conversion in computer assisted pronunciation training","volume":"51","author":"Felps","year":"2009","journal-title":"Speech Commun"},{"key":"B34","doi-asserted-by":"publisher","first-page":"53","DOI":"10.1109\/MITP.2020.2977589","article-title":"Fake news, disinformation, and deepfakes: leveraging distributed ledger technologies and blockchain to combat digital deception and counterfeit reality","volume":"22","author":"Fraga-Lamas","year":"2020","journal-title":"IT Prof"},{"key":"B35","article-title":"WaveFake: a data set to facilitate audio deepfake detection","author":"Frank","year":"2021","journal-title":"arXiv"},{"key":"B36","unstructured":"FunkeD.\n          PolitiFact: Nancy Pelosi Doesn't Drink, So Why Do False Claims About Her Being Drunk Keep Going Viral?2020"},{"key":"B37","doi-asserted-by":"crossref","first-page":"2506","DOI":"10.1109\/ICASSP.2018.8462018","article-title":"\u201cVoice impersonation using generative adversarial networks,\u201d","volume-title":"2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Gao","year":"2018"},{"key":"B38","article-title":"\u201cDeep voice 2: Multi-speaker neural text-to-speech,\u201d","author":"Gibiansky","year":"2017","journal-title":"Advances in Neural Information Processing Systems"},{"key":"B39","doi-asserted-by":"publisher","DOI":"10.21437\/Odyssey.2018-43","article-title":"\u201cAn audio fingerprinting approach to replay attack detection on ASVSPOOF 2017 challenge data,\u201d","author":"Gonzalez-Rodriguez","year":"2018","journal-title":"Odyssey"},{"key":"B40","author":"Goodfellow","year":"2016","journal-title":"Deep Learning"},{"key":"B41","doi-asserted-by":"publisher","first-page":"244","DOI":"10.1016\/j.compenvurbsys.2018.10.008","article-title":"Artificial neural networks and deep learning in urban geography: a systematic review and meta-analysis","volume":"74","author":"Grekousis","year":"2019","journal-title":"Comput. Environ. Urban. Syst"},{"key":"B42","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3393880","article-title":"The future of false information detection on social media: new perspectives and trends","volume":"53","author":"Guo","year":"2020","journal-title":"ACM Comput. Surveys"},{"key":"B43","unstructured":"HarrisR.\n          How It Feels to Find Your Face Photoshopped Onto Internet Porn2019"},{"key":"B44","article-title":"Trump shares fake video of biden playing n.w.a.'s 'f\u2013 tha police' instead of 'despacito'","author":"Herbert","year":"2020"},{"key":"B45","doi-asserted-by":"crossref","first-page":"2567","DOI":"10.1109\/ICASSP.2019.8682573","article-title":"\u201cAudio replay spoof attack detection using segment-based hybrid feature and DenseNet-LSTM network,\u201d","volume-title":"ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Huang","year":"2019"},{"key":"B46","doi-asserted-by":"publisher","first-page":"1813","DOI":"10.1109\/TASLP.2020.2998870","article-title":"Audio replay spoof attack detection by joint segment-based linear filter bank feature extraction and attention-enhanced DenseNet-BiLSTM network","volume":"28","author":"Huang","year":"2020","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process"},{"key":"B47","doi-asserted-by":"crossref","first-page":"5967","DOI":"10.1109\/CVPR.2017.632","article-title":"\u201cImage-to-image translation with conditional adversarial networks,\u201d","volume-title":"2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Isola","year":"2017"},{"key":"B48","author":"Ito","year":"2017","journal-title":"The LJ Speech Dataset"},{"key":"B49","doi-asserted-by":"publisher","first-page":"139","DOI":"10.1016\/0167-6393(94)00051-B","article-title":"Speech spectrum conversion based on speaker interpolation and multi-functional representation with weighting by radial basis function networks","volume":"16","author":"Iwahashi","year":"1995","journal-title":"Speech Commun"},{"key":"B50","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1806.04558","article-title":"Transfer learning from speaker verification to multispeaker text-to-speech synthesis","author":"Jia","year":"2019","journal-title":"arXiv:1806.04558 [cs, eess"},{"key":"B51","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3072959.3073702","article-title":"VoCo: text-based insertion and replacement in audio narration","volume":"36","author":"Jin","year":"2017","journal-title":"ACM Trans. Graph"},{"key":"B52","doi-asserted-by":"publisher","first-page":"743","DOI":"10.1016\/j.specom.2007.05.001","article-title":"Improving the intelligibility of dysarthric speech","volume":"49","author":"Kain","year":"2007","journal-title":"Speech Commun"},{"key":"B53","doi-asserted-by":"crossref","first-page":"266","DOI":"10.1109\/SLT.2018.8639535","article-title":"\u201cStarGAN-VC: non-parallel many-to-many voice conversion using star generative adversarial networks,\u201d","volume-title":"2018 IEEE Spoken Language Technology Workshop (SLT)","author":"Kameoka","year":"2018"},{"key":"B54","unstructured":"KanskiA.\n          Study: 86% of People Don't Fact Check News Spotted on Social Media. PR Week2017"},{"key":"B55","doi-asserted-by":"crossref","first-page":"4396","DOI":"10.1109\/CVPR.2019.00453","article-title":"\u201cA style-based generator architecture for generative adversarial networks,\u201d","volume-title":"2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Karras","year":"2019"},{"key":"B56","doi-asserted-by":"crossref","first-page":"8107","DOI":"10.1109\/CVPR42600.2020.00813","article-title":"\u201cAnalyzing and improving the image quality of StyleGAN,\u201d","volume-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Karras","year":"2020"},{"key":"B57","unstructured":"KesslerG.\n          Trump Campaign ad Manipulates Three Images to Put Biden in a \u2018basement'2020"},{"key":"B58","doi-asserted-by":"publisher","first-page":"3447","DOI":"10.1007\/s13369-021-06297-w","article-title":"A deep learning framework for audio deepfake detection","volume":"47","author":"Khochare","year":"2022","journal-title":"Arabian J. Sci. Eng"},{"key":"B59","doi-asserted-by":"crossref","first-page":"55","DOI":"10.1109\/AI4G50087.2020.9311067","article-title":"\u201cCombating deepfakes: multi-LSTM and blockchain as proof of authenticity for digital media,\u201d","volume-title":"2020 IEEE \/ ITU International Conference on Artificial Intelligence for Good (AI4G)","author":"Ki Chan","year":"2020"},{"key":"B60","first-page":"8067","article-title":"\u201cGlow-TTS: a generative flow for text-to-speech via monotonic alignment search,\u201d","volume-title":"Advances in Neural Information Processing Systems, Vol. 33","author":"Kim","year":"2020"},{"key":"B61","doi-asserted-by":"crossref","first-page":"6997","DOI":"10.1109\/ICASSP43922.2022.9746139","article-title":"\u201cAssem-vc: realistic voice conversion by assembling modern speech synthesis techniques,\u201d","volume-title":"ICASSP 2022-2022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Kim","year":"2022"},{"key":"B62","first-page":"10236","article-title":"\u201cGlow: generative flow with invertible 1 x 1 convolutions,\u201d","volume-title":"Proceedings of the 32nd International Conference on Neural Information Processing Systems, NIPS'18","author":"Kingma","year":""},{"key":"B63","author":"Kingma","year":""},{"key":"B64","doi-asserted-by":"publisher","first-page":"2","DOI":"10.21437\/Interspeech.2017-1111","article-title":"The ASVspoof 2017 challenge: assessing the limits of replay spoofing attack detection","volume":"2017","author":"Kinnunen","year":"2017","journal-title":"Interspeech"},{"key":"B65","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2014-539","article-title":"\u201cStatistical singing voice conversion with direct waveform modification based on the spectrum differential,\u201d","author":"Kobayashi","year":"2014","journal-title":"Fifteenth Annual Conference of the International Speech Communication Association"},{"key":"B66","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2010.05646","article-title":"HiFi-GAN: generative adversarial networks for efficient and high fidelity speech synthesis","author":"Kong","year":"2020","journal-title":"arXiv:2010.05646 [cs, eess"},{"key":"B67","doi-asserted-by":"publisher","DOI":"10.14419\/ijet.v7i2.28.12933","article-title":"Speech synthesis systems: disadvantages and limitations","author":"Kuligowska","year":"2018","journal-title":"Int. J. Eng. Technol"},{"key":"B68","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1910.06711","article-title":"MelGAN: generative adversarial networks for conditional waveform synthesis","author":"Kumar","year":"2019","journal-title":"arXiv:1910.06711 [cs, eess"},{"key":"B69","doi-asserted-by":"crossref","first-page":"6316","DOI":"10.1109\/ICASSP.2019.8682640","article-title":"\u201cAttentive filtering networks for audio replay attack detection,\u201d","volume-title":"ICASSP 2019 - 2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Lai","year":"2019"},{"key":"B70","doi-asserted-by":"publisher","first-page":"82","DOI":"10.21437\/Interspeech.2017-360","article-title":"Audio replay attack detection with deep learning frameworks","volume":"2017","author":"Lavrentyeva","year":"2017","journal-title":"Interspeech"},{"key":"B71","doi-asserted-by":"publisher","first-page":"436","DOI":"10.1038\/nature14539","article-title":"Deep learning","volume":"521","author":"LeCun","year":"2015","journal-title":"Nature"},{"key":"B72","doi-asserted-by":"publisher","first-page":"2278","DOI":"10.1109\/5.726791","article-title":"Gradient-based learning applied to document recognition","volume":"86","author":"Lecun","year":"1998","journal-title":"Proc. IEEE"},{"key":"B73","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00067","article-title":"Fully character-level neural machine translation without explicit segmentation","author":"Lee","year":"2017","journal-title":"arXiv:1610.03017 [cs"},{"key":"B74","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2015-336","article-title":"\u201cHigh-level feature representation using recurrent neural network for speech emotion recognition,\u201d","author":"Lee","year":"2015","journal-title":"Interspeech"},{"key":"B75","doi-asserted-by":"crossref","first-page":"2479","DOI":"10.1109\/CVPR.2016.272","article-title":"\u201cCombining markov random fields and convolutional neural networks for image synthesis,\u201d","volume-title":"2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Computer Vision and Pattern Recognition (CVPR)","author":"Li","year":"2016"},{"key":"B76","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2021.114683","article-title":"Speech emotion recognition using recurrent neural networks with directional self-attention","author":"Li","year":"2021","journal-title":"Expert Syst. Appl"},{"key":"B77","doi-asserted-by":"publisher","DOI":"10.3390\/app9081539","article-title":"Attention-based LSTM algorithm for audio replay detection in noisy environments","author":"Li","year":"2019","journal-title":"Appl. Sci"},{"key":"B78","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-456","article-title":"A study on replay attack and anti-spoofing for automatic speaker verification","author":"Li","year":"2017","journal-title":"arXiv:1706.02101 [cs"},{"key":"B79","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/WIFS.2018.8630787","article-title":"\u201cIn ictu oculi: exposing AI created fake videos by detecting eye blinking,\u201d","volume-title":"2018 IEEE International Workshop on Information Forensics and Security (WIFS)","author":"Li","year":"2018"},{"key":"B80","doi-asserted-by":"publisher","first-page":"651","DOI":"10.3390\/sym12040651","article-title":"Within the lack of chest COVID-19 x-ray dataset: a novel detection model based on GAN and deep transfer learning","volume":"12","author":"Loey","year":"2020","journal-title":"Symmetry"},{"key":"B81","doi-asserted-by":"crossref","first-page":"6359","DOI":"10.1109\/ICASSP39728.2021.9414670","article-title":"\u201cA capsule network based approach for detection of audio spoofing attacks,\u201d","volume-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Luo","year":"2021"},{"key":"B82","doi-asserted-by":"crossref","first-page":"5699","DOI":"10.1109\/ICASSP39728.2021.9414403","article-title":"\u201cLightspeech: lightweight and fast text to speech with neural architecture search,\u201d","volume-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Luo","year":"2021"},{"key":"B83","first-page":"408","article-title":"\u201cMethods of deepfake detection based on machine learning,\u201d","volume-title":"2020 IEEE Conference of Russian Young Researchers in Electrical and Electronic Engineering (EIConRus), Russian Young Researchers in Electrical and Electronic Engineering (EIConRus)","author":"Maksutov","year":"2020"},{"key":"B84","doi-asserted-by":"crossref","DOI":"10.1109\/ICCV.2017.304","article-title":"\u201cLeast squares generative adversarial networks,\u201d","volume-title":"2017 IEEE International Conference on Computer Vision (ICCV)","author":"Mao","year":"2017"},{"key":"B85","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3425780","article-title":"The creation and detection of deepfakes: a survey","volume":"54","author":"Mirsky","year":"2021","journal-title":"ACM Comput. Surveys"},{"key":"B86","doi-asserted-by":"crossref","first-page":"2823","DOI":"10.1145\/3394171.3413570","article-title":"\u201cEmotions don't lie: An audio-visual deepfake detection method using affective cues,\u201d","volume-title":"Proceedings of the 28th ACM International Conference on Multimedia","author":"Mittal","year":"2020"},{"key":"B87","doi-asserted-by":"publisher","first-page":"364","DOI":"10.1016\/j.neucom.2021.03.097","article-title":"DGSAN: discrete generative self-adversarial network","volume":"448","author":"Montahaei","year":"2021","journal-title":"Neurocomputing"},{"key":"B88","unstructured":"MurphyC.\n            HuangZ.\n          China's Red-Hot Face-Swapping App Provokes Privacy Concern2019"},{"key":"B89","doi-asserted-by":"publisher","first-page":"97","DOI":"10.21437\/Interspeech.2017-1377","article-title":"Replay attack detection using DNN for channel discrimination","volume":"2017","author":"Nagarsheth","year":"2017","journal-title":"Interspeech"},{"key":"B90","doi-asserted-by":"publisher","first-page":"207","DOI":"10.1016\/0167-6393(94)00058-I","article-title":"Transformation of formants for voice conversion using artificial neural networks","volume":"16","author":"Narendranath","year":"1995","journal-title":"Speech Commun"},{"key":"B91","doi-asserted-by":"publisher","first-page":"173","DOI":"10.1111\/cgf.14062","article-title":"High-resolution neural face swapping for visual effects","volume":"39","author":"Naruniec","year":"2020","journal-title":"Comput. Graphics Forum"},{"key":"B92","unstructured":"Tortillas\/Cancer-Story. NBC News2019"},{"key":"B93","doi-asserted-by":"publisher","DOI":"10.2139\/ssrn.4030341","article-title":"Deep learning for deepfakes creation and detection: a survey","author":"Nguyen","year":"2021","journal-title":"arXiv:1909.11573 [cs, eess"},{"key":"B94","unstructured":"Auspire2019"},{"key":"B95","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1609.03499","article-title":"WaveNet: a generative model for raw audio","author":"Oord","year":"2016","journal-title":"arXiv:1609.03499 [cs"},{"key":"B96","unstructured":"O'SullivanD.\n          Inside the Pentagon's Race Against Deepfake Videos2019"},{"key":"B97","doi-asserted-by":"crossref","first-page":"5206","DOI":"10.1109\/ICASSP.2015.7178964","article-title":"\u201cLibrispeech: an ASR corpus based on public domain audio books,\u201d","volume-title":"2015 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Panayotov","year":"2015"},{"key":"B98","doi-asserted-by":"publisher","first-page":"4696","DOI":"10.21437\/Interspeech.2020-1542","article-title":"Cotatron: Transcription-guided speech encoder for any-to-many voice conversion without parallel data","volume":"2020","author":"Park","year":"2020","journal-title":"Interspeech"},{"key":"B99","doi-asserted-by":"publisher","first-page":"271","DOI":"10.1046\/j.1440-1770.2002.00203.x","article-title":"Forecasting and assessing the impact of urban sprawl in coastal watersheds along eastern lake michigan","volume":"7","author":"Pijanowski","year":"2002","journal-title":"Lakes Reservoirs Res. Manag"},{"key":"B100","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1710.07654","article-title":"Deep voice 3: scaling text-to-speech with convolutional sequence learning","author":"Ping","year":"2018","journal-title":"arXiv:1710.07654 [cs, eess"},{"key":"B101","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3351258","article-title":"\u201cCombating replay attacks against voice assistants,\u201d","author":"Pradhan","year":"2019","journal-title":"Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies"},{"key":"B102","doi-asserted-by":"crossref","first-page":"3617","DOI":"10.1109\/ICASSP.2019.8683143","article-title":"\u201cWaveglow: a flow-based generative network for speech synthesis,\u201d","volume-title":"ICASSP 2019-2019 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Prenger","year":"2019"},{"key":"B103","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2008.03464","article-title":"Audio spoofing verification using deep convolutional neural networks by transfer learning","author":"Rahul","year":"2020","journal-title":"arXiv:2008.03464 [cs, eess"},{"key":"B104","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2021.115401","article-title":"A preliminary analysis of AI based smartphone application for diagnosis of COVID-19 using chest x-ray images","author":"Rangarajan","year":"2021","journal-title":"Expert Syst. Appl"},{"key":"B105","volume-title":"Artists Create a Sinister 'deepfake' of Mark Zuckerberg to Teach Facebook (and the rest of us) a Lesson About Digital Propaganda","author":"Rea","year":"2019"},{"key":"B106","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/SPED.2019.8906599","article-title":"\u201cFor: A dataset for synthetic speech detection,\u201d","volume-title":"2019 International Conference on Speech Technology and Human-Computer Dialogue (SpeD)","author":"Reimao","year":"2019"},{"key":"B107","article-title":"Fastspeech 2: Fast and high-quality end-to-end text to speech","author":"Ren","year":"2020","journal-title":"arXiv"},{"key":"B108","unstructured":"Reporting by Joseph Sipalan and Liz Lee; Writing by A. Ananthalakshmi; Editing by Nick Macfie. Malaysian police say political leader behind gay sex tape allegations2019"},{"key":"B109","doi-asserted-by":"publisher","first-page":"84","DOI":"10.1109\/TASLP.2017.2761547","article-title":"Statistical parametric speech synthesis incorporating generative adversarial networks","volume":"26","author":"Saito","year":"2018","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process"},{"key":"B110","unstructured":"SantosT.\n          Instagram Hides False Content Behind Warnings, Except for Politicians2019"},{"key":"B111","article-title":"After biden plays \u2018despacito' at an event, trump shares a doctored video replacing it with an anti-police song","author":"Saul","year":"2020","journal-title":"The New York Times"},{"key":"B112","doi-asserted-by":"crossref","first-page":"3483","DOI":"10.1109\/IJCNN.2017.7966294","article-title":"\u201cOn the use of deep recurrent neural networks for detecting audio spoofing attacks,\u201d","volume-title":"2017 International Joint Conference on Neural Networks (IJCNN)","author":"Scardapane","year":"2017"},{"key":"B113","doi-asserted-by":"crossref","first-page":"4779","DOI":"10.1109\/ICASSP.2018.8461368","article-title":"\u201cNatural TTS synthesis by conditioning wavenet on MEL spectrogram predictions,\u201d","volume-title":"2018 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Shen","year":"2018"},{"key":"B114","unstructured":"SierraA. D.\n          California Deepfake Laws First in Country to Take Effect2020"},{"key":"B115","doi-asserted-by":"crossref","DOI":"10.1109\/APSIPAASC47483.2019.9023162","article-title":"\u201cSINGAN: singing voice conversion with generative adversarial networks,\u201d","volume-title":"2019 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA ASC)","author":"Sisman","year":"2019"},{"key":"B116","unstructured":"SmithS.\n          NYT Cited Gender Blinding Tech Job Study, Doesn't Know if It's Real2019"},{"key":"B117","unstructured":"SmithS.\n          Nebraska TV News Fell for Scam Call Saying Post Office Closing for Coronavirus2020"},{"key":"B118","doi-asserted-by":"publisher","first-page":"3399","DOI":"10.1007\/s12652-020-02560-4","article-title":"Secure prediction and assessment of sports injuries using deep learning based convolutional neural network","volume":"12","author":"Song","year":"2021","journal-title":"J. Ambient. Intell. Humaniz Comput"},{"key":"B119","article-title":"\u201cChar2wav: End-to-end speech synthesis,\u201d","author":"Sotelo","year":"2017","journal-title":"ICLR 2017 Workshop Submission"},{"key":"B120","unstructured":"SpanglerT.\n          Snap Confirms Acquisition of Deepfakes Startup AI Factory, Used to Power 'Cameos' Selfie Videos2020"},{"key":"B121","article-title":"Fraudsters used AI to mimic CEO's voice in unusual cybercrime case","author":"Stupp","year":"2019","journal-title":"Wall Street J"},{"key":"B122","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1409.3215","article-title":"Sequence to sequence learning with neural networks","author":"Sutskever","year":"2014","journal-title":"arXiv:1409.3215 [cs"},{"key":"B123","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3072959.3073640","article-title":"Synthesizing obama: learning lip sync from audio","volume":"36","author":"Suwajanakorn","year":"2017","journal-title":"ACM Trans. Graphics"},{"key":"B124","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2106.15561","article-title":"A survey on neural speech synthesis","author":"Tan","year":"2021","journal-title":"arXiv:2106.15561 [eess.AS"},{"key":"B125","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3306346.3323035","article-title":"Deferred neural rendering: image synthesis using neural textures","volume":"38","author":"Thies","year":"2019","journal-title":"ACM Trans. Graph"},{"key":"B126","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/APSIPA.2016.7820738","article-title":"\u201cSpoofing speech detection using temporal convolutional neural network,\u201d","volume-title":"2016 Asia-Pacific Signal and Information Processing Association Annual Summit and Conference (APSIPA)","author":"Tian","year":"2016"},{"key":"B127","doi-asserted-by":"publisher","first-page":"2222","DOI":"10.1109\/TASL.2007.907344","article-title":"Voice conversion based on maximum-likelihood estimation of spectral parameter trajectory","volume":"15","author":"Toda","year":"2007","journal-title":"IEEE Trans. Audio Speech Lang. Process"},{"key":"B128","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2016-1066","article-title":"\u201cThe voice conversion challenge,\u201d","author":"Toda","year":"2016","journal-title":"Interspeech"},{"key":"B129","doi-asserted-by":"publisher","first-page":"131","DOI":"10.1016\/j.inffus.2020.06.014","article-title":"Deepfakes and beyond: a survey of face manipulation and fake detection","volume":"64","author":"Tolosana","year":"2020","journal-title":"Inf. Fusion"},{"key":"B130","doi-asserted-by":"publisher","first-page":"681","DOI":"10.21437\/Interspeech.2018-2279","article-title":"End-to-end audio replay attack detection using deep convolutional networks with attention","volume":"2018","author":"Tom","year":"2018","journal-title":"Interspeech"},{"key":"B131","first-page":"190","article-title":"\u201cSegment-based speech emotion recognition using recurrent neural networks,\u201d 2017","volume-title":"Seventh International Conference on Affective Computing and Intelligent Interaction (ACII), Affective Computing and Intelligent Interaction (ACII)","author":"Tzinis","year":"2017"},{"key":"B132","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1906.01083","article-title":"MelNet: a generative model for audio in the frequency domain","author":"Vasquez","year":"2019","journal-title":"arXiv:1906.01083 [cs, eess, stat"},{"key":"B133","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/CCST.2011.6095943","article-title":"\u201cPreventing replay attacks on speaker verification systems,\u201d","volume-title":"2011 Carnahan Conference on Security Technology","author":"Villalba","year":"2011"},{"key":"B134","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413716","article-title":"\u201cDeepsonar: Towards effective and robust detection of ai-synthesized fake voices,\u201d","author":"Wang","year":"","journal-title":"Proceedings of the 28th ACM International Conference on Multimedia"},{"key":"B135","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/476","article-title":"FakeSpotter: a simple yet robust baseline for spotting AI-synthesized fake faces","author":"Wang","year":"","journal-title":"arXiv:1909.06122 [cs"},{"key":"B136","doi-asserted-by":"publisher","DOI":"10.1016\/j.csl.2020.101114","article-title":"ASVspoof 2019: a large-scale public database of synthesized, converted and replayed speech","author":"Wang","year":"2020","journal-title":"Comput. Speech Lang"},{"key":"B137","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-1452","article-title":"Tacotron: towards end-to-end speech synthesis","author":"Wang","year":"2017","journal-title":"arXiv:1703.10135 [cs"},{"key":"B138","doi-asserted-by":"publisher","first-page":"27","DOI":"10.21437\/Interspeech.2017-776","article-title":"Audio replay attack detection using high-frequency features","volume":"2017","author":"Witkowski","year":"2017","journal-title":"Interspeech"},{"key":"B139","article-title":"\u201cMaking speech synthesis more accessible to older people,\u201d","author":"Wolters","year":"2007","journal-title":"6th ISCA Workshops on Speech Synthesis (SSW-6)"},{"key":"B140","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2004.13796","article-title":"TextGAIL: generative adversarial imitation learning for text generation","author":"Wu","year":"2021","journal-title":"arXiv:2004.13796 [cs"},{"key":"B141","doi-asserted-by":"publisher","first-page":"2037","DOI":"10.21437\/Interspeech.2015-462","article-title":"ASVspoof 2015: the first automatic speaker verification spoofing and countermeasures challenge","volume":"2015","author":"Wu","year":"2015","journal-title":"Interspeech"},{"key":"B142","doi-asserted-by":"publisher","DOI":"10.1017\/ATSIP.2014.17","article-title":"Voice conversion versus speaker verification: an overview","author":"Wu","year":"2014","journal-title":"APSIPA Trans. Signal Inf. Process"},{"key":"B143","doi-asserted-by":"publisher","first-page":"588","DOI":"10.1109\/JSTSP.2017.2671435","article-title":"ASVspoof: the automatic speaker verification spoofing and countermeasures challenge","volume":"11","author":"Wu","year":"2017","journal-title":"IEEE J. Sel. Top. Signal Process"},{"key":"B144","doi-asserted-by":"publisher","DOI":"10.1016\/j.cmpb.2020.105917","article-title":"Audio-based snore detection using deep neural networks","author":"Xie","year":"2021","journal-title":"Comput. Methods Programs Biomed"},{"key":"B145","doi-asserted-by":"publisher","first-page":"35365","DOI":"10.1109\/ACCESS.2018.2836950","article-title":"Machine learning and deep learning methods for cybersecurity","volume":"6","author":"Xin","year":"2018","journal-title":"IEEE Access"},{"key":"B146","author":"Yamagishi","year":"2019","journal-title":"Cstr vctk Corpus: English Multi-Speaker Corpus for cstr Voice Cloning Toolkit (Version 0.92)"},{"key":"B147","doi-asserted-by":"crossref","first-page":"6613","DOI":"10.1109\/ICASSP39728.2021.9414872","article-title":"\u201cAdaspeech 2: adaptive text to speech with untranscribed data,\u201d","volume-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Yan","year":"2021"},{"key":"B148","doi-asserted-by":"publisher","first-page":"105217","DOI":"10.1109\/ACCESS.2020.2993928","article-title":"FGGAN: Feature-guiding generative adversarial networks for text generation","volume":"8","author":"Yang","year":"2020","journal-title":"IEEE Access"},{"key":"B149","author":"Yankovic","year":""},{"key":"B150","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/GCWkshps50303.2020.9367545","article-title":"\u201cMaking sense of blockchain for AI deepfakes technology,\u201d","volume-title":"2020 IEEE Globecom Workshops (GC Wkshps)","author":"Yazdinejad","year":"2020"},{"key":"B151","doi-asserted-by":"crossref","first-page":"9458","DOI":"10.1109\/ICCV.2019.00955","article-title":"\u201cFew-shot adversarial learning of realistic neural talking head models,\u201d","volume-title":"2019 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"Zakharov","year":"2019"},{"key":"B152","doi-asserted-by":"crossref","first-page":"7063","DOI":"10.1109\/ICASSP39728.2021.9413934","article-title":"\u201cDenoispeech: denoising text to speech with frame-level noise modeling,\u201d","volume-title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","author":"Zhang","year":"2021"},{"key":"B153","doi-asserted-by":"publisher","first-page":"540","DOI":"10.1109\/TASLP.2019.2960721","article-title":"Non-parallel sequence-to-sequence voice conversion with disentangled linguistic and speaker representations","volume":"28","author":"Zhang","year":"2020","journal-title":"IEEE\/ACM Trans. Audio Speech Lang. Process"},{"key":"B154","doi-asserted-by":"crossref","first-page":"67","DOI":"10.1109\/CCET50901.2020.9213159","article-title":"\u201cDeep learning in face synthesis: a survey on deepfakes,\u201d","volume-title":"2020 IEEE 3rd International Conference on Computer and Communication Engineering Technology (CCET)","author":"Zhang","year":"2020"},{"key":"B155","doi-asserted-by":"publisher","first-page":"937","DOI":"10.1109\/LSP.2021.3076358","article-title":"One-class learning towards synthetic voice spoofing detection","volume":"28","author":"Zhang","year":"2021","journal-title":"IEEE Signal Process Lett"}],"container-title":["Frontiers in Big Data"],"original-title":[],"link":[{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fdata.2022.1001063\/full","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,11]],"date-time":"2023-01-11T03:15:23Z","timestamp":1673406923000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fdata.2022.1001063\/full"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,1,9]]},"references-count":155,"alternative-id":["10.3389\/fdata.2022.1001063"],"URL":"https:\/\/doi.org\/10.3389\/fdata.2022.1001063","relation":{},"ISSN":["2624-909X"],"issn-type":[{"value":"2624-909X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,1,9]]},"article-number":"1001063"}}