{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,22]],"date-time":"2026-07-22T16:42:48Z","timestamp":1784738568956,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":47,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,6,18]]},"DOI":"10.1145\/3733102.3736706","type":"proceedings-article","created":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T11:14:07Z","timestamp":1750158847000},"page":"181-192","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["Robust Multilingual Audio Deepfake Detection Through Hybrid Modeling"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-9853-8893","authenticated-orcid":false,"given":"Candy Olivia","family":"Mawalim","sequence":"first","affiliation":[{"name":"Japan Advanced Institute of Science and Technology, Nomi, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-0110-9153","authenticated-orcid":false,"given":"Yutong","family":"Wang","sequence":"additional","affiliation":[{"name":"Japan Advanced Institute of Science and Technology, Nomi, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-2518-5665","authenticated-orcid":false,"given":"Aulia","family":"Adila","sequence":"additional","affiliation":[{"name":"Japan Advanced Institute of Science and Technology, Nomi, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9260-0403","authenticated-orcid":false,"given":"Shogo","family":"Okada","sequence":"additional","affiliation":[{"name":"Japan Advanced Institute of Science and Technology, Nomi, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6605-2052","authenticated-orcid":false,"given":"Masashi","family":"Unoki","sequence":"additional","affiliation":[{"name":"Japan Advanced Institute of Science and Technology, Nomi, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2025,6,17]]},"reference":[{"key":"e_1_3_3_2_2_2","doi-asserted-by":"publisher","DOI":"10.1109\/APSIPAASC63619.2025.10848707"},{"key":"e_1_3_3_2_3_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICAICTA63815.2024.10763091"},{"key":"e_1_3_3_2_4_2","doi-asserted-by":"publisher","DOI":"10.1145\/3543507.3583222"},{"key":"e_1_3_3_2_5_2","doi-asserted-by":"publisher","DOI":"10.21437\/INTERSPEECH.2022-143"},{"key":"e_1_3_3_2_6_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICSDA.2017.8384449"},{"key":"e_1_3_3_2_7_2","doi-asserted-by":"publisher","unstructured":"Sanyuan Chen Chengyi Wang Zhengyang Chen Yu Wu Shujie Liu Zhuo Chen Jinyu Li Naoyuki Kanda Takuya Yoshioka Xiong Xiao Jian Wu Long Zhou Shuo Ren Yanmin Qian Yao Qian Jian Wu Michael Zeng Xiangzhan Yu and Furu Wei. 2022. WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing. IEEE J. Sel. Top. Signal Process. 16 6 (2022) 1505\u20131518. 10.1109\/JSTSP.2022.3188113","DOI":"10.1109\/JSTSP.2022.3188113"},{"key":"e_1_3_3_2_8_2","doi-asserted-by":"publisher","DOI":"10.1109\/WIFS55849.2022.9975433"},{"key":"e_1_3_3_2_9_2","volume-title":"ASVspoof 5 Evaluation Plan","author":"Delgado H\u00e9ctor","year":"2024","unstructured":"H\u00e9ctor Delgado, Nicholas Evans, Jee-weon Jung, Tomi Kinnunen, Ivan Kukanov, Kong\u00a0Aik Lee, Xuechen Liu, Hye-jin Shim, Md Sahidullah, Hemlata Tak, Massimiliano Todisco, Xin Wang, and Junichi Yamagishi. 2024. ASVspoof 5 Evaluation Plan. Technical Report. ASVspoof consortium. http:\/\/www.asvspoof.org\/"},{"key":"e_1_3_3_2_10_2","doi-asserted-by":"publisher","DOI":"10.21437\/ODYSSEY.2018-42"},{"key":"e_1_3_3_2_11_2","doi-asserted-by":"crossref","unstructured":"Helen Fraser Vincent Aubanel Robert\u00a0C. Maher Candy\u00a0Olivia Mawalim Xin Wang Peter Po\u010dta Emma Keith G\u00e9rard Chollet and Karla Pizzi. 2024. Forensic Speech Enhancement: Toward Reliable Handling of Poor-Quality Speech Recordings Used as Evidence in Criminal Trials. journal of the audio engineering society 72 (may 2024) 748\u2013753. Issue 11.","DOI":"10.17743\/jaes.2022.0176"},{"key":"e_1_3_3_2_12_2","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-1397"},{"key":"e_1_3_3_2_13_2","doi-asserted-by":"publisher","DOI":"10.1109\/iSAI-NLP60301.2023.10354956"},{"key":"e_1_3_3_2_14_2","unstructured":"Alan Godoy Fl\u00e1vio\u00a0Olmos Sim\u00f5es Jos\u00e9\u00a0Augusto Stuchi Marcus de Assis\u00a0Angeloni M\u00e1rio\u00a0Uliani Neto and Ricardo Paranhos\u00a0Velloso Violato. 2015. Using Deep Learning for Detecting Spoofing Attacks on Speech Signals. https:\/\/api.semanticscholar.org\/CorpusID:13962874"},{"key":"e_1_3_3_2_15_2","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2024-1972"},{"key":"e_1_3_3_2_16_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.639"},{"key":"e_1_3_3_2_17_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747766"},{"key":"e_1_3_3_2_18_2","unstructured":"Rostislav Kolobov Olga Okhapkina Olga Omelchishina Andrey Platunov Roman Bedyakin Vyacheslav Moshkin Dmitry Menshikov and Nikolay Mikhaylovskiy. 2021. MediaSpeech: Multilanguage ASR Benchmark and Dataset. arXiv:https:\/\/arXiv.org\/abs\/2103.16193https:\/\/arxiv.org\/abs\/2103.16193"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2019.8682674"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"publisher","unstructured":"Menglu Li Yasaman Ahmadiadli and Xiao-Ping Zhang. 2025. A Survey on Speech Deepfake Detection. ACM Comput. Surv. 57 7 Article 165 (Feb. 2025) 38\u00a0pages. 10.1145\/3714458","DOI":"10.1145\/3714458"},{"key":"e_1_3_3_2_21_2","doi-asserted-by":"publisher","unstructured":"Xuechen Liu Xin Wang Md. Sahidullah Jose Patino H\u00e9ctor Delgado Tomi Kinnunen Massimiliano Todisco Junichi Yamagishi Nicholas W.\u00a0D. Evans Andreas Nautsch and Kong\u00a0Aik Lee. 2023. ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild. IEEE ACM Trans. Audio Speech Lang. Process. 31 (2023) 2507\u20132522. 10.1109\/TASLP.2023.3285283","DOI":"10.1109\/TASLP.2023.3285283"},{"key":"e_1_3_3_2_22_2","doi-asserted-by":"publisher","unstructured":"Bartlomiej Marek Piotr Kawa and Piotr Syga. 2024. Are audio DeepFake detection models polyglots?10.48550\/ARXIV.2412.17924 arXiv:https:\/\/arXiv.org\/abs\/2412.17924","DOI":"10.48550\/ARXIV.2412.17924"},{"key":"e_1_3_3_2_23_2","unstructured":"Candy\u00a0Olivia Mawalim Sarah\u00a0Azka Arief and Dessi\u00a0Puji Lestari. 2025. InaSAS: Benchmarking Indonesian Speech Antispoofing Systems. APSIPA Transactions on Signal and Information Processing (2025). Accepted."},{"key":"e_1_3_3_2_24_2","unstructured":"Candy\u00a0Olivia Mawalim Kasorn Galajit Dessi\u00a0Puji Lestari Win\u00a0Pa Pa and Masashi Unoki. 2025. Challenges in Speech Spoofing Countermeasures for Southeast Asian Languages. ASJ Spring Meeting 2025."},{"key":"e_1_3_3_2_25_2","unstructured":"Candy\u00a0Olivia Mawalim Yutong Wang Aulia Adila Shogo Okada and Masashi Unoki. 2025. Multilingual Audio Deepfakes Dataset for Robust and Generalizable Detection. https:\/\/candyolivia.github.io\/assets\/pdf\/paper\/JMADv1.pdf Pre-release."},{"key":"e_1_3_3_2_26_2","doi-asserted-by":"publisher","DOI":"10.21437\/INTERSPEECH.2022-108"},{"key":"e_1_3_3_2_27_2","unstructured":"Nicolas\u00a0M. M\u00fcller Piotr Kawa Wei\u00a0Herng Choong Edresson Casanova Eren G\u00f6lge Thorsten M\u00fcller Piotr Syga Philip Sperl and Konstantin B\u00f6ttinger. 2025. MLAAD: The Multi-Language Audio Anti-Spoofing Dataset. arxiv:https:\/\/arXiv.org\/abs\/2401.09512\u00a0[cs.SD] https:\/\/arxiv.org\/abs\/2401.09512"},{"key":"e_1_3_3_2_28_2","doi-asserted-by":"publisher","DOI":"10.1109\/O-COCOSDA64382.2024.10800220"},{"key":"e_1_3_3_2_29_2","doi-asserted-by":"publisher","unstructured":"Olivier Perrotin Brooke Stephenson Silvain Gerber G\u00e9rard Bailly and Simon King. 2024. Refining the evaluation of speech synthesis: A summary of the Blizzard Challenge 2023. Comput. Speech Lang. 90 (2024) 101747. 10.1016\/j.csl.2024.101747","DOI":"10.1016\/j.csl.2024.101747"},{"key":"e_1_3_3_2_30_2","doi-asserted-by":"publisher","DOI":"10.18653\/V1\/2024.FINDINGS-NAACL.160"},{"key":"e_1_3_3_2_31_2","unstructured":"Vineel Pratap Andros Tjandra Bowen Shi Paden Tomasello Arun Babu Sayani Kundu Ali Elkahky Zhaoheng Ni Apoorv Vyas Maryam Fazel-Zarandi Alexei Baevski Yossi Adi Xiaohui Zhang Wei-Ning Hsu Alexis Conneau and Michael Auli. 2024. Scaling Speech Technology to 1 000+ Languages. J. Mach. Learn. Res. 25 (2024) 97:1\u201397:52. https:\/\/jmlr.org\/papers\/v25\/23-1318.html"},{"key":"e_1_3_3_2_32_2","doi-asserted-by":"publisher","DOI":"10.21437\/INTERSPEECH.2020-2826"},{"key":"e_1_3_3_2_33_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746108"},{"key":"e_1_3_3_2_34_2","doi-asserted-by":"publisher","DOI":"10.1109\/SPED.2019.8906599"},{"key":"e_1_3_3_2_35_2","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2021-755"},{"key":"e_1_3_3_2_36_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746213"},{"key":"e_1_3_3_2_37_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP39728.2021.9414234"},{"key":"e_1_3_3_2_38_2","doi-asserted-by":"publisher","DOI":"10.21437\/INTERSPEECH.2019-2249"},{"key":"e_1_3_3_2_39_2","doi-asserted-by":"publisher","unstructured":"Xin Wang H\u00e9ctor Delgado Hemlata Tak Jee-weon Jung Hye-jin Shim Massimiliano Todisco Ivan Kukanov Xuechen Liu Md. Sahidullah Tomi Kinnunen Nicholas W.\u00a0D. Evans Kong\u00a0Aik Lee and Junichi Yamagishi. 2024. ASVspoof 5: Crowdsourced Speech Data Deepfakes and Adversarial Attacks at Scale. 10.48550\/ARXIV.2408.08739","DOI":"10.48550\/ARXIV.2408.08739"},{"key":"e_1_3_3_2_40_2","doi-asserted-by":"publisher","unstructured":"Xin Wang Junichi Yamagishi Massimiliano Todisco H\u00e9ctor Delgado Andreas Nautsch Nicholas W.\u00a0D. Evans Md. Sahidullah Ville Vestman Tomi\u00a0H. Kinnunen Kong\u00a0Aik Lee Lauri Juvela Paavo Alku Yu-Huai Peng Hsin-Te Hwang Yu Tsao Hsin-Min Wang S\u00e9bastien\u00a0Le Maguer Markus Becker and Zhenhua Ling. 2020. ASVspoof 2019: A large-scale public database of synthesized converted and replayed speech. Comput. Speech Lang. 64 (2020) 101114. 10.1016\/J.CSL.2020.101114","DOI":"10.1016\/J.CSL.2020.101114"},{"key":"e_1_3_3_2_41_2","doi-asserted-by":"publisher","unstructured":"Zhizheng Wu Nicholas W.\u00a0D. Evans Tomi Kinnunen Junichi Yamagishi Federico Alegre and Haizhou Li. 2015. Spoofing and countermeasures for speaker verification: A survey. Speech Commun. 66 (2015) 130\u2013153. 10.1016\/J.SPECOM.2014.10.005","DOI":"10.1016\/J.SPECOM.2014.10.005"},{"key":"e_1_3_3_2_42_2","doi-asserted-by":"publisher","DOI":"10.21437\/INTERSPEECH.2015-462"},{"key":"e_1_3_3_2_43_2","doi-asserted-by":"crossref","unstructured":"Junichi Yamagishi Xin Wang Massimiliano Todisco Md. Sahidullah Jose Patino Andreas Nautsch Xuechen Liu Kong\u00a0Aik Lee Tomi Kinnunen Nicholas W.\u00a0D. Evans and H\u00e9ctor Delgado. 2021. ASVspoof 2021: accelerating progress in spoofed and deepfake speech detection. https:\/\/arxiv.org\/abs\/2109.00537","DOI":"10.21437\/ASVSPOOF.2021-8"},{"key":"e_1_3_3_2_44_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746939"},{"key":"e_1_3_3_2_45_2","first-page":"125","volume-title":"Proc. of the Workshop on Deepfake Audio Detection and Analysis co-located with 32th IJCAI 2023","author":"Yi Jiangyan","year":"2023","unstructured":"Jiangyan Yi, Jianhua Tao, Ruibo Fu, Xinrui Yan, Chenglong Wang, Tao Wang, Chu\u00a0Yuan Zhang, Xiaohui Zhang, Yan Zhao, Yong Ren, Le Xu, Junzuo Zhou, Hao Gu, Zhengqi Wen, Shan Liang, Zheng Lian, Shuai Nie, and Haizhou Li. 2023. ADD 2023: the Second Audio Deepfake Detection Challenge. In Proc. of the Workshop on Deepfake Audio Detection and Analysis co-located with 32th IJCAI 2023, Vol.\u00a03597. CEUR-WS.org, Macao, China, 125\u2013130. https:\/\/ceur-ws.org\/Vol-3597\/paper21.pdf"},{"key":"e_1_3_3_2_46_2","doi-asserted-by":"publisher","unstructured":"Jiangyan Yi Chenglong Wang Jianhua Tao Xiaohui Zhang Chu\u00a0Yuan Zhang and Yan Zhao. 2023. Audio Deepfake Detection: A Survey. 10.48550\/ARXIV.2308.14970 arXiv:https:\/\/arXiv.org\/abs\/2308.14970","DOI":"10.48550\/ARXIV.2308.14970"},{"key":"e_1_3_3_2_47_2","volume-title":"Proc. of ICLR 2021, Virtual Event","author":"Zeghidour Neil","year":"2021","unstructured":"Neil Zeghidour, Olivier Teboul, F\u00e9lix de Chaumont\u00a0Quitry, and Marco Tagliasacchi. 2021. {LEAF}: A Learnable Frontend for Audio Classification. In Proc. of ICLR 2021, Virtual Event. ICLR, Austria, 16\u00a0pages. https:\/\/openreview.net\/forum?id=jM76BCb6F9m"},{"key":"e_1_3_3_2_48_2","unstructured":"\u0130mdat Celeste. 2020. The M-AILABS Speech Dataset. https:\/\/github.com\/imdatceleste\/m-ailabs-dataset. Accessed: April 2025."}],"event":{"name":"IH&MMSEC '25: ACM Workshop on Information Hiding and Multimedia Security","location":"San Jose USA","acronym":"IH&MMSEC '25","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the ACM Workshop on Information Hiding and Multimedia Security"],"original-title":[],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T11:15:32Z","timestamp":1750158932000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3733102.3736706"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,17]]},"references-count":47,"alternative-id":["10.1145\/3733102.3736706","10.1145\/3733102"],"URL":"https:\/\/doi.org\/10.1145\/3733102.3736706","relation":{},"subject":[],"published":{"date-parts":[[2025,6,17]]},"assertion":[{"value":"2025-06-17","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}