{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T01:49:32Z","timestamp":1783561772997,"version":"3.55.0"},"publisher-location":"Cham","reference-count":22,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031877834","type":"print"},{"value":"9783031877841","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-87784-1_37","type":"book-chapter","created":{"date-parts":[[2025,4,21]],"date-time":"2025-04-21T01:08:55Z","timestamp":1745197735000},"page":"407-416","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":12,"title":["Mel Spectrogram-Based CNN Framework for\u00a0Explainable Audio Deepfake Detection"],"prefix":"10.1007","author":[{"given":"Muhammad\u00a0Khurram Zahur","family":"Bajwa","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aniello","family":"Castiglione","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chiara","family":"Pero","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,4,22]]},"reference":[{"issue":"5","key":"37_CR1","doi-asserted-by":"publisher","first-page":"155","DOI":"10.3390\/a15050155","volume":"15","author":"Z Almutairi","year":"2022","unstructured":"Almutairi, Z., Elgibreen, H.: A review of modern audio deepfake detection methods: challenges and future directions. Algorithms 15(5), 155 (2022)","journal-title":"Algorithms"},{"key":"37_CR2","doi-asserted-by":"crossref","unstructured":"Bekheet, A.A., Khoriba, G., Ghoneim, A.S.: Development of a multimodal framework for deepfake detection: combining visual and audio analysis. In: Proceedings of the 10th World Congress on Electrical Engineering and Computer Systems and Sciences (EECSS 2024) (2024)","DOI":"10.11159\/mvml24.115"},{"key":"37_CR3","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2024.104145","volume":"249","author":"C Bisogni","year":"2024","unstructured":"Bisogni, C., Loia, V., Nappi, M., Pero, C.: Acoustic features analysis for explainable machine learning-based audio spoofing detection. Comput. Vis. Image Underst. 249, 104145 (2024)","journal-title":"Comput. Vis. Image Underst."},{"key":"37_CR4","doi-asserted-by":"crossref","unstructured":"Chandran, P.P., Sriram, S., Babu, C.: Multimodal forgery detection in videos using a tri-network model. In: 2024 10th International Conference on Advanced Computing and Communication Systems (ICACCS), vol.\u00a01, pp. 1507\u20131514 (2024)","DOI":"10.1109\/ICACCS60874.2024.10717044"},{"key":"37_CR5","doi-asserted-by":"publisher","DOI":"10.1016\/j.heliyon.2023.e15090","volume":"9","author":"A Firc","year":"2023","unstructured":"Firc, A., Malinka, K., Han\u00e1\u010dek, P.: Deepfakes as a threat to a speaker and facial recognition: an overview of tools and attack vectors. Heliyon 9, e15090 (2023)","journal-title":"Heliyon"},{"key":"37_CR6","doi-asserted-by":"crossref","unstructured":"Gao, Y., Wang, X., Zhang, Y., Zeng, P., Ma, Y.: Temporal feature prediction in audio\u2013visual deepfake detection. Electronics 13(17) (2024)","DOI":"10.3390\/electronics13173433"},{"key":"37_CR7","doi-asserted-by":"publisher","DOI":"10.1016\/j.acha.2023.101579","volume":"67","author":"R Geng","year":"2023","unstructured":"Geng, R., Gao, Y., Zhang, H.K., Zu, J.: Graph signal processing on dynamic graphs based on temporal-attention product. Appl. Comput. Harmon. Anal. 67, 101579 (2023)","journal-title":"Appl. Comput. Harmon. Anal."},{"key":"37_CR8","doi-asserted-by":"publisher","first-page":"134018","DOI":"10.1109\/ACCESS.2022.3231480","volume":"10","author":"A Hamza","year":"2022","unstructured":"Hamza, A., et al.: Deepfake audio detection via MFCC features using machine learning. IEEE Access 10, 134018\u2013134028 (2022)","journal-title":"IEEE Access"},{"key":"37_CR9","doi-asserted-by":"publisher","DOI":"10.1016\/j.asoc.2023.110124","volume":"136","author":"H Ilyas","year":"2023","unstructured":"Ilyas, H., Javed, A., Malik, K.M.: AVFakeNet: a unified end-to-end dense swin transformer deep learning model for audio-visual deepfakes detection. Appl. Soft Comput. 136, 110124 (2023)","journal-title":"Appl. Soft Comput."},{"key":"37_CR10","unstructured":"Jia, Y., et\u00a0al.: Transfer learning from speaker verification to multispeaker text-to-speech synthesis. Adv. Neural Inf. Process. Syst. 31 (2018)"},{"key":"37_CR11","doi-asserted-by":"crossref","unstructured":"Jung, J.w., Heo, H.S., Kim, J.h., Shim, H.j., Yu, H.J.: RawNet: advanced end-to-end deep neural network using raw waveforms for text-independent speaker verification. arXiv preprint arXiv:1904.08104 (2019)","DOI":"10.21437\/Interspeech.2019-1982"},{"key":"37_CR12","doi-asserted-by":"crossref","unstructured":"Jung, J.w., et al.: AASIST: audio anti-spoofing using integrated spectro-temporal graph attention networks. In: ICASSP 2022\u20132022 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 6367\u20136371. IEEE (2022)","DOI":"10.1109\/ICASSP43922.2022.9747766"},{"key":"37_CR13","unstructured":"Khalid, H., Tariq, S., Kim, M., Woo, S.S.: FakeAVCeleb: a novel audio-video multimodal deepfake dataset. In: Thirty-fifth Conference on Neural Information Processing Systems Datasets and Benchmarks Track (Round 2) (2021)"},{"key":"37_CR14","doi-asserted-by":"publisher","first-page":"1001063","DOI":"10.3389\/fdata.2022.1001063","volume":"5","author":"Z Khanjani","year":"2023","unstructured":"Khanjani, Z., Watson, G., Janeja, V.P.: Audio deepfakes: a survey. Front. Big Data 5, 1001063 (2023)","journal-title":"Front. Big Data"},{"key":"37_CR15","doi-asserted-by":"publisher","first-page":"144497","DOI":"10.1109\/ACCESS.2023.3344653","volume":"11","author":"R Mubarak","year":"2023","unstructured":"Mubarak, R., Alsboui, T., Alshaikh, O., Inuwa-Dute, I., Khan, S., Parkinson, S.: A survey on the detection and impacts of deepfakes in visual, audio, and textual formats. IEEE Access 11, 144497\u2013144529 (2023)","journal-title":"IEEE Access"},{"key":"37_CR16","doi-asserted-by":"crossref","unstructured":"Pianese, A., Cozzolino, D., Poggi, G., Verdoliva, L.: Deepfake audio detection by speaker verification. In: 2022 IEEE International Workshop on Information Forensics and Security (WIFS), pp.\u00a01\u20136. IEEE (2022)","DOI":"10.1109\/WIFS55849.2022.9975428"},{"key":"37_CR17","doi-asserted-by":"crossref","unstructured":"Prajwal, K., Mukhopadhyay, R., Namboodiri, V.P., Jawahar, C.: A lip sync expert is all you need for speech to lip generation in the wild. In: Proceedings of the 28th ACM International Conference on Multimedia, pp. 484\u2013492 (2020)","DOI":"10.1145\/3394171.3413532"},{"key":"37_CR18","doi-asserted-by":"crossref","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., Batra, D.: Grad-cam: visual explanations from deep networks via gradient-based localization. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 618\u2013626 (2017)","DOI":"10.1109\/ICCV.2017.74"},{"key":"37_CR19","doi-asserted-by":"publisher","first-page":"1960","DOI":"10.1109\/LSP.2024.3433596","volume":"31","author":"R Wang","year":"2024","unstructured":"Wang, R., Ye, D., Tang, L., Zhang, Y., Deng, J.: AVT$$^{2}$$-DWF: improving deepfake detection with audio-visual fusion and dynamic weighting strategies. IEEE Signal Process. Lett. 31, 1960\u20131964 (2024)","journal-title":"IEEE Signal Process. Lett."},{"key":"37_CR20","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2024.104133","volume":"248","author":"Y Wang","year":"2024","unstructured":"Wang, Y., Huang, H.: Audio-visual deepfake detection using articulatory representation learning. Comput. Vis. Image Underst. 248, 104133 (2024)","journal-title":"Comput. Vis. Image Underst."},{"key":"37_CR21","doi-asserted-by":"crossref","unstructured":"Xue, J., et al.: Audio deepfake detection based on a combination of f0 information and real plus imaginary spectrogram features. In: Proceedings of the 1st International Workshop on Deepfake Detection for Audio Multimedia, DDAM 2022, pp. 19\u201326. Association for Computing Machinery, New York (2022)","DOI":"10.1145\/3552466.3556526"},{"issue":"1","key":"37_CR22","doi-asserted-by":"publisher","first-page":"27","DOI":"10.1631\/FITEE.1700808","volume":"19","author":"Q Zhang","year":"2018","unstructured":"Zhang, Q., Zhu, S.: Visual interpretability for deep learning: a survey. Front. Inf. Technol. Electron. Eng. 19(1), 27\u201339 (2018). https:\/\/doi.org\/10.1631\/FITEE.1700808","journal-title":"Front. Inf. Technol. Electron. Eng."}],"container-title":["Lecture Notes on Data Engineering and Communications Technologies","Advanced Information Networking and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-87784-1_37","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,6]],"date-time":"2025-09-06T11:50:39Z","timestamp":1757159439000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-87784-1_37"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031877834","9783031877841"],"references-count":22,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-87784-1_37","relation":{},"ISSN":["2367-4512","2367-4520"],"issn-type":[{"value":"2367-4512","type":"print"},{"value":"2367-4520","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"22 April 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"AINA","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Advanced Information Networking and Applications","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Barcelona","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Spain","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"9 April 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"11 April 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"39","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"aina0","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/voyager.ce.fit.ac.jp\/conf\/aina\/2025\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}