{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,29]],"date-time":"2026-01-29T13:44:20Z","timestamp":1769694260138,"version":"3.49.0"},"reference-count":51,"publisher":"Frontiers Media SA","license":[{"start":{"date-parts":[[2025,8,18]],"date-time":"2025-08-18T00:00:00Z","timestamp":1755475200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["frontiersin.org"],"crossmark-restriction":true},"short-container-title":["Front. Digit. Health"],"abstract":"<jats:p>Early detection is crucial for managing incurable disorders, particularly autism spectrum disorder (ASD). Unfortunately, a considerable number of individuals with ASD receive a late diagnosis or remain undiagnosed. Speech holds a critical role in ASD, as a significant number of affected individuals experience speech impairments or remain non-verbal. To address this, we use speech analysis for automatic ASD recognition in children by classifying their speech as either autistic or typically developing. However, due to the lack of large labelled datasets, we leverage two smaller datasets to explore deep transfer learning methods. We investigate two fine-tuning approaches: (1) Discriminative Fine-Tuning (D-FT), which is pre-trained on a related dataset before being tuned on a similar task, and (2) Wav2Vec 2.0 Fine-Tuning (W2V2-FT), which leverages self-supervised speech representations pre-trained on a larger, unrelated dataset. We perform two distinct classification tasks: (a) a binary task to determine typicality, classifying speech as either that of a typically developing (TD) child or an atypically developing (AD) child; and (b) a four-class diagnosis task, which further classifies atypical cases into ASD, dysphasia (DYS), or pervasive developmental disorder-not otherwise specified (NOS), alongside TD. This research aims to improve early recognition strategies, particularly for individuals with ASD. The findings suggest that transfer learning methods can be a valuable tool for autism recognition from speech. For the typicality classification task (TD vs. AD), the D-FT model achieved the highest test UAR (94.8%), outperforming W2V2-FT (91.5%). In the diagnosis task (TD, ASD, DYS, NOS), D-FT also demonstrated superior performance (60.9% UAR) compared to W2V2-FT (54.3%). These results highlight the potential of transfer learning for speech-based ASD recognition and underscore the challenges of multi-class classification with limited labeled data.<\/jats:p>","DOI":"10.3389\/fdgth.2025.1274675","type":"journal-article","created":{"date-parts":[[2025,8,18]],"date-time":"2025-08-18T06:03:00Z","timestamp":1755496980000},"update-policy":"https:\/\/doi.org\/10.3389\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["The Noor Project: fair transformer transfer learning for autism spectrum disorder recognition from speech"],"prefix":"10.3389","volume":"7","author":[{"given":"Najla D.","family":"Al Futaisi","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bj\u00f6rn W.","family":"Schuller","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fabien","family":"Ringeval","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Maja","family":"Pantic","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"1965","published-online":{"date-parts":[[2025,8,18]]},"reference":[{"key":"B1","doi-asserted-by":"publisher","first-page":"384","DOI":"10.1002\/aur.1678","article-title":"Is voice a marker for autism spectrum disorder? a systematic review and meta-analysis","volume":"10","author":"Fusaroli","year":"2017","journal-title":"Autism Res"},{"key":"B2","doi-asserted-by":"publisher","first-page":"42","DOI":"10.1016\/j.neulet.2010.04.066","article-title":"Sounds of melody\u2014pitch patterns of speech in autism","volume":"478","author":"Sharda","year":"2010","journal-title":"Neurosci Lett"},{"key":"B3","doi-asserted-by":"publisher","first-page":"516","DOI":"10.1016\/j.braindev.2013.07.006","article-title":"Speech intonation in children with autism spectrum disorder","volume":"36","author":"Nakai","year":"2014","journal-title":"Brain Dev"},{"key":"B4","doi-asserted-by":"crossref","DOI":"10.1109\/KSE.2019.8919266","article-title":"Machine learning based automated speech dialog analysis of autistic children","author":"Wijesinghe","year":""},{"key":"B5","doi-asserted-by":"publisher","first-page":"1399","DOI":"10.3390\/s21041399","article-title":"Biosignal sensors and deep learning-based speech recognition: a review","volume":"21","author":"Lee","year":"2021","journal-title":"Sensors"},{"key":"B6","article-title":"Detecting autism spectrum disorders with machine learning models using speech transcripts","author":"Ramesh","year":""},{"key":"B7","doi-asserted-by":"crossref","DOI":"10.1109\/NCC48643.2020.9056025","article-title":"Acoustic features characterization of autism speech for automated detection and classification","author":"Mohanta","year":""},{"key":"B8","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2013-56","article-title":"The interspeech 2013 computational paralinguistics challenge: social signals, conflict, emotion, autism","author":"Schuller","year":""},{"key":"B9","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2017-730","article-title":"Automatic classification of autistic child vocalisations: a novel database and results","author":"Baird","year":""},{"key":"B10","doi-asserted-by":"publisher","first-page":"103811","DOI":"10.1016\/j.bspc.2022.103811","article-title":"Applying random forest classification to diagnose autism using acoustical voice-quality parameters during lexical tone production","volume":"77","author":"Guo","year":"2022","journal-title":"Biomed Signal Process Control"},{"key":"B11","doi-asserted-by":"publisher","first-page":"139489","DOI":"10.1109\/ACCESS.2020.3012532","article-title":"Estimating autism severity in young children from speech signals using a deep neural network","volume":"8","author":"Eni","year":"2020","journal-title":"IEEE Access"},{"key":"B12","doi-asserted-by":"publisher","first-page":"825","DOI":"10.1515\/revneuro-2020-0043","article-title":"Machine learning (ML) for the diagnosis of autism spectrum disorder (ASD) using brain imaging","volume":"31","author":"Nogay","year":"2020","journal-title":"Rev Neurosci"},{"key":"B13","doi-asserted-by":"crossref","DOI":"10.1109\/IROS.2018.8594177","article-title":"Culturenet: a deep learning approach for engagement intensity estimation from face images of children with autism","author":"Rudovic","year":""},{"key":"B14","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-030-01424-7_27","article-title":"A survey on deep transfer learning","author":"Tan","year":""},{"key":"B15","article-title":"vq-wav2vec: Self-supervised learning of discrete speech representations","author":"Baevski","year":""},{"key":"B16","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2019-1873","article-title":"wav2vec: Unsupervised pre-training for speech recognition","author":"Schneider","year":""},{"key":"B17","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2021-703","article-title":"Emotion recognition from speech using wav2vec 2.0 embeddings","author":"Pepino","year":""},{"key":"B18","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2021-1280","article-title":"Exploring wav2vec 2.0 on speaker verification and language identification","author":"Fan","year":""},{"key":"B19","first-page":"12449","article-title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","author":"Baevski","year":"2020","journal-title":"Advances in Neural Information Processing Systems"},{"key":"B20","doi-asserted-by":"crossref","DOI":"10.1109\/NCC48643.2020.9056084","article-title":"Classifying speech of ASD affected and normal children using acoustic features","author":"Mohanta","year":""},{"key":"B21","doi-asserted-by":"publisher","first-page":"82","DOI":"10.1109\/MSP.2012.2205597","article-title":"Deep neural networks for acoustic modeling in speech recognition: the shared views of four research groups","volume":"29","author":"Hinton","year":"2012","journal-title":"IEEE Signal Process Mag"},{"key":"B22","article-title":"Improving language understanding by generative pre-training (2018)","author":"Radford","year":""},{"key":"B23","doi-asserted-by":"publisher","first-page":"806","DOI":"10.1089\/cyber.2020.29200.ceu","article-title":"De-enigma: multimodal human-robot interaction for teaching and expanding social imagination in autistic children","volume":"23","author":"Riva","year":"2020","journal-title":"Cyberpsychol Behav Soc Netw"},{"key":"B24","doi-asserted-by":"publisher","first-page":"1328","DOI":"10.1109\/TASL.2010.2090147","article-title":"Automatic intonation recognition for the prosodic assessment of language-impaired children","volume":"19","author":"Ringeval","year":"2010","journal-title":"IEEE Trans Audio Speech Lang Process"},{"key":"B25","doi-asserted-by":"publisher","first-page":"146","DOI":"10.1097\/WCO.0b013e32835ee548","article-title":"Sex differences in autism spectrum disorders","volume":"26","author":"Werling","year":"2013","journal-title":"Curr Opin Neurol"},{"key":"B26","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1038\/s41398-020-0699-8","article-title":"Genetic evidence of gender difference in autism spectrum disorder supports the female-protective effect","volume":"10","author":"Zhang","year":"2020","journal-title":"Transl Psychiatry"},{"key":"B27","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/s13229-016-0073-0","article-title":"An investigation of the \u2018female camouflage effect\u2019in autism using a computerized ADOS-2 and a test of sex\/gender differences","volume":"7","author":"Rynkiewicz","year":"2016","journal-title":"Mol Autism"},{"key":"B28","article-title":"Generative adversarial nets","author":"Goodfellow","year":"2014"},{"key":"B29","article-title":"Applying wav2vec2. 0 to speech recognition in various low-resource languages","author":"Yi","year":""},{"key":"B30","doi-asserted-by":"crossref","DOI":"10.1109\/ICASSP.2015.7178964","article-title":"Librispeech: an ASR corpus based on public domain audio books","author":"Panayotov","year":""},{"key":"B31","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2016-129","article-title":"The interspeech 2016 computational paralinguistics challenge: deception, sincerity & native language","author":"Schuller","year":""},{"key":"B32","doi-asserted-by":"crossref","DOI":"10.1145\/1873951.1874246","article-title":"Opensmile: the munich versatile and fast open-source audio feature extractor","author":"Eyben","year":""},{"key":"B33","doi-asserted-by":"publisher","first-page":"321","DOI":"10.1613\/jair.953","article-title":"Smote: synthetic minority over-sampling technique","volume":"16","author":"Chawla","year":"2002","journal-title":"J Artif Intell Res"},{"key":"B34","doi-asserted-by":"crossref","DOI":"10.1007\/11538059_91","article-title":"Borderline-smote: a new over-sampling method in imbalanced data sets learning","author":"Han","year":""},{"key":"B35","article-title":"Adasyn: adaptive synthetic sampling approach for imbalanced learning","author":"He","year":""},{"key":"B36","doi-asserted-by":"crossref","DOI":"10.1145\/3340555.3353751","article-title":"VCMNet: weakly supervised learning for automatic infant vocalisation maturity analysis","author":"Al Futaisi","year":""},{"key":"B37","doi-asserted-by":"crossref","DOI":"10.21437\/Interspeech.2013-65","article-title":"Robust and accurate features for detecting and diagnosing autism spectrum disorders","author":"Asgari","year":""},{"key":"B38","article-title":"Automated speech-and text-based classification of neuropsychiatric conditions in a multidiagnostic setting","author":"Hansen","year":""},{"key":"B39","article-title":"Classifying autism from crowdsourced semi-structured speech recordings: a machine learning approach","author":"Chi","year":""},{"key":"B40","doi-asserted-by":"publisher","first-page":"202","DOI":"10.3390\/s23010202","article-title":"End-to-end model-based detection of infants with autism spectrum disorder using a pretrained model","volume":"23","author":"Lee","year":"2022","journal-title":"Sensors"},{"key":"B41","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3457607","article-title":"A survey on bias and fairness in machine learning","volume":"54","author":"Mehrabi","year":"2021","journal-title":"ACM Comput Surv (CSUR)"},{"key":"B42","doi-asserted-by":"crossref","DOI":"10.1145\/3194770.3194776","article-title":"Fairness definitions explained","author":"Verma","year":""},{"key":"B43","doi-asserted-by":"crossref","DOI":"10.1109\/SLT54892.2023.10022724","article-title":"How does pre-trained wav2vec 2.0 perform on domain-shifted ASR? an extensive benchmark on air traffic control communications","author":"Zuluaga-Gomez","year":""},{"key":"B44","article-title":"Nonverbal vocalizations as speech: characterizing natural-environment audio from nonverbal individuals with autism","author":"Narain","year":""},{"key":"B45","doi-asserted-by":"publisher","first-page":"468","DOI":"10.1111\/cdev.13697","article-title":"Infant vocalizing and phenotypic outcomes in autism: evidence from the first 2 years","volume":"93","author":"Plate","year":"2022","journal-title":"Child Dev"},{"key":"B46","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s11920-019-1113-1","article-title":"Pre-and paralinguistic vocal production in ASD: birth through school age","volume":"21","author":"Yankowitz","year":"2019","journal-title":"Curr Psychiatry Rep"},{"key":"B47","doi-asserted-by":"crossref","DOI":"10.1109\/ICASSP49357.2023.10096728","article-title":"Hearttoheart: the arts of infant versus adult-directed speech classification","author":"Al Futaisi","year":""},{"key":"B48","doi-asserted-by":"crossref","DOI":"10.1109\/IWSSIP.2019.8787306","article-title":"Performance analysis of smote-based oversampling techniques when dealing with data imbalance","author":"Bajer","year":""},{"key":"B49","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1016\/j.ins.2019.07.070","article-title":"A comprehensive analysis of synthetic minority oversampling technique (smote) for handling class imbalance","volume":"505","author":"Elreedy","year":"2019","journal-title":"Inf Sci (Ny)"},{"key":"B50","doi-asserted-by":"publisher","first-page":"e537","DOI":"10.1016\/S2589-7500(21)00141-2","article-title":"COVID-19 detection from audio: seven grains of salt","volume":"3","author":"Coppock","year":"2021","journal-title":"Lancet Digit Health"},{"key":"B51","article-title":"Data augmentation using gans","author":"Tanaka","year":""}],"container-title":["Frontiers in Digital Health"],"original-title":[],"link":[{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fdgth.2025.1274675\/full","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,18]],"date-time":"2025-08-18T06:03:03Z","timestamp":1755496983000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.frontiersin.org\/articles\/10.3389\/fdgth.2025.1274675\/full"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8,18]]},"references-count":51,"alternative-id":["10.3389\/fdgth.2025.1274675"],"URL":"https:\/\/doi.org\/10.3389\/fdgth.2025.1274675","relation":{},"ISSN":["2673-253X"],"issn-type":[{"value":"2673-253X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,8,18]]},"article-number":"1274675"}}