{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,2]],"date-time":"2026-07-02T16:21:15Z","timestamp":1783009275827,"version":"3.54.5"},"reference-count":358,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"Hasler Foundation through the Responsible Face Recognition (SAFER) Project"},{"name":"Swiss Center for Biometrics Research at Idiap Research Institute"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans.Inform.Forensic Secur."],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/tifs.2025.3602233","type":"journal-article","created":{"date-parts":[[2025,8,25]],"date-time":"2025-08-25T20:43:50Z","timestamp":1756154630000},"page":"9113-9138","source":"Crossref","is-referenced-by-count":10,"title":["Foundation Models and Biometrics: A Survey and Outlook"],"prefix":"10.1109","volume":"20","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8199-0098","authenticated-orcid":false,"given":"Hatef","family":"Otroshi Shahreza","sequence":"first","affiliation":[{"name":"Biometrics Security and Privacy Group, Idiap Research Institute, Martigny, Switzerland"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2497-9140","authenticated-orcid":false,"given":"S\u00e9bastien","family":"Marcel","sequence":"additional","affiliation":[{"name":"Biometrics Security and Privacy Group, Idiap Research Institute, Martigny, Switzerland"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"On the opportunities and risks of foundation models","author":"Bommasani","year":"2021","journal-title":"arXiv:2108.07258"},{"key":"ref2","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv:1810.04805"},{"key":"ref3","article-title":"Improving language understanding by generative pre-training","author":"Radford","year":"2018"},{"key":"ref4","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. ICML","author":"Radford"},{"key":"ref5","article-title":"A survey of large language models","author":"Xin Zhao","year":"2023","journal-title":"arXiv:2303.18223"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2024.3365742"},{"key":"ref7","article-title":"Large language models: A survey","author":"Minaee","year":"2024","journal-title":"arXiv:2402.06196"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2022\/762"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/s11633-022-1369-5"},{"key":"ref10","article-title":"A systematic survey of prompt engineering on vision-language foundation models","author":"Gu","year":"2023","journal-title":"arXiv:2307.12980"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3369699"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3506283"},{"key":"ref13","article-title":"Sparks of large audio models: A survey and outlook","author":"Latif","year":"2023","journal-title":"arXiv:2308.12792"},{"key":"ref14","article-title":"Recent advances in speech language models: A survey","author":"Cui","year":"2024","journal-title":"arXiv:2410.03751"},{"key":"ref15","article-title":"A comprehensive review of multimodal large language models: Performance and challenges across different tasks","author":"Wang","year":"2024","journal-title":"arXiv:2408.01319"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.738"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/s13042-024-02443-6"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2006.873653"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2003.818349"},{"key":"ref20","article-title":"GPT-4o system card","author":"Hurst","year":"2024","journal-title":"arXiv:2410.21276"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP51287.2024.10647924"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2024.3370437"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/IJCB62174.2024.10744525"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref25","article-title":"Language models are unsupervised multitask learners","author":"Radford","year":"2019"},{"key":"ref26","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Brown"},{"key":"ref27","article-title":"GPT-4 technical report","volume-title":"arXiv:2303.08774","author":"Achiam","year":"2023"},{"issue":"140","key":"ref28","first-page":"1","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"ref29","article-title":"PaLM: Scaling language modeling with pathways","author":"Chowdhery","year":"2022","journal-title":"arXiv:2204.02311"},{"key":"ref30","volume-title":"Claude: Anthropic\u2019s Language Model for Dialogue Applications","year":"2023"},{"key":"ref31","volume-title":"Falcon: An Open Large Language Model","year":"2023"},{"key":"ref32","volume-title":"Introducing Mistral: A New Generation of Open-Weight Language Models","year":"2023"},{"key":"ref33","article-title":"LLaMA: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv:2302.13971"},{"key":"ref34","article-title":"Gemma: Open models based on Gemini research and technology","author":"Team","year":"2024","journal-title":"arXiv:2403.08295"},{"key":"ref35","article-title":"OPT: Open pre-trained transformer language models","author":"Zhang","year":"2022","journal-title":"arXiv:2205.01068"},{"key":"ref36","article-title":"Nemotron-4 340B technical report","volume-title":"arXiv:2406.11704","author":"Adler","year":"2024"},{"key":"ref37","article-title":"Qwen technical report","volume-title":"arXiv:2309.16609","author":"Bai","year":"2023"},{"key":"ref38","article-title":"Phi-4 technical report","volume-title":"arXiv:2412.08905","author":"Abdin","year":"2024"},{"key":"ref39","article-title":"DeepSeek LLM: Scaling open-source language models with longtermism","author":"Bi","year":"2024","journal-title":"arXiv:2401.02954"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1016\/j.patter.2025.101260"},{"key":"ref41","article-title":"A systematic survey of prompt engineering in large language models: Techniques and applications","author":"Sahoo","year":"2024","journal-title":"arXiv:2402.07927"},{"key":"ref42","first-page":"22199","article-title":"Large language models are zero-shot reasoners","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Kojima"},{"key":"ref43","first-page":"24824","article-title":"Chain-of-thought prompting elicits reasoning in large language models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"35","author":"Wei"},{"key":"ref44","article-title":"Tree of thoughts: Deliberate problem solving with large language models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Yao"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.64"},{"key":"ref46","article-title":"OpenAI o1 system card","author":"Jaech","year":"2024","journal-title":"arXiv:2412.16720"},{"key":"ref47","volume-title":"Openai O3-Mini System Card","year":"2025"},{"issue":"70","key":"ref48","first-page":"1","article-title":"Scaling instruction-finetuned language models","volume":"25","author":"Chung","year":"2024","journal-title":"J. Mach. Learn. Res."},{"key":"ref49","article-title":"Mixtral of experts","author":"Jiang","year":"2024","journal-title":"arXiv:2401.04088"},{"key":"ref50","article-title":"Llama 2: Open foundation and fine-tuned chat models","author":"Touvron","year":"2023","journal-title":"arXiv:2307.09288"},{"key":"ref51","first-page":"46595","article-title":"Judging LLM-as-a-judge with MT-bench and chatbot arena","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Zheng"},{"key":"ref52","article-title":"Gemma 2: Improving open language models at a practical size","author":"Team","year":"2024","journal-title":"arXiv:2408.00118"},{"key":"ref53","article-title":"Qwen2.5 technical report","volume-title":"arXiv:2412.15115","author":"Yang","year":"2024"},{"key":"ref54","article-title":"Qwen3 technical report","volume-title":"arXiv:2505.09388","author":"Yang","year":"2025"},{"key":"ref55","article-title":"DeepSeek-v2: A strong, economical, and efficient mixture-of-experts language model","author":"Liu","year":"2024","journal-title":"arXiv:2405.04434"},{"key":"ref56","article-title":"DeepSeek-V3 technical report","volume-title":"arXiv:2412.19437","author":"Liu","year":"2024"},{"key":"ref57","article-title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning","author":"Guo","year":"2025","journal-title":"arXiv:2501.12948"},{"key":"ref58","article-title":"ReasonFlux: Hierarchical LLM reasoning via scaling thought templates","author":"Yang","year":"2025","journal-title":"arXiv:2502.06772"},{"key":"ref59","article-title":"Parameter-efficient fine-tuning methods for pretrained language models: A critical review and assessment","author":"Xu","year":"2023","journal-title":"arXiv:2312.12148"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1038\/s42256-023-00626-4"},{"key":"ref61","article-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2021","journal-title":"arXiv:2106.09685"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"ref63","first-page":"2790","article-title":"Parameter-efficient transfer learning for NLP","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Houlsby"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.47"},{"key":"ref65","first-page":"27730","article-title":"Training language models to follow instructions with human feedback","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ouyang"},{"key":"ref66","article-title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","author":"Bai","year":"2022","journal-title":"arXiv:2204.05862"},{"key":"ref67","article-title":"Constitutional AI: Harmlessness from AI feedback","author":"Bai","year":"2022","journal-title":"arXiv:2212.08073"},{"key":"ref68","first-page":"53728","article-title":"Direct preference optimization: Your language model is secretly a reward model","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Rafailov"},{"key":"ref69","first-page":"9459","article-title":"Retrieval-augmented generation for knowledge-intensive NLP tasks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Lewis"},{"key":"ref70","article-title":"Retrieval-augmented generation for large language models: A survey","author":"Gao","year":"2023","journal-title":"arXiv:2312.10997"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00530"},{"issue":"120","key":"ref72","first-page":"1","article-title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","volume":"23","author":"Fedus","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"ref73","article-title":"GSM-symbolic: Understanding the limitations of mathematical reasoning in large language models","author":"Mirzadeh","year":"2024","journal-title":"arXiv:2410.05229"},{"key":"ref74","article-title":"Competitive programming with large reasoning models","author":"El-Kishky","year":"2025","journal-title":"arXiv:2502.06807"},{"key":"ref75","article-title":"Phi-4-reasoning technical report","volume-title":"arXiv:2504.21318","author":"Abdin","year":"2025"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"ref77","article-title":"DINOv2: Learning robust visual features without supervision","author":"Oquab","year":"2023","journal-title":"arXiv:2304.07193"},{"key":"ref78","article-title":"BEiT: BERT pre-training of image transformers","author":"Bao","year":"2021","journal-title":"arXiv:2106.08254"},{"key":"ref79","article-title":"An image is worth 16\u00d716 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020","journal-title":"arXiv:2010.11929"},{"key":"ref80","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"Proc. 38th Int. Conf. Mach. Learn.","author":"Jia"},{"key":"ref81","first-page":"6105","article-title":"EfficientNet: Rethinking model scaling for convolutional neural networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Tan"},{"key":"ref82","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref83","first-page":"19730","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01100"},{"key":"ref85","article-title":"SigLIP 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","author":"Tschannen","year":"2025","journal-title":"arXiv:2502.14786"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00276"},{"key":"ref87","first-page":"1","article-title":"Unified-IO: A unified model for vision, language, and multi-modal tasks","volume-title":"Proc. 11th Int. Conf. Learn. Represent.","author":"Lu"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"ref89","article-title":"SAM 2: Segment anything in images and videos","author":"Ravi","year":"2024","journal-title":"arXiv:2408.00714"},{"key":"ref90","first-page":"12371","article-title":"Scalable pre-training of large autoregressive image models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"El-Nouby"},{"key":"ref91","article-title":"Multimodal autoregressive pre-training of large vision encoders","author":"Fini","year":"2024","journal-title":"arXiv:2411.14402"},{"key":"ref92","first-page":"23716","article-title":"Flamingo: A visual language model for few-shot learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Alayrac"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01519"},{"key":"ref94","article-title":"Florence: A new foundation model for computer vision","author":"Yuan","year":"2021","journal-title":"arXiv:2111.11432"},{"key":"ref95","first-page":"23318","article-title":"OFA: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wang"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"ref97","volume-title":"Gpt-4v","year":"2024"},{"key":"ref98","article-title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2023","journal-title":"arXiv:2304.10592"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"ref100","article-title":"Video-LLaVA: Learning united visual representation by alignment before projection","author":"Lin","year":"2023","journal-title":"arXiv:2311.10122"},{"key":"ref101","article-title":"Pixtral 12B","author":"Agrawal","year":"2024","journal-title":"arXiv:2410.07073"},{"key":"ref102","article-title":"Phi-3 technical report: A highly capable language model locally on your phone","volume-title":"arXiv:2404.14219","author":"Abdin","year":"2024"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02520"},{"key":"ref104","article-title":"NVILA: Efficient frontier visual language models","author":"Liu","year":"2024","journal-title":"arXiv:2412.04468"},{"key":"ref105","article-title":"VILA-U: A unified foundation model integrating visual understanding and generation","author":"Wu","year":"2024","journal-title":"arXiv:2409.04429"},{"key":"ref106","article-title":"TokenFlow: Unified image tokenizer for multimodal understanding and generation","author":"Qu","year":"2024","journal-title":"arXiv:2412.03069"},{"key":"ref107","article-title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","author":"Dai","year":"2023","journal-title":"arXiv:2305.06500"},{"key":"ref108","article-title":"YI: Open foundation models by 01. AI","author":"Young","year":"2024","journal-title":"arXiv:2403.04652"},{"key":"ref109","article-title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond","author":"Bai","year":"2023","journal-title":"arXiv:2308.12966"},{"key":"ref110","article-title":"Qwen2-VL: Enhancing vision-language model\u2019s perception of the world at any resolution","author":"Wang","year":"2024","journal-title":"arXiv:2409.12191"},{"key":"ref111","article-title":"Qwen2.5-VL technical report","volume-title":"arXiv:2502.13923","author":"Bai","year":"2025"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.02283"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4231-5"},{"key":"ref114","article-title":"InternVL3: Exploring advanced training and test-time recipes for open-source multimodal models","author":"Zhu","year":"2025","journal-title":"arXiv:2504.10479"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73013-9_23"},{"key":"ref116","article-title":"LLaVA-OneVision: Easy visual task transfer","author":"Li","year":"2024","journal-title":"arXiv:2408.03326"},{"key":"ref117","article-title":"LLaVA-NeXT-interleave: Tackling multi-image, video, and 3D in large multimodal models","author":"Li","year":"2024","journal-title":"arXiv:2407.07895"},{"key":"ref118","article-title":"CogVLM2: Visual language models for image and video understanding","author":"Hong","year":"2024","journal-title":"arXiv:2408.16500"},{"key":"ref119","article-title":"Efficient multimodal learning from data-centric perspective","author":"He","year":"2024","journal-title":"arXiv:2402.11530"},{"key":"ref120","article-title":"Chameleon: Mixed-modal early-fusion foundation models","author":"Team","year":"2024","journal-title":"arXiv:2405.09818"},{"key":"ref121","article-title":"Apollo: An exploration of video understanding in large multimodal models","author":"Zohar","year":"2024","journal-title":"arXiv:2412.10360"},{"key":"ref122","article-title":"DeepSeek-VL: Towards real-world vision-language understanding","author":"Lu","year":"2024","journal-title":"arXiv:2403.05525"},{"key":"ref123","article-title":"DeepSeek-VL2: Mixture-of-experts vision-language models for advanced multimodal understanding","author":"Wu","year":"2024","journal-title":"arXiv:2412.10302"},{"key":"ref124","first-page":"8821","article-title":"Zero-shot text-to-image generation","volume-title":"Proc. Int. Conf. Mach. Learn. (ICML)","author":"Ramesh"},{"key":"ref125","article-title":"Hierarchical text-conditional image generation with CLIP latents","author":"Ramesh","year":"2022","journal-title":"arXiv:2204.06125"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"issue":"3","key":"ref127","first-page":"8","article-title":"Improving image generation with better captions","volume":"2","author":"Betker","year":"2023","journal-title":"Comput. Sci."},{"key":"ref128","article-title":"Imagen 3","author":"Baldridge","year":"2024","journal-title":"arXiv:2408.07009"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"ref131","article-title":"Edify image: High-quality image generation with pixel space Laplacian diffusion models","author":"Atzmon","year":"2024","journal-title":"arXiv:2411.07126"},{"key":"ref132","article-title":"Autoregressive model beats diffusion: Llama for scalable image generation","author":"Sun","year":"2024","journal-title":"arXiv:2406.06525"},{"key":"ref133","first-page":"84839","article-title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"37","author":"Tian"},{"key":"ref134","article-title":"Emu3: Next-token prediction is all you need","author":"Wang","year":"2024","journal-title":"arXiv:2409.18869"},{"key":"ref135","article-title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","author":"Wu","year":"2024","journal-title":"arXiv:2410.13848"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00725"},{"key":"ref137","article-title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","author":"Chen","year":"2025","journal-title":"arXiv:2501.17811"},{"key":"ref138","article-title":"Movie gen: A cast of media foundation models","author":"Polyak","year":"2024","journal-title":"arXiv:2410.13720"},{"key":"ref139","article-title":"Mochi 1","year":"2024"},{"key":"ref140","article-title":"Imagen video: High definition video generation with diffusion models","author":"Ho","year":"2022","journal-title":"arXiv:2210.02303"},{"key":"ref141","first-page":"1","article-title":"Make-A-video: Text-to-video generation without text-video data","volume-title":"Proc. 11th Int. Conf. Learn. Represent.","author":"Singer"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00701"},{"key":"ref143","article-title":"CogVideoX: Text-to-video diffusion models with an expert transformer","author":"Yang","year":"2024","journal-title":"arXiv:2408.06072"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00845"},{"key":"ref145","article-title":"FlashVideo: Flowing fidelity to detail for efficient high-resolution video generation","author":"Zhang","year":"2025","journal-title":"arXiv:2502.05179"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02190"},{"key":"ref147","article-title":"Step-video-T2V technical report: The practice, challenges, and future of video foundation model","volume-title":"arXiv:2502.10248","author":"Ma","year":"2025"},{"key":"ref148","volume-title":"Sora: Creating Video from Text","year":"2024"},{"key":"ref149","first-page":"53366","article-title":"NExT-GPT: Any-to-any multimodal LLM","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wu"},{"key":"ref150","article-title":"Are we on the right way for evaluating large vision-language models?","author":"Chen","year":"2024","journal-title":"arXiv:2403.20330"},{"key":"ref151","first-page":"12449","article-title":"Wav2vec 2.0: A framework for self-supervised learning of speech representations","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Baevski"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2019-1873"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1109\/TASLP.2021.3122291"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2022.3188113"},{"key":"ref155","article-title":"UniAudio: An audio foundation model toward universal audio generation","author":"Yang","year":"2023","journal-title":"arXiv:2310.00704"},{"key":"ref156","first-page":"28492","article-title":"Robust speech recognition via large-scale weak supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford"},{"key":"ref157","article-title":"Google USM: Scaling automatic speech recognition beyond 100 languages","author":"Zhang","year":"2023","journal-title":"arXiv:2303.01037"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP49357.2023.10095889"},{"key":"ref159","article-title":"MERT: Acoustic music understanding model with large-scale self-supervised training","author":"Li","year":"2023","journal-title":"arXiv:2306.00107"},{"key":"ref160","article-title":"FunAudioLLM: Voice understanding and generation foundation models for natural interaction between humans and LLMs","author":"An","year":"2024","journal-title":"arXiv:2407.04051"},{"key":"ref161","article-title":"Neural codec language models are zero-shot text to speech synthesizers","author":"Wang","year":"2023","journal-title":"arXiv:2301.02111"},{"key":"ref162","article-title":"High fidelity neural audio compression","author":"D\u00e9fossez","year":"2023","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU57964.2023.10389703"},{"key":"ref164","article-title":"SpeechT5: Unified-modal encoder\u2013decoder pre-training for spoken language processing","author":"Ao","year":"2021","journal-title":"arXiv:2110.07205"},{"key":"ref165","first-page":"18090","article-title":"Pengi: An audio language model for audio tasks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Deshmukh"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i21.30570"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.1055"},{"key":"ref168","article-title":"AudioPaLM: A large language model that can speak and listen","author":"Rubenstein","year":"2023","journal-title":"arXiv:2306.12925"},{"key":"ref169","first-page":"1","article-title":"Salmonn: Towards generic hearing abilities for large language models","volume-title":"Proc. The 12th Int. Conf. Learn. Represent.","author":"Tang"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.263"},{"key":"ref171","first-page":"1","article-title":"Listen, think, and understand","volume-title":"Proc. 12th Int. Conf. Learn. Represent.","author":"Gong"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.361"},{"key":"ref173","article-title":"Qwen2-audio technical report","volume-title":"arXiv:2407.10759","author":"Chu","year":"2024"},{"key":"ref174","article-title":"Seamlessm4t-massively multilingual & multimodal machine translation","author":"Barrault","year":"2023","journal-title":"arXiv:2308.11596"},{"key":"ref175","article-title":"Step-audio: Unified understanding and generation in intelligent speech interaction","author":"Huang","year":"2025","journal-title":"arXiv:2502.11946"},{"key":"ref176","article-title":"AudioBench: A universal benchmark for audio large language models","author":"Wang","year":"2024","journal-title":"arXiv:2406.16020"},{"key":"ref177","article-title":"MusicLM: Generating music from text","author":"Agostinelli","year":"2023","journal-title":"arXiv:2301.11325"},{"key":"ref178","article-title":"AudioLDM: Text-to-audio generation with latent diffusion models","author":"Liu","year":"2023","journal-title":"arXiv:2301.12503"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747631"},{"key":"ref180","first-page":"58363","article-title":"4M: Massively multimodal masked modeling","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Mizrahi"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"ref182","article-title":"PandaGPT: One model to instruction-follow them all","author":"Su","year":"2023","journal-title":"arXiv:2305.16355"},{"key":"ref183","article-title":"VideoLLaMA 2: Advancing spatial\u2013temporal modeling and audio understanding in video-LLMs","author":"Cheng","year":"2024","journal-title":"arXiv:2406.07476"},{"key":"ref184","article-title":"Video-SALMONN: Speech-enhanced audio-visual large language models","author":"Sun","year":"2024","journal-title":"arXiv:2406.15704"},{"key":"ref185","article-title":"Gemini: A family of highly capable multimodal models","author":"Anil","year":"2023","journal-title":"arXiv:2312.11805"},{"key":"ref186","article-title":"The llama 3 herd of models","author":"Dubey","year":"2024","journal-title":"arXiv:2407.21783"},{"key":"ref187","article-title":"Qwen2.5-Omni technical report","volume-title":"arXiv:2503.20215","author":"Xu","year":"2025"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-45344-X_32"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.1038\/s44287-024-00094-x"},{"key":"ref190","article-title":"On the information in deep biometric templates: From vulnerability of unprotected templates to leakage in protected templates","author":"Shahreza","year":"2024"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2015.2437652"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2018.2812193"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2014.2381273"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-19-5288-3"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1145\/3687264"},{"key":"ref196","article-title":"Model pairing using embedding translation for backdoor attack detection on open-set classification tasks","author":"Unnervik","year":"2024","journal-title":"arXiv:2402.18718"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3092646"},{"key":"ref198","first-page":"34136","article-title":"Adv-attribute: Inconspicuous and transferable adversarial attack on face recognition","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NeruIPS)","volume":"35","author":"Jia"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2015.2426728"},{"key":"ref200","doi-asserted-by":"publisher","DOI":"10.1016\/j.cose.2020.101902"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2023.102144"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3312123"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2827389"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.361"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP46576.2022.9897535"},{"key":"ref206","first-page":"12703","article-title":"Face reconstruction from facial templates by learning latent space of a generator network","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"36","author":"Shahreza"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2024.3381820"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1109\/MSP.2015.2427849"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1007\/s11042-022-13817-9"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-019-09767-8"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/IJCB54206.2022.10007960"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.23919\/EUSIPCO58844.2023.10289780"},{"key":"ref213","article-title":"DeepFakes: A new threat to face recognition? Assessment and detection","author":"Korshunov","year":"2018","journal-title":"arXiv:1812.08685"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2020.06.014"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2022.3154404"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2021-1280"},{"key":"ref217","article-title":"A fine-tuned Wav2vec 2.0\/HuBERT benchmark for speech emotion recognition, speaker verification and spoken language understanding","author":"Wang","year":"2021","journal-title":"arXiv:2111.02735"},{"key":"ref218","article-title":"Foundation versus domain-specific models: Performance comparison, fusion, and explainability in face recognition","author":"Sony","year":"2025","journal-title":"arXiv:2507.03541"},{"key":"ref219","article-title":"Benchmarking foundation models for zero-shot biometric tasks","author":"Sony","year":"2025","journal-title":"arXiv:2505.24214"},{"key":"ref220","article-title":"FaceXBench: Evaluating multimodal LLMs on face understanding","author":"Narayan","year":"2025","journal-title":"arXiv:2501.10360"},{"key":"ref221","article-title":"Face-human-bench: A comprehensive benchmark of face and human understanding for multi-modal assistants","author":"Qin","year":"2025","journal-title":"arXiv:2501.01243"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-97-8702-9_27"},{"key":"ref223","doi-asserted-by":"publisher","DOI":"10.3390\/electronics14020246"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2025.105453"},{"key":"ref225","article-title":"HumanOmni: A large vision-speech language model for human-centric video understanding","author":"Zhao","year":"2025","journal-title":"arXiv:2501.15111"},{"key":"ref226","article-title":"FaceLLM: A multimodal large language model for face understanding","author":"Shahreza","year":"2025","journal-title":"arXiv:2507.10300"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00159"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-92089-9_14"},{"key":"ref229","article-title":"From pixels to words: Leveraging explainability in face recognition through interactive natural language processing","author":"DeAndres-Tame","year":"2024","journal-title":"arXiv:2409.16089"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747077"},{"key":"ref231","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747814"},{"key":"ref232","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01814"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00150"},{"key":"ref234","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00203"},{"key":"ref235","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00937"},{"key":"ref236","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00598"},{"key":"ref237","article-title":"ComFace: Facial representation learning with synthetic data for comparing faces","author":"Akamatsu","year":"2024","journal-title":"arXiv:2405.16016"},{"key":"ref238","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3304724"},{"key":"ref239","article-title":"FaceXFormer: A unified transformer for facial analysis","author":"Narayan","year":"2024","journal-title":"arXiv:2403.12960"},{"key":"ref240","article-title":"Task-adaptive Q-face","author":"Sun","year":"2024","journal-title":"arXiv:2405.09059"},{"key":"ref241","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72754-2_14"},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2020-2650"},{"key":"ref243","first-page":"9912","article-title":"Unsupervised learning of visual features by contrasting cluster assignments","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Caron"},{"key":"ref244","doi-asserted-by":"publisher","DOI":"10.5555\/3524938.3525087"},{"key":"ref245","doi-asserted-by":"publisher","DOI":"10.1109\/MIPR62202.2024.00103"},{"key":"ref246","doi-asserted-by":"publisher","DOI":"10.1109\/ICME57554.2024.10687508"},{"key":"ref247","doi-asserted-by":"publisher","DOI":"10.1109\/FG59268.2024.10581982"},{"key":"ref248","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3680827"},{"key":"ref249","article-title":"Face-MLLM: A large face perception model","author":"Sun","year":"2024","journal-title":"arXiv:2410.20717"},{"key":"ref250","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00855"},{"key":"ref251","article-title":"Face-LLaVA: Facial expression and attribute understanding through instruction tuning","author":"Chaubey","year":"2025","journal-title":"arXiv:2504.07198"},{"key":"ref252","article-title":"FaceInsight: A multimodal large language model for face perception","author":"Li","year":"2025","journal-title":"arXiv:2504.15624"},{"key":"ref253","article-title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning","author":"Zhao","year":"2025","journal-title":"arXiv:2503.05379"},{"key":"ref254","article-title":"FaceGPT: Self-supervised learning to chat about 3D human faces","author":"Wang","year":"2024","journal-title":"arXiv:2406.07163"},{"key":"ref255","doi-asserted-by":"publisher","DOI":"10.1109\/tifs.2025.3576577"},{"key":"ref256","article-title":"Forensics adapter: Unleashing CLIP for generalizable face forgery detection","author":"Cui","year":"2024","journal-title":"arXiv:2411.19715"},{"key":"ref257","doi-asserted-by":"publisher","DOI":"10.1109\/WACVW65960.2025.00179"},{"key":"ref258","article-title":"FSFM: A generalizable face security foundation model via self-supervised facial representation learning","author":"Wang","year":"2024","journal-title":"arXiv:2412.12032"},{"key":"ref259","doi-asserted-by":"publisher","DOI":"10.21437\/Odyssey.2022-16"},{"key":"ref260","article-title":"X2-DFD: A framework for eXplainable and eXtendable deepfake detection","author":"Chen","year":"2024","journal-title":"arXiv:2410.06126"},{"key":"ref261","article-title":"FFAA: Multimodal large language model based explainable open-world face forgery analysis assistant","author":"Huang","year":"2024","journal-title":"arXiv:2408.10072"},{"key":"ref262","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52734.2025.01823"},{"key":"ref263","doi-asserted-by":"publisher","DOI":"10.1109\/IJCB62174.2024.10744532"},{"key":"ref264","article-title":"Are music foundation models better at singing voice deepfake detection? Far-better fuse them with speech foundation models","author":"Phukan","year":"2024","journal-title":"arXiv:2409.14131"},{"key":"ref265","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00019"},{"key":"ref266","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i5.32559"},{"key":"ref267","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00436"},{"key":"ref268","article-title":"How good is ChatGPT at audiovisual deepfake detection: A comparative study of ChatGPT, AI models and human perception","author":"Shahzad","year":"2024","journal-title":"arXiv:2411.09266"},{"key":"ref269","doi-asserted-by":"publisher","DOI":"10.1109\/TBIOM.2025.3605525"},{"key":"ref270","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747766"},{"key":"ref271","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746213"},{"key":"ref272","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8461375"},{"key":"ref273","article-title":"ForgeryGPT: Multimodal large language model for explainable image forgery detection and localization","author":"Liu","year":"2024","journal-title":"arXiv:2410.10238"},{"key":"ref274","doi-asserted-by":"publisher","DOI":"10.1145\/3652583.3658035"},{"key":"ref275","doi-asserted-by":"publisher","DOI":"10.1111\/exsy.13829"},{"key":"ref276","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00439"},{"key":"ref277","article-title":"AntifakePrompt: Prompt-tuned vision-language models are fake image detectors","author":"Chang","year":"2023","journal-title":"arXiv:2310.17419"},{"key":"ref278","article-title":"Mixture of low-rank experts for transferable AI-generated image detection","author":"Liu","year":"2024","journal-title":"arXiv:2404.04883"},{"key":"ref279","doi-asserted-by":"publisher","DOI":"10.1109\/MSEC.2024.3376637"},{"key":"ref280","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-78305-0_11"},{"key":"ref281","article-title":"SIDA: Social media image deepfake detection, localization and explanation with large multimodal model","author":"Huang","year":"2024","journal-title":"arXiv:2412.04292"},{"key":"ref282","article-title":"FakeShield: Explainable image forgery detection and localization via multi-modal large language models","author":"Xu","year":"2024","journal-title":"arXiv:2410.02761"},{"key":"ref283","doi-asserted-by":"publisher","DOI":"10.1109\/tifs.2025.3597211"},{"key":"ref284","article-title":"Survey on AI-generated media detection: From non-MLLM to MLLM","author":"Zou","year":"2025","journal-title":"arXiv:2502.05240"},{"key":"ref285","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01803"},{"key":"ref286","doi-asserted-by":"publisher","DOI":"10.1109\/IJCB57857.2023.10448619"},{"key":"ref287","doi-asserted-by":"publisher","DOI":"10.1109\/IJCB62174.2024.10744492"},{"key":"ref288","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3680856"},{"key":"ref289","doi-asserted-by":"publisher","DOI":"10.1109\/IJCB62174.2024.10744523"},{"key":"ref290","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00029"},{"key":"ref291","article-title":"InstructFLIP: Exploring unified vision-language model for face anti-spoofing","author":"Lin","year":"2025","journal-title":"arXiv:2507.12060"},{"key":"ref292","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2025.3573785"},{"key":"ref293","article-title":"FaceShield: Explainable face anti-spoofing with multimodal large language models","author":"Wang","year":"2025","journal-title":"arXiv:2505.09415"},{"key":"ref294","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i9.33073"},{"key":"ref295","article-title":"Exploring task-solving paradigm for generalized cross-domain face anti-spoofing via reinforcement fine-tuning","author":"Jiang","year":"2025","journal-title":"arXiv:2506.21895"},{"key":"ref296","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10448156"},{"key":"ref297","doi-asserted-by":"publisher","DOI":"10.1109\/WACVW65960.2025.00084"},{"key":"ref298","doi-asserted-by":"publisher","DOI":"10.1109\/FG61629.2025.11099412"},{"key":"ref299","doi-asserted-by":"publisher","DOI":"10.1109\/WACVW65960.2025.00093"},{"key":"ref300","article-title":"Are foundation models all you need for zero-shot face presentation attack detection?","author":"Gonzalez-Sole","year":"2025","journal-title":"arXiv:2507.16393"},{"key":"ref301","doi-asserted-by":"publisher","DOI":"10.1007\/s44267-025-00079-w"},{"key":"ref302","article-title":"From sparse to soft mixtures of experts","author":"Puigcerver","year":"2023","journal-title":"arXiv:2308.00951"},{"key":"ref303","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3436900"},{"key":"ref304","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2023.3345866"},{"key":"ref305","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01813"},{"key":"ref306","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547935"},{"key":"ref307","doi-asserted-by":"publisher","DOI":"10.1145\/3694974"},{"key":"ref308","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-26293-7_5"},{"key":"ref309","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00350"},{"key":"ref310","article-title":"PhotoVerse: Tuning-free image customization with text-to-image diffusion models","author":"Chen","year":"2023","journal-title":"arXiv:2309.05793"},{"key":"ref311","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-024-02227-z"},{"key":"ref312","doi-asserted-by":"publisher","DOI":"10.1145\/3680528.3687662"},{"key":"ref313","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00825"},{"key":"ref314","doi-asserted-by":"publisher","DOI":"10.1145\/3610548.3618249"},{"key":"ref315","article-title":"IP-adapter: Text compatible image prompt adapter for text-to-image diffusion models","author":"Ye","year":"2023","journal-title":"arXiv:2308.06721"},{"key":"ref316","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i2.27891"},{"key":"ref317","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.02557"},{"key":"ref318","article-title":"InstantID: Zero-shot identity-preserving generation in seconds","author":"Wang","year":"2024","journal-title":"arXiv:2401.07519"},{"key":"ref319","article-title":"ID-aligner: Enhancing identity-preserving text-to-image generation with reward feedback learning","author":"Chen","year":"2024","journal-title":"arXiv:2404.15449"},{"key":"ref320","article-title":"FaceStudio: Put your face everywhere in seconds","author":"Yan","year":"2023","journal-title":"arXiv:2312.02663"},{"key":"ref321","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00100"},{"key":"ref322","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72913-3_14"},{"key":"ref323","first-page":"5584","article-title":"Face reconstruction from face embeddings using adapter to a face foundation model","volume-title":"Proc. Comput. Vis. Pattern Recognit.","author":"Shahreza"},{"key":"ref324","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01006"},{"key":"ref325","doi-asserted-by":"publisher","DOI":"10.1109\/FG59268.2024.10581924"},{"key":"ref326","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2022.3227762"},{"key":"ref327","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00103"},{"key":"ref328","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3204591"},{"key":"ref329","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2023.3255585"},{"key":"ref330","doi-asserted-by":"publisher","DOI":"10.1109\/FG59268.2024.10581946"},{"key":"ref331","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00323"},{"key":"ref332","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2024.3505621"},{"key":"ref333","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW59228.2023.00113"},{"key":"ref334","article-title":"HyperFace: Generating synthetic face recognition datasets by exploring face embedding hypersphere","author":"Shahreza","year":"2024","journal-title":"arXiv:2411.08470"},{"key":"ref335","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01223"},{"key":"ref336","article-title":"Synthetic face datasets generation via latent space exploration from Brownian identity diffusion","author":"Geissb\u00fchler","year":"2024","journal-title":"arXiv:2405.00228"},{"key":"ref337","doi-asserted-by":"publisher","DOI":"10.1109\/IJCB57857.2023.10448642"},{"key":"ref338","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00352"},{"key":"ref339","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref340","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"ref341","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2106.12423"},{"key":"ref342","doi-asserted-by":"publisher","DOI":"10.1145\/3130800.3130813"},{"key":"ref343","article-title":"Hallucination of multimodal large language models: A survey","author":"Bai","year":"2024","journal-title":"arXiv:2404.18930"},{"key":"ref344","doi-asserted-by":"publisher","DOI":"10.1145\/3703155"},{"key":"ref345","doi-asserted-by":"publisher","DOI":"10.1145\/3630106.3658968"},{"key":"ref346","article-title":"FairerCLIP: Debiasing CLIP\u2019s zero-shot predictions using functions in RKHSs","author":"Dehdashtian","year":"2024","journal-title":"arXiv:2403.15593"},{"key":"ref347","doi-asserted-by":"publisher","DOI":"10.1109\/TBIOM.2021.3115465"},{"key":"ref348","doi-asserted-by":"publisher","DOI":"10.1109\/TBIOM.2021.3102862"},{"key":"ref349","doi-asserted-by":"publisher","DOI":"10.1145\/3705295"},{"key":"ref350","doi-asserted-by":"publisher","DOI":"10.1613\/jair.1.15461"},{"key":"ref351","article-title":"Membership inference attacks against vision-language models","author":"Hu","year":"2025","journal-title":"arXiv:2501.18624"},{"key":"ref352","article-title":"Unveiling synthetic faces: How synthetic datasets can expose real identities","author":"Shahreza","year":"2024","journal-title":"arXiv:2410.24015"},{"key":"ref353","first-page":"2633","article-title":"Extracting training data from large language models","volume-title":"Proc. 30th USENIX Secur. Symp.","author":"Carlini"},{"key":"ref354","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2025.3592935"},{"key":"ref355","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i20.30275"},{"key":"ref356","article-title":"Ethics whitepaper: Whitepaper on ethical research into large language models","author":"Ungless","year":"2024","journal-title":"arXiv:2410.19812"},{"key":"ref357","article-title":"Safety at scale: A comprehensive survey of large model and agent safety","author":"Ma","year":"2025","journal-title":"arXiv:2502.05206"},{"key":"ref358","doi-asserted-by":"publisher","DOI":"10.1145\/3712001"}],"container-title":["IEEE Transactions on Information Forensics and Security"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10206\/10810755\/11137396.pdf?arnumber=11137396","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,6]],"date-time":"2025-09-06T06:02:32Z","timestamp":1757138552000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11137396\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":358,"URL":"https:\/\/doi.org\/10.1109\/tifs.2025.3602233","relation":{"has-preprint":[{"id-type":"doi","id":"10.36227\/techrxiv.174119169.94570936\/v1","asserted-by":"object"},{"id-type":"doi","id":"10.36227\/techrxiv.174119169.94570936\/v2","asserted-by":"object"}]},"ISSN":["1556-6013","1556-6021"],"issn-type":[{"value":"1556-6013","type":"print"},{"value":"1556-6021","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]}}}