{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T15:47:17Z","timestamp":1781797637233,"version":"3.54.5"},"reference-count":72,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,10,19]],"date-time":"2025-10-19T00:00:00Z","timestamp":1760832000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100003475","name":"Hasler foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100003475","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100023751","name":"Idiap Research Institute","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100023751","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,10,19]]},"DOI":"10.1109\/iccvw69036.2025.00390","type":"proceedings-article","created":{"date-parts":[[2026,2,23]],"date-time":"2026-02-23T20:44:02Z","timestamp":1771879442000},"page":"3736-3746","source":"Crossref","is-referenced-by-count":5,"title":["FaceLLM: A Multimodal Large Language Model for Face Understanding"],"prefix":"10.1109","author":[{"given":"Hatef Otroshi","family":"Shahreza","sequence":"first","affiliation":[{"name":"Idiap Research Institute,Switzerland"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"S\u00e9bastien","family":"Marcel","sequence":"additional","affiliation":[{"name":"Idiap Research Institute,Switzerland"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Phi-3 technical report: A highly capable language model locally on your phone","author":"Abdin","year":"2024","journal-title":"arXiv preprint"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/wacv61041.2025.00514"},{"key":"ref3","first-page":"23716","article-title":"Flamingo: a visual language model for few-shot learning","volume":"35","author":"Alayrac","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref4","article-title":"Paligemma: A versatile 3b vlm for trans-fer","author":"Beyer","year":"2024","journal-title":"arXiv preprint"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00150"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3680827"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4231-5"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-20893-6_38"},{"key":"ref9","first-page":"1","article-title":"On the effectiveness of local binary patterns in face anti-spoofing","volume-title":"2012 BIOSIG-proceedings of the international conference of biometrics special interest group (BIOSIG)","author":"Chingovska"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2024.3370437"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00598"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-23123-0_11"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/FG59268.2024.10581982"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00203"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2019.2916652"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP51287.2024.10647924"},{"key":"ref17","author":"Hong","year":"2024","journal-title":"Cogvlm2: Visual language models for image and video understanding"},{"issue":"2","key":"ref18","first-page":"3","article-title":"Lora: Low-rank adaptation of large language models","volume":"1","author":"Edward","year":"2022","journal-title":"ICLR"},{"key":"ref19","article-title":"Labeled faces in the wild: A database forstudying face recognition in unconstrained environments","volume-title":"Workshop on faces in \u2019Real-Life \u2019Images: detection, alignment, and recognition","author":"Gary"},{"key":"ref20","article-title":"Gpt-4o system card","author":"Hurst","year":"2024","journal-title":"arXiv preprint"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/cvprw63382.2024.00436"},{"key":"ref22","article-title":"Mantis: Interleaved multi-image instruction tuning","author":"Jiang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00159"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/wacvw65960.2025.00093"},{"key":"ref25","author":"Laurencon","year":"2023","journal-title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2789"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00559"},{"key":"ref28","article-title":"Llava-onevision: Easy visual task transfer","author":"Li","year":"2024","journal-title":"arXiv preprint"},{"key":"ref29","article-title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","author":"Li","year":"2024","journal-title":"arXiv preprint"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/ICME57554.2024.10687508"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.277"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00327"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.02527"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.02520"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/MIPR62202.2024.00103"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref37","article-title":"Visual instruction tuning","volume":"36","author":"Liu","year":"2024","journal-title":"Advances in neural information processing systems"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6832"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00937"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.425"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/TAFFC.2017.2740923"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2017.250"},{"key":"ref44","article-title":"Facexformer: A unified transformer for fa-cial analysis","author":"Narayan","year":"2024","journal-title":"arXiv preprint"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/tbiom.2026.3655668"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3304724"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72754-2_14"},{"key":"ref48","article-title":"Face-human-bench: A comprehensive benchmark of face and human understanding for multi-modal assistants","author":"Qin","year":"2025","journal-title":"arXiv preprint"},{"key":"ref49","author":"Qwen","year":"2025","journal-title":"Qwen2.5 technical report"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00009"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0940-3"},{"key":"ref52","first-page":"25278","article-title":"Laion-5b: An open large-scale dataset for training next generation image-text models","volume":"35","author":"Schuhmann","year":"2022","journal-title":"Advances in neural information processing systems"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2016.7477558"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/tifs.2025.3602233"},{"key":"ref55","author":"Shi","year":"2024","journal-title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/s44267-025-00079-w"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3035969"},{"key":"ref58","article-title":"Chameleon Team","year":"2024","journal-title":"Chameleon: Mixed-modal early-fusion foundation models"},{"key":"ref59","volume-title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context (2024)","year":"2024"},{"key":"ref60","author":"Wang","year":"2024","journal-title":"Qwen2-vl: Enhancing vision-language model\u2019s perception of the world at any resolution"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00855"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TIFS.2015.2400395"},{"key":"ref63","article-title":"Minicpm-v: A gpt-4v level mllm on your phone","author":"Yao","year":"2024","journal-title":"arXiv preprint"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.430"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.70"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/ICB.2012.6199754"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.463"},{"key":"ref68","article-title":"Humanomni: A large vision-speech language model for human-centric video understanding","author":"Zhao","year":"2025","journal-title":"arXiv preprint"},{"issue":"7","key":"ref69","first-page":"5","article-title":"Cross-pose lfw: A database for studying cross-pose face recognition in un-constrained environments","volume":"5","author":"Zheng","year":"2018","journal-title":"Beijing University of Posts and Telecommunications, Tech. Rep"},{"key":"ref70","article-title":"Cross-age lfw: A database for studying cross-age face recognition in un-constrained environments","author":"Zheng","year":"2017","journal-title":"arXiv preprint"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01814"},{"key":"ref72","article-title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","author":"Zhu","year":"2025","journal-title":"arXiv preprint"}],"event":{"name":"2025 IEEE\/CVF International Conference on Computer Vision Workshops (ICCVW)","location":"Honolulu, HI, USA","start":{"date-parts":[[2025,10,19]]},"end":{"date-parts":[[2025,10,20]]}},"container-title":["2025 IEEE\/CVF International Conference on Computer Vision Workshops (ICCVW)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11373940\/11374285\/11375703.pdf?arnumber=11375703","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,24]],"date-time":"2026-02-24T07:35:44Z","timestamp":1771918544000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11375703\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,19]]},"references-count":72,"URL":"https:\/\/doi.org\/10.1109\/iccvw69036.2025.00390","relation":{},"subject":[],"published":{"date-parts":[[2025,10,19]]}}}