{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,7]],"date-time":"2026-03-07T16:06:20Z","timestamp":1772899580423,"version":"3.50.1"},"reference-count":100,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2026,1,1]],"date-time":"2026-01-01T00:00:00Z","timestamp":1767225600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"Horizon Europe through the Research Project AutoTRUST: Inclusiveness and Trust in the Interaction Between Users and New Automated Modes of Road Transport and Mobility Services","award":["101148123"],"award-info":[{"award-number":["101148123"]}]},{"name":"Research Project GuardAI: Enhancing Robustness and Security of Edge AI Systems for Safety-Critical Applications","award":["101168067"],"award-info":[{"award-number":["101168067"]}]},{"name":"OA mode was financially supported by HEAL-Link"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2026]]},"DOI":"10.1109\/access.2026.3664520","type":"journal-article","created":{"date-parts":[[2026,2,13]],"date-time":"2026-02-13T20:50:52Z","timestamp":1771015852000},"page":"32431-32454","source":"Crossref","is-referenced-by-count":0,"title":["Visual Language Models: Foundations and Applications"],"prefix":"10.1109","volume":"14","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2247-3082","authenticated-orcid":false,"given":"Sotiris","family":"Kotsiantis","sequence":"first","affiliation":[{"name":"Department of Mathematics, University of Patras, Patras, Greece"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4044-6018","authenticated-orcid":false,"given":"Theodor","family":"Panagiotakopoulos","sequence":"additional","affiliation":[{"name":"Department of Management Science and Technology, University of Patras, Patras, Greece"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0262-7619","authenticated-orcid":false,"given":"Nikos","family":"Piperigkos","sequence":"additional","affiliation":[{"name":"Industrial Systems Institute, Athena Research Center, Patras, Greece"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0511-9302","authenticated-orcid":false,"given":"Aris S.","family":"Lalos","sequence":"additional","affiliation":[{"name":"Industrial Systems Institute, Athena Research Center, Patras, Greece"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01838"},{"key":"ref2","article-title":"Multimodal chain-of-thought reasoning in language models","author":"Zhang","year":"2023","journal-title":"arXiv:2302.00923"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.52202\/075280-1516"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2024.3369699"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1514"},{"key":"ref7","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref8","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Jia"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00331"},{"key":"ref10","article-title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","author":"Zhu","year":"2023","journal-title":"arXiv:2304.10592"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.5555\/3045118.3045336"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2025.113880"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-025-02368-9"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.23919\/DATE64628.2025.10992791"},{"key":"ref17","first-page":"5583","article-title":"ViLT: Vision-and-language transformer without convolution or region supervision","volume-title":"Proc. Int. Conf. Mach. Learn. (ICML)","author":"Kim"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.52202\/068431-1723"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01032"},{"key":"ref20","article-title":"LAION-5B: An open large-scale dataset for training next generation image-text models","author":"Schuhmann","year":"2022","journal-title":"arXiv:2210.08402"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00851"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1238"},{"key":"ref25","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2025.3565552"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.36001\/phmconf.2024.v16i1.4147"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.3115\/1073083.1073135"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.3115\/1626355.1626389"},{"key":"ref30","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of summaries","volume-title":"Proc. Workshop Text Summarization Branches Out","author":"Lin"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref32","doi-asserted-by":"crossref","DOI":"10.1017\/CBO9780511809071","volume-title":"Ntroduction to Information Retrieval","author":"Manning","year":"2008"},{"key":"ref33","first-page":"77","article-title":"The TREC-8 question answering track","volume-title":"Proc. TREC","author":"Voorhees"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1145\/582415.582418"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2022\/762"},{"key":"ref36","article-title":"Vision-language intelligence: Tasks, representation learning, and large models","author":"Li","year":"2022","journal-title":"arXiv:2203.01922"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/s11633-022-1369-5"},{"key":"ref38","article-title":"Multimodal learning with transformers: A survey","author":"Xu","year":"2022","journal-title":"arXiv:2206.06488"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1002\/widm.70036"},{"key":"ref40","article-title":"AGENTICT2S: Robust text-to-SPARQL via agentic collaborative reasoning over heterogeneous knowledge graphs for the circular economy","author":"Zhao","year":"2025","journal-title":"arXiv:2508.01815"},{"key":"ref41","article-title":"Movable antenna enhanced federated fine-tuning of large language models via hybrid client selection optimization","author":"Zhao","year":"2025","journal-title":"arXiv:2506.00011"},{"key":"ref42","first-page":"19730","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1264"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.3115\/1626431.1626433"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01081"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1080\/13658816.2025.2455112"},{"key":"ref47","article-title":"Multimodal datasets: Misogyny, pornography, and malignant stereotypes","author":"Birhane","year":"2021","journal-title":"arXiv:2110.01963"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1038\/s41698-025-00916-7"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2025.103336"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.3390\/agriculture15111173"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.2352\/CIC.2024.32.1.20"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1038\/s41598-025-85838-x"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2025.3557780"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1145\/3708991"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3403167"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73390-1_18"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/JIOT.2025.3532494"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-97-9437-9_31"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.3233\/FAIA240916"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1016\/j.jvcir.2024.104280"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01472"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02212"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.3390\/s25010258"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2024.129167"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2024.3488181"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2025.129826"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2024.106906"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1016\/j.jnlssr.2024.10.001"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/TGRS.2024.3512548"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-78447-7_10"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-97-8620-6_33"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.70137"},{"key":"ref73","first-page":"10967","article-title":"GIT: A generative image-to-text transformer for vision and language","volume-title":"Proc. CVPR","author":"Wang"},{"key":"ref74","article-title":"MusicLM: Generating music from text","author":"Agostinelli","year":"2023","journal-title":"arXiv:2301.11325"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1063\/5.0271562"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00186"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.3390\/electronics13091660"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ISBI60581.2025.10981180"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-97-7498-2_1"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.3390\/math13091365"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1007\/s11760-025-03951-w"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00708"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.3390\/buildings15060959"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1016\/j.imavis.2024.105280"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/LRA.2024.3471457"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1117\/12.3052174"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.15043"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1016\/j.cag.2024.104048"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.20965\/jrm.2024.p0353"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/TII.2024.3441638"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.3389\/fnbot.2024.1513354"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/JSTARS.2024.3488034"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.3390\/rs16162927"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01354"},{"key":"ref95","first-page":"771","article-title":"Women also snowboard: Overcoming bias in captioning models","volume-title":"Proc. Eur. Conf. Comput. Vis. (ECCV)","author":"Burns"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1437"},{"key":"ref97","article-title":"Reformer: The efficient transformer","author":"Kitaev","year":"2020","journal-title":"arXiv:2001.04451"},{"key":"ref98","article-title":"A generalist agent","author":"Reed","year":"2022","journal-title":"arXiv:2205.06175"},{"key":"ref99","article-title":"Kosmos-2: Grounding multimodal large language models to the world","author":"Peng","year":"2023","journal-title":"arXiv:2306.14824"},{"key":"ref100","article-title":"OpenFlamingo: An open-source framework for training large autoregressive vision-language models","author":"Awadalla","year":"2023","journal-title":"arXiv:2308.01390"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/11323511\/11395961.pdf?arnumber=11395961","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,6]],"date-time":"2026-03-06T21:03:12Z","timestamp":1772830992000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11395961\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026]]},"references-count":100,"URL":"https:\/\/doi.org\/10.1109\/access.2026.3664520","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026]]}}}