{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:39:21Z","timestamp":1777657161949,"version":"3.51.4"},"reference-count":50,"publisher":"IEEE","license":[{"start":{"date-parts":[[2024,10,6]],"date-time":"2024-10-06T00:00:00Z","timestamp":1728172800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,10,6]],"date-time":"2024-10-06T00:00:00Z","timestamp":1728172800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,10,6]]},"DOI":"10.1109\/smc54092.2024.10831129","type":"proceedings-article","created":{"date-parts":[[2025,1,20]],"date-time":"2025-01-20T18:39:20Z","timestamp":1737398360000},"page":"3428-3433","source":"Crossref","is-referenced-by-count":5,"title":["Unbridled Icarus: A Survey of the Potential Perils of Image Inputs in Multimodal Large Language Model Security"],"prefix":"10.1109","author":[{"given":"Yihe","family":"Fan","sequence":"first","affiliation":[{"name":"School of Electronics and Information Engineering, TongJi University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yuxin","family":"Cao","sequence":"additional","affiliation":[{"name":"School of Computing, National University of Singapore,Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ziyu","family":"Zhao","sequence":"additional","affiliation":[{"name":"Fan Gongxiu Honors College, Beijing University of Technology,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ziyao","family":"Liu","sequence":"additional","affiliation":[{"name":"Nanyang Technological University,Singapore"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shaofeng","family":"Li","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Southeast University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/VTC2023-Fall60731.2023.10333689"},{"key":"ref2","article-title":"Jailbreak in pieces: Compositional adversarial attacks on multi-modal language models","volume-title":"The Twelfth International Conference on Learning Representations","author":"Shayegani","year":"2023"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73464-9_11"},{"key":"ref4","article-title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts","author":"Gong","year":"2023","journal-title":"arXiv preprint"},{"key":"ref5","article-title":"On evaluating adversarial robustness of large vision-language models","volume":"36","author":"Zhao","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref6","article-title":"Survey of vulnerabilities in large language models re-vealed by adversarial attacks. arxiv. doi: 10.48550","author":"Shayegani","year":"2023","journal-title":"arXiv preprint"},{"key":"ref7","article-title":"A survey of safety and trustworthi-ness of large language models through the lens of verification and validation","author":"Huang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref8","article-title":"Risk taxonomy, mitigation, and assess-ment benchmarks of large language model systems","author":"Cui","year":"2024","journal-title":"ar Xiv preprint"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.738"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2024\/918"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW60793.2023.00395"},{"key":"ref12","article-title":"Visual adversarial examples jailbreak aligned large language models","volume-title":"The Second Workshop on New Frontiers in Adversarial Machine Learning","author":"Qi","year":"2023"},{"key":"ref13","article-title":"An image is worth 1000 lies: Adversarial transferability across prompts on vision-language models","author":"Luo","year":"2024","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Image hijacks: Adversarial images can control generative models at runtime","author":"Bailey","year":"2023","journal-title":"arXiv preprint"},{"key":"ref15","article-title":"(ab) using images and sounds for indirect instruction injection in multi-modal llms","author":"Bagdasaryan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref16","article-title":"Stop reasoning! when multimodal llms with chain-of-thought reasoning meets adversarial images","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref17","article-title":"Test-time backdoor attacks on multimodal large language models","author":"Lu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref18","article-title":"Agent smith: A single image can jailbreak one million multimodal llm agents exponentially fast","author":"Gu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref19","article-title":"The wolf within: Covert injection of malice into mllm societies via an mllm operative","author":"Tan","year":"2024","journal-title":"arXiv preprint"},{"key":"ref20","article-title":"Vision-llms can fool themselves with self-generated typographic attacks","author":"Qraitem","year":"2024","journal-title":"arXiv preprint"},{"key":"ref21","article-title":"Jailbreaking gpt-4v via self-adversarial attacks with system prompts","author":"Wu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref22","article-title":"How robust is google\u2019s bard to adversarial image attacks?","author":"Dong","year":"2023","journal-title":"arXiv preprint"},{"key":"ref23","article-title":"Instructta: Instruction-tuned targeted attack for large vision-language models","author":"Wang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref24","article-title":"Ceci n\u2019est pas une pomme: Adversarial illusions in multi-modal embeddings","author":"Bagdasaryan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref25","article-title":"at-attack: Enhancing adversarial transferability of vision-language models via optimal transport optimization","author":"Han","year":"2023","journal-title":"arXiv preprint"},{"key":"ref26","article-title":"Jailbreaking attack against multimodal large language model","author":"Niu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref27","article-title":"Imgtrojan: Jail-breaking vision-language models with one image","author":"Tao","year":"2024","journal-title":"arXiv preprint"},{"key":"ref28","article-title":"Shadowcast: Stealthy data poisoning attacks against vision-language models","author":"Xu","year":"2024","journal-title":"arXiv preprint"},{"key":"ref29","article-title":"VI-trojan: Multimodal instruction backdoor attacks against autore-gressive visual language models","author":"Liang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref30","volume-title":"Image to prompt injection with google bard","author":"Rehberger","year":"2023"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547801"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00016"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612454"},{"key":"ref34","article-title":"Vlattack: Multimodal adversarial attacks on vision-language tasks via pre-trained models","author":"Yin","year":"2023","journal-title":"arXiv preprint"},{"key":"ref35","article-title":"Exploring transferability of multimodal adversarial samples for vision-language pre-training models with contrastive learning","author":"Wang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref36","article-title":"Sa-attack: Improving adversarial transferability of vision-language pre-training models via self-augmentation","author":"He","year":"2023","journal-title":"arXiv preprint"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1007\/s10208-015-9296-2"},{"key":"ref38","article-title":"Jailbreaking black box large language models in twenty queries","author":"Chao","year":"2023","journal-title":"arXiv preprint"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/TDSC.2020.3021407"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3460120.3484576"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.198"},{"key":"ref42","article-title":"Robust contrastive language-image pretraining against data poisoning and backdoor attacks","volume":"36","author":"Yang","year":"2024","journal-title":"Advances in Neural Information Processing Systems"},{"key":"ref43","article-title":"Adversarial prompt tuning for vision-language models","author":"Zhang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02304"},{"key":"ref45","article-title":"Dress: Instructing large vision-language models to align and in-teract with humans via natural language feedback","author":"Chen","year":"2023","journal-title":"arXiv preprint"},{"key":"ref46","article-title":"A mutation-based method for multi-modal jailbreaking attack detection","author":"Zhang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.895"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.emnlp-main.585"},{"key":"ref49","article-title":"Adashield: Safeguarding multimodal large language models from structure-based attack via adaptive shield prompting","author":"Wang","year":"2024","journal-title":"arXiv preprint"},{"key":"ref50","article-title":"Eyes closed, safety on: Protecting multimodal llms via image-to-text transformation","author":"Gou","year":"2024","journal-title":"arXiv preprint"}],"event":{"name":"2024 IEEE International Conference on Systems, Man, and Cybernetics (SMC)","location":"Kuching, Malaysia","start":{"date-parts":[[2024,10,6]]},"end":{"date-parts":[[2024,10,10]]}},"container-title":["2024 IEEE International Conference on Systems, Man, and Cybernetics (SMC)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/10830919\/10830920\/10831129.pdf?arnumber=10831129","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,21]],"date-time":"2025-01-21T06:31:17Z","timestamp":1737441077000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10831129\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,6]]},"references-count":50,"URL":"https:\/\/doi.org\/10.1109\/smc54092.2024.10831129","relation":{},"subject":[],"published":{"date-parts":[[2024,10,6]]}}}