{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T07:18:06Z","timestamp":1763191086526,"version":"3.45.0"},"reference-count":40,"publisher":"IEEE","license":[{"start":{"date-parts":[[2025,6,30]],"date-time":"2025-06-30T00:00:00Z","timestamp":1751241600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2025,6,30]],"date-time":"2025-06-30T00:00:00Z","timestamp":1751241600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,6,30]]},"DOI":"10.1109\/ijcnn64981.2025.11228995","type":"proceedings-article","created":{"date-parts":[[2025,11,14]],"date-time":"2025-11-14T18:46:15Z","timestamp":1763145975000},"page":"1-8","source":"Crossref","is-referenced-by-count":0,"title":["Role-Playing in Vision-Language Models: A Comprehensive Evaluation of Image Description Performance"],"prefix":"10.1109","author":[{"given":"Zhaofeng","family":"Niu","sequence":"first","affiliation":[{"name":"Qufu Normal University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoya","family":"Chang","sequence":"additional","affiliation":[{"name":"Qufu Normal University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bowen","family":"Wang","sequence":"additional","affiliation":[{"name":"Osaka University,Japan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xingfu","family":"Cheng","sequence":"additional","affiliation":[{"name":"Qufu Normal University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guangshun","family":"Li","sequence":"additional","affiliation":[{"name":"Qufu Normal University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Liangzhi","family":"Li","sequence":"additional","affiliation":[{"name":"Qufu Normal University,China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"article-title":"A survey of large language models","year":"2023","author":"Zhao","key":"ref1"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1145\/3744746"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1093\/nsr\/nwae403"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.738"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-emnlp.969"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-023-06647-8"},{"article-title":"Chatharuhi: Reviving anime character in reality via large language model","year":"2023","author":"Li","key":"ref7"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1016\/j.sbspro.2013.10.668"},{"key":"ref9","article-title":"A survey on large language models: Applications, challenges, limitations, and practical usage","author":"Hadi","year":"2023","journal-title":"Authorea Preprints"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/s11280-024-01291-2"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2386"},{"issue":"8","key":"ref12","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI blog"},{"key":"ref13","first-page":"1877","article-title":"Language models are few-shot learners","volume":"33","author":"Brown","year":"2020","journal-title":"Advances in neural information processing systems"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1038\/d41586-023-00816-5"},{"article-title":"Gpt-4 technical report","year":"2023","author":"Achiam","key":"ref15"},{"article-title":"Palm 2 technical report","year":"2023","author":"Anil","key":"ref16"},{"key":"ref17","first-page":"S0140525X16001837","article-title":"Attention is all you need.(nips), 2017","volume":"10","author":"Vaswani","year":"2017"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/TCSS.2021.3052261"},{"article-title":"Large language model-based role-playing for personalized medical jargon extraction","year":"2024","author":"Lim","key":"ref19"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.54364\/AAIML.2024.42129"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1145\/3613905.3651122"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01055"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.102"},{"article-title":"Self-prompt tuning: Enable autonomous role-playing in llms","year":"2024","author":"Kong","key":"ref24"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.findings-acl.878"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.eacl-demo.10"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.468"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.814"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/BigData59044.2023.10386743"},{"article-title":"A comprehensive survey and guide to multimodal large language models in vision-language tasks","year":"2024","author":"Liang","key":"ref30"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"article-title":"Visualbert: A simple and performant baseline for vision and language","year":"2019","author":"Li","key":"ref32"},{"key":"ref33","article-title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume":"32","author":"Lu","year":"2019","journal-title":"Advances in neural information processing systems"},{"article-title":"From text to image: Exploring gpt-4vision\u2019s potential in advanced radiological analysis across subspecialties","year":"2023","author":"Busch","key":"ref34"},{"article-title":"Gpt-4o system card","year":"2024","author":"Hurst","key":"ref35"},{"article-title":"Visualroleplay: Universal jailbreak attack on multimodal large language models via role-playing image characte","year":"2024","author":"Ma","key":"ref36"},{"article-title":"Can vlms play action role-playing games? take black myth wukong as a study case","year":"2024","author":"Chen","key":"ref37"},{"article-title":"Bertscore: Evaluating text generation with bert","year":"2020","author":"Zhang","key":"ref38"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1145\/3696459"},{"article-title":"Deceiving google\u2019s perspective api built for detecting toxic comments","year":"2017","author":"Hosseini","key":"ref40"}],"event":{"name":"2025 International Joint Conference on Neural Networks (IJCNN)","start":{"date-parts":[[2025,6,30]]},"location":"Rome, Italy","end":{"date-parts":[[2025,7,5]]}},"container-title":["2025 International Joint Conference on Neural Networks (IJCNN)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/11227166\/11227148\/11228995.pdf?arnumber=11228995","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T07:14:21Z","timestamp":1763190861000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11228995\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,30]]},"references-count":40,"URL":"https:\/\/doi.org\/10.1109\/ijcnn64981.2025.11228995","relation":{},"subject":[],"published":{"date-parts":[[2025,6,30]]}}}