{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,7]],"date-time":"2026-07-07T16:00:43Z","timestamp":1783440043652,"version":"3.54.6"},"reference-count":44,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100005090","name":"Beijing Nova Program","doi-asserted-by":"publisher","award":["20230484368"],"award-info":[{"award-number":["20230484368"]}],"id":[{"id":"10.13039\/501100005090","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004739","name":"Youth Innovation Promotion Association of the Chinese Academy of Sciences","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004739","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002367","name":"Chinese Academy of Sciences","doi-asserted-by":"publisher","award":["XDB0680202"],"award-info":[{"award-number":["XDB0680202"]}],"id":[{"id":"10.13039\/501100002367","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.patcog.2026.113624","type":"journal-article","created":{"date-parts":[[2026,4,4]],"date-time":"2026-04-04T12:42:23Z","timestamp":1775306543000},"page":"113624","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":1,"special_numbering":"PB","title":["MM-MoralBench: A multimodal moral evaluation benchmark for large vision-language models"],"prefix":"10.1016","volume":"179","author":[{"given":"Bei","family":"Yan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jie","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhiyuan","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shiguang","family":"Shan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xilin","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.113624_bib0001","doi-asserted-by":"crossref","first-page":"8","DOI":"10.1016\/j.patrec.2025.01.001","article-title":"MiniMedGPT: efficient large vision\u2013language model for medical visual question answering","volume":"189","author":"Alsabbagh","year":"2025","journal-title":"Pattern Recognit. Lett."},{"key":"10.1016\/j.patcog.2026.113624_bib0002","doi-asserted-by":"crossref","DOI":"10.1016\/j.aiopen.2024.09.002","article-title":"Large language models in law: a survey","author":"Lai","year":"2024","journal-title":"AI Open"},{"key":"10.1016\/j.patcog.2026.113624_bib0003","series-title":"Proceedings of the Fourth ACM International Conference on AI in Finance","article-title":"Large language models in finance: a survey","author":"Li","year":"2023"},{"key":"10.1016\/j.patcog.2026.113624_bib0004","article-title":"Jailbreak attack with multimodal virtual scenario hypnosis for vision-language models","author":"Shi","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113624_bib0005","unstructured":"T. Shen, et al., Large language model alignment: a survey, (2023). arXiv: 2309.15025\">arXiv preprint arXiv: 2309.15025."},{"issue":"4","key":"10.1016\/j.patcog.2026.113624_bib0006","doi-asserted-by":"crossref","first-page":"55","DOI":"10.1162\/0011526042365555","article-title":"Intuitive ethics: how innately prepared intuitions generate culturally variable virtues","volume":"133","author":"Haidt","year":"2004","journal-title":"Daedalus"},{"key":"10.1016\/j.patcog.2026.113624_bib0007","doi-asserted-by":"crossref","first-page":"55","DOI":"10.1016\/B978-0-12-407236-7.00002-4","article-title":"Moral foundations theory: the pragmatic validity of moral pluralism","volume":"47","author":"Graham","year":"2013","journal-title":"Adv. Exp. Soc. Psychol."},{"issue":"4","key":"10.1016\/j.patcog.2026.113624_bib0008","doi-asserted-by":"crossref","first-page":"1178","DOI":"10.3758\/s13428-014-0551-2","article-title":"Moral foundations vignettes: a standardized stimulus database of scenarios based on moral foundations theory","volume":"47","author":"Clifford","year":"2015","journal-title":"Behav. Res. Method."},{"key":"10.1016\/j.patcog.2026.113624_bib0009","unstructured":"X. Yi, et al., Unpacking the ethical value alignment in big models, (2023). arXiv: 2310.17551\">arXiv preprint arXiv: 2310.17551."},{"key":"10.1016\/j.patcog.2026.113624_bib0010","series-title":"Advances in Neural Information Processing Systems","article-title":"Evaluating the moral beliefs encoded in LLMS","author":"Scherrer","year":"2024"},{"issue":"1","key":"10.1016\/j.patcog.2026.113624_bib0011","doi-asserted-by":"crossref","first-page":"62","DOI":"10.1145\/3748239.3748246","article-title":"Moralbench: moral evaluation of LLMS","volume":"27","author":"Ji","year":"2025","journal-title":"ACM SIGKDD Explorat. Newsl."},{"key":"10.1016\/j.patcog.2026.113624_bib0012","series-title":"International Conference on Learning Representations","article-title":"Aligning ai with shared human values","author":"Hendrycks","year":"2021"},{"key":"10.1016\/j.patcog.2026.113624_bib0013","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"13470","article-title":"Scruples: a corpus of community ethical judgments on 32,000 real-life anecdotes","volume":"35","author":"Lourie","year":"2021"},{"key":"10.1016\/j.patcog.2026.113624_bib0014","series-title":"Empirical Methods in Natural Language Processing","article-title":"CMoralEval: a moral evaluation benchmark for Chinese large language models","author":"Yu","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0015","series-title":"Advances in Neural Information Processing Systems","article-title":"When to make exceptions: exploring language models as accounts of human moral judgment","author":"Jin","year":"2022"},{"key":"10.1016\/j.patcog.2026.113624_bib0016","series-title":"International Conference on Learning Representations","article-title":"DailyDilemmas: revealing value preferences of LLMs with quandaries of daily life","author":"Chiu","year":"2024"},{"issue":"5","key":"10.1016\/j.patcog.2026.113624_bib0017","doi-asserted-by":"crossref","first-page":"1029","DOI":"10.1037\/a0015141","article-title":"Liberals and conservatives rely on different sets of moral foundations","volume":"96","author":"Graham","year":"2009","journal-title":"J. Pers. Soc. Psychol."},{"key":"10.1016\/j.patcog.2026.113624_bib0018","article-title":"Vision-language models for vision tasks: a survey","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.113624_bib0019","article-title":"Cross-modal generalizable visual-language models via inter-modal bidirectional supervision for enhanced pathology image recognition","author":"Hou","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.113624_bib0020","series-title":"Advances in Neural Information Processing Systems","article-title":"Visual instruction tuning","author":"Liu","year":"2023"},{"key":"10.1016\/j.patcog.2026.113624_bib0021","series-title":"Advances in Neural Information Processing Systems","article-title":"Cogvlm: visual expert for pretrained language models","author":"Wang","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0022","unstructured":"X. Dong, et al., Internlm-xcomposer2: mastering free-form text-image composition and comprehension in vision-language large model, (2024). arXiv: 2401.16420\">arXiv preprint arXiv: 2401.16420."},{"key":"10.1016\/j.patcog.2026.113624_bib0023","unstructured":"Y. Yao, et al., Minicpm-v: a gpt-4v level mllm on your phone, (2024). arXiv: 2408.01800\">arXiv preprint arXiv: 2408.01800."},{"key":"10.1016\/j.patcog.2026.113624_bib0024","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"13040","article-title":"mplug-owl2: revolutionizing multi-modal large language model with modality collaboration","author":"Ye","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0025","unstructured":"J. Bai, et al., Qwen-VL: a versatile vision-language model for understanding, localization, text reading, and beyond, (2023). arXiv: 2308.12966\">arXiv preprint arXiv: 2308.12966."},{"key":"10.1016\/j.patcog.2026.113624_bib0026","series-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"24185","article-title":"Internvl: scaling up vision foundation models and aligning for generic visual-linguistic tasks","author":"Chen","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0027","unstructured":"G. Team, et al., Gemini: a family of highly capable multimodal models, (2023). arXiv: 2312.11805\">arXiv preprint arXiv: 2312.11805."},{"key":"10.1016\/j.patcog.2026.113624_bib0028","unstructured":"OpenAI, Hello GPT-4o, https:\/\/openai.com\/index\/hello-gpt-4o\/(2024)."},{"key":"10.1016\/j.patcog.2026.113624_bib0029","series-title":"International Conference on Machine Learning","article-title":"Scaling rectified flow transformers for high-resolution image synthesis","author":"Esser","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0030","series-title":"International Conference on Learning Representations","article-title":"Large language models are not robust multiple choice selectors","author":"Zheng","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0031","series-title":"IEEE International Symposium on Workload Characterization","article-title":"MMBench: benchmarking end-to-end multi-modal DNNs and understanding their hardware-software implications","author":"Xu","year":"2023"},{"issue":"6","key":"10.1016\/j.patcog.2026.113624_bib0032","doi-asserted-by":"crossref","first-page":"1087","DOI":"10.1063\/1.1699114","article-title":"Equation of state calculations by fast computing machines","volume":"21","author":"Metropolis","year":"1953","journal-title":"J. Chem. Phys."},{"key":"10.1016\/j.patcog.2026.113624_bib0033","unstructured":"A. Young, et al., Yi: open foundation models by 01. ai, (2024). arXiv: 2403.04652\">arXiv preprint arXiv: 2403.04652."},{"key":"10.1016\/j.patcog.2026.113624_bib0034","unstructured":"Z. Wu, et al., Deepseek-vl2: mixture-of-experts vision-language models for advanced multimodal understanding, (2024). arXiv: 2412.10302\">arXiv preprint arXiv: 2412.10302."},{"key":"10.1016\/j.patcog.2026.113624_bib0035","unstructured":"V. Team, et al., GLM-4.5V and GLM-4.1V-thinking: towards versatile multimodal reasoning with scalable reinforcement learning, (2025). arXiv: 2507.01006\">arXiv preprint arXiv: 2507.01006."},{"key":"10.1016\/j.patcog.2026.113624_bib0036","unstructured":"S. Bai, et al., Qwen2.5-VL technical report, (2025a). arXiv: 2502.13923\">arXiv preprint arXiv: 2502.13923."},{"key":"10.1016\/j.patcog.2026.113624_bib0037","unstructured":"S. Bai, et al., Qwen3-VL technical report, (2025b). arXiv: 2511.21631\">arXiv preprint arXiv: 2511.21631."},{"key":"10.1016\/j.patcog.2026.113624_bib0038","unstructured":"OpenAI, Introducing GPT-5, https:\/\/openai.com\/index\/introducing-gpt-5\/(2025)."},{"key":"10.1016\/j.patcog.2026.113624_bib0039","unstructured":"G. Team, et al., Gemini 1.5: unlocking multimodal understanding across millions of tokens of context, (2024). arXiv: 2403.05530\">arXiv preprint arXiv: 2403.05530."},{"key":"10.1016\/j.patcog.2026.113624_bib0040","unstructured":"J. Achiam, et al., Gpt-4 technical report, (2023). arXiv: 2303.08774\">arXiv preprint arXiv: 2303.08774."},{"key":"10.1016\/j.patcog.2026.113624_bib0041","series-title":"Advances in Neural Information Processing Systems","article-title":"Journeydb: a benchmark for generative image understanding","author":"Sun","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0042","series-title":"Empirical Methods in Natural Language Processing","article-title":"Clipscore: a reference-free evaluation metric for image captioning","author":"Hessel","year":"2021"},{"key":"10.1016\/j.patcog.2026.113624_bib0043","series-title":"European Conference on Computer Vision","article-title":"Evaluating text-to-visual generation with image-to-text generation","author":"Lin","year":"2024"},{"key":"10.1016\/j.patcog.2026.113624_bib0044","unstructured":"T. Wan, et al., Wan: open and advanced large-scale video generative models, (2025). arXiv: 2503.20314\">arXiv preprint arXiv: 2503.20314."}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326005893?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326005893?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,12]],"date-time":"2026-06-12T21:09:12Z","timestamp":1781298552000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326005893"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":44,"alternative-id":["S0031320326005893"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113624","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"MM-MoralBench: A multimodal moral evaluation benchmark for large vision-language models","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.113624","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"113624"}}