{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T08:04:19Z","timestamp":1784534659769,"version":"3.55.0"},"reference-count":93,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,8,1]],"date-time":"2026-08-01T00:00:00Z","timestamp":1785542400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62225112"],"award-info":[{"award-number":["62225112"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Journal of Visual Communication and Image Representation"],"published-print":{"date-parts":[[2026,8]]},"DOI":"10.1016\/j.jvcir.2026.104885","type":"journal-article","created":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T07:03:11Z","timestamp":1782802991000},"page":"104885","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["GOBench: Benchmarking and instruction-tuned assessment of geometric optics in multimodal LLMs"],"prefix":"10.1016","volume":"119","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-9145-3829","authenticated-orcid":false,"given":"Xiaorong","family":"Zhu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ziheng","family":"Jia","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zicheng","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangtao","family":"Zhai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.jvcir.2026.104885_b1","series-title":"A survey on multimodal large language models","author":"Yin","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b2","unstructured":"J. Li, D. Li, C. Xiong, S. Hoi, BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models, in: International Conference on Machine Learning, ICML, 2023."},{"key":"10.1016\/j.jvcir.2026.104885_b3","series-title":"Advances in Neural Information Processing Systems","article-title":"Visual instruction tuning","author":"Liu","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b4","series-title":"InternVL: Scaling up vision foundation models and aligning for multimodal interaction","author":"Chen","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b5","series-title":"Qwen2-VL: Enhancing vision-language models as versatile vision engines","author":"Wang","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104885_b6","doi-asserted-by":"crossref","unstructured":"R. Rombach, A. Blattmann, D. Lorenz, P. Esser, B. Ommer, High-Resolution Image Synthesis with Latent Diffusion Models, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2022.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"10.1016\/j.jvcir.2026.104885_b7","series-title":"Hierarchical text-conditional image generation with CLIP latents","author":"Ramesh","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104885_b8","article-title":"Improving image generation with better captions","author":"Betker","year":"2023","journal-title":"Comput. Sci."},{"key":"10.1016\/j.jvcir.2026.104885_b9","series-title":"Advances in Neural Information Processing Systems","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","author":"Saharia","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104885_b10","doi-asserted-by":"crossref","unstructured":"L. Zhang, A. Rao, M. Agrawala, Adding Conditional Control to Text-to-Image Diffusion Models, in: IEEE\/CVF International Conference on Computer Vision, ICCV, 2023.","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"10.1016\/j.jvcir.2026.104885_b11","doi-asserted-by":"crossref","unstructured":"C. Mou, X. Wang, L. Xie, et al., T2I-Adapter: Learning Adapters to Dig Out More Controllable Ability for Text-to-Image Diffusion Models, in: AAAI Conference on Artificial Intelligence, 2024.","DOI":"10.1609\/aaai.v38i5.28226"},{"key":"10.1016\/j.jvcir.2026.104885_b12","series-title":"Empirical Methods in Natural Language Processing","article-title":"Evaluating object hallucination in large vision-language models","author":"Li","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b13","unstructured":"F. Liu, K. Lin, et al., HallusionBench: An Image-Context Reasoning Benchmark Challenging Zero-Shot LLMs, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2024."},{"key":"10.1016\/j.jvcir.2026.104885_b14","series-title":"Empirical Methods in Natural Language Processing","article-title":"Object hallucination in image captioning","author":"Rohrbach","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104885_b15","series-title":"Hallucination is inevitable: An innate limitation of large language models","author":"Xu","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104885_b16","series-title":"Advances in Neural Information Processing Systems","article-title":"TIFA: Accurate and interpretable text-to-image faithfulness evaluation with question answering","author":"Hu","year":"2023"},{"issue":"4","key":"10.1016\/j.jvcir.2026.104885_b17","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/2629646","article-title":"Shadows do not Lie: Physical consistency for shadow-based image forensics","volume":"33","author":"Kee","year":"2014","journal-title":"ACM Trans. Graph."},{"key":"10.1016\/j.jvcir.2026.104885_b18","unstructured":"T. Li, et al., PHYB: A Benchmark for Evaluating Physical Reasoning in Text-to-Image Diffusion Models, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, CVPRW, 2024."},{"key":"10.1016\/j.jvcir.2026.104885_b19","doi-asserted-by":"crossref","unstructured":"P. Bergmann, M. Fauser, D. Sattlegger, C. Steger, MVTec AD\u2013A Comprehensive Real-World Dataset for Unsupervised Anomaly Detection, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2019.","DOI":"10.1109\/CVPR.2019.00982"},{"key":"10.1016\/j.jvcir.2026.104885_b20","series-title":"Physically Based Rendering: From Theory to Implementation","author":"Pharr","year":"2016"},{"key":"10.1016\/j.jvcir.2026.104885_b21","series-title":"Advances in Neural Information Processing Systems","article-title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","author":"Heusel","year":"2017"},{"key":"10.1016\/j.jvcir.2026.104885_b22","series-title":"Advances in Neural Information Processing Systems","article-title":"Improved techniques for training GANs","author":"Salimans","year":"2016"},{"issue":"12","key":"10.1016\/j.jvcir.2026.104885_b23","doi-asserted-by":"crossref","first-page":"4695","DOI":"10.1109\/TIP.2012.2214050","article-title":"No-reference image quality assessment in the spatial domain","volume":"21","author":"Mittal","year":"2012","journal-title":"IEEE Trans. Image Process."},{"issue":"3","key":"10.1016\/j.jvcir.2026.104885_b24","doi-asserted-by":"crossref","first-page":"209","DOI":"10.1109\/LSP.2012.2227726","article-title":"Making a \u201ccompletely blind\u201d image quality analyzer","volume":"20","author":"Mittal","year":"2013","journal-title":"IEEE Signal Process. Lett."},{"key":"10.1016\/j.jvcir.2026.104885_b25","first-page":"2374","article-title":"HyperIQA: HyperNet for blind image quality assessment","volume":"30","author":"Su","year":"2021","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.jvcir.2026.104885_b26","doi-asserted-by":"crossref","unstructured":"X. Yang, K. Ma, X. Zhang, MANIQA: Multi-Dimension Attention Network for No-Reference Image Quality Assessment, in: IEEE Conference on Computer Vision and Pattern Recognition Workshops, CVPRW, 2022.","DOI":"10.1109\/CVPRW56347.2022.00126"},{"key":"10.1016\/j.jvcir.2026.104885_b27","doi-asserted-by":"crossref","unstructured":"J. Ke, Q. Wang, Y. Wang, et al., MUSIQ: Multi-scale Image Quality Transformer, in: IEEE Conference on Computer Vision and Pattern Recognition, CVPR, 2021, pp. 5148\u20135157.","DOI":"10.1109\/ICCV48922.2021.00510"},{"key":"10.1016\/j.jvcir.2026.104885_b28","unstructured":"P.C. Madhusudana, S. Nallapati, A.C. Bovik, Contrique: Contrastive Learning for Image Quality Evaluation, in: IEEE Conference on Computer Vision and Pattern Recognition, CVPR, 2022, pp. 10373\u201310382."},{"key":"10.1016\/j.jvcir.2026.104885_b29","unstructured":"Y. Chen, X. Jin, K. Ma, TopIQ: Top-down Distortion Decomposition for Learned Image Quality Assessment, in: IEEE International Conference on Computer Vision, ICCV, 2023."},{"key":"10.1016\/j.jvcir.2026.104885_b30","article-title":"MINT-IQA: Quality assessment for AI generated images with instruction tuning","author":"Wang","year":"2025","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.jvcir.2026.104885_b31","series-title":"Q-align: Teaching multimodal LLMs for open-ended medical image question answering","author":"Chen","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b32","unstructured":"Z. Xu, et al., CrossScore: Towards Multi-View Image Evaluation and Scoring, in: European Conference on Computer Vision, ECCV, 2024."},{"key":"10.1016\/j.jvcir.2026.104885_b33","doi-asserted-by":"crossref","unstructured":"J. Yang, et al., MoE-AGIQA: Mixture-of-Experts Boosted Visual Perception-Driven and Semantic-Aware Quality Assessment for AI-Generated Images, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, CVPRW, 2024.","DOI":"10.1109\/CVPRW63382.2024.00641"},{"key":"10.1016\/j.jvcir.2026.104885_b34","doi-asserted-by":"crossref","unstructured":"P. Wang, W. Sun, Z. Zhang, J. Jia, Y. Jiang, Z. Zhang, X. Min, G. Zhai, Large Multi-modality Model Assisted AI-Generated Image Quality Assessment, in: Proceedings of the 32nd ACM International Conference on Multimedia, 2024, pp. 7803\u20137812.","DOI":"10.1145\/3664647.3681471"},{"key":"10.1016\/j.jvcir.2026.104885_b35","doi-asserted-by":"crossref","unstructured":"L. Qu, J. Tian, S. He, Y. Tang, R.W. Lau, DeshadowNet: A Multi-Context Embedding Deep Network for Shadow Removal, in: IEEE Conference on Computer Vision and Pattern Recognition, CVPR, 2017.","DOI":"10.1109\/CVPR.2017.248"},{"key":"10.1016\/j.jvcir.2026.104885_b36","doi-asserted-by":"crossref","unstructured":"X. Hu, C.-W. Fu, L. Zhu, J. Qin, P.-A. Heng, Direction-Aware Spatial Context Features for Shadow Detection, in: IEEE Conference on Computer Vision and Pattern Recognition, CVPR, 2018.","DOI":"10.1109\/CVPR.2018.00778"},{"key":"10.1016\/j.jvcir.2026.104885_b37","article-title":"CoRRN: Cooperative reflection removal network","author":"Wan","year":"2019","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell. (TPAMI)"},{"key":"10.1016\/j.jvcir.2026.104885_b38","unstructured":"Q. Fan, Z. Yang, G. Hua, B. Chen, D. Wipf, PIR2: Physics-Informed Reflection Removal, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2022."},{"key":"10.1016\/j.jvcir.2026.104885_b39","doi-asserted-by":"crossref","unstructured":"E. Xie, W.J. Hildreth, W. Zhang, P. Luo, Segmenting Transparent Objects in the Wild, in: European Conference on Computer Vision, ECCV, 2020.","DOI":"10.1007\/978-3-030-58601-0_41"},{"key":"10.1016\/j.jvcir.2026.104885_b40","unstructured":"E. Xie, W. Wang, W. Wang, et al., Trans2Seg: Transformer for Transparent Object Segmentation, in: International Joint Conference on Artificial Intelligence, IJCAI, 2021."},{"key":"10.1016\/j.jvcir.2026.104885_b41","article-title":"Envisioning beyond the pixels: Benchmarking reasoning-informed visual editing","volume":"38","author":"Zhao","year":"2025","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"10","key":"10.1016\/j.jvcir.2026.104885_b42","first-page":"3758","article-title":"IL-NIQE: A natural scene statistics approach to blind image quality assessment","volume":"24","author":"Zhang","year":"2015","journal-title":"IEEE Trans. Image Process."},{"issue":"2","key":"10.1016\/j.jvcir.2026.104885_b43","first-page":"145","article-title":"DIIVINE\u2014A diversified image quality index","volume":"17","author":"Moorthy","year":"2010","journal-title":"IEEE Signal Process. Lett."},{"issue":"8","key":"10.1016\/j.jvcir.2026.104885_b44","first-page":"833","article-title":"BLIINDS-II: Learning blind image quality assessment codebooks for spatial and frequency domains","volume":"27","author":"Saad","year":"2012","journal-title":"Signal Process., Image Commun."},{"issue":"8","key":"10.1016\/j.jvcir.2026.104885_b45","doi-asserted-by":"crossref","first-page":"3339","DOI":"10.1109\/TIP.2012.2191563","article-title":"Blind image quality assessment: A natural scene statistics approach in the DCT domain","volume":"21","author":"Saad","year":"2012","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.jvcir.2026.104885_b46","doi-asserted-by":"crossref","unstructured":"L. Kang, P. Ye, Y. Li, D. Doermann, Blind Image Quality Assessment Using Convolutional Neural Networks, in: IEEE Conference on Computer Vision and Pattern Recognition, CVPR, 2014, pp. 1733\u20131740.","DOI":"10.1109\/CVPR.2014.224"},{"key":"10.1016\/j.jvcir.2026.104885_b47","unstructured":"W. Zhang, K. Ma, X. Zhang, W. Gao, Z. Wang, Blind Image Quality Assessment Using a Deep Bilinear Convolutional Neural Network, in: IEEE Conference on Computer Vision and Pattern Recognition, CVPR, 2018, pp. 2889\u20132898."},{"key":"10.1016\/j.jvcir.2026.104885_b48","unstructured":"X. Ying, et al., PaQ-2-PiQ: Perceptual Image Quality Assessment by Pairwise Quality Prediction, in: IEEE Conference on Computer Vision and Pattern Recognition Workshops, CVPRW, 2020."},{"key":"10.1016\/j.jvcir.2026.104885_b49","first-page":"3713","article-title":"MetaIQA: Deep meta-learning for no-reference image quality assessment","volume":"29","author":"Zhu","year":"2020","journal-title":"IEEE Trans. Image Process."},{"issue":"8","key":"10.1016\/j.jvcir.2026.104885_b50","first-page":"2469","article-title":"Blind image quality assessment via deep feature learning","volume":"24","author":"Kang","year":"2015","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.jvcir.2026.104885_b51","series-title":"Image quality assessment: Investigating causal perceptual effects with abductive counterfactual inference","author":"Shen","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104885_b52","doi-asserted-by":"crossref","first-page":"3242","DOI":"10.1007\/s11263-024-02338-7","article-title":"Blind image quality assessment: Exploring content fidelity perceptibility via quality adversarial learning","volume":"133","author":"Zhou","year":"2025","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.jvcir.2026.104885_b53","doi-asserted-by":"crossref","DOI":"10.1109\/TBC.2025.3609055","article-title":"Image quality assessment: Exploring the similarity of deep features via covariance-constrained spectra","author":"Lang","year":"2026","journal-title":"IEEE Trans. Broadcast."},{"key":"10.1016\/j.jvcir.2026.104885_b54","unstructured":"K. Simonyan, A. Zisserman, Very Deep Convolutional Networks for Large-Scale Image Recognition, in: International Conference on Learning Representations, ICLR, 2015."},{"key":"10.1016\/j.jvcir.2026.104885_b55","doi-asserted-by":"crossref","unstructured":"K. He, X. Zhang, S. Ren, J. Sun, Deep Residual Learning for Image Recognition, in: IEEE Conference on Computer Vision and Pattern Recognition, CVPR, 2016.","DOI":"10.1109\/CVPR.2016.90"},{"key":"10.1016\/j.jvcir.2026.104885_b56","unstructured":"A. Dosovitskiy, et al., An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale, in: International Conference on Learning Representations, ICLR, 2021."},{"key":"10.1016\/j.jvcir.2026.104885_b57","unstructured":"I. Loshchilov, F. Hutter, Decoupled Weight Decay Regularization, in: International Conference on Learning Representations, ICLR, 2019."},{"key":"10.1016\/j.jvcir.2026.104885_b58","unstructured":"I. Loshchilov, F. Hutter, SGDR: Stochastic Gradient Descent with Warm Restarts, in: International Conference on Learning Representations, ICLR, 2017."},{"key":"10.1016\/j.jvcir.2026.104885_b59","series-title":"The LIVE image quality assessment database release 2","author":"Sheikh","year":"2005"},{"key":"10.1016\/j.jvcir.2026.104885_b60","unstructured":"E.C. Larson, D.M. Chandler, CSIQ: A Database for Image Quality Assessment, in: Proc. IEEE International Conference on Image Processing, ICIP, 2010."},{"issue":"6","key":"10.1016\/j.jvcir.2026.104885_b61","first-page":"2758","article-title":"TID2013: A database for image quality assessment","volume":"23","author":"Ponomarenko","year":"2014","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.jvcir.2026.104885_b62","doi-asserted-by":"crossref","first-page":"4041","DOI":"10.1109\/TIP.2020.2967829","article-title":"KonIQ-10k: An ecologically valid database for deep learning of blind image quality assessment","volume":"29","author":"Hosu","year":"2020","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.jvcir.2026.104885_b63","article-title":"A perceptual quality assessment exploration for AI-generated images","author":"Wang","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"issue":"10","key":"10.1016\/j.jvcir.2026.104885_b64","first-page":"9995","article-title":"AGIQA-3K: An open database for AI-generated image quality assessment","volume":"34","author":"Li","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.jvcir.2026.104885_b65","doi-asserted-by":"crossref","unstructured":"C. Li, T. Kou, Y. Gao, et al., AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops, CVPRW, 2024.","DOI":"10.1109\/CVPRW63382.2024.00636"},{"key":"10.1016\/j.jvcir.2026.104885_b66","series-title":"PKU-AIGIQA-4K: A perceptual quality assessment database for both text-to-image and image-to-image AI-generated images","author":"Yuan","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104885_b67","doi-asserted-by":"crossref","unstructured":"B. Hu, N. Li, L. He, W. Lu, L. Li, X. Gao, AGIAA-2K: A Fine-grained Dataset for Aesthetic and Alignment Evaluation of AI-Generated Images, in: IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP, 2025.","DOI":"10.1109\/ICASSP49660.2025.10890774"},{"key":"10.1016\/j.jvcir.2026.104885_b68","doi-asserted-by":"crossref","unstructured":"J. Xia, L. He, B. Hu, B. Han, X. Gao, A Two-Stage AIGC Image Quality Assessment with T2I Correspondence and Visual Perception, in: IEEE International Conference on Acoustics, Speech and Signal Processing, ICASSP, 2025.","DOI":"10.1109\/ICASSP49660.2025.10889554"},{"key":"10.1016\/j.jvcir.2026.104885_b69","doi-asserted-by":"crossref","unstructured":"J. Wang, K.C.K. Chan, C.C. Loy, Exploring CLIP for Assessing the Look and Feel of Images, in: AAAI Conference on Artificial Intelligence, 2023.","DOI":"10.1609\/aaai.v37i2.25353"},{"key":"10.1016\/j.jvcir.2026.104885_b70","series-title":"Empirical Methods in Natural Language Processing","article-title":"CLIPScore: A reference-free evaluation metric for image captioning","author":"Hessel","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104885_b71","unstructured":"A. Radford, J.W. Kim, C. Hallacy, et al., Learning Transferable Visual Models From Natural Language Supervision, in: International Conference on Machine Learning, ICML, 2021."},{"key":"10.1016\/j.jvcir.2026.104885_b72","series-title":"Advances in Neural Information Processing Systems","article-title":"ImageReward: Learning and evaluating human preferences for text-to-image generation","author":"Xu","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b73","series-title":"Advances in Neural Information Processing Systems","article-title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","author":"Kirstain","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b74","series-title":"HP-V2: a benchmark for evaluating human preference alignment of text-to-image models","author":"Wu","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b75","doi-asserted-by":"crossref","unstructured":"K. Liang, et al., RichHF-18K: Rich Human Feedback for Text-to-Image Generation, in: IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2024.","DOI":"10.1109\/CVPR52733.2024.01835"},{"key":"10.1016\/j.jvcir.2026.104885_b76","series-title":"StairReward: A staircase preference model for text-to-image generation","author":"Li","year":"2024"},{"key":"10.1016\/j.jvcir.2026.104885_b77","unstructured":"Z. Kou, Y. Li, X. Wang, et al., MPS: A Multi-Dimensional Preference Score for Text-to-Image Generation, in: ACM International Conference on Multimedia, ACM MM, 2023."},{"key":"10.1016\/j.jvcir.2026.104885_b78","series-title":"Advances in Neural Information Processing Systems","article-title":"T2I-CompBench: Benchmarking text-to-image generation with compositional attributes","author":"Xu","year":"2023"},{"key":"10.1016\/j.jvcir.2026.104885_b79","doi-asserted-by":"crossref","unstructured":"J. Wang, H. Duan, J. Wang, Z. Jia, W.Y. Yang, X. Zhu, Y. Zhao, J. Qian, Y. Xing, G. Zhai, X. Min, DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models, in: Proceedings of the 33rd ACM International Conference on Multimedia, 2025, pp. 12666\u201312673.","DOI":"10.1145\/3746027.3758204"},{"key":"10.1016\/j.jvcir.2026.104885_b80","doi-asserted-by":"crossref","unstructured":"Y. Cheng, H. Wang, P. Xiao, Y. Ding, E. Liu, C.W. Zhou, et al., VQualA 2025 Challenge on GenAI-Bench AIGC Video Quality Assessment: Methods and Results, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision Workshops, 2025, pp. 3517\u20133526.","DOI":"10.1109\/ICCVW69036.2025.00799"},{"key":"10.1016\/j.jvcir.2026.104885_b81","series-title":"Large language models are state-of-the-art evaluators of text quality","author":"Kocmi","year":"2021"},{"key":"10.1016\/j.jvcir.2026.104885_b82","series-title":"Large multimodal models evaluation: A survey","author":"Zhang","year":"2025"},{"key":"10.1016\/j.jvcir.2026.104885_b83","series-title":"G-EVAL: NLG evaluation using GPT-4 with better human alignment","author":"Liu","year":"2023"},{"issue":"12","key":"10.1016\/j.jvcir.2026.104885_b84","doi-asserted-by":"crossref","first-page":"221301","DOI":"10.1007\/s11432-025-4676-4","article-title":"Large multimodal models evaluation: A survey","volume":"68","author":"Zhang","year":"2025","journal-title":"Sci. China Inf. Sci."},{"key":"10.1016\/j.jvcir.2026.104885_b85","article-title":"AIBench: Towards trustworthy evaluation under the 45\u2218 law","author":"Zhang","year":"2025","journal-title":"Displays"},{"key":"10.1016\/j.jvcir.2026.104885_b86","series-title":"Advances in Neural Information Processing Systems","article-title":"Deep reinforcement learning from human preferences","author":"Christiano","year":"2017"},{"key":"10.1016\/j.jvcir.2026.104885_b87","series-title":"Advances in Neural Information Processing Systems","article-title":"Direct preference optimization: Your language model is secretly a reward model","author":"Rafailov","year":"2023"},{"issue":"2","key":"10.1016\/j.jvcir.2026.104885_b88","doi-asserted-by":"crossref","first-page":"420","DOI":"10.1037\/0033-2909.86.2.420","article-title":"Reliability of measurements in the design and analysis of clinical experiments","volume":"86","author":"Shrout","year":"1979","journal-title":"Psychol. Bull."},{"key":"10.1016\/j.jvcir.2026.104885_b89","series-title":"Content Analysis: An Introduction to Its Methodology","author":"Krippendorff","year":"2018"},{"key":"10.1016\/j.jvcir.2026.104885_b90","series-title":"Advances in Neural Information Processing Systems","article-title":"Chain-of-thought prompting elicits reasoning in large language models","author":"Wei","year":"2022"},{"key":"10.1016\/j.jvcir.2026.104885_b91","unstructured":"J. Wei, M. Bosma, V. Zhao, et al., Finetuned Language Models are Zero-Shot Learners, in: International Conference on Learning Representations, ICLR, 2022."},{"key":"10.1016\/j.jvcir.2026.104885_b92","unstructured":"J. Ye, et al., FLASK: Fine-Grained Language Model Evaluation based on Alignment Skill Sets, in: International Conference on Learning Representations, ICLR, 2024."},{"key":"10.1016\/j.jvcir.2026.104885_b93","doi-asserted-by":"crossref","unstructured":"Q. Ye, H. Xu, J. Ye, M. Yan, A. Hu, H. Liu, Q. Qian, J. Zhang, F. Huang, J. Zhou, mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, CVPR, 2024.","DOI":"10.1109\/CVPR52733.2024.01239"}],"container-title":["Journal of Visual Communication and Image Representation"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S104732032600180X?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S104732032600180X?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T07:23:22Z","timestamp":1784532202000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S104732032600180X"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,8]]},"references-count":93,"alternative-id":["S104732032600180X"],"URL":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104885","relation":{},"ISSN":["1047-3203"],"issn-type":[{"value":"1047-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,8]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"GOBench: Benchmarking and instruction-tuned assessment of geometric optics in multimodal LLMs","name":"articletitle","label":"Article Title"},{"value":"Journal of Visual Communication and Image Representation","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.jvcir.2026.104885","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Inc. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104885"}}