{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T15:22:22Z","timestamp":1783610542826,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":67,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,28]],"date-time":"2024-10-28T00:00:00Z","timestamp":1730073600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-sa\/4.0\/"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,28]]},"DOI":"10.1145\/3664647.3680939","type":"proceedings-article","created":{"date-parts":[[2024,10,26]],"date-time":"2024-10-26T06:59:41Z","timestamp":1729925981000},"page":"3676-3685","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":9,"title":["T2I-Scorer: Quantitative Evaluation on Text-to-Image Generation via Fine-Tuned Large Multi-Modal Models"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8642-8101","authenticated-orcid":false,"given":"Haoning","family":"Wu","sequence":"first","affiliation":[{"name":"Nanyang Technological University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-4578-2880","authenticated-orcid":false,"given":"Xiele","family":"Wu","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-0634-1710","authenticated-orcid":false,"given":"Chunyi","family":"Li","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7247-7938","authenticated-orcid":false,"given":"Zicheng","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6137-5162","authenticated-orcid":false,"given":"Chaofeng","family":"Chen","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6377-4730","authenticated-orcid":false,"given":"Xiaohong","family":"Liu","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8165-9322","authenticated-orcid":false,"given":"Guangtao","family":"Zhai","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9866-1947","authenticated-orcid":false,"given":"Weisi","family":"Lin","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2024,10,28]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"2000. Recommendation 500-10: Methodology for the subjective assessment of the quality of television pictures. ITU-R Rec. BT.500."},{"key":"e_1_3_2_1_2_1","volume-title":"TOPIQ: A Top-down Approach from Semantics to Distortions for Image Quality Assessment. arXiv:2308.03060 [cs.CV]","author":"Chen Chaofeng","year":"2023","unstructured":"Chaofeng Chen, Jiadi Mo, Jingwen Hou, Haoning Wu, Liang Liao, Wenxiu Sun, Qiong Yan, and Weisi Lin. 2023. TOPIQ: A Top-down Approach from Semantics to Distortions for Image Quality Assessment. arXiv:2308.03060 [cs.CV]"},{"key":"e_1_3_2_1_3_1","first-page":"00426","article-title":"PixArt-\u03b1","volume":"2310","author":"Chen Junsong","year":"2023","unstructured":"Junsong Chen, Jincheng Yu, Chongjian Ge, Lewei Yao, Enze Xie, Yue Wu, Zhongdao Wang, James Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li. 2023. PixArt-\u03b1: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis. 2310.00426.","journal-title":"Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis."},{"key":"e_1_3_2_1_4_1","unstructured":"Zijian Chen Wei Sun Haoning Wu Zicheng Zhang Jun Jia Zhongpeng Ji Fengyu Sun Shangling Jui Xiongkuo Min Guangtao Zhai and Wenjun Zhang. 2024. Exploring the Naturalness of AI-Generated Images. arXiv:2312.05476 [cs.CV]"},{"key":"e_1_3_2_1_5_1","unstructured":"Jaemin Cho Yushi Hu Roopal Garg Peter Anderson Ranjay Krishna Jason Baldridge Mohit Bansal Jordi Pont-Tuset and Su Wang. 2024. Davidsonian Scene Graph: Improving Reliability in Fine-grained Evaluation for Text-to-Image Generation. arXiv:2310.18235 [cs.CV]"},{"key":"e_1_3_2_1_6_1","unstructured":"DeepFloyd. 2023. IF-I-XL-v1.0. https:\/\/www.deepfloyd.ai."},{"key":"e_1_3_2_1_7_1","volume-title":"InternLMXComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model. CoRR abs\/2401.16420","author":"Dong Xiaoyi","year":"2024","unstructured":"Xiaoyi Dong, Pan Zhang, Yuhang Zang, Yuhang Cao, Bin Wang, Linke Ouyang, Xilin Wei, Songyang Zhang, Haodong Duan, Maosong Cao, Wenwei Zhang, Yining Li, Hang Yan, Yang Gao, Xinyue Zhang,Wei Li, Jingwen Li, Kai Chen, Conghui He, Xingcheng Zhang, Yu Qiao, Dahua Lin, and Jiaqi Wang. 2024. InternLMXComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model. CoRR abs\/2401.16420 (2024)."},{"key":"e_1_3_2_1_8_1","unstructured":"dreamlike art. 2023. dreamlike-photoreal-2.0. https:\/\/dreamlike.art."},{"key":"e_1_3_2_1_9_1","unstructured":"Patrick Esser Sumith Kulal Andreas Blattmann Rahim Entezari Jonas M\u00fcller Harry Saini Yam Levi Dominik Lorenz Axel Sauer Frederic Boesel Dustin Podell Tim Dockhorn Zion English Kyle Lacey Alex Goodwin Yannik Marek and Robin Rombach. 2024. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis. arXiv:2403.03206 [cs.CV]"},{"key":"e_1_3_2_1_10_1","volume-title":"Perceptual Quality Assessment of Smartphone Photography","author":"Fang Yuming","unstructured":"Yuming Fang, Hanwei Zhu, Yan Zeng, Kede Ma, and ZhouWang. 2020. Perceptual Quality Assessment of Smartphone Photography. In IEEE CVPR. 3677--3686."},{"key":"e_1_3_2_1_11_1","unstructured":"Google. 2023. Gemini Pro. https:\/\/deepmind.google\/technologies\/gemini"},{"key":"e_1_3_2_1_12_1","unstructured":"Yatharth Gupta Vishnu V. Jaddipal Harish Prabhala Sayak Paul and Patrick Von Platen. 2024. Progressive Knowledge Distillation Of Stable Diffusion XL Using Layer Level Loss. 2401.02677."},{"key":"e_1_3_2_1_13_1","unstructured":"David Holz. 2023. Midjourney. https:\/\/www.midjourney.com."},{"key":"e_1_3_2_1_14_1","unstructured":"Zhipeng Huang Zhizheng Zhang Yiting Lu Zheng-Jun Zha Zhibo Chen and Baining Guo. 2024. VisualCritic: Making LMMs Perceive Visual Quality Like Humans. arXiv:2403.12806 [cs.CV]"},{"key":"e_1_3_2_1_15_1","volume-title":"MUSIQ: Multi-Scale Image Quality Transformer","author":"Ke Junjie","year":"2021","unstructured":"Junjie Ke, QifeiWang, Yilin Wang, Peyman Milanfar, and Feng Yang. 2021. MUSIQ: Multi-Scale Image Quality Transformer. In IEEE ICCV. 5148--5157."},{"key":"e_1_3_2_1_16_1","unstructured":"Diederik P Kingma and Max Welling. 2022. Auto-Encoding Variational Bayes. arXiv:1312.6114 [stat.ML]"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"crossref","unstructured":"Max Ku Dongfu Jiang Cong Wei Xiang Yue and Wenhu Chen. 2023. VIEScore: Towards Explainable Metrics for Conditional Image Synthesis Evaluation. arXiv:2312.14867 [cs.CV]","DOI":"10.18653\/v1\/2024.acl-long.663"},{"key":"e_1_3_2_1_18_1","unstructured":"Chunyi Li Tengchuan Kou Yixuan Gao Yuqin Cao Wei Sun Zicheng Zhang Yingjie Zhou Zhichao Zhang Weixia Zhang Haoning Wu Xiaohong Liu Xiongkuo Min and Guangtao Zhai. 2024. AIGIQA-20K: A Large Database for AI-Generated Image Quality Assessment. arXiv:2404.03407 [cs.CV]"},{"key":"e_1_3_2_1_19_1","volume-title":"AGIQA-3K: An Open Database for AIGenerated Image Quality Assessment","author":"Li Chunyi","year":"2023","unstructured":"Chunyi Li, Zicheng Zhang, Haoning Wu, Wei Sun, Xiongkuo Min, Xiaohong Liu, Guangtao Zhai, and Weisi Lin. 2023. AGIQA-3K: An Open Database for AIGenerated Image Quality Assessment. IEEE Transactions on Circuits and Systems for Video Technology (2023)."},{"key":"e_1_3_2_1_20_1","first-page":"1221","article-title":"Which Has Better Visual Quality: The Clear Blue Sky or a Blurry Animal","volume":"21","author":"Li Dingquan","year":"2019","unstructured":"Dingquan Li, Tingting Jiang, Weisi Lin, and Ming Jiang. 2019. Which Has Better Visual Quality: The Clear Blue Sky or a Blurry Animal? IEEE TMM 21, 5 (2019), 1221--1234.","journal-title":"IEEE TMM"},{"key":"e_1_3_2_1_21_1","volume-title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv preprint arXiv:2301.12597","author":"Li Junnan","year":"2023","unstructured":"Junnan Li and Others. 2023. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. arXiv preprint arXiv:2301.12597 (2023)."},{"key":"e_1_3_2_1_22_1","volume-title":"Improved Baselines with Visual Instruction Tuning. CoRR abs\/2310.03744","author":"Liu Haotian","year":"2023","unstructured":"Haotian Liu, Chunyuan Li, Yuheng Li, and Yong Jae Lee. 2023. Improved Baselines with Visual Instruction Tuning. CoRR abs\/2310.03744 (2023)."},{"key":"e_1_3_2_1_23_1","volume-title":"Visual Instruction Tuning. CoRR abs\/2304.08485","author":"Liu Haotian","year":"2023","unstructured":"Haotian Liu, Chunyuan Li, QingyangWu, and Yong Jae Lee. 2023. Visual Instruction Tuning. CoRR abs\/2304.08485 (2023)."},{"key":"e_1_3_2_1_24_1","volume-title":"MMBench: Is Your Multi-modal Model an All-around Player? CoRR abs\/2307.06281","author":"Liu Yuan","year":"2023","unstructured":"Yuan Liu, Haodong Duan, Yuanhan Zhang, Bo Li, Songyang Zhang, Wangbo Zhao, Yike Yuan, Jiaqi Wang, Conghui He, Ziwei Liu, Kai Chen, and Dahua Lin. 2023. MMBench: Is Your Multi-modal Model an All-around Player? CoRR abs\/2307.06281 (2023)."},{"key":"e_1_3_2_1_25_1","volume-title":"Xin Eric Wang, and William Yang Wang","author":"Lu Yujie","year":"2023","unstructured":"Yujie Lu, Xianjun Yang, Xiujun Li, Xin Eric Wang, and William Yang Wang. 2023. LLMScore: Unveiling the Power of Large Language Models in Text-to-Image Synthesis Evaluation. arXiv:2305.11116 [cs.CV]"},{"key":"e_1_3_2_1_26_1","unstructured":"Simian Luo Yiqin Tan Suraj Patil Daniel Gu Patrick von Platen Apolin\u00e1rio Passos Longbo Huang Jian Li and Hang Zhao. 2023. LCM-LoRA: A Universal Stable-Diffusion Acceleration Module. arXiv:2311.05556 [cs.CV]"},{"key":"e_1_3_2_1_27_1","volume-title":"Anush Krishna Moorthy, and Alan Conrad Bovik","author":"Mittal Anish","year":"2012","unstructured":"Anish Mittal, Anush Krishna Moorthy, and Alan Conrad Bovik. 2012. No-Reference Image Quality Assessment in the Spatial Domain. IEEE TIP 21, 12 (2012)."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/LSP.2012.2227726"},{"key":"e_1_3_2_1_29_1","volume-title":"WordCloud: a Cytoscape plugin to create a visual semantic summary of networks. Source code for biology and medicine 6, 1","author":"Oesper Layla","year":"2011","unstructured":"Layla Oesper, Daniele Merico, Ruth Isserlin, and Gary D Bader. 2011. WordCloud: a Cytoscape plugin to create a visual semantic summary of networks. Source code for biology and medicine 6, 1 (2011), 7."},{"key":"e_1_3_2_1_30_1","unstructured":"OpenAI. 2023. GPT-4Technical Report. arXiv:2303.08774 [cs.CL]"},{"key":"e_1_3_2_1_31_1","volume-title":"Scalable Diffusion Models with Transformers. arXiv preprint arXiv:2212.09748","author":"Peebles William","year":"2022","unstructured":"William Peebles and Saining Xie. 2022. Scalable Diffusion Models with Transformers. arXiv preprint arXiv:2212.09748 (2022)."},{"key":"e_1_3_2_1_32_1","unstructured":"PlaygroundAI. 2023. playground-v2-1024px-aesthetic. https:\/\/playground.com."},{"key":"e_1_3_2_1_33_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In ICML. 8748--8763."},{"key":"e_1_3_2_1_34_1","first-page":"1","article-title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","volume":"21","author":"Raffel Colin","year":"2020","unstructured":"Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou, Wei Li, and Peter J. Liu. 2020. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. Journal of Machine Learning Research 21, 140 (2020), 1--67. http:\/\/jmlr.org\/papers\/v21\/20-074.html","journal-title":"Journal of Machine Learning Research"},{"key":"e_1_3_2_1_35_1","unstructured":"Aditya Ramesh Prafulla Dhariwal Alex Nichol Casey Chu and Mark Chen. 2022. Hierarchical Text-Conditional Image Generation with CLIP Latents. 2204.06125."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_1_38_1","unstructured":"Robin Rombach Andreas Blattmann and Bj\u00f6rn Ommer. 2022. Text-Guided Synthesis of Artistic Images with Retrieval-Augmented Diffusion Models. 2207.13038."},{"key":"e_1_3_2_1_39_1","unstructured":"Axel Sauer Tero Karras Samuli Laine Andreas Geiger and Timo Aila. 2023. StyleGAN-T: Unlocking the Power of GANs for Fast Large-Scale Text-to-Image Synthesis. arXiv.org abs\/2301.09515. https:\/\/arxiv.org\/abs\/2301.09515"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"crossref","unstructured":"Axel Sauer Dominik Lorenz Andreas Blattmann and Robin Rombach. 2023. Adversarial diffusion distillation. arXiv:arXiv:2311.17042","DOI":"10.1007\/978-3-031-73016-0_6"},{"key":"e_1_3_2_1_41_1","volume-title":"NIMA: Neural Image Assessment","author":"Talebi Hossein","year":"2018","unstructured":"Hossein Talebi and Peyman Milanfar. 2018. NIMA: Neural Image Assessment. IEEE TIP (2018)."},{"key":"e_1_3_2_1_42_1","unstructured":"Hugo Touvron Louis Martin Kevin Stone Peter Albert Amjad Almahairi Yasmine Babaei Nikolay Bashlykov Soumya Batra Prajjwal Bhargava Shruti Bhosale Dan Bikel Lukas Blecher Cristian Canton Ferrer Moya Chen Guillem Cucurull David Esiobu Jude Fernandes Jeremy Fu Wenyin Fu Brian Fuller Cynthia Gao Vedanuj Goswami Naman Goyal Anthony Hartshorn Saghar Hosseini Rui Hou Hakan Inan Marcin Kardas Viktor Kerkez Madian Khabsa Isabel Kloumann Artem Korenev Punit Singh Koura Marie-Anne Lachaux Thibaut Lavril Jenya Lee Diana Liskovich Yinghai Lu Yuning Mao Xavier Martinet Todor Mihaylov Pushkar Mishra Igor Molybog Yixin Nie Andrew Poulton Jeremy Reizenstein Rashi Rungta Kalyan Saladi Alan Schelten Ruan Silva Eric Michael Smith Ranjan Subramanian Xiaoqing Ellen Tan Binh Tang Ross Taylor Adina Williams Jian Xiang Kuan Puxin Xu Zheng Yan Iliyan Zarov Yuchen Zhang Angela Fan Melanie Kambadur Sharan Narang Aurelien Rodriguez Robert Stojnic Sergey Edunov and Thomas Scialom. 2023. Llama 2: Open Foundation and Fine-Tuned Chat Models. CoRR abs\/2307.09288 (2023)."},{"key":"e_1_3_2_1_43_1","unstructured":"Jianyi Wang Kelvin C. K. Chan and Chen Change Loy. 2022. Exploring CLIP for Assessing the Look and Feel of Images."},{"key":"e_1_3_2_1_44_1","volume-title":"CAAI International Conference on Artificial Intelligence. Springer, 46--57","author":"Wang Jiarui","year":"2023","unstructured":"Jiarui Wang, Huiyu Duan, Jing Liu, Shi Chen, Xiongkuo Min, and Guangtao Zhai. 2023. Aigciqa2023: A large-scale image quality assessment database for ai generated images: from the perspectives of quality, authenticity and correspondence. In CAAI International Conference on Artificial Intelligence. Springer, 46--57."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"crossref","unstructured":"Haoning Wu Chaofeng Chen Jingwen Hou Liang Liao Annan Wang Wenxiu Sun Qiong Yan and Weisi Lin. 2022. FAST-VQA: Efficient End-to-end Video Quality Assessment with Fragment Sampling. In ECCV. 538--554.","DOI":"10.1007\/978-3-031-20068-7_31"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3319332"},{"key":"e_1_3_2_1_47_1","volume-title":"andWeisi Lin","author":"Wu Haoning","year":"2023","unstructured":"Haoning Wu, Erli Zhang, Liang Liao, Chaofeng Chen, Jingwen Hou, Annan Wang, Wenxiu Sun, Qiong Yan, andWeisi Lin. 2023. Exploring Video Quality Assessment on User Generated Contents from Aesthetic and Technical Perspectives. In IEEE ICCV."},{"key":"e_1_3_2_1_48_1","volume-title":"Q-bench: A benchmark for general-purpose foundation models on low-level vision. In ICLR. 1--13.","author":"Wu Haoning","year":"2023","unstructured":"Haoning Wu, Zicheng Zhang, Erli Zhang, Chaofeng Chen, Liang Liao, Annan Wang, Chunyi Li, Wenxiu Sun, Qiong Yan, Guangtao Zhai, and Weisi Lin. 2023. Q-bench: A benchmark for general-purpose foundation models on low-level vision. In ICLR. 1--13."},{"key":"e_1_3_2_1_49_1","unstructured":"Haoning Wu Zicheng Zhang Erli Zhang Chaofeng Chen Liang Liao Annan Wang Chunyi Li Wenxiu Sun Qiong Yan Guangtao Zhai and Weisi Lin. 2024. Q-Bench: A Benchmark for General-Purpose Foundation Models on Low-level Vision. In ICLR."},{"key":"e_1_3_2_1_50_1","unstructured":"Haoning Wu Zicheng Zhang Erli Zhang Chaofeng Chen Liang Liao Annan Wang Kaixin Xu Chunyi Li Jingwen Hou Guangtao Zhai et al. 2024. Q-Instruct: Improving low-level visual abilities for multi-modality foundation models. IEEE CVPR (2024) 1--16."},{"key":"e_1_3_2_1_51_1","unstructured":"Haoning Wu Zicheng Zhang Weixia Zhang Chaofeng Chen Liang Liao Chunyi Li Yixuan Gao Annan Wang Erli Zhang Wenxiu Sun et al. 2023. Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels. CoRR abs\/2312.17090 (2023)."},{"key":"e_1_3_2_1_52_1","unstructured":"Haoning Wu Hanwei Zhu Zicheng Zhang Erli Zhang Chaofeng Chen Liang Liao Chunyi Li Annan Wang Wenxiu Sun Qiong Yan Xiaohong Liu Guangtao Zhai Shiqi Wang and Weisi Lin. 2024. Towards Open-ended Visual Quality Comparison. arXiv:2402.16641 [cs.CV]"},{"key":"e_1_3_2_1_53_1","volume-title":"Jia-Wei Liu, Yuchao Gu, Rui Zhao, Weisi Lin, Wynne Hsu, Ying Shan, and Mike Zheng Shou.","author":"Wu Jay Zhangjie","year":"2024","unstructured":"Jay Zhangjie Wu, Guian Fang, Haoning Wu, Xintao Wang, Yixiao Ge, Xiaodong Cun, David Junhao Zhang, Jia-Wei Liu, Yuchao Gu, Rui Zhao, Weisi Lin, Wynne Hsu, Ying Shan, and Mike Zheng Shou. 2024. Towards A Better Metric for Text-to-Video Generation. arXiv:2401.07781 [cs.CV]"},{"key":"e_1_3_2_1_54_1","unstructured":"Tianhe Wu Kede Ma Jie Liang Yujiu Yang and Lei Zhang. 2024. A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment. arXiv:2403.10854 [cs.CV]"},{"key":"e_1_3_2_1_55_1","volume-title":"Better Aligning Text-to-Image Models with Human Preference. CoRR abs\/2303.14420","author":"Wu Xiaoshi","year":"2023","unstructured":"Xiaoshi Wu, Keqiang Sun, Feng Zhu, Rui Zhao, and Hongsheng Li. 2023. Better Aligning Text-to-Image Models with Human Preference. CoRR abs\/2303.14420 (2023)."},{"key":"e_1_3_2_1_56_1","volume-title":"ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation. CoRR abs\/2304.05977","author":"Xu Jiazheng","year":"2023","unstructured":"Jiazheng Xu, Xiao Liu, Yuchen Wu, Yuxuan Tong, Qinkai Li, Ming Ding, Jie Tang, and Yuxiao Dong. 2023. ImageReward: Learning and Evaluating Human Preferences for Text-to-Image Generation. CoRR abs\/2304.05977 (2023)."},{"key":"e_1_3_2_1_57_1","volume-title":"mPLUG-Owl2: Revolutionizing multi-modal large language model with modality collaboration. CoRR abs\/2311.04257","author":"Ye Qinghao","year":"2023","unstructured":"Qinghao Ye, Haiyang Xu, Jiabo Ye, Ming Yan, Haowei Liu, Qi Qian, Ji Zhang, Fei Huang, and Jingren Zhou. 2023. mPLUG-Owl2: Revolutionizing multi-modal large language model with modality collaboration. CoRR abs\/2311.04257 (2023)."},{"key":"e_1_3_2_1_58_1","unstructured":"Zhiyuan You Zheyuan Li Jinjin Gu Zhenfei Yin Tianfan Xue and Chao Dong. 2023. Depicting Beyond Scores: Advancing Image Quality Assessment through Multi-modal Language Models. arXiv:2312.08962 [cs.CV]"},{"key":"e_1_3_2_1_59_1","volume-title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI. CoRR abs\/2311.16502","author":"Yue Xiang","year":"2023","unstructured":"Xiang Yue, Yuansheng Ni, Kai Zhang, Tianyu Zheng, Ruoqi Liu, Ge Zhang, Samuel Stevens, Dongfu Jiang, Weiming Ren, Yuxuan Sun, et al. 2023. MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI. CoRR abs\/2311.16502 (2023)."},{"key":"e_1_3_2_1_60_1","first-page":"36","article-title":"Blind Image Quality Assessment Using a Deep Bilinear Convolutional Neural Network","volume":"30","author":"Zhang Weixia","year":"2020","unstructured":"Weixia Zhang, Kede Ma, Jia Yan, Dexiang Deng, and Zhou Wang. 2020. Blind Image Quality Assessment Using a Deep Bilinear Convolutional Neural Network. IEEE TCSVT 30, 1 (2020), 36--47.","journal-title":"IEEE TCSVT"},{"key":"e_1_3_2_1_61_1","first-page":"3474","article-title":"Uncertainty aware blind image quality assessment in the laboratory and wild","volume":"30","author":"Zhang Weixia","year":"2021","unstructured":"Weixia Zhang, Kede Ma, Guangtao Zhai, and Xiaokang Yang. 2021. Uncertainty aware blind image quality assessment in the laboratory and wild. IEEE TIP 30 (2021), 3474--3486.","journal-title":"IEEE TIP"},{"key":"e_1_3_2_1_62_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01352"},{"key":"e_1_3_2_1_63_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICMEW59549.2023.00082"},{"key":"e_1_3_2_1_64_1","doi-asserted-by":"crossref","unstructured":"Zicheng Zhang Haoning Wu Zhongpeng Ji Chunyi Li Erli Zhang Wei Sun Xiaohong Liu Xiongkuo Min Fengyu Sun Shangling Jui Weisi Lin and Guangtao Zhai. 2023. Q-Boost: On Visual Quality Assessment Ability of Low-level Multi Modality Foundation Models. arXiv:2312.15300 [cs.CV]","DOI":"10.1109\/ICMEW63481.2024.10645451"},{"key":"e_1_3_2_1_65_1","volume-title":"A Benchmark for Multi-modal Foundation Models on Low-level Vision: from Single Images to Pairs. CoRR abs\/2402.07116","author":"Zhang Zicheng","year":"2024","unstructured":"Zicheng Zhang, Haoning Wu, Erli Zhang, Guangtao Zhai, and Weisi Lin. 2024. A Benchmark for Multi-modal Foundation Models on Low-level Vision: from Single Images to Pairs. CoRR abs\/2402.07116 (2024)."},{"key":"e_1_3_2_1_66_1","unstructured":"Lianmin Zheng Wei-Lin Chiang Ying Sheng Siyuan Zhuang Zhanghao Wu Yonghao Zhuang Zi Lin Zhuohan Li Dacheng Li Eric. P Xing Hao Zhang Joseph E. Gonzalez and Ion Stoica. 2023. Judging LLM-as-a-judge with MTBench and Chatbot Arena. arXiv:2306.05685 [cs.CL]"},{"key":"e_1_3_2_1_67_1","volume-title":"2AFC Prompting of Large Multimodal Models for Image Quality Assessment. CoRR abs\/2402.01162","author":"Zhu Hanwei","year":"2024","unstructured":"Hanwei Zhu, Xiangjie Sui, Baoliang Chen, Xuelin Liu, Peilin Chen, Yuming Fang, and Shiqi Wang. 2024. 2AFC Prompting of Large Multimodal Models for Image Quality Assessment. CoRR abs\/2402.01162 (2024)."}],"event":{"name":"MM '24: The 32nd ACM International Conference on Multimedia","location":"Melbourne VIC Australia","acronym":"MM '24","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 32nd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680939","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3664647.3680939","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:17:34Z","timestamp":1750295854000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3664647.3680939"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,28]]},"references-count":67,"alternative-id":["10.1145\/3664647.3680939","10.1145\/3664647"],"URL":"https:\/\/doi.org\/10.1145\/3664647.3680939","relation":{},"subject":[],"published":{"date-parts":[[2024,10,28]]},"assertion":[{"value":"2024-10-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}