{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T07:18:26Z","timestamp":1771658306302,"version":"3.50.1"},"reference-count":229,"publisher":"Zhejiang University Press","issue":"7","license":[{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,7,1]],"date-time":"2025-07-01T00:00:00Z","timestamp":1751328000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Front Inform Technol Electron Eng"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1631\/fitee.2400904","type":"journal-article","created":{"date-parts":[[2025,7,31]],"date-time":"2025-07-31T22:59:08Z","timestamp":1754002748000},"page":"1027-1065","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Image generation evaluation: a comprehensive survey of human and automatic evaluations","\u56fe\u50cf\u751f\u6210\u8bc4\u4f30:\u4eba\u7c7b\u8bc4\u4f30\u4e0e\u81ea\u52a8\u8bc4\u4f30\u7684\u5168\u9762\u7efc\u8ff0"],"prefix":"10.1631","volume":"26","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8784-7404","authenticated-orcid":false,"given":"Qi","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuanglin","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5313-2742","authenticated-orcid":false,"given":"Zejian","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lefan","family":"Hou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenye","family":"Meng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ying","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lingyun","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"635","published-online":{"date-parts":[[2025,8,1]]},"reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00031"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.01064"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/access.2024.3365043"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/s11831-019-09388-y"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2014.471"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00466"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.01834"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/s10462-023-10434-2"},{"key":"ref9","first-page":"1737","article-title":"MultiDiffusion: fusing diffusion paths for controlled image generation","volume-title":"Proc 40th Int Conf on Machine Learning","author":"Bar-Tal","year":"2023"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00460"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-020-01424-w"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3612706"},{"key":"ref13","author":"Binkowski","year":"2021","journal-title":"Demystifying MMD GANs"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00652"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2018.10.009"},{"key":"ref16","author":"Brock","year":"2019","journal-title":"Large scale GAN training for high fidelity natural image synthesis"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00673"},{"key":"ref18","first-page":"1567","article-title":"Learning imbalanced datasets with label-distribution-aware margin loss","volume-title":"Proc 33 rd Int Conf on Neural Information Processing Systems","author":"Cao","year":"2019"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/iccv.2019.00603"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2021.3137605"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73411-3_5"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/tmm.2022.3221351"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2022.09.092"},{"key":"ref24","author":"Chen","year":"2022","journal-title":"Re-Imagen: retrieval-augmented text-to-image generator"},{"key":"ref25","author":"Chen","year":"2019","journal-title":"Unpaired pose guided human image generation"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.01009"},{"key":"ref27","author":"Cheng","year":"2023","journal-title":"LayoutDiffuse: adapting foundational diffusion models for layout-to-image generation"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.00283"},{"key":"ref29","author":"Cho","year":"2024","journal-title":"Davidsonian scene graph: improving reliability in fine-grained evaluation for text-to-image generation"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.00460"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2023.3261988"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2009.5206848"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1111\/j.1547-5069.2007.00161.x"},{"key":"ref34","article-title":"CogView: mastering text-to-image generation via Transformers","volume-title":"Proc 35th Int Conf on Neural Information Processing Systems","author":"Ding","year":"2021"},{"key":"ref35","article-title":"CogView 2: faster and better text-to-image generation via hierarchical Transformers","volume-title":"Proc 36 th Int Conf on Neural Information Processing Systems","author":"Ding","year":"2022"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_34"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2021.3130539"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/jstsp.2020.2968772"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/s11063-022-10777-x"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413757"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/iccvw60793.2023.00016"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.126"},{"key":"ref43","author":"Foo","year":"2023","journal-title":"AI-generated content (AIGC) for various data modalities: a survey"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2021.07.019"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00757"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00522"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547872"},{"issue":"1","key":"ref48","first-page":"7","article-title":"Psychometrics in behavioral software engineering: a methodological introduction with guidelines","volume":"31","author":"Graziotin","year":"2021","journal-title":"ACM Trans Softw Eng Methodol"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.01241"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.00835"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.01387"},{"key":"ref52","first-page":"4745","article-title":"Generative view synthesis: from single-view semantics to novel-view images","volume-title":"Proc 34th Int Conf on Neural Information Processing Systems","author":"Habtegebrial","year":"2020"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1145\/3630106.3658927"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i2.16242"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1016\/j.jksuci.2023.03.021"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.01480"},{"key":"ref57","author":"He","year":"2023","journal-title":"Localized text-to-image generation for free via cross attention control"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.595"},{"key":"ref59","first-page":"6626","article-title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","volume-title":"Proc 31st Int Conf on Neural Information Processing Systems","author":"Heusel","year":"2017"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2020.3021209"},{"issue":"1","key":"ref61","first-page":"47","article-title":"Cascaded diffusion models for high fidelity image generation","volume":"23","author":"Ho","year":"2022","journal-title":"J Mach Learn Res"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1145\/3396237"},{"key":"ref63","first-page":"2713","article-title":"Learning hierarchical semantic image manipulation through structured representations","volume-title":"Proc 32nd Int Conf on Neural Information Processing Systems","author":"Hong","year":"2018"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413561"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.01866"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i2.16250"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v29i1.9186"},{"key":"ref68","article-title":"T2I-compBench: a comprehensive benchmark for open-world compositional text-to-image generation","volume-title":"Proc 37th Int Conf on Neural Information Processing Systems","author":"Huang","year":"2023"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00745"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58536-5_2"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/cvprw50498.2020.00329"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.15165"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.1016\/0165-1684(85)90053-2"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00889"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475404"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00133"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00176"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-main.787"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01603"},{"key":"ref80","first-page":"36652","article-title":"Pick-a-Pic: an open dataset of user preferences for text-to-image generation","volume-title":"Proc 37th Int Conf on Neural Information Processing Systems","author":"Kirstain","year":"2023"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1162\/coli_a_00516"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00662"},{"key":"ref83","volume-title":"Learning Multiple Layers of Features from Tiny Images","author":"Krizhevsky","year":"2009"},{"key":"ref84","author":"Ku","year":"2024","journal-title":"ImagenHub: standardizing the evaluation of conditional image generation models"},{"key":"ref85","first-page":"3927","article-title":"Improved precision and recall metric for assessing generative models","volume-title":"Proc 33rd Int Conf on Neural Information Processing Systems","author":"Kynk\u00e4\u00e4nniemi","year":"2019"},{"key":"ref86","author":"Kynk\u00e4\u00e4nniemi","year":"2023","journal-title":"The role of ImageNet classes in Fr\u00e9chet inception distance"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.19"},{"key":"ref88","first-page":"69981","article-title":"Holistic evaluation of text-to-image models","volume-title":"Proc 37th Int Conf on Neural Information Processing Systems","author":"Lee","year":"2023"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2018.2867951"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-25115-3_7"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.01141"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00566"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350973"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00778"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2007.383048"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.02076"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00664"},{"key":"ref98","first-page":"15885","article-title":"Few-shot image generation with elastic weight consolidation","volume-title":"Proc 34th Int Conf on Neural Information Processing Systems","author":"Li","year":"2020"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.01356"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01261-8_34"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.01835"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72673-6_20"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i4.28155"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2022.3212995"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2018.05.045"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20080"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.740"},{"key":"ref109","first-page":"698","article-title":"Are GANs created equal? A large-scale study","volume-title":"Proc 32nd Int Conf on Neural Information Processing Systems","author":"Lucic","year":"2018"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00381"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.01066"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3478870"},{"key":"ref113","first-page":"406","article-title":"Pose guided person image generation","volume-title":"Proc 31st Int Conf on Neural Information Processing Systems","author":"Ma","year":"2017"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1145\/1873951.1873965"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/tvcg.2021.3067780"},{"key":"ref116","author":"Meng","year":"2024","journal-title":"PhyBench: a physical commonsense benchmark for evaluating text-to-image models"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1007\/s42979-024-02791-8"},{"key":"ref118","article-title":"Few-shot cross-domain image generation via inference-time latent-code learning","volume-title":"11th Int Conf on Learning Representations","author":"Mondal","year":"2023"},{"key":"ref119","first-page":"7176","article-title":"Reliable fidelity and diversity metrics for generative models","volume-title":"37th Int Conf on Machine Learning","author":"Naeem","year":"2020"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-94544-6_9"},{"key":"ref121","first-page":"2642","article-title":"Conditional image synthesis with auxiliary classifier GANs","volume-title":"Int Conf on Machine Learning","author":"Odena","year":"2017"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_20"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.01060"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.01372"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/tmm.2021.3109419"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00244"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01112"},{"key":"ref128","author":"Petsiuk","year":"2022","journal-title":"Human evaluation of text-to-image models on a multi-task benchmark"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/tmm.2021.3077729"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00758"},{"key":"ref131","first-page":"885","article-title":"Learn, imagine and create: text-to-image generation from prior knowledge","volume-title":"Proc 33rd Int Conf on Neural Information Processing Systems","author":"Qiao","year":"2019a"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00160"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1007\/s00530-024-01287-y"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2022.3152624"},{"key":"ref135","author":"Ramesh","year":"2022","journal-title":"Hierarchical text-conditional image generation with CLIP latents"},{"key":"ref136","first-page":"12268","article-title":"Classification accuracy score for conditional generative models","volume-title":"Proc 33rd Int Conf on Neural Information Processing Systems","author":"Ravuri","year":"2019"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00369"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2020.3018224"},{"key":"ref139","first-page":"36479","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume-title":"Proc 36th Int Conf on Neural Information Processing Systems","author":"Saharia","year":"2022"},{"key":"ref140","first-page":"5228","article-title":"Assessing generative models via precision and recall","volume-title":"Proc 32nd Int Conf on Neural Information Processing Systems","author":"Sajjadi","year":"2018"},{"key":"ref141","first-page":"2234","article-title":"Improved techniques for training GANs","volume-title":"Proc 30th Int Conf on Neural Information Processing Systems","author":"Salimans","year":"2016"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.00669"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1145\/3528233.3530738"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2010.133"},{"key":"ref145","author":"Shen","year":"2024","journal-title":"SG-Adapter: enhancing text-to-image generation with scene graph guidance"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2017.135"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00847"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2021.108351"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1002\/ecj.11563"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00748"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00359"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2021.3078577"},{"key":"ref153","author":"Sushko","year":"2021","journal-title":"You only need adversarial supervision for semantic image synthesis"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16368"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.00787"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00252"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00789"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58595-2_43"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2022.3155989"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v35i3.16369"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00853"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2011.5995347"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1109\/cvprw.2019.00094"},{"key":"ref164","author":"Tripathi","year":"2019b","journal-title":"Using scene graph context to improve image generation"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/cvprw50498.2020.00194"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-023-01851-5"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-99-9119-8_5"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/access.2020.2982224"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.01761"},{"key":"ref170","first-page":"331","article-title":"Image inpainting via generative multi-column convolutional neural networks","volume-title":"Proc 32nd Int Conf on Neural Information Processing Systems","author":"Wang","year":"2018"},{"key":"ref171","author":"Wang","year":"2024","journal-title":"InternVid: a large-scale video-text dataset for multimodal understanding and generation"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1109\/icassp43922.2022.9746576"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1109\/acssc.2003.1292216"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2003.819861"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2020.2982166"},{"key":"ref176","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00755"},{"key":"ref177","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2023.126684"},{"key":"ref178","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20497-5_3"},{"key":"ref179","author":"Wu","year":"2023","journal-title":"AI-generated content (AIGC): a survey"},{"key":"ref180","doi-asserted-by":"publisher","DOI":"10.1109\/tmm.2022.3162474"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.00200"},{"key":"ref182","author":"Wu","year":"2023b","journal-title":"Human preference score v2: a solid benchmark for evaluating human preferences of text-to-image synthesis"},{"key":"ref183","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.01411"},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1109\/icme55011.2023.00357"},{"key":"ref185","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.07.029"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.00229"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00892"},{"key":"ref188","article-title":"Magical Brush: a symbol-based modern Chinese painting system for novices","volume-title":"Proc CHI Conf on Human Factors in Computing Systems","author":"Xu","year":"2023"},{"key":"ref189","article-title":"ImageReward: learning and evaluating human preferences for text-to-image generation","volume-title":"Proc 37th Int Conf on Neural Information Processing Systems","author":"Xu","year":"2023"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1145\/2393347.2393400"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00143"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_4"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00787"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.1145\/3626235"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01779"},{"key":"ref196","article-title":"Position: towards implicit prompt for text-to-image models","volume-title":"41st Int Conf on Machine Learning","author":"Yang","year":"2024"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1145\/2964284.2967213"},{"key":"ref198","author":"Yu","year":"2022","journal-title":"Scaling autoregressive models for content-rich text-to-image generation"},{"key":"ref199","doi-asserted-by":"publisher","DOI":"10.1109\/iccv48922.2021.01385"},{"key":"ref200","author":"Yuan","year":"2024","journal-title":"CamFreeDiff: camera-free image to panorama generation with diffusion model"},{"key":"ref201","article-title":"Perceptual image quality assessment: a survey","author":"Zhai","year":"2020","journal-title":"Sci China Inform Sci, 63(11):211301"},{"key":"ref202","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00607"},{"key":"ref203","author":"Zhang","year":"2024","journal-title":"Evaluation agent: efficient and promptable evaluation framework for visual generative models"},{"key":"ref204","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.00089"},{"key":"ref205","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00613"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1109\/tits.2021.3123070"},{"key":"ref207","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01633-5"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1109\/tcsvt.2021.3131738"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46487-9_40"},{"key":"ref210","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2018.00068"},{"key":"ref211","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52733.2024.00766"},{"key":"ref212","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2022.08.033"},{"key":"ref213","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2023\/192"},{"key":"ref214","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00878"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.02136"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2021.3060873"},{"key":"ref217","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01645-1"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00893"},{"key":"ref219","author":"Zhao","year":"2023","journal-title":"AdAM: few-shot image generation via adaptation-aware kernel modulation"},{"key":"ref220","author":"Zheng","year":"2024","journal-title":"LM4LV: a frozen large language model for low-level vision tasks"},{"key":"ref221","first-page":"1","article-title":"CogView3: finer and faster text-to-image generation via relay diffusion","volume-title":"18th European Conf on Computer Vision","author":"Zheng","year":"2024"},{"key":"ref222","author":"Zhou","year":"2024","journal-title":"SceneX: procedural controllable large-scale scene generation"},{"key":"ref223","first-page":"3449","article-title":"HYPE: a benchmark for human eye perceptual evaluation of generative models","volume-title":"Proc 33rd Int Conf on Neural Information Processing Systems","author":"Zhou","year":"2019"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00979"},{"key":"ref225","author":"Zhou","year":"2024","journal-title":"Toffee: efficient million-scale dataset construction for subject-driven text-to-image generation"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.1109\/tip.2024.3385295"},{"key":"ref227","doi-asserted-by":"publisher","DOI":"10.1016\/j.sigpro.2017.12.001"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00245"},{"key":"ref229","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr42600.2020.00551"}],"container-title":["Frontiers of Information Technology &amp; Electronic Engineering"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1631\/FITEE.2400904.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1631\/FITEE.2400904\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1631\/FITEE.2400904.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,21]],"date-time":"2026-02-21T06:59:11Z","timestamp":1771657151000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1631\/FITEE.2400904"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7]]},"references-count":229,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2025,7]]}},"alternative-id":["904"],"URL":"https:\/\/doi.org\/10.1631\/fitee.2400904","relation":{},"ISSN":["2095-9184","2095-9230"],"issn-type":[{"value":"2095-9184","type":"print"},{"value":"2095-9230","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,7]]},"assertion":[{"value":"12 October 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 January 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"1 August 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"All the authors declare that they have no conflict of interest.","order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}