{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,23]],"date-time":"2026-05-23T09:08:52Z","timestamp":1779527332006,"version":"3.53.1"},"reference-count":104,"publisher":"Springer Science and Business Media LLC","issue":"5","license":[{"start":{"date-parts":[[2026,4,17]],"date-time":"2026-04-17T00:00:00Z","timestamp":1776384000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,4,17]],"date-time":"2026-04-17T00:00:00Z","timestamp":1776384000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1007\/s11263-026-02842-y","type":"journal-article","created":{"date-parts":[[2026,4,17]],"date-time":"2026-04-17T18:03:49Z","timestamp":1776449029000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["SCoRE: Standardized Human Evaluation Provides a Reliable Measure for Semantic Consistency of Text-to-Image Generation"],"prefix":"10.1007","volume":"134","author":[{"given":"Zejian","family":"Li","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8784-7404","authenticated-orcid":false,"given":"Qi","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiaman","family":"Pan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rui","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lefan","family":"Hou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiangfei","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiarui","family":"Ma","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shengyuan","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiesi","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xuetao","family":"Tian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yun","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hao","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ling","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaoming","family":"Deng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,4,17]]},"reference":[{"issue":"4","key":"2842_CR1","doi-asserted-by":"publisher","first-page":"535","DOI":"10.1086\/268949","volume":"49","author":"DF Alwin","year":"1985","unstructured":"Alwin, D. F., & Krosnick, J. A. (1985). The measurement of values in surveys: A comparison of ratings and rankings. Public Opinion Quarterly, 49(4), 535\u2013552. https:\/\/doi.org\/10.1086\/268949","journal-title":"Public Opinion Quarterly"},{"key":"2842_CR2","doi-asserted-by":"crossref","unstructured":"Bakr, E. M., Sun, P., Shen, X., Khan, F. F., Erran\u00a0Li, L., & Elhoseiny, M. (2023). HRS-Bench: Holistic, Reliable and Scalable Benchmark for Text-to-Image Models . 2023 ieee\/cvf international conference on computer vision (iccv) (p.19984-19996).","DOI":"10.1109\/ICCV51070.2023.01834"},{"key":"2842_CR3","doi-asserted-by":"crossref","unstructured":"Betti, F., Staiano, J., Baraldi, L., Baraldi, L., Cucchiara, R., & Sebe, N. (2023). Let\u2019s vice! mimicking human cognitive behavior in image generation evaluation. Proceedings of the 31st acm international conference on multimedia (p.9306\u20139312). Association for Computing Machinery.","DOI":"10.1145\/3581783.3612706"},{"key":"2842_CR4","unstructured":"Brooke, J., and others (1996). Sus-a quick and dirty usability scale. Usability evaluation in industry (pp. 4\u20137). London, England."},{"issue":"2","key":"2842_CR5","doi-asserted-by":"publisher","first-page":"94","DOI":"10.1016\/S0031-9406(05)61211-4","volume":"86","author":"A Bruton","year":"2000","unstructured":"Bruton, A., Conway, J. H., & Holgate, S. T. (2000). Reliability: What is it, and how is it measured? Physiotherapy, 86(2), 94\u201399. https:\/\/doi.org\/10.1016\/S0031-9406(05)61211-4","journal-title":"Physiotherapy"},{"key":"2842_CR6","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., Jegou, H., Mairal, J., Bojanowski, P., & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. 2021 ieee\/cvf international conference on computer vision (iccv) (p.9630-9640).","DOI":"10.1109\/ICCV48922.2021.00951"},{"issue":"1","key":"2842_CR7","doi-asserted-by":"publisher","first-page":"25","DOI":"10.1080\/19312458.2017.1396583","volume":"12","author":"S Carpenter","year":"2018","unstructured":"Carpenter, S. (2018). Ten steps in scale development and reporting: A guide for researchers. Communication methods and measures, 12(1), 25\u201344. https:\/\/doi.org\/10.1080\/19312458.2017.1396583","journal-title":"Communication methods and measures"},{"key":"2842_CR8","unstructured":"Chahine, N., Ferradans, S., & Ponce, J. (2024). Pairwise comparisons are all you need. arXiv preprint. arXiv:2403.09746"},{"key":"2842_CR9","doi-asserted-by":"publisher","unstructured":"Chai, J., Liang, Y., Zhang, X., & Lu, Y. (2025). Understanding exercise persistence through fitness app engagement: an affordance actualization theory perspective. Aslib Journal of Information Management, 1\u201330. https:\/\/doi.org\/10.1108\/AJIM-11-2024-0928","DOI":"10.1108\/AJIM-11-2024-0928"},{"issue":"3","key":"2842_CR10","doi-asserted-by":"publisher","first-page":"1225","DOI":"10.1007\/s11482-022-10132-1","volume":"18","author":"C Chaves","year":"2023","unstructured":"Chaves, C., Ballesteros-Vald\u00e9s, R., Madridejos, E., & Charles-Leija, H. (2023). Perma-profiler for the evaluation of well-being: Adaptation and validation in a sample of university students and employees in the mexican educational context. Applied Research in Quality of Life, 18(3), 1225\u20131247.","journal-title":"Applied Research in Quality of Life"},{"issue":"4","key":"2842_CR11","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3592116","volume":"42","author":"H Chefer","year":"2023","unstructured":"Chefer, H., Alaluf, Y., Vinker, Y., Wolf, L., & Cohen-Or, D. (2023). Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models. ACM Trans. Graph., 42(4), 1\u201310. https:\/\/doi.org\/10.1145\/3592116","journal-title":"ACM Trans. Graph."},{"key":"2842_CR12","unstructured":"Cho, J., Hu, Y., Baldridge, J., Garg, R., Anderson, P., Krishna, R., & Wang, S. (2024). Davidsonian scene graph: Improving reliability in fine-grained evaluation for text-to-image generation. International conference on learning representations (iclr)."},{"issue":"2","key":"2842_CR13","doi-asserted-by":"publisher","first-page":"166.e7","DOI":"10.1016\/j.amjmed.2005.10.036","volume":"119","author":"DA Cook","year":"2006","unstructured":"Cook, D. A., & Beckman, T. J. (2006). Current concepts in validity and reliability for psychometric instruments: theory and application. The American journal of medicine, 119(2), 166.e7-166.e16.","journal-title":"The American journal of medicine"},{"key":"2842_CR14","unstructured":"Costello, A. B., & Osborne, J. (2005). Best practices in exploratory factor analysis: Four recommendations for getting the most from your analysis. Practical assessment, research, and evaluation, 10(1)."},{"key":"2842_CR15","doi-asserted-by":"publisher","DOI":"10.1016\/j.chb.2021.106910","volume":"124","author":"E Croes","year":"2021","unstructured":"Croes, E., & Bartels, J. (2021). Young adults\u2019 motivations for following social influencers and their relationship to identification and buying behavior. Computers in Human Behavior, 124, Article 106910. https:\/\/doi.org\/10.1016\/j.chb.2021.106910","journal-title":"Computers in Human Behavior"},{"key":"2842_CR16","doi-asserted-by":"publisher","first-page":"1","DOI":"10.18637\/jss.v085.b04","volume":"85","author":"H Demirtas","year":"2018","unstructured":"Demirtas, H. (2018). Flexible imputation of missing data. Journal of statistical software, 85, 1\u20135.","journal-title":"Journal of statistical software"},{"key":"2842_CR17","unstructured":"DeVellis, R. F., & Thorpe, C. T. (2021). Scale development: Theory and applications. Sage publications."},{"issue":"2","key":"2842_CR18","doi-asserted-by":"publisher","first-page":"155","DOI":"10.1111\/j.1547-5069.2007.00161.x","volume":"39","author":"HA DeVon","year":"2007","unstructured":"DeVon, H. A., Block, M. E., Moyle-Wright, P., Ernst, D. M., Hayden, S. J., Lazzara, D. J., & Kostas-Polston, E. (2007). A psychometric toolbox for testing validity and reliability. Journal of Nursing Scholarship: An Official Publication of Sigma Theta Tau International Honor Society of Nursing, 39(2), 155\u2013164. https:\/\/doi.org\/10.1111\/j.1547-5069.2007.00161.x","journal-title":"Journal of Nursing Scholarship: An Official Publication of Sigma Theta Tau International Honor Society of Nursing"},{"issue":"3","key":"2842_CR19","doi-asserted-by":"publisher","first-page":"434","DOI":"10.1007\/s11747-011-0300-3","volume":"40","author":"A Diamantopoulos","year":"2012","unstructured":"Diamantopoulos, A., Sarstedt, M., Fuchs, C., Wilczynski, P., & Kaiser, S. (2012). Guidelines for choosing between multi-item and single-item scales for construct measurement: a predictive validity perspective. Journal of the Academy of Marketing Science, 40(3), 434\u2013449.","journal-title":"Journal of the Academy of Marketing Science"},{"key":"2842_CR20","unstructured":"Ding, M., Yang, Z., Hong, W., Zheng, W., Zhou, C., Yin, D., & Tang, J. (2021). Cogview: mastering text-to-image generation via transformers. Proceedings of the 35th international conference on neural information processing systems."},{"key":"2842_CR21","unstructured":"Enders, C. K. (2022). Applied missing data analysis. Guilford Publications."},{"key":"2842_CR22","doi-asserted-by":"publisher","unstructured":"Eysenck, S. B., Barrett, P. T., & Saklofske, D. H. (2021). The junior eysenck personality questionnaire. Personality and Individual Differences,169, Article 109974. https:\/\/doi.org\/10.1016\/j.paid.2020.109974","DOI":"10.1016\/j.paid.2020.109974"},{"issue":"3","key":"2842_CR23","doi-asserted-by":"publisher","first-page":"272","DOI":"10.1037\/1082-989X.4.3.272","volume":"4","author":"LR Fabrigar","year":"1999","unstructured":"Fabrigar, L. R., Wegener, D. T., MacCallum, R. C., & Strahan, E. J. (1999). Evaluating the use of exploratory factor analysis in psychological research. Psychological methods, 4(3), 272.","journal-title":"Psychological methods"},{"issue":"15","key":"2842_CR24","doi-asserted-by":"publisher","first-page":"8692","DOI":"10.3390\/app15158692","volume":"15","author":"A Fejjari","year":"2025","unstructured":"Fejjari, A., Abela, A., Tanti, M., & Muscat, A. (2025). Evaluation of stylegan-clip models in text-to-image generation of faces. Applied Sciences, 15(15), 8692. https:\/\/doi.org\/10.3390\/app15158692","journal-title":"Applied Sciences"},{"key":"2842_CR25","doi-asserted-by":"crossref","unstructured":"Fleisig, E., Blodgett, S. L., Klein, D., & Talat, Z. (2024). The perspectivist paradigm shift: Assumptions and challenges of capturing human labels. Duh, K., Gomez, H., Bethard, S. (Eds.), Proceedings of the 2024 conference of the north american chapter of the association for computational linguistics: Human language technologies (pp. 2279\u20132292). Association for Computational Linguistics.","DOI":"10.18653\/v1\/2024.naacl-long.126"},{"key":"2842_CR26","doi-asserted-by":"publisher","first-page":"187","DOI":"10.1016\/j.neunet.2021.07.019","volume":"144","author":"S Frolov","year":"2021","unstructured":"Frolov, S., Hinz, T., Raue, F., Hees, J., & Dengel, A. (2021). Adversarial text-to-image synthesis: A review. Neural Networks, 144, 187\u2013209. https:\/\/doi.org\/10.1016\/j.neunet.2021.07.019","journal-title":"Neural Networks"},{"key":"2842_CR27","doi-asserted-by":"crossref","unstructured":"Gao, Y., Min, X., Zhu, Y., Li, J., Zhang, X-P., & Zhai, G. (2022). Image quality assessment: From mean opinion score to opinion score distribution. Proceedings of the 30th acm international conference on multimedia (p.997\u20131005).","DOI":"10.1145\/3503161.3547872"},{"key":"2842_CR28","doi-asserted-by":"publisher","first-page":"24","DOI":"10.1016\/j.ijhcs.2016.09.014","volume":"98","author":"Y Georgiou","year":"2017","unstructured":"Georgiou, Y., & Kyza, E. A. (2017). The development and validation of the ari questionnaire. Int. J. Hum.-Comput. Stud., 98, 24\u201337. https:\/\/doi.org\/10.1016\/j.ijhcs.2016.09.014","journal-title":"Int. J. Hum.-Comput. Stud."},{"issue":"1145\/2231816","key":"2842_CR29","first-page":"2231817","volume":"10","author":"Y Gingold","year":"2012","unstructured":"Gingold, Y., Shamir, A., & Cohen-Or, D. (2012). Micro perceptual human computation for visual tasks. ACM Trans. Graph. doi, 10(1145\/2231816), 2231817.","journal-title":"ACM Trans. Graph. doi"},{"issue":"3","key":"2842_CR30","doi-asserted-by":"publisher","first-page":"330","DOI":"10.1016\/j.sapharm.2012.04.004","volume":"9","author":"N Gisev","year":"2013","unstructured":"Gisev, N., Bell, J. S., & Chen, T. F. (2013). Interrater agreement and interrater reliability: Key concepts, approaches, and applications. Research in Social and Administrative Pharmacy, 9(3), 330\u2013338. https:\/\/doi.org\/10.1016\/j.sapharm.2012.04.004","journal-title":"Research in Social and Administrative Pharmacy"},{"issue":"1","key":"2842_CR31","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1080\/00273171.2012.640589","volume":"47","author":"AC Gottschall","year":"2012","unstructured":"Gottschall, A. C., West, S. G., & Enders, C. K. (2012). A comparison of item-level and scale-level multiple imputation for questionnaire batteries. Multivariate Behavioral Research, 47(1), 1\u201325. https:\/\/doi.org\/10.1080\/00273171.2012.640589","journal-title":"Multivariate Behavioral Research"},{"issue":"1","key":"2842_CR32","doi-asserted-by":"publisher","first-page":"549","DOI":"10.1146\/annurev.psych.58.110405.085530","volume":"60","author":"JW Graham","year":"2009","unstructured":"Graham, J. W. (2009). Missing data analysis: Making it work in the real world. Annual review of psychology, 60(1), 549\u2013576.","journal-title":"Annual review of psychology"},{"issue":"3","key":"2842_CR33","doi-asserted-by":"publisher","first-page":"206","DOI":"10.1007\/s11121-007-0070-9","volume":"8","author":"JW Graham","year":"2007","unstructured":"Graham, J. W., Olchowski, A. E., & Gilreath, T. D. (2007). How many imputations are really needed? some practical clarifications of multiple imputation theory. Prevention science, 8(3), 206\u2013213.","journal-title":"Prevention science"},{"issue":"1","key":"2842_CR34","doi-asserted-by":"publisher","first-page":"771","DOI":"10.1186\/s12877-025-06370-1","volume":"25","author":"M Gulbahar Eren","year":"2025","unstructured":"Gulbahar Eren, M., & Sert, H. (2025). Development and psychometric testing of symptom severity scale in older patients with cardiometabolic multimorbidity. BMC geriatrics, 25(1), 771.","journal-title":"BMC geriatrics"},{"key":"2842_CR35","doi-asserted-by":"crossref","unstructured":"Han, S., Fan, H., Fu, J., Li, L., Li, T., Cui, J., & Li, C. (2024). Evalmuse-40k: A reliable and fine-grained benchmark with comprehensive human annotations for text-to-image generation model evaluation. arXiv preprint. arXiv:2412.18150","DOI":"10.1609\/aaai.v40i6.42458"},{"issue":"3","key":"2842_CR36","doi-asserted-by":"publisher","first-page":"238","DOI":"10.1037\/1040-3590.7.3.238","volume":"7","author":"SN Haynes","year":"1995","unstructured":"Haynes, S. N., Richard, D., & Kubany, E. S. (1995). Content validity in psychological assessment: A functional approach to concepts and methods. Psychological assessment, 7(3), 238.","journal-title":"Psychological assessment"},{"key":"2842_CR37","doi-asserted-by":"crossref","unstructured":"Hessel, J., Holtzman, A., Forbes, M., Le\u00a0Bras, R., & Choi, Y. (2021). Clipscore: A reference-free evaluation metric for image captioning. Proceedings of the 2021 conference on empirical methods in natural language processing (pp. 7514\u20137528).","DOI":"10.18653\/v1\/2021.emnlp-main.595"},{"issue":"03","key":"2842_CR38","doi-asserted-by":"publisher","first-page":"1552","DOI":"10.1109\/TPAMI.2020.3021209","volume":"44","author":"T Hinz","year":"2022","unstructured":"Hinz, T., Heinrich, S., & Wermter, S. (2022). Semantic Object Accuracy for Generative Text-to-Image Synthesis. IEEE Transactions on Pattern Analysis & Machine Intelligence, 44(03), 1552\u20131565. https:\/\/doi.org\/10.1109\/TPAMI.2020.3021209","journal-title":"IEEE Transactions on Pattern Analysis & Machine Intelligence"},{"key":"2842_CR39","doi-asserted-by":"crossref","unstructured":"Hu, Y., Liu, B., Kasai, J., Wang, Y., Ostendorf, M., Krishna, R., & Smith, N. A. (2023). TIFA: Accurate and Interpretable Text-to-Image Faithfulness Evaluation with Question Answering . 2023 ieee\/cvf international conference on computer vision (iccv) (p.20349-20360).","DOI":"10.1109\/ICCV51070.2023.01866"},{"key":"2842_CR40","unstructured":"Huang, H-P., Wang, X., Bitton, Y., Taitelbaum, H., Tomar, G. S., Chang, M-W., & Yang, M-H. (2025). Kitten: A knowledge-intensive evaluation of image generation on visual entities. arXiv preprint. arXiv:2410.11824."},{"issue":"05","key":"2842_CR41","doi-asserted-by":"publisher","first-page":"3563","DOI":"10.1109\/TPAMI.2025.3531907","volume":"47","author":"K Huang","year":"2025","unstructured":"Huang, K., Duan, C., Sun, K., Xie, E., Li, Z., & Liu, X. (2025). T2I-CompBench++: An Enhanced and Comprehensive Benchmark for Compositional Text-to-Image Generation. IEEE Transactions on Pattern Analysis & Machine Intelligence, 47(05), 3563\u20133579. https:\/\/doi.org\/10.1109\/TPAMI.2025.3531907","journal-title":"IEEE Transactions on Pattern Analysis & Machine Intelligence"},{"issue":"4","key":"2842_CR42","doi-asserted-by":"publisher","first-page":"396","DOI":"10.9734\/BJAST\/2015\/14975","volume":"7","author":"A Joshi","year":"2015","unstructured":"Joshi, A., Kale, S., Chandel, S., & Pal, D. K. (2015). Likert scale: Explored and explained. British journal of applied science & technology, 7(4), 396.","journal-title":"British journal of applied science & technology"},{"issue":"1","key":"2842_CR43","doi-asserted-by":"publisher","first-page":"36","DOI":"10.4103\/jpcs.jpcs_11_17","volume":"3","author":"A Kalra","year":"2017","unstructured":"Kalra, A. (2017). Decoding the bland-altman plot: Basic review. Journal of the Practice of Cardiovascular Sciences, 3(1), 36\u201338. https:\/\/doi.org\/10.4103\/jpcs.jpcs_11_17","journal-title":"Journal of the Practice of Cardiovascular Sciences"},{"key":"2842_CR44","doi-asserted-by":"crossref","unstructured":"Khashabi, D., Stanovsky, G., Bragg, J., Lourie, N., Kasai, J., Choi, Y., & Weld, D. (2022). GENIE: Toward reproducible and standardized human evaluation for text generation. Proceedings of the 2022 conference on empirical methods in natural language processing (pp. 11444\u201311458). Association for Computational Linguistics.","DOI":"10.18653\/v1\/2022.emnlp-main.787"},{"key":"2842_CR45","doi-asserted-by":"crossref","unstructured":"Kim, T., Song, G., Lee, S., Kim, S., Seo, Y., Lee, S., & Bae, K. (2022). L-Verse: Bidirectional Generation Between Image and Text . 2022 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.16505-16515). IEEE Computer Society.","DOI":"10.1109\/CVPR52688.2022.01603"},{"key":"2842_CR46","doi-asserted-by":"publisher","first-page":"817","DOI":"10.1162\/coli_a_00516","volume":"50","author":"J-C Klie","year":"2024","unstructured":"Klie, J.-C., Eckart de Castilho, R., & Gurevych, I. (2024). Analyzing dataset annotation quality management in the wild. Computational Linguistics, 50, 817\u2013866.","journal-title":"Computational Linguistics"},{"issue":"11","key":"2842_CR47","doi-asserted-by":"publisher","first-page":"2695","DOI":"10.1007\/s00127-025-02946-9","volume":"60","author":"Y Kotera","year":"2025","unstructured":"Kotera, Y., Hara, A., Newby, C., Miyamoto, Y., Ozaki, A., Ali, Y., et al. (2025). Development and evaluation of a mental health recovery priority measure for cross-cultural research: Global inspire. Social Psychiatry and Psychiatric Epidemiology, 60(11), 2695\u20132706.","journal-title":"Social Psychiatry and Psychiatric Epidemiology"},{"key":"2842_CR48","unstructured":"Ku, M., Li, T., Zhang, K., Lu, Y., Fu, X., Zhuang, W., & Chen, W. (2024). Imagenhub: Standardizing the evaluation of conditional image generation models. The twelfth international conference on learning representations. https:\/\/openreview.net\/forum?id=OuV9ZrkQlc."},{"issue":"9","key":"2842_CR49","doi-asserted-by":"publisher","first-page":"1328","DOI":"10.1016\/j.jbusres.2011.10.026","volume":"65","author":"LW Lam","year":"2012","unstructured":"Lam, L. W. (2012). Impact of competitiveness on salespeople\u2019s commitment and performance. Journal of Business Research, 65(9), 1328\u20131334. https:\/\/doi.org\/10.1016\/j.jbusres.2011.10.026","journal-title":"Journal of Business Research"},{"key":"2842_CR50","unstructured":"Lee, T., Yasunaga, M., Meng, C., Mai, Y., Park, J. S., Gupta, A., & Liang, P. (2023). Holistic evaluation of text-to-image models. Proceedings of the 37th international conference on neural information processing systems (p.1-31)."},{"key":"2842_CR51","unstructured":"Li, Y., Zhang, R., Lu, J., & Shechtman, E. (2020). Few-shot image generation with elastic weight consolidation. arXiv preprint. arXiv:2012.02780."},{"key":"2842_CR52","doi-asserted-by":"crossref","unstructured":"Liang, Y., He, J., Li, G., Li, P., Klimovskiy, A., Carolan, N., & Navalpakkam, V. (2024). Rich human feedback for text-to-image generation. 2024 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.19401-19411).","DOI":"10.1109\/CVPR52733.2024.01835"},{"key":"2842_CR53","doi-asserted-by":"crossref","unstructured":"Lin, Z., Pathak, D., Li, B., Li, J., Xia, X., Neubig, G., & Ramanan, D. (2025). Evaluating text-to-visual generation with image-to-text generation. Computer vision \u2013 eccv 2024 (p.366-384).","DOI":"10.1007\/978-3-031-72673-6_20"},{"issue":"3","key":"2842_CR54","doi-asserted-by":"publisher","first-page":"287","DOI":"10.1080\/07350015.1988.10509663","volume":"6","author":"RJA Little","year":"1988","unstructured":"Little, R. J. A. (1988). Missing-data adjustments in large surveys. Journal of Business & Economic Statistics, 6(3), 287\u2013296. https:\/\/doi.org\/10.1080\/07350015.1988.10509663","journal-title":"Journal of Business & Economic Statistics"},{"issue":"6","key":"2842_CR55","doi-asserted-by":"publisher","first-page":"382","DOI":"10.1097\/00006199-198611000-00017","volume":"35","author":"MR Lynn","year":"1986","unstructured":"Lynn, M. R. (1986). Determination and quantification of content validity. Nursing research, 35(6), 382\u2013386. https:\/\/doi.org\/10.1097\/00006199-198611000-00017","journal-title":"Nursing research"},{"key":"2842_CR56","doi-asserted-by":"publisher","first-page":"3650","DOI":"10.1109\/TIP.2021.3064195","volume":"30","author":"J Ma","year":"2021","unstructured":"Ma, J., Wu, J., Li, L., Dong, W., Xie, X., Shi, G., & Lin, W. (2021). Blind image quality assessment with active inference. IEEE Transactions on Image Processing, 30, 3650\u20133663. https:\/\/doi.org\/10.1109\/TIP.2021.3064195","journal-title":"IEEE Transactions on Image Processing"},{"key":"2842_CR57","doi-asserted-by":"crossref","unstructured":"Ma, K., & Fang, Y. (2021). Image quality assessment in the modern age. Proceedings of the 29th acm international conference on multimedia (p.5664\u20135666). Association for Computing Machinery.","DOI":"10.1145\/3474085.3478870"},{"key":"2842_CR58","doi-asserted-by":"crossref","unstructured":"Mertens, L., Yargholi, E., de Beeck, H. O., Van\u00a0den Stock, J., & Vennekens, J. (2024). Findingemo: An image dataset for emotion recognition in the wild. A.\u00a0Globerson et\u00a0al. (Eds.), Advances in neural information processing systems (Vol.\u00a037, pp. 4956\u20134996). Curran Associates, Inc.","DOI":"10.52202\/079017-0161"},{"key":"2842_CR59","unstructured":"Morrison, M., Tang, B., Tan, G., & Pardo, B. (2022). Reproducible subjective evaluation. arXiv preprint. arXiv:2203.04444."},{"key":"2842_CR60","unstructured":"Organization, W. H. (1998). Wellbeing measures in primary health care\/the depcare project: report on a who meeting: Stockholm, sweden, 12\u201313 february 1998. World Health Organization. Regional Office for Europe. https:\/\/iris.who.int\/handle\/10665\/349766."},{"key":"2842_CR61","doi-asserted-by":"crossref","unstructured":"Otani, M., Togashi, R., Sawai, Y., Ishigami, R., Nakashima, Y., Rahtu, E., & Satoh, S. (2023). Toward Verifiable and Reproducible Human Evaluation for Text-to-Image Generation. 2023 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.14277-14286).","DOI":"10.1109\/CVPR52729.2023.01372"},{"key":"2842_CR62","doi-asserted-by":"crossref","unstructured":"Ouyang, L., Wu, J., Jiang, X., Almeida, D., Wainwright, C., Mishkin, P., & Lowe, R. (2022). Training language models to follow instructions with human feedback. Advances in neural information processing systems (pp. 27730\u201327744). Curran Associates, Inc.","DOI":"10.52202\/068431-2011"},{"key":"2842_CR63","doi-asserted-by":"crossref","unstructured":"Parmar, G., Zhang, R., & Zhu, J-Y. (2022). On Aliased Resizing and Surprising Subtleties in GAN Evaluation . 2022 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.11400-11410). IEEE Computer Society.","DOI":"10.1109\/CVPR52688.2022.01112"},{"key":"2842_CR64","doi-asserted-by":"publisher","first-page":"992","DOI":"10.1590\/S0080-62342009000500002","volume":"43","author":"L Pasquali","year":"2009","unstructured":"Pasquali, L. (2009). Psychometrics. Revista da Escola de Enfermagem da USP, 43, 992\u2013999.","journal-title":"Revista da Escola de Enfermagem da USP"},{"issue":"5","key":"2842_CR65","doi-asserted-by":"publisher","first-page":"489","DOI":"10.1002\/nur.20147","volume":"29","author":"DF Polit","year":"2006","unstructured":"Polit, D. F., & Beck, C. T. (2006). The content validity index: are you sure you know what\u2019s being reported? critique and recommendations. Research in nursing & health, 29(5), 489\u2013497. https:\/\/doi.org\/10.1002\/nur.20147","journal-title":"Research in nursing & health"},{"key":"2842_CR66","doi-asserted-by":"publisher","first-page":"1139","DOI":"10.1109\/TIP.2019.2936103","volume":"29","author":"M P\u00e9rez-Ortiz","year":"2020","unstructured":"P\u00e9rez-Ortiz, M., Mikhailiuk, A., Zerman, E., Hulusic, V., Valenzise, G., & Mantiuk, R. K. (2020). From pairwise comparisons and rating to a unified quality scale. IEEE Transactions on Image Processing, 29, 1139\u20131151. https:\/\/doi.org\/10.1109\/TIP.2019.2936103","journal-title":"IEEE Transactions on Image Processing"},{"key":"2842_CR67","doi-asserted-by":"crossref","unstructured":"Qiao, T., Zhang, J., Xu, D., & Tao, D. (2019). MirrorGAN: Learning Text-To-Image Generation by Redescription . 2019 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.1505-1514). IEEE Computer Society.","DOI":"10.1109\/CVPR.2019.00160"},{"key":"2842_CR68","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision. Proceedings of the 38th international conference on machine learning (pp. 8748\u20138763). PMLR. https:\/\/proceedings.mlr.press\/v139\/radford21a.html."},{"key":"2842_CR69","doi-asserted-by":"crossref","unstructured":"Rafailov, R., Sharma, A., Mitchell, E., Manning, C. D., Ermon, S., & Finn, C. (2023). Direct preference optimization: Your language model is secretly a reward model. Advances in neural information processing systems (pp. 53728\u201353741).","DOI":"10.52202\/075280-2338"},{"key":"2842_CR70","unstructured":"Rassin, R., Slobodkin, A., Ravfogel, S., Elazar, Y., & Goldberg, Y. (2025). Grade: Quantifying sample diversity in text-to-image models. arXiv preprint. arXiv:2410.22592"},{"key":"2842_CR71","unstructured":"Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal policy optimization algorithms. arXiv:1707.06347"},{"key":"2842_CR72","unstructured":"Shao, Z., Wang, P., Zhu, Q., Xu, R., Song, J., Bi, X., & Guo, D. (2024). Deepseekmath: Pushing the limits of mathematical reasoning in open language models. arXiv:2402.03300."},{"key":"2842_CR73","doi-asserted-by":"crossref","unstructured":"Sheynin, S., Polyak, A., Singer, U., Kirstain, Y., Zohar, A., Ashual, O., & Taigman, Y. (2024). Emu Edit: Precise Image Editing via Recognition and Generation Tasks . 2024 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.8871-8879).","DOI":"10.1109\/CVPR52733.2024.00847"},{"issue":"2","key":"2842_CR74","doi-asserted-by":"publisher","first-page":"420","DOI":"10.1037\/0033-2909.86.2.420","volume":"86","author":"PE Shrout","year":"1979","unstructured":"Shrout, P. E., & Fleiss, J. L. (1979). Intraclass correlations: uses in assessing rater reliability. Psychological bulletin, 86(2), 420.","journal-title":"Psychological bulletin"},{"key":"2842_CR75","doi-asserted-by":"publisher","first-page":"28","DOI":"10.2139\/ssrn.3205040","volume":"5","author":"H Taherdoost","year":"2016","unstructured":"Taherdoost, H. (2016). Validity and reliability of the research instrument; how to test the validation of a questionnaire\/survey in a research. International Journal of Academic Research in Management (IJARM), 5, 28\u201336. https:\/\/doi.org\/10.2139\/ssrn.3205040","journal-title":"International Journal of Academic Research in Management (IJARM)"},{"key":"2842_CR76","doi-asserted-by":"crossref","unstructured":"Teotia, R., Ross, C., Ullrich, K., Chopra, S., Romero-Soriano, A., Hall, M., & Muckley, M. (2025). Dimcim: A quantitative evaluation framework for default-mode diversity and generalization in text-to-image generative models. Proceedings of the ieee\/cvf international conference on computer vision (iccv) (p.16431-16440).","DOI":"10.1109\/ICCV51701.2025.01525"},{"key":"2842_CR77","doi-asserted-by":"publisher","unstructured":"Tong, Y., Zhang, J., Wei, S., Guo, W., Zhuang, F., Wang, D., & Xuan, R. (2025). Mindscore: quantifying human preference for text-to-image generation through multi-view lens. Science China Information Sciences,68(6), Article 160105. https:\/\/doi.org\/10.1007\/s11432-024-4401-y","DOI":"10.1007\/s11432-024-4401-y"},{"issue":"3","key":"2842_CR78","doi-asserted-by":"publisher","first-page":"167","DOI":"10.1159\/000376585","volume":"84","author":"CW Topp","year":"2015","unstructured":"Topp, C. W., \u00d8stergaard, S. D., S\u00f8ndergaard, S., & Bech, P. (2015). The who-5 well-being index: a systematic review of the literature. Psychotherapy and psychosomatics, 84(3), 167\u2013176. https:\/\/doi.org\/10.1159\/000376585","journal-title":"Psychotherapy and psychosomatics"},{"key":"2842_CR79","doi-asserted-by":"crossref","unstructured":"Torralba, A., & Efros, A. A. (2011). Unbiased look at dataset bias . 2013 ieee conference on computer vision and pattern recognition (p.1521-1528). IEEE Computer Society.","DOI":"10.1109\/CVPR.2011.5995347"},{"key":"2842_CR80","unstructured":"Tripathi, T., Wadhwa, M., Durrett, G., & Niekum, S. (2025). Pairwise or pointwise? evaluating feedback protocols for bias in llm-based evaluation. arXiv preprint. arXiv:2504.14716."},{"issue":"11","key":"2842_CR81","doi-asserted-by":"publisher","first-page":"3074","DOI":"10.1007\/s11263-023-01851-5","volume":"131","author":"J Wang","year":"2023","unstructured":"Wang, J., Chen, Z., Yuan, C., Li, B., Ma, W., & Hu, W. (2023). Hierarchical curriculum learning for no-reference image quality assessment., 131(11), 3074\u20133093. https:\/\/doi.org\/10.1007\/s11263-023-01851-5","journal-title":"Hierarchical curriculum learning for no-reference image quality assessment."},{"key":"2842_CR82","doi-asserted-by":"crossref","unstructured":"Wang, S., Saharia, C., Montgomery, C., Pont-Tuset, J., Noy, S., Pellegrini, S., & Chan, W. (2023). Imagen Editor and EditBench: Advancing and Evaluating Text-Guided Image Inpainting . 2023 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.18359-18369).","DOI":"10.1109\/CVPR52729.2023.01761"},{"key":"2842_CR83","doi-asserted-by":"crossref","unstructured":"Wu, T., Yang, G., Li, Z., Zhang, K., Liu, Z., Guibas, L., & Wetzstein, G. (2024). GPT-4V(ision) is a Human-Aligned Evaluator for Text-to-3D Generation . 2024 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.22227-22238). IEEE Computer Society.","DOI":"10.1109\/CVPR52733.2024.02098"},{"key":"2842_CR84","unstructured":"Wu, X., Hao, Y., Sun, K., Chen, Y., Zhu, F., Zhao, R., & Li, H. (2023). Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis. arXiv preprint. arXiv:2306.09341."},{"key":"2842_CR85","doi-asserted-by":"publisher","first-page":"944","DOI":"10.1038\/s41562-024-02089-y","volume":"9","author":"DU Wulff","year":"2025","unstructured":"Wulff, D. U., & Mata, R. (2025). Semantic embeddings reveal and address taxonomic incommensurability in psychological measurement. Nature Human Behaviour, 9, 944\u2013954. https:\/\/doi.org\/10.1038\/s41562-024-02089-y","journal-title":"Nature Human Behaviour"},{"key":"2842_CR86","unstructured":"Xu, J., Liu, X., Wu, Y., Tong, Y., Li, Q., Ding, M., & Dong, Y. (2023). Imagereward: learning and evaluating human preferences for text-to-image generation. Proceedings of the 37th international conference on neural information processing systems."},{"key":"2842_CR87","doi-asserted-by":"crossref","unstructured":"Xu, Q., Huang, Q., & Yao, Y. (2012). Online crowdsourcing subjective image quality assessment. Proceedings of the 20th acm international conference on multimedia (p.359\u2013368). Association for Computing Machinery.","DOI":"10.1145\/2393347.2393400"},{"key":"2842_CR88","doi-asserted-by":"crossref","unstructured":"Xu, T., Zhang, P., Huang, Q., Zhang, H., Gan, Z., Huang, X., & He, X. (2018). AttnGAN: Fine-Grained Text to Image Generation with Attentional Generative Adversarial Networks . 2018 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.1316-1324). IEEE Computer Society.","DOI":"10.1109\/CVPR.2018.00143"},{"key":"2842_CR89","doi-asserted-by":"crossref","unstructured":"Yan, K., Ji, L., Wu, C., Bao, J., Zhou, M., Duan, N., & Ma, S. (2022a). Trace controlled text-to-image generation. Computer vision \u2013 eccv 2022 (pp. 59\u201375).","DOI":"10.1007\/978-3-031-20059-5_4"},{"key":"2842_CR90","doi-asserted-by":"crossref","unstructured":"Yan, K., Ji, L., Wu, C., Bao, J., Zhou, M., Duan, N., & Ma, S. (2022b). Trace controlled text to image generation. Computer vision \u2013 eccv 2022 (Vol. 13696, pp. 59\u201375). Springer Nature Switzerland.","DOI":"10.1007\/978-3-031-20059-5_4"},{"key":"2842_CR91","doi-asserted-by":"crossref","unstructured":"Yang, J., Feng, J., & Huang, H. (2024). EmoGen: Emotional Image Content Generation with Text-to-Image Diffusion Models . 2024 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.6358-6368). IEEE Computer Society.","DOI":"10.1109\/CVPR52733.2024.00608"},{"issue":"8","key":"2842_CR92","doi-asserted-by":"publisher","first-page":"2743","DOI":"10.1007\/s11263-024-02001-1","volume":"132","author":"L Yang","year":"2024","unstructured":"Yang, L., Pang, K., Zhang, H., & Song, Y.-Z. (2024). Annotation-free human sketch quality assessment. International Journal of Computer Vision, 132(8), 2743\u20132764.","journal-title":"International Journal of Computer Vision"},{"key":"2842_CR93","doi-asserted-by":"crossref","unstructured":"Yao, Y., Hua, X-s., Shen, F., Zhang, J., & Tang, Z. (2016). A domain robust approach for image dataset construction. Proceedings of the 24th acm international conference on multimedia (p.212\u2013216). Association for Computing Machinery.","DOI":"10.1145\/2964284.2967213"},{"key":"2842_CR94","unstructured":"Yin, T., Gharbi, M., Park, T., Zhang, R., Shechtman, E., Durand, F., & Freeman, W.T. (2025). Improved distribution matching distillation for fast image synthesis. Proceedings of the 38th international conference on neural information processing systems. Red Hook, NY, USA: Curran Associates Inc."},{"key":"2842_CR95","unstructured":"Yuksekgonul, M., Bianchi, F., Kalluri, P., Jurafsky, D., Zou, J., and others (2023). When and why vision-language models behave like bags-of-words, and what to do about it? 11th international conference on learning representations, (iclr)."},{"key":"2842_CR96","doi-asserted-by":"crossref","unstructured":"Zhang, F., Tian, S., Huang, Z., Qiao, Y., & Liu, Z. (2025). Evaluation agent: Efficient and promptable evaluation framework for visual generative models. arXiv preprint. arXiv:2412.09645","DOI":"10.18653\/v1\/2025.acl-long.374"},{"key":"2842_CR97","doi-asserted-by":"crossref","unstructured":"Zhang, H., Koh, J. Y., Baldridge, J., Lee, H., & Yang, Y. (2021). Cross-Modal Contrastive Learning for Text-to-Image Generation . 2021 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.833-842).","DOI":"10.1109\/CVPR46437.2021.00089"},{"key":"2842_CR98","unstructured":"Zhang, H., & Wan, X. (2025). Re-thinking the automatic evaluation of image-text alignment in text-to-image models. arXiv preprint. arXiv:2506.08480"},{"key":"2842_CR99","doi-asserted-by":"crossref","unstructured":"Zhang, R., Isola, P., Efros, A. A., Shechtman, E., & Wang, O. (2018). The unreasonable effectiveness of deep features as a perceptual metric. 2018 ieee\/cvf conference on computer vision and pattern recognition (p.586-595).","DOI":"10.1109\/CVPR.2018.00068"},{"key":"2842_CR100","doi-asserted-by":"crossref","unstructured":"Zhang, S., Wang, B., Wu, J., Li, Y., Gao, T., Zhang, D., & Wang, Z. (2024). Learning Multi-Dimensional Human Preference for Text-to-Image Generation . 2024 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.8018-8027). IEEE Computer Society.","DOI":"10.1109\/CVPR52733.2024.00766"},{"key":"2842_CR101","unstructured":"Zhang, Y., Yu, T., Tian, H., Fu, C., Li, P., Zeng, J., & Jin, R. (2025). MM-RLHF: The next step forward in multimodal LLM alignment. Forty-second international conference on machine learning."},{"key":"2842_CR102","doi-asserted-by":"crossref","unstructured":"Zhao, K., Yuan, K., Sun, M., Li, M., & Wen, X. (2023). Quality-aware pretrained models for blind image quality assessment. 2023 ieee\/cvf conference on computer vision and pattern recognition (cvpr) (p.22302-22313). IEEE.","DOI":"10.1109\/CVPR52729.2023.02136"},{"key":"2842_CR103","unstructured":"Zhou, S., Gordon, M. L., Krishna, R., Narcomey, A., Fei-Fei, L., & Bernstein, M. S. (2019). Hype: a benchmark for human eye perceptual evaluation of generative models. Proceedings of the 33rd international conference on neural information processing systems. Curran Associates Inc."},{"key":"2842_CR104","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1016\/j.sigpro.2017.12.001","volume":"145","author":"W Zhu","year":"2018","unstructured":"Zhu, W., Zhai, G., Hu, M., Liu, J., & Yang, X. (2018). Arrow\u2019s impossibility theorem inspired subjective image quality assessment approach. Signal Processing, 145, 193\u2013201.","journal-title":"Signal Processing"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02842-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-026-02842-y","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-026-02842-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,5,23]],"date-time":"2026-05-23T08:43:37Z","timestamp":1779525817000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-026-02842-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,17]]},"references-count":104,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2026,5]]}},"alternative-id":["2842"],"URL":"https:\/\/doi.org\/10.1007\/s11263-026-02842-y","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4,17]]},"assertion":[{"value":"31 October 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 March 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 April 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"234"}}