{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T14:50:41Z","timestamp":1784904641337,"version":"3.55.0"},"reference-count":175,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"DOI":"10.13039\/501100001459","name":"Ministry of Education - Singapore","doi-asserted-by":"publisher","award":["MOET2EP20221-0012"],"award-info":[{"award-number":["MOET2EP20221-0012"]}],"id":[{"id":"10.13039\/501100001459","id-type":"DOI","asserted-by":"publisher"}]},{"name":"NTU NAP","award":["RIE2020"],"award-info":[{"award-number":["RIE2020"]}]},{"name":"Industry Alignment Fund - Industry Collaboration Projects (IAF-ICP) Funding Initiative"},{"name":"industry partne"},{"name":"National Key R&#x0026;D Program of China","award":["2022ZD0160201"],"award-info":[{"award-number":["2022ZD0160201"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62076119"],"award-info":[{"award-number":["62076119"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61921006"],"award-info":[{"award-number":["61921006"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62102150"],"award-info":[{"award-number":["62102150"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003399","name":"Science and Technology Commission of Shanghai Municipality","doi-asserted-by":"publisher","award":["23YF1461900"],"award-info":[{"award-number":["23YF1461900"]}],"id":[{"id":"10.13039\/501100003399","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003399","name":"Science and Technology Commission of Shanghai Municipality","doi-asserted-by":"publisher","award":["23QD1400800"],"award-info":[{"award-number":["23QD1400800"]}],"id":[{"id":"10.13039\/501100003399","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Shanghai Artificial lntelligence Laboratory"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1109\/tpami.2025.3633890","type":"journal-article","created":{"date-parts":[[2025,11,17]],"date-time":"2025-11-17T18:41:04Z","timestamp":1763404864000},"page":"3268-3285","source":"Crossref","is-referenced-by-count":4,"title":["VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models"],"prefix":"10.1109","volume":"48","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8008-5873","authenticated-orcid":false,"given":"Ziqi","family":"Huang","sequence":"first","affiliation":[{"name":"S-Lab, Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-8938-795X","authenticated-orcid":false,"given":"Fan","family":"Zhang","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaojie","family":"Xu","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yinan","family":"He","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3094-6687","authenticated-orcid":false,"given":"Jiashuo","family":"Yu","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-9816-6743","authenticated-orcid":false,"given":"Ziyue","family":"Dong","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-8349-0345","authenticated-orcid":false,"given":"Qianli","family":"Ma","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Nattapol","family":"Chanpaisit","sequence":"additional","affiliation":[{"name":"S-Lab, Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3354-1968","authenticated-orcid":false,"given":"Chenyang","family":"Si","sequence":"additional","affiliation":[{"name":"S-Lab, Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7653-4015","authenticated-orcid":false,"given":"Yuming","family":"Jiang","sequence":"additional","affiliation":[{"name":"S-Lab, Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-9487-6187","authenticated-orcid":false,"given":"Yaohui","family":"Wang","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5517-7255","authenticated-orcid":false,"given":"Xinyuan","family":"Chen","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9565-8205","authenticated-orcid":false,"given":"Ying-Cong","family":"Chen","sequence":"additional","affiliation":[{"name":"Hong Kong University of Science and Technology (Guangzhou), Guangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3674-7718","authenticated-orcid":false,"given":"Limin","family":"Wang","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8865-7896","authenticated-orcid":false,"given":"Dahua","family":"Lin","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1889-2567","authenticated-orcid":false,"given":"Yu","family":"Qiao","sequence":"additional","affiliation":[{"name":"Shanghai Artificial Intelligence Laboratory, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4220-5958","authenticated-orcid":false,"given":"Ziwei","family":"Liu","sequence":"additional","affiliation":[{"name":"S-Lab, Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","article-title":"Auto-encoding variational bayes","author":"Kingma","year":"2013"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.5555\/2969033.2969125"},{"key":"ref3","article-title":"Conditional generative adversarial nets","author":"Mirza","year":"2014"},{"key":"ref4","article-title":"Large scale GAN training for high fidelity natural image synthesis","author":"Brock","year":"2018"},{"key":"ref5","article-title":"Progressive growing of GANs for improved quality, stability, and variation","author":"Karras","year":"2017"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2106.12423"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01354"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_1"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00671"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3347299"},{"key":"ref13","first-page":"6309","article-title":"Neural discrete representation learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Van Den"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01268"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3528223.3530104"},{"key":"ref16","first-page":"574","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ho"},{"key":"ref17","first-page":"2256","article-title":"Deep unsupervised learning using nonequilibrium thermodynamics","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Sohl-Dickstein"},{"key":"ref18","article-title":"Score-based generative modeling through stochastic differential equations","author":"Song","year":"2020"},{"key":"ref19","article-title":"CogVideo: Large-scale pretraining for text-to-video generation via transformers","author":"Hong","year":"2022"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00984"},{"key":"ref21","article-title":"Make-a-video: Text-to-video generation without text-video data","author":"Singer","year":"2022"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.00701"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02161"},{"key":"ref24","article-title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths","author":"He","year":"2022"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-024-02271-9"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-024-02295-1"},{"key":"ref27","article-title":"Modelscope text-to-video technical report","author":"Wang","year":"2023"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01008"},{"key":"ref29","article-title":"Language model beats diffusion\u2013tokenizer is key to visual generation","author":"Yu","year":"2023"},{"key":"ref30","article-title":"VideoPoet: A large language model for zero-shot video generation","author":"Kondratyuk","year":"2023"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72986-7_23"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1145\/3680528.3687614"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00672"},{"key":"ref34","article-title":"Magicvideo-V2: Multi-stage high-aesthetic video generation","author":"Wang","year":"2024"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73033-7_12"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00698"},{"key":"ref37","article-title":"Phenaki: Variable length video generation from open domain textual descriptions","author":"Villegas","year":"2022"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19790-1_7"},{"key":"ref39","article-title":"Improved techniques for training GANs","volume-title":"Proc. Adv. Neural Inf. Process Syst.","volume":"29","author":"Salimans","year":"2016"},{"key":"ref40","article-title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"30","author":"Heusel","year":"2017"},{"key":"ref41","article-title":"Towards accurate generative models of video: A new metric & challenges","author":"Unterthiner","year":"2018"},{"key":"ref42","article-title":"FVD: A new metric for video generation","author":"Unterthiner","year":"2019"},{"key":"ref43","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford"},{"key":"ref44","first-page":"16890","article-title":"Cogview2: Faster and better text-to-image generation via hierarchical transformers","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ding"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01372"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2023.3319332"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20068-7_31"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01843"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3611737"},{"key":"ref50","article-title":"Towards robust text-prompted semantic criterion for in-the-wild video quality assessment","author":"Wu","year":"2023"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/ICME55011.2023.00070"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3249741"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3351028"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3072221"},{"key":"ref55","article-title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","author":"Blattmann","year":"2023"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72952-2_23"},{"key":"ref57","article-title":"Seine: Short-to-long video diffusion model for generative transition and prediction","author":"Chen","year":"2023"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72649-1_27"},{"key":"ref59","article-title":"AnimateZero: Video diffusion models are zero-shot image animators","author":"Yu","year":"2023"},{"key":"ref60","article-title":"Consisti2V: Enhancing visual consistency for image-to-video generation","author":"Ren","year":"2024"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/icassp49660.2025.10887583"},{"key":"ref62","article-title":"Videocrafter1: Open diffusion models for high-quality video generation","author":"Chen","year":"2023"},{"key":"ref63","article-title":"Fine-grained open domain image animation with motion guidance","author":"Dai","year":"2023"},{"key":"ref64","article-title":"I2VGen-XL: High-quality image-to-video synthesis via cascaded diffusion models","author":"Zhang","year":"2023"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW63382.2024.00735"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00845"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1145\/3641519.3657407"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-025-02346-1"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1145\/3641519.3657497"},{"key":"ref70","article-title":"Worlddreamer: Towards general world models for video generation via predicting masked tokens","author":"Wang","year":"2024"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02060"},{"key":"ref72","first-page":"8780","article-title":"Diffusion models beat GANs on image synthesis","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Dhariwal"},{"key":"ref73","article-title":"GLIDE: Towards photorealistic image generation and editing with text-guided diffusion models","author":"Nichol","year":"2021"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01043"},{"key":"ref75","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","author":"Saharia","year":"2022"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref77","article-title":"SDXL: Improving latent diffusion models for high-resolution image synthesis","author":"Podell","year":"2023"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00589"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1145\/3680528.3687658"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1145\/3696415"},{"key":"ref81","article-title":"Flexible diffusion modeling of long videos","author":"Harvey","year":"2022"},{"key":"ref82","article-title":"Video diffusion models","author":"Ho","year":"2022"},{"key":"ref83","article-title":"Imagen video: High definition video generation with diffusion models","author":"Ho","year":"2022"},{"key":"ref84","article-title":"Magicvideo: Efficient video generation with latent diffusion models","author":"Zhou","year":"2022"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02096"},{"key":"ref86","article-title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","author":"Guo","year":"2023"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01462"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02079"},{"key":"ref89","article-title":"Latte: Latent diffusion transformer for video generation","author":"Ma","year":"2024"},{"key":"ref90","article-title":"Dragnuwa: Fine-grained control in video generation by integrating text, image, and trajectory","author":"Yin","year":"2023"},{"key":"ref91","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00675"},{"key":"ref92","article-title":"Motion-conditioned diffusion model for controllable video synthesis","author":"Chen","year":"2023"},{"key":"ref93","article-title":"MagicEdit: High-fidelity and temporally coherent video editing","author":"Liew","year":"2023"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01460"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1145\/3610548.3618160"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00773"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02106"},{"key":"ref98","article-title":"Magicavatar: Multimodal avatar generation and animation","author":"Zhang","year":"2023"},{"key":"ref99","article-title":"VideoComposer: Compositional video synthesis with motion controllability","author":"Wang","year":"2023"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i5.28206"},{"key":"ref101","article-title":"ControlVideo: Training-free controllable text-to-video generation","author":"Zhang","year":"2023"},{"key":"ref102","article-title":"Control-a-video: Controllable text-to-video generation with diffusion models","author":"Chen","year":"2023"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02073"},{"key":"ref104","article-title":"UCF101: A dataset of 101 human actions classes from videos in the wild","author":"Soomro","year":"2012"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.571"},{"key":"ref106","article-title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation","author":"Huang","year":"2023"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.01761"},{"key":"ref108","article-title":"Holistic evaluation of text-to-image models","author":"Lee","year":"2023"},{"key":"ref109","article-title":"EditVal: Benchmarking diffusion based text-guided image editing methods","author":"Basu","year":"2023"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01834"},{"key":"ref111","article-title":"ImagenHub: Standardizing the evaluation of conditional image generation models","author":"Ku","year":"2023"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02090"},{"key":"ref113","first-page":"62352","article-title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video generation","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","volume":"36","author":"Liu"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00068"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00652"},{"key":"ref116","article-title":"Stream: Spatio-temporal evaluation and analysis metric for video generative models","author":"Kim","year":"2024"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1016\/j.tbench.2024.100152"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00740"},{"key":"ref119","article-title":"TC-bench: Benchmarking temporal compositionality in text-to-video and image-to-video generation","author":"Feng","year":"2024"},{"key":"ref120","article-title":"Survey of bias in text-to-image generation: Definition, evaluation, and mitigation","author":"Wan","year":"2024"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1145\/3593013.3594095"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.667"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02157"},{"key":"ref124","article-title":"Faintbench: A holistic and precise benchmark for bias evaluation in text-to-image models","author":"Luo","year":"2024"},{"key":"ref125","article-title":"Membership inference on text-to-image diffusion models via conditional likelihood discrepancy","author":"Zhai","year":"2024"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1145\/3630106.3658927"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1145\/3719027.3765088"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-short.48"},{"key":"ref129","article-title":"Evaluating text-to-image generative models: An empirical study on human image synthesis","author":"Chen","year":"2024"},{"key":"ref130","article-title":"Sociotechnical safety evaluation of generative AI systems","author":"Weidinger","year":"2023"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00732"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1613\/jair.1.15388"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1145\/3689904.3694710"},{"key":"ref134","first-page":"69981","article-title":"Holistic evaluation of text-to-image models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"36","author":"Lee"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00474"},{"key":"ref136","article-title":"Debiasing vision-language models via biased prompts","author":"Chuang","year":"2023"},{"key":"ref137","article-title":"Bias-to-text: Debiasing unknown visual biases through language interpretation","author":"Kim","year":"2023"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1145\/3689090.3689387"},{"key":"ref139","article-title":"Finetuning text-to-image diffusion models for fairness","author":"Shen","year":"2024"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00283"},{"key":"ref141","article-title":"Dalle 3 system card","year":"2022"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1145\/3658644.3670295"},{"key":"ref143","article-title":"Nudenet","year":"2023"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1145\/3531146.3533192"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00945"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58536-5_24"},{"key":"ref148","article-title":"Aesthetic-predictor","year":"2022"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00510"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00373"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72989-8_12"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01826"},{"key":"ref153","article-title":"Tag2text: Guiding vision-language model via image tagging","author":"Huang","year":"2023"},{"key":"ref154","article-title":"InternVid: A large-scale video-text dataset for multimodal understanding and generation","author":"Wang","year":"2023"},{"key":"ref155","article-title":"DreamSim: Learning new dimensions of human visual similarity using synthetic data","author":"Fu","year":"2023"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73033-7_2"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00525"},{"key":"ref158","first-page":"19730","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1001\/archderm.124.6.869"},{"key":"ref160","article-title":"GuardT2I: Defending text-to-image models from adversarial prompts","author":"Yang","year":"2024"},{"key":"ref161","article-title":"NSFW detector","year":"2023"},{"key":"ref162","article-title":"The kinetics human action video dataset","author":"Kay","year":"2017"},{"key":"ref163","article-title":"Judging LLM-as-a-judge with MT-bench and chatbot arena","author":"Zheng","year":"2023"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.4324\/9781003060963-50"},{"key":"ref165","article-title":"GPT-4 technical report","year":"2023"},{"key":"ref166","article-title":"Pexels, royalty-free stock footage website","year":"2024"},{"key":"ref167","article-title":"Pixabay, royalty-free stock footage website","year":"2024"},{"key":"ref168","article-title":"CoCa: Contrastive captioners are image-text foundation models","author":"Yu","year":"2022"},{"key":"ref169","article-title":"Gen-2","year":"2023"},{"key":"ref170","article-title":"Pika 1.0","year":"2023"},{"key":"ref171","article-title":"Kling","year":"2024"},{"key":"ref172","article-title":"Gen-3","year":"2024"},{"key":"ref173","article-title":"CogVideox: Text-to-video diffusion models with an expert transformer","author":"Yang","year":"2024"},{"key":"ref174","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01042"},{"key":"ref175","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00175"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/11372200\/11250949.pdf?arnumber=11250949","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,9]],"date-time":"2026-02-09T21:05:54Z","timestamp":1770671154000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11250949\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3]]},"references-count":175,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2025.3633890","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3]]}}}