{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,25]],"date-time":"2026-07-25T05:19:24Z","timestamp":1784956764286,"version":"3.55.0"},"reference-count":303,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"12","license":[{"start":{"date-parts":[[2023,12,1]],"date-time":"2023-12-01T00:00:00Z","timestamp":1701388800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2023,12,1]],"date-time":"2023-12-01T00:00:00Z","timestamp":1701388800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2023,12,1]],"date-time":"2023-12-01T00:00:00Z","timestamp":1701388800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2023,12]]},"DOI":"10.1109\/tpami.2023.3305243","type":"journal-article","created":{"date-parts":[[2023,8,25]],"date-time":"2023-08-25T17:22:23Z","timestamp":1692984143000},"page":"15098-15119","source":"Crossref","is-referenced-by-count":117,"title":["Multimodal Image Synthesis and Editing: The Generative AI Era"],"prefix":"10.1109","volume":"45","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1502-6847","authenticated-orcid":false,"given":"Fangneng","family":"Zhan","sequence":"first","affiliation":[{"name":"Max Planck Institute for Informatics, Saarbr&#x00FC;cken, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7893-0764","authenticated-orcid":false,"given":"Yingchen","family":"Yu","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5586-0628","authenticated-orcid":false,"given":"Rongliang","family":"Wu","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9059-7546","authenticated-orcid":false,"given":"Jiahui","family":"Zhang","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6766-2506","authenticated-orcid":false,"given":"Shijian","family":"Lu","sequence":"additional","affiliation":[{"name":"Nanyang Technological University, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4301-1474","authenticated-orcid":false,"given":"Lingjie","family":"Liu","sequence":"additional","affiliation":[{"name":"Max Planck Institute for Informatics, Saarbr&#x00FC;cken, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9146-4403","authenticated-orcid":false,"given":"Adam","family":"Kortylewski","sequence":"additional","affiliation":[{"name":"Max Planck Institute for Informatics, Saarbr&#x00FC;cken, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6104-6625","authenticated-orcid":false,"given":"Christian","family":"Theobalt","sequence":"additional","affiliation":[{"name":"Max Planck Institute for Informatics, Saarbr&#x00FC;cken, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Eric","family":"Xing","sequence":"additional","affiliation":[{"name":"Carnegie Mellon University, Pittsburgh, PA, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.5555\/2969033.2969125"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.01268"},{"key":"ref3","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. 34th Int. Conf. Neural Inf. Process. Syst.","author":"Ho"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58452-8_24"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.632"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00244"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00559"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.02154"},{"key":"ref10","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","author":"Saharia","year":"2022"},{"key":"ref11","article-title":"Dreamfusion: Text-to-3D using 2D diffusion","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Poole"},{"key":"ref12","article-title":"Make-a-video: Text-to-video generation without text-video data","author":"Singer","year":"2022"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00573"},{"key":"ref14","article-title":"PasteGAN: A semi-parametric method to generate image from scene graph","volume-title":"Proc. 33rd Int. Conf. Neural Inf. Process. Syst.","author":"Li"},{"key":"ref15","article-title":"Improving visual image reconstruction from human brain activity using latent diffusion models via multiple decoded inputs","author":"Takagi","year":"2023"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/3588432.3591500"},{"key":"ref17","article-title":"Generating images from captions with attention","author":"Mansimov","year":"2015"},{"key":"ref18","article-title":"Conditional generative adversarial nets","author":"Mirza","year":"2014"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.241"},{"key":"ref20","article-title":"You said that?","author":"Chung","year":"2017"},{"key":"ref21","first-page":"8780","article-title":"Diffusion models beat GANs on image synthesis","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Dhariwal"},{"key":"ref22","article-title":"Denoising diffusion implicit models","author":"Song","year":"2020"},{"key":"ref23","article-title":"Score-based generative modeling through stochastic differential equations","author":"Song","year":"2020"},{"key":"ref24","article-title":"Adversarial score matching and improved sampling for image generation","author":"Jolicoeur-Martineau","year":"2020"},{"key":"ref25","article-title":"Hierarchical text-conditional image generation with clip latents","author":"Ramesh","year":"2022"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01738"},{"key":"ref27","article-title":"Classifier-free diffusion guidance","author":"Ho","year":"2022"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00229"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00209"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3181070"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58520-4_35"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/wacv56688.2023.00037"},{"key":"ref33","article-title":"DiffusionCLIP: Text-guided image manipulation using diffusion models","author":"Kim","year":"2021"},{"key":"ref34","article-title":"Prompt-to-prompt image editing with cross attention control","author":"Hertz","year":"2022"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.02155"},{"key":"ref36","article-title":"An image is worth one word: Personalizing text-to-image generation using textual inversion","author":"Gal","year":"2022"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"issue":"8","key":"ref38","first-page":"9","article-title":"Language models are unsupervised multitask learners","volume":"1","author":"Radford","year":"2019","journal-title":"OpenAI Blog"},{"key":"ref39","article-title":"Generative pretraining from pixels","volume-title":"Proc. 37th Int. Conf. Mach. Learn.","author":"Chen"},{"key":"ref40","article-title":"Jukebox: A generative model for music","author":"Dhariwal","year":"2020"},{"key":"ref41","first-page":"1242","article-title":"Deep AutoRegressive networks","volume-title":"Proc. 31st Int. Conf. Mach. Learn.","author":"Gregor"},{"key":"ref42","article-title":"Neural discrete representation learning","author":"Oord","year":"2017"},{"key":"ref43","first-page":"8821","article-title":"Zero-shot text-to-image generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Ramesh","year":"2021"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_41"},{"key":"ref45","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00037"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1145\/3550454.3555506"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00431"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00917"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_3"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-65414-6_39"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.629"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00143"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00160"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00976"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413532"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1145\/3414685.3417774"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00416"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i2.20102"},{"key":"ref61","article-title":"Semantic image synthesis via diffusion models","author":"Wang","year":"2022"},{"key":"ref62","article-title":"UniControl: A unified diffusion model for controllable visual generation in the wild","author":"Qin","year":"2023"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01764"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00197"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00051"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00985"},{"key":"ref67","article-title":"Diffusion-based scene graph to image generation with masked contrastive pre-training","author":"Yang","year":"2022"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01778"},{"key":"ref69","article-title":"CogView: Mastering text-to-image generation via transformers","author":"Ding","year":"2021"},{"key":"ref70","article-title":"Zero-shot text-to-image generation","author":"Ramesh","year":"2021"},{"key":"ref71","article-title":"Scaling autoregressive models for content-rich text-to-image generation","author":"Yu","year":"2022"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19784-0_6"},{"key":"ref73","article-title":"Muse: Text-to-image generation via masked generative transformers","author":"Chang","year":"2023"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1145\/3478513.3480484"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01315"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01077"},{"key":"ref77","article-title":"OR-NeRF: Object removing from 3D scenes guided by multiview segmentation with neural radiance fields","author":"Yin","year":"2023"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01343"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02004"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01586"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20047-2_42"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01219"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00381"},{"key":"ref84","article-title":"ProlificDreamer: High-fidelity and diverse text-to-3D generation with variational score distillation","author":"Wang","year":"2023"},{"key":"ref85","article-title":"GeneFace: Generalized and high-fidelity audio-driven 3D talking face synthesis","author":"Ye","year":"2023"},{"key":"ref86","article-title":"GeneFace: Generalized and stable real-time audio-driven 3D talking face generation","author":"Ye","year":"2023"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19775-8_39"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19836-6_7"},{"key":"ref89","article-title":"Pose guided person image generation","author":"Ma","year":"2017"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00513"},{"key":"ref91","article-title":"Deep monocular 3D human pose estimation via cascaded dimension-lifting","author":"Zhang","year":"2021"},{"key":"ref92","first-page":"465","article-title":"Toward multimodal image-to-image translation","volume-title":"Proc. 31st Int. Conf. Neural Inf. Process. Syst.","author":"Zhu"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00522"},{"key":"ref94","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00981"},{"key":"ref95","doi-asserted-by":"publisher","DOI":"10.1145\/3386569.3392386"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2018.2890018"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-021-01442-2"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2020.3030536"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3015015"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01063"},{"key":"ref101","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00878"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00839"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01356"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-92659-5_23"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00028"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_13"},{"key":"ref107","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3181587"},{"key":"ref108","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2856256"},{"key":"ref109","first-page":"1060","article-title":"Generative adversarial text to image synthesis","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Reed"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2021.07.019"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1310.4546"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1080\/00437956.1954.11659520"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/WACV48630.2021.00342"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58539-6_29"},{"key":"ref115","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P17-1047"},{"key":"ref117","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462396"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1109\/JSTSP.2020.2987417"},{"key":"ref119","first-page":"892","article-title":"SoundNet: Learning sound representations from unlabeled video","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Aytar"},{"key":"ref120","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00802"},{"key":"ref121","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.264"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/129"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.1037\/t27734-000"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00133"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58604-1_18"},{"key":"ref127","first-page":"802","article-title":"Convolutional LSTM network: A machine learning approach for precipitation nowcasting","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Shi"},{"key":"ref128","first-page":"13038","article-title":"Reconstructing perceptive images from brain activity by shape-semantic GAN","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Fang"},{"key":"ref129","article-title":"Mind reader: Reconstructing complex images from brain activities","author":"Lin","year":"2022"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01389"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00141"},{"key":"ref132","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.14686"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00252"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00519"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01478"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.U09\/CVPR42600.2020.00515"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01060"},{"key":"ref138","article-title":"Controllable text-to-image generation","author":"Li","year":"2019"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00595"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1145\/311535.311556"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58545-7_3"},{"key":"ref142","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33019299"},{"key":"ref143","doi-asserted-by":"publisher","DOI":"10.1145\/3072959.3073640"},{"key":"ref144","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i3.20154"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref146","article-title":"Progressive growing of GANS for improved quality, stability, and variation","author":"Karras","year":"2017"},{"key":"ref147","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00649"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00243"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33013272"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00919"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.244"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350980"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00766"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.1109\/ICMEW.2019.00085"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.374"},{"key":"ref156","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1603.08155"},{"key":"ref157","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2836316"},{"key":"ref158","first-page":"752","article-title":"One-sided unsupervised domain mapping","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Benaim"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00253"},{"key":"ref160","article-title":"Representation learning with contrastive predictive coding","author":"Oord","year":"2018"},{"key":"ref161","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58545-7_19"},{"key":"ref162","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00220"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00089"},{"key":"ref164","article-title":"Large scale GAN training for high fidelity natural image synthesis","author":"Brock","year":"2018"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00068"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr46437.2021.00232"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475226"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01354"},{"key":"ref169","article-title":"Paint by word","author":"Bau","year":"2021"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1109\/wacv51458.2022.00350"},{"key":"ref171","article-title":"FuseDream: Training-free text-to-image generation with improved clip GAN space optimization","author":"Liu","year":"2021"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1145\/3528223.3530164"},{"key":"ref173","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547935"},{"key":"ref174","first-page":"2256","article-title":"Deep unsupervised learning using nonequilibrium thermodynamics","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Sohl-Dickstein"},{"key":"ref175","article-title":"Auto-encoding variational bayes","author":"Kingma","year":"2013"},{"key":"ref176","first-page":"1530","article-title":"Variational inference with normalizing flows","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Rezende"},{"key":"ref177","article-title":"Density estimation using real NVP","author":"Dinh","year":"2016"},{"key":"ref178","article-title":"Generating high fidelity images with subscale pixel networks and multidimensional upscaling","author":"Menick","year":"2018"},{"key":"ref179","first-page":"1747","article-title":"Pixel recurrent neural networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Van Oord"},{"key":"ref180","article-title":"GLIDE: Towards photorealistic image generation and editing with text-guided diffusion models","author":"Nichol","year":"2021"},{"key":"ref181","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00582"},{"key":"ref182","first-page":"5485","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"ref183","first-page":"2249","article-title":"Cascaded diffusion models for high fidelity image generation","volume":"23","author":"Ho","year":"2022","journal-title":"J. Mach. Learn. Res."},{"key":"ref184","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01043"},{"key":"ref185","article-title":"Improved vector quantized diffusion models","author":"Tang","year":"2022"},{"key":"ref186","article-title":"Exploring transformer backbones for image diffusion models","author":"Chahal","year":"2022"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.1145\/3528223.3530104"},{"key":"ref188","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19790-1_26"},{"key":"ref189","article-title":"Multidiffusion: Fusing diffusion paths for controlled image generation","author":"Bar-Tal","year":"2023"},{"key":"ref190","article-title":"Retrieval-augmented diffusion models","author":"Blattmann","year":"2022"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01767"},{"key":"ref192","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.00584"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_7"},{"key":"ref194","first-page":"3518","article-title":"ImageBART: Bidirectional context with multinomial diffusion for autoregressive image synthesis","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Esser"},{"key":"ref195","article-title":"Discrete variational autoencoders","author":"Rolfe","year":"2016"},{"key":"ref196","article-title":"Estimating or propagating gradients through stochastic neurons for conditional computation","author":"Bengio","year":"2013"},{"key":"ref197","article-title":"Vector-quantized image modeling with improved VQGAN","author":"Yu","year":"2021"},{"key":"ref198","article-title":"Translation-equivariant image quantizer for bi-directional image-text generation","author":"Shin","year":"2021"},{"key":"ref199","article-title":"Discriminative regularization for generative models","author":"Lamb","year":"2016"},{"key":"ref200","first-page":"1558","article-title":"Autoencoding beyond pixels using a learned similarity metric","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Larsen"},{"key":"ref201","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i1.25130"},{"key":"ref202","article-title":"BEiT: BERT pre-training of image transformers","author":"Bao","year":"2021"},{"key":"ref203","doi-asserted-by":"publisher","DOI":"10.1109\/FG.2018.00020"},{"key":"ref204","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"ref205","article-title":"DiVAE: Photorealistic images synthesis with denoising diffusion decoder","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Shi","year":"2020"},{"key":"ref206","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.01363"},{"key":"ref207","first-page":"14866","article-title":"Generating diverse high-fidelity images with VQ-VAE-2","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Razavi"},{"key":"ref208","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01123"},{"key":"ref209","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01771"},{"key":"ref210","article-title":"vq-wav2vec: Self-supervised learning of discrete speech representations","author":"Baevski","year":"2019"},{"key":"ref211","article-title":"Categorical reparameterization with Gumbel-softmax","author":"Jang","year":"2016"},{"key":"ref212","first-page":"31841","article-title":"GET3D: A generative model of high quality 3D textured shapes learned from images","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Gao"},{"key":"ref213","first-page":"4797","article-title":"Conditional image generation with PixelCNN decoders","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Van den Oord"},{"key":"ref214","first-page":"4055","article-title":"Image transformer","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Parmar"},{"key":"ref215","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3478561"},{"key":"ref216","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3481540"},{"key":"ref217","article-title":"Argmax flows and multinomial diffusion: Towards non-autoregressive language models","author":"Hoogeboom","year":"2021"},{"key":"ref218","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01103"},{"key":"ref219","article-title":"M6-UFC: Unifying multi-modal controls for conditional image synthesis","author":"Zhang","year":"2021"},{"key":"ref220","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475436"},{"key":"ref221","doi-asserted-by":"publisher","DOI":"10.1145\/3528223.3530172"},{"key":"ref222","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.14505"},{"key":"ref223","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00094"},{"key":"ref224","doi-asserted-by":"publisher","DOI":"10.1145\/3528223.3530094"},{"key":"ref225","first-page":"6087","article-title":"Deep marching tetrahedra: A hybrid representation for high-resolution 3D shape synthesis","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Shen"},{"key":"ref226","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00541"},{"key":"ref227","first-page":"20154","article-title":"GRAF: Generative radiance fields for 3D-aware image synthesis","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Schwarz"},{"key":"ref228","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01129"},{"key":"ref229","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00574"},{"key":"ref230","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.11671"},{"key":"ref231","first-page":"7462","article-title":"Implicit neural representations with periodic activation functions","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Sitzmann"},{"key":"ref232","article-title":"StyleNeRF: A style-based 3D-aware generator for high-resolution image synthesis","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Gu"},{"key":"ref233","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01565"},{"key":"ref234","article-title":"CG-NeRF: Conditional generative neural radiance fields","author":"Jo","year":"2021"},{"key":"ref235","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19781-9_42"},{"key":"ref236","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00752"},{"key":"ref237","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.00381"},{"key":"ref238","doi-asserted-by":"publisher","DOI":"10.1007\/s41095-021-0234-8"},{"key":"ref239","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.544"},{"key":"ref240","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref241","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00132"},{"key":"ref242","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19812-0_11"},{"key":"ref243","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1604.01685"},{"key":"ref244","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.425"},{"key":"ref245","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.124"},{"key":"ref246","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2015.2408360"},{"key":"ref247","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2011.6130298"},{"key":"ref248","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2013.77"},{"key":"ref249","doi-asserted-by":"publisher","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"ref250","article-title":"Caltech-UCSD birds 200","author":"Welinder","year":"2010"},{"key":"ref251","first-page":"25278","article-title":"LAION-5B: An open large-scale dataset for training next generation image-text models","volume-title":"Proc. NeurIPS Datasets Benchmarks Track","author":"Schuhmann"},{"key":"ref252","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref253","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-950"},{"key":"ref254","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.367"},{"key":"ref255","article-title":"Language-driven image style transfer","author":"Fu","year":"2021"},{"key":"ref256","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01753"},{"key":"ref257","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-25069-9_38"},{"key":"ref258","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01313"},{"key":"ref259","article-title":"Text to mesh without 3D supervision using limit subdivision","author":"Khalid","year":"2022"},{"key":"ref260","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01579"},{"key":"ref261","article-title":"RGBD-GAN: Unsupervised 3D representation learning from natural image datasets via RGBD image synthesis","author":"Noguchi","year":"2019"},{"key":"ref262","first-page":"118","article-title":"Visual object networks: Image generation with disentangled 3D representations","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Zhu"},{"key":"ref263","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_23"},{"key":"ref264","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00768"},{"key":"ref265","first-page":"14745","article-title":"TransGAN: Two pure transformers can make one strong GAN, and that can scale up","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Jiang"},{"key":"ref266","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00878"},{"key":"ref267","first-page":"4487","article-title":"Generative adversarial transformers","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Hudson"},{"key":"ref268","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.707"},{"key":"ref269","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_6"},{"key":"ref270","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3076487"},{"key":"ref271","article-title":"Learning to predict layout-to-image conditional convolutions for semantic image synthesis","author":"Liu","year":"2019"},{"key":"ref272","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00551"},{"key":"ref273","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00787"},{"key":"ref274","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2020.3021209"},{"key":"ref275","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01245"},{"key":"ref276","doi-asserted-by":"publisher","DOI":"10.1109\/ICME46284.2020.9102904"},{"key":"ref277","doi-asserted-by":"publisher","DOI":"10.1145\/3391709"},{"key":"ref278","article-title":"Network-to-network translation with conditional invertible neural networks","author":"Rombach","year":"2020"},{"key":"ref279","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58548-8_29"},{"key":"ref280","article-title":"CogView2: Faster and better text-to-image generation via hierarchical transformers","author":"Ding","year":"2022"},{"key":"ref281","doi-asserted-by":"publisher","DOI":"10.21437\/interspeech.2018-1929"},{"key":"ref282","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-54184-6_6"},{"key":"ref283","first-page":"2234","article-title":"Improved techniques for training GANs","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Salimans"},{"key":"ref284","first-page":"6629","article-title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Heusel"},{"key":"ref285","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00833"},{"key":"ref286","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-54427-4_19"},{"key":"ref287","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_26"},{"key":"ref288","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.75"},{"key":"ref289","article-title":"Semantic image segmentation with deep convolutional nets and fully connected CRFs","author":"Chen","year":"2014"},{"key":"ref290","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00338"},{"key":"ref291","doi-asserted-by":"publisher","DOI":"10.1145\/3528233.3530745"},{"key":"ref292","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109865"},{"key":"ref293","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i3.20154"},{"key":"ref294","doi-asserted-by":"publisher","DOI":"10.1109\/iccv51070.2023.00200"},{"key":"ref295","article-title":"Pick-a-pic: An open dataset of user preferences for text-to-image generation","author":"Kirstain","year":"2023"},{"key":"ref296","first-page":"4807","article-title":"Parallel and flexible sampling from autoregressive models via Langevin dynamics","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Jayaram"},{"key":"ref297","article-title":"Score-based generative modeling with critically-damped Langevin diffusion","author":"Dockhorn","year":"2021"},{"key":"ref298","first-page":"32211","article-title":"Consistency models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Song"},{"key":"ref299","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"ref300","article-title":"3D generation on imagenet","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Skorokhodov"},{"key":"ref301","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00536"},{"key":"ref302","article-title":"The tools of generative art, from flash to neural networks","volume":"8","author":"Bailey","year":"2020","journal-title":"Art Amer."},{"key":"ref303","doi-asserted-by":"publisher","DOI":"10.1145\/3425780"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/10308548\/10230895.pdf?arnumber=10230895","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,3,14]],"date-time":"2024-03-14T03:40:06Z","timestamp":1710387606000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10230895\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12]]},"references-count":303,"journal-issue":{"issue":"12"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2023.3305243","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,12]]}}}