{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,29]],"date-time":"2026-07-29T14:26:24Z","timestamp":1785335184573,"version":"3.55.0"},"reference-count":88,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"3","license":[{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key R&#x0026;D Program of China","award":["2024YFB4708200"],"award-info":[{"award-number":["2024YFB4708200"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U24B20173"],"award-info":[{"award-number":["U24B20173"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Scientific Research Innovation Capability Support Project for Young Faculty","award":["ZYGXQNJSKYCXNLZCXM-I20"],"award-info":[{"award-number":["ZYGXQNJSKYCXNLZCXM-I20"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1109\/tpami.2025.3626772","type":"journal-article","created":{"date-parts":[[2025,10,31]],"date-time":"2025-10-31T17:11:59Z","timestamp":1761930719000},"page":"2695-2713","source":"Crossref","is-referenced-by-count":3,"title":["AdaGen: Learning Adaptive Policy for Image Synthesis"],"prefix":"10.1109","volume":"48","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-6428-1456","authenticated-orcid":false,"given":"Zanlin","family":"Ni","sequence":"first","affiliation":[{"name":"Department of Automation, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1363-0234","authenticated-orcid":false,"given":"Yulin","family":"Wang","sequence":"additional","affiliation":[{"name":"Department of Automation, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yeguo","family":"Hua","sequence":"additional","affiliation":[{"name":"Department of Automation, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-0546-0885","authenticated-orcid":false,"given":"Renping","family":"Zhou","sequence":"additional","affiliation":[{"name":"Department of Automation, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-7004-939X","authenticated-orcid":false,"given":"Jiayi","family":"Guo","sequence":"additional","affiliation":[{"name":"Department of Automation, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5778-6452","authenticated-orcid":false,"given":"Jun","family":"Song","sequence":"additional","affiliation":[{"name":"Taobao &#x0026; Tmall Group of Alibaba, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4037-6315","authenticated-orcid":false,"given":"Bo","family":"Zheng","sequence":"additional","affiliation":[{"name":"Taobao &#x0026; Tmall Group of Alibaba, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7251-0988","authenticated-orcid":false,"given":"Gao","family":"Huang","sequence":"additional","affiliation":[{"name":"Department of Automation, BNRist, Tsinghua University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01103"},{"key":"ref2","first-page":"4055","article-title":"Muse: Text-to-image generation via masked generative transformers","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Chang","year":"2023"},{"key":"ref3","article-title":"A PyTorch reproduction of masked generative image transformer","author":"Besnier","year":"2023"},{"key":"ref4","first-page":"128940","article-title":"An image is worth 32 tokens for reconstruction and generation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Yu","year":"2024"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.52202\/079017-2694"},{"key":"ref6","article-title":"Autoregressive model beats diffusion: Llama for scalable image generation","author":"Sun","year":"2024"},{"key":"ref7","article-title":"Denoising diffusion implicit models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Song","year":"2021"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/s11633-025-1562-4"},{"key":"ref9","first-page":"8780","article-title":"Diffusion models beat GANs on image synthesis","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Dhariwal","year":"2021"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52729.2023.02171"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02117"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72980-5_2"},{"key":"ref14","first-page":"1415","article-title":"Maximum likelihood training of score-based diffusion models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Song","year":"2021"},{"key":"ref15","first-page":"5775","article-title":"DPM-solver: A fast ODE solver for diffusion probabilistic model sampling in around 10 steps","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Lu","year":"2022"},{"key":"ref16","article-title":"A unified sampling framework for solver searching of diffusion probabilistic models","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Liu","year":"2024"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20050-2_5"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00213"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01268"},{"key":"ref20","article-title":"Scaling autoregressive models for content-rich text-to-image generation","volume":"2022","author":"Yu","year":"2022","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref22","article-title":"Flow straight and fast: Learning to generate and transfer data with rectified flow","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Liu","year":"2023"},{"key":"ref23","first-page":"15903","article-title":"ImageReward: Learning and evaluating human preferences for text-to-image generation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Xu","year":"2023"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.5555\/2969033.2969125"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1238"},{"key":"ref28","first-page":"25278","article-title":"LAION-5B: An open large-scale dataset for training next generation image-text models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Schuhmann","year":"2022"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72640-8_17"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00453"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"ref32","first-page":"36479","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Saharia","year":"2022"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00976"},{"key":"ref34","article-title":"Hierarchical text-conditional image generation with CLIP latents","author":"Ramesh","year":"2022"},{"key":"ref35","first-page":"19822","article-title":"CogView: Mastering text-to-image generation via transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ding","year":"2021"},{"key":"ref36","first-page":"3249","article-title":"Data generation as sequential decision making","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Bachman","year":"2015"},{"key":"ref37","article-title":"Training diffusion models with reinforcement learning","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Black","year":"2024"},{"key":"ref38","first-page":"79858","article-title":"Reinforcement learning for fine-tuning text-to-image diffusion models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Fan","year":"2023"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73036-8_1"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v31i1.10804"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/3077136.3080786"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1083"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00605"},{"key":"ref44","article-title":"Optimizing DDPM sampling with shortcut fine-tuning","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Fan","year":"2023"},{"key":"ref45","article-title":"Learning multiple layers of features from tiny images","author":"Krizhevsky","year":"2009"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.425"},{"key":"ref47","article-title":"Learning fast samplers for diffusion models by differentiating through sample quality","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Watson","year":"2022"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00654"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00669"},{"key":"ref50","first-page":"21915","article-title":"OMS-DPM: Optimizing the model schedule for diffusion probabilistic models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Liu","year":"2023"},{"key":"ref51","first-page":"6626","article-title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Heusel","year":"2017"},{"key":"ref52","article-title":"Demystifying MMD GANs","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Bi\u0144kowski","year":"2018"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.1810.04805"},{"key":"ref54","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ho","year":"2020"},{"key":"ref55","first-page":"2226","article-title":"Improved techniques for training GANs","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Salimans","year":"2016"},{"key":"ref56","article-title":"Proximal policy optimization algorithms","author":"Schulman","year":"2017"},{"key":"ref57","article-title":"VisionReward: Fine-grained multi-dimensional human preference learning for image and video generation","author":"Xu","year":"2024"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-03194-1_4"},{"key":"ref59","first-page":"1634","article-title":"Smooth exploration for robotic reinforcement learning","volume-title":"Proc. Conf. Robot Learn.","author":"Raffin","year":"2022"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1049\/ep.1987.0120"},{"key":"ref61","article-title":"Large language monkeys: Scaling inference compute with repeated sampling","author":"Brown","year":"2024"},{"key":"ref62","article-title":"Inference-time scaling for diffusion models beyond scaling denoising steps","author":"Ma","year":"2025"},{"key":"ref63","first-page":"14837","article-title":"Generating diverse high-fidelity images with VQ-VAE-2","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Razavi","year":"2019"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01043"},{"key":"ref65","article-title":"Vector-quantized image modeling with improved VQGAN","author":"Yu","year":"2021"},{"key":"ref66","first-page":"30127","article-title":"Draft-and-revise: Effective image generation with contextual RQ-transformer","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Lee","year":"2022"},{"key":"ref67","first-page":"13213","article-title":"Simple diffusion: End-to-end diffusion for high resolution images","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Hoogeboom","year":"2023"},{"key":"ref68","article-title":"Scalable adaptive computation for iterative generation","author":"Jabri","year":"2022"},{"key":"ref69","first-page":"65484","article-title":"Understanding diffusion objectives as the ELBO with simple data augmentation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kingma","year":"2023"},{"key":"ref70","article-title":"Language model beats diffusion\u2013tokenizer is key to visual generation","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Yu","year":"2024"},{"key":"ref71","article-title":"Finite scalar quantization: VQ-VAE made simple","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Mentzer","year":"2023"},{"key":"ref72","first-page":"125441","article-title":"Return of unconditional generation: A self-supervised representation generation method","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Li","year":"2024"},{"key":"ref73","article-title":"SANA: Efficient high-resolution image synthesis with linear diffusion transformers","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Xie","year":"2025"},{"key":"ref74","first-page":"30105","article-title":"StyleGAN-T: Unlocking the power of GANs for fast large-scale text-to-image synthesis","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Sauer","year":"2023"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02282"},{"key":"ref76","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-73242-3_3"},{"key":"ref77","article-title":"Lumina-T2X: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","author":"Gao","year":"2024"},{"key":"ref78","article-title":"Fast training of diffusion models with masked transformers","author":"Zheng","year":"2024","journal-title":"TMLR"},{"key":"ref79","article-title":"Dynamic diffusion transformer","volume-title":"Proc. Int. Conf. Learn Representations","author":"Zhao","year":"2025"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i1.25133"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19784-0_6"},{"key":"ref82","first-page":"3518","article-title":"ImageBART: Bidirectional context with multinomial diffusion for autoregressive image synthesis","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Esser","year":"2021"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01738"},{"key":"ref84","first-page":"16890","article-title":"CogView2: Faster and better text-to-image generation via hierarchical transformers","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Ding","year":"2022"},{"key":"ref85","article-title":"GLIDE: Towards photorealistic image generation and editing with text-guided diffusion models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Nichol","year":"2022"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00979"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00813"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00527"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/34\/11372200\/11223107.pdf?arnumber=11223107","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,9]],"date-time":"2026-02-09T21:05:15Z","timestamp":1770671115000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11223107\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3]]},"references-count":88,"journal-issue":{"issue":"3"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2025.3626772","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3]]}}}