{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,11]],"date-time":"2025-09-11T20:21:21Z","timestamp":1757622081725,"version":"3.44.0"},"reference-count":53,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"Korea Government [Ministry of Science and ICT (MSIT)]","award":["IITP-RS-2021-II211341"],"award-info":[{"award-number":["IITP-RS-2021-II211341"]}]},{"name":"Artificial Intelligence Graduate School, Chung-Ang University","award":["NRF-RS-2023-00251366"],"award-info":[{"award-number":["NRF-RS-2023-00251366"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/access.2025.3603215","type":"journal-article","created":{"date-parts":[[2025,8,27]],"date-time":"2025-08-27T18:32:22Z","timestamp":1756319542000},"page":"152651-152668","source":"Crossref","is-referenced-by-count":0,"title":["Diffusion Models With Implicit Conditions Driven by Latent Shifts"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-6770-6692","authenticated-orcid":false,"given":"Da","family":"Eun Lee","sequence":"first","affiliation":[{"name":"Department of AI, Chung-Ang University, Seoul, Republic of Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6858-3551","authenticated-orcid":false,"given":"Kensuke","family":"Nakamura","sequence":"additional","affiliation":[{"name":"Department of AI, Chung-Ang University, Seoul, Republic of Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2752-3939","authenticated-orcid":false,"given":"Byung-Woo","family":"Hong","sequence":"additional","affiliation":[{"name":"Department of AI, Chung-Ang University, Seoul, Republic of Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1038\/nature14539"},{"key":"ref2","first-page":"16664","article-title":"GLIDE: Towards photorealistic image generation and editing with text-guided diffusion models","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Nichol"},{"key":"ref3","first-page":"25114","article-title":"Photorealistic text-to-image diffusion models with deep language understanding","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Saharia"},{"key":"ref4","article-title":"Hierarchical text-conditional image generation with CLIP latents","author":"Ramesh","year":"2022","journal-title":"arXiv:2204.06125"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"ref6","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Brown"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.21437\/SSW.2016"},{"key":"ref8","first-page":"1","article-title":"Make-a-video: Text-to-video generation without text-video data","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Singer"},{"key":"ref9","first-page":"1","article-title":"DreamFusion: Text-to-3D using 2D diffusion","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Poole"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1038\/s41586-023-06415-8"},{"key":"ref11","first-page":"1","article-title":"Auto-encoding variational Bayes","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Kingma"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1145\/3422622"},{"key":"ref13","first-page":"1","article-title":"Density estimation using real NVP","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Dinh"},{"key":"ref14","first-page":"6840","article-title":"Denoising diffusion probabilistic models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Ho"},{"key":"ref15","first-page":"1","article-title":"Adversarial autoencoders","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Makhzani"},{"key":"ref16","first-page":"1","article-title":"Neural discrete representation learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"van den Oord"},{"key":"ref17","article-title":"Deep unsupervised clustering with Gaussian mixture variational autoencoders","author":"Dilokthanakul","year":"2016","journal-title":"arXiv:1611.02648"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.525"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1016\/j.neunet.2019.11.003"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02162"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00211"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v37i3.25465"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00979"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2024.3486610"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2025.3582756"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW59228.2023.00351"},{"key":"ref27","first-page":"73","article-title":"ICGAN: An implicit conditioning method for interpretable feature control of neural audio synthesis","volume-title":"Proc. Digit. Audio Effects Conf.","author":"Liu"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01483"},{"key":"ref29","first-page":"3483","article-title":"Learning structured output representation using deep conditional generative models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"28","author":"Sohn"},{"key":"ref30","article-title":"Conditional generative adversarial nets","author":"Mirza","year":"2014","journal-title":"arXiv:1411.1784"},{"key":"ref31","first-page":"2642","article-title":"Conditional image synthesis with auxiliary classifier GANs","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Odena"},{"key":"ref32","first-page":"1","article-title":"Large scale GAN training for high fidelity natural image synthesis","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Brock"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00916"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00244"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00158"},{"key":"ref36","first-page":"8780","article-title":"Diffusion models beat GANs on image synthesis","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Dhariwal"},{"key":"ref37","article-title":"Classifier-free diffusion guidance","author":"Ho","year":"2022","journal-title":"arXiv:2207.12598"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.01410"},{"key":"ref40","first-page":"32483","article-title":"Loss-guided diffusion models for plug-and-play controllable generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Song"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01117"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01906"},{"key":"ref43","first-page":"21994","article-title":"Learning latent space energy-based prior model","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Pang"},{"key":"ref44","first-page":"7176","article-title":"Reliable fidelity and diversity metrics for generative models","volume-title":"Proc. Int. Conf. Mach. Learn.","volume":"1","author":"Naeem"},{"key":"ref45","first-page":"6629","article-title":"GANs trained by a two time-scale update rule converge to a local Nash equilibrium","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Heusel"},{"key":"ref46","first-page":"3927","article-title":"Improved precision and recall metric for assessing generative models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kynk\u00e4\u00e4nniemi"},{"key":"ref47","first-page":"1","article-title":"Analog bits: Generating discrete data using diffusion models with self-conditioning","volume-title":"Proc. Int. Conf. Learn. Represent.","author":"Chen"},{"key":"ref48","first-page":"1","article-title":"Simple drop-in LoRA conditioning on attention layers will improve your diffusion model","author":"Choi","year":"2024","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref49","first-page":"125441","article-title":"Return of unconditional generation: A self-supervised representation generation method","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"37","author":"Li"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2023.3319330"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01633-5"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2867733"},{"key":"ref53","first-page":"23593","article-title":"Denoising diffusion restoration models","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kawar"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/10820123\/11142693.pdf?arnumber=11142693","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,8]],"date-time":"2025-09-08T17:47:45Z","timestamp":1757353665000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11142693\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":53,"URL":"https:\/\/doi.org\/10.1109\/access.2025.3603215","relation":{},"ISSN":["2169-3536"],"issn-type":[{"type":"electronic","value":"2169-3536"}],"subject":[],"published":{"date-parts":[[2025]]}}}