{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T14:13:55Z","timestamp":1783520035917,"version":"3.55.0"},"reference-count":115,"publisher":"Springer Science and Business Media LLC","issue":"7","license":[{"start":{"date-parts":[[2025,3,14]],"date-time":"2025-03-14T00:00:00Z","timestamp":1741910400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,3,14]],"date-time":"2025-03-14T00:00:00Z","timestamp":1741910400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1007\/s11263-025-02361-2","type":"journal-article","created":{"date-parts":[[2025,3,14]],"date-time":"2025-03-14T05:02:42Z","timestamp":1741928562000},"page":"4604-4622","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Expressive Image Generation and Editing with Rich Text"],"prefix":"10.1007","volume":"133","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-1922-7455","authenticated-orcid":false,"given":"Songwei","family":"Ge","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Taesung","family":"Park","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jun-Yan","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jia-Bin","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,3,14]]},"reference":[{"key":"2361_CR1","unstructured":"Agrawala, M. (2023). Unpredictable black boxes are terrible interfaces. https:\/\/magrawala.substack.com\/p\/unpredictable-black-boxes-are-terrible"},{"key":"2361_CR2","unstructured":"Avrahami, O., Fried, O., & Lischinski, D. (2022). Blended latent diffusion. arXiv preprint arXiv:2206.02779"},{"key":"2361_CR3","doi-asserted-by":"crossref","unstructured":"Avrahami, O., Hayes, T., Gafni, O., Gupta, S., Taigman, Y., Parikh, D., Lischinski, D., Fried, O., & Yin, X. (2023). Spatext: Spatio-textual representation for controllable image generation. In CVPR.","DOI":"10.1109\/CVPR52729.2023.01762"},{"key":"2361_CR4","doi-asserted-by":"crossref","unstructured":"Bakr, E.M., Sun, P., Shen, X., Khan, F.F., Li, L.E., & Elhoseiny, M. (2023). Hrs-bench: Holistic, reliable and scalable benchmark for text-to-image models. In ICCV.","DOI":"10.1109\/ICCV51070.2023.01834"},{"key":"2361_CR5","unstructured":"Balaji, Y., Nah, S., Huang, X., Vahdat, A., Song, J., Kreis, K., Aittala, M., Aila, T., Laine, S., Catanzaro, B., Karras, T., & Liu, M-Y. (2022). ediffi: Text-to-image diffusion models with an ensemble of expert denoisers. arXiv preprint arXiv:2211.01324."},{"key":"2361_CR6","doi-asserted-by":"crossref","unstructured":"Bansal, A., Chu, H.-M., Schwarzschild, A., Sengupta, S., Goldblum, M., Geiping, J., & Goldstein, T. (2023). Universal guidance for diffusion models. arXiv preprint arXiv:2302.07121","DOI":"10.1109\/CVPRW59228.2023.00091"},{"key":"2361_CR7","unstructured":"Bar-Tal, O., Yariv, L., Lipman, Y., & Dekel, T. (2023). Multidiffusion: Fusing diffusion paths for controlled image generation. In ICML."},{"issue":"3","key":"2361_CR8","first-page":"8","volume":"2","author":"J Betker","year":"2023","unstructured":"Betker, J., Goh, G., Jing, L., Brooks, T., Wang, J., Li, L., Ouyang, L., Zhuang, J., Lee, J., Guo, Y., Manassra, W., Dhariwal, P., Chu, C., Jiao, Y., & Ramesh, A. (2023). Improving image generation with better captions. Computer Science, 2(3), 8.","journal-title":"Computer Science"},{"key":"2361_CR9","doi-asserted-by":"crossref","unstructured":"Brooks, T., Holynski, A., & Efros, A.A. (2023). Instructpix2pix: Learning to follow image editing instructions. In CVPR.","DOI":"10.1109\/CVPR52729.2023.01764"},{"key":"2361_CR10","unstructured":"Byeon, M., Park, B., Kim, H., Lee, S., Baek, W., & Kim, S. (2022). COYO-700M: Image-text pair dataset. https:\/\/github.com\/kakaobrain\/coyo-dataset"},{"key":"2361_CR11","doi-asserted-by":"crossref","unstructured":"Cao, M., Wang, X., Qi, Z., Shan, Y., Qie, X., & Zheng, Y. (2023). Masactrl: Tuning-free mutual self-attention control for consistent image synthesis and editing. In ICCV.","DOI":"10.1109\/ICCV51070.2023.02062"},{"key":"2361_CR12","doi-asserted-by":"crossref","unstructured":"Ceylan, D., Huang, C.-H., & Mitra, N.J. (2023). Pix2video: Video editing using image diffusion. arXiv:2303.12688","DOI":"10.1109\/ICCV51070.2023.02121"},{"key":"2361_CR13","unstructured":"Chang, H., Zhang, H., Barber, J., Maschinot, A., Lezama, J., Jiang, L., Yang, M.-H., Murphy, K., Freeman, W.T., Rubinstein, M., Li, Y., & Krishnan D. (2023). Muse: Text-to-image generation via masked generative transformers. arXiv preprint arXiv:2301.00704"},{"issue":"4","key":"2361_CR14","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3592116","volume":"42","author":"H Chefer","year":"2023","unstructured":"Chefer, H., Alaluf, Y., Vinker, Y., Wolf, L., & Cohen-Or, D. (2023). Attend-and-excite: Attention-based semantic guidance for text-to-image diffusion models. ACM Transactions on Graphics (TOG), 42(4), 1\u201310.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"2361_CR15","unstructured":"Chen, W., Hu, H., Li, Y., Rui, N., Jia, X., Chang, M.-W., & Cohen, W.W. (2023). Subject-driven text-to-image generation via apprenticeship learning. arXiv preprint arXiv:2304.00186"},{"key":"2361_CR16","doi-asserted-by":"crossref","unstructured":"Chen, X., Huang, L., Liu, Y., Shen, Y., Zhao, D., & Zhao, H. (2023). Anydoor: Zero-shot object-level image customization. arXiv preprint arXiv:2307.09481","DOI":"10.1109\/CVPR52733.2024.00630"},{"key":"2361_CR17","doi-asserted-by":"crossref","unstructured":"Choi, J., Kim, S., Jeong, Y., Gwon, Y., & Yoon, S. (2021). Ilvr: Conditioning method for denoising diffusion probabilistic models. In ICCV.","DOI":"10.1109\/ICCV48922.2021.01410"},{"key":"2361_CR18","unstructured":"Colorado State\u00a0University (2012). T.A.P. tutorial: Rich text format (RTF) from Microsoft Word - the ACCESS project. http:\/\/accessproject.colostate.edu\/udl\/modules\/word\/tut_rtf.cfm"},{"key":"2361_CR19","doi-asserted-by":"crossref","unstructured":"Couairon, G., Careil, M., Cord, M., Lathuiliere, S., & Verbeek, J. (2023). Zero-shot spatial layout conditioning for text-to-image diffusion models. In ICCV.","DOI":"10.1109\/ICCV51070.2023.00207"},{"key":"2361_CR20","unstructured":"Dhariwal, P., & Nichol, A. (2021). Diffusion models beat gans on image synthesis. In NeurIPS."},{"key":"2361_CR21","unstructured":"Ding, M., Zheng, W., Hong, W., & Tang, J. (2022). Cogview2: Faster and better text-to-image generation via hierarchical transformers. arXiv preprint arXiv:2204.14217."},{"key":"2361_CR22","unstructured":"Feng, W., He, X., Fu, T.-J., Jampani, V., Akula, A.R., Narayana, P., Basu, S., Wang, X.E., & Wang, W.Y. (2023). Training-free structured diffusion guidance for compositional text-to-image synthesis. In ICLR."},{"key":"2361_CR23","unstructured":"Feng, W., Zhu, W., Fu, T.-j., Jampani, V., Akula, A., He, X., Basu, S., Wang, X.E., & Wang, W.Y. (2024). Layoutgpt: Compositional visual planning and generation with large language models."},{"key":"2361_CR24","doi-asserted-by":"crossref","unstructured":"Gafni, O., Polyak, A., Ashual, O., Sheynin, S., Parikh, D., & Taigman, Y. (2022). Make-a-scene: Scene-based text-to-image generation with human priors. In ECCV.","DOI":"10.1007\/978-3-031-19784-0_6"},{"key":"2361_CR25","unstructured":"Gal, R., Alaluf, Y., Atzmon, Y., Patashnik, O., Bermano, A.H., Chechik, G., & Cohen-or, D. (2023). An image is worth one word: Personalizing text-to-image generation using textual inversion. In ICLR. https:\/\/openreview.net\/forum?id=NAQvF08TcyG"},{"issue":"4","key":"2361_CR26","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3592133","volume":"42","author":"R Gal","year":"2023","unstructured":"Gal, R., Arar, M., Atzmon, Y., Bermano, A. H., Chechik, G., & Cohen-Or, D. (2023). Encoder-based domain tuning for fast personalization of text-to-image models. ACM Transactions on Graphics (TOG), 42(4), 1\u201313.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"2361_CR27","doi-asserted-by":"crossref","unstructured":"Gatys, L.A., Ecker, A.S., & Bethge, M. (2016). Image style transfer using convolutional neural networks. In CVPR","DOI":"10.1109\/CVPR.2016.265"},{"key":"2361_CR28","doi-asserted-by":"crossref","unstructured":"Ge, S., Park, T., Zhu, J.-Y., & Huang, J.-B. (2023). Expressive text-to-image generation with rich text. In ICCV.","DOI":"10.1109\/ICCV51070.2023.00694"},{"key":"2361_CR29","unstructured":"Hertz, A., Mokady, R., Tenenbaum, J., Aberman, K., Pritch, Y., & Cohen-or, D. (2023). Prompt-to-prompt image editing with cross-attention control. In ICLR."},{"key":"2361_CR30","unstructured":"Ho, J., & Salimans, T. (2021). Classifier-free diffusion guidance. In NeurIPS Workshop on deep generative models and downstream applications."},{"key":"2361_CR31","unstructured":"Ho, J., & Salimans, T. (2022). Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598"},{"key":"2361_CR32","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. In NeurIPS"},{"key":"2361_CR33","unstructured":"Ho, J., Salimans, T., Gritsenko, A., Chan, W., Norouzi, M., & Fleet, D.J. (2022). Video diffusion models. In NeurIPS."},{"issue":"47","key":"2361_CR34","first-page":"1","volume":"23","author":"J Ho","year":"2022","unstructured":"Ho, J., Saharia, C., Chan, W., Fleet, D. J., Norouzi, M., & Salimans, T. (2022). Cascaded diffusion models for high fidelity image generation. Journal of Machine Learning Research, 23(47), 1\u201333.","journal-title":"Journal of Machine Learning Research"},{"key":"2361_CR35","doi-asserted-by":"crossref","unstructured":"Hu, Y., Liu, B., Kasai, J., Wang, Y., Ostendorf, M., Krishna, R., & Smith, N.A. (2023). Tifa: Accurate and interpretable text-to-image faithfulness evaluation with question answering. In ICCV.","DOI":"10.1109\/ICCV51070.2023.01866"},{"key":"2361_CR36","doi-asserted-by":"crossref","unstructured":"Huang, K., Sun, K., Xie, E., Li, Z., & Liu, X. (2024). T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation. In NeurIPS.","DOI":"10.1109\/TPAMI.2025.3531907"},{"key":"2361_CR37","doi-asserted-by":"crossref","unstructured":"Huberman-Spiegelglas, I., Kulikov, V., & Michaeli, T. (2023). An edit friendly ddpm noise space: Inversion and manipulations. arXiv preprint arXiv:2304.06140","DOI":"10.1109\/CVPR52733.2024.01185"},{"issue":"8","key":"2361_CR38","doi-asserted-by":"publisher","first-page":"4110","DOI":"10.1002\/cpe.4110","volume":"33","author":"C-L Ignat","year":"2021","unstructured":"Ignat, C.-L., Andr\u00e9, L., & Oster, G. (2021). Enhancing rich content wikis with real-time collaboration. Concurrency and Computation: Practice and Experience, 33(8), 4110.","journal-title":"Concurrency and Computation: Practice and Experience"},{"key":"2361_CR39","doi-asserted-by":"crossref","unstructured":"Isola, P., Zhu, J.-Y., Zhou, T., & Efros, A.A. (2017). Image-to-image translation with conditional adversarial networks. In CVPR.","DOI":"10.1109\/CVPR.2017.632"},{"key":"2361_CR40","unstructured":"Jia, X., Zhao, Y., Chan, K.C., Li, Y., Zhang, H., Gong, B., Hou, T., Wang, H., & Su, Y.-C. (2023). Taming encoder for zero fine-tuning image customization with text-to-image diffusion models. arXiv preprint arXiv:2304.02642"},{"key":"2361_CR41","unstructured":"Jim\u00e9nez, \u00c1.B. (2023). Mixture of diffusers for scene composition and high resolution image generation. arXiv preprint arXiv:2302.02412"},{"key":"2361_CR42","doi-asserted-by":"crossref","unstructured":"Johnson, J., Alahi, A., & Fei-Fei, L. (2016). Perceptual losses for real-time style transfer and super-resolution. In ECCV.","DOI":"10.1007\/978-3-319-46475-6_43"},{"key":"2361_CR43","doi-asserted-by":"crossref","unstructured":"Johnson, J., Gupta, A., & Fei-Fei, L. (2018). Image generation from scene graphs. In CVPR.","DOI":"10.1109\/CVPR.2018.00133"},{"key":"2361_CR44","doi-asserted-by":"crossref","unstructured":"Johnson, J., Karpathy, A., & Fei-Fei, L. (2016). Densecap: Fully convolutional localization networks for dense captioning. In CVPR.","DOI":"10.1109\/CVPR.2016.494"},{"key":"2361_CR45","unstructured":"Ju, X., Zeng, A., Bian, Y., Liu, S., & Xu, Q. (2024). Pnp inversion: Boosting diffusion-based editing with 3 lines of code. In ICLR."},{"key":"2361_CR46","doi-asserted-by":"crossref","unstructured":"Kang, M., Zhu, J.-Y., Zhang, R., Park, J., Shechtman, E., Paris, S., & Park, T. (2023). Scaling up gans for text-to-image synthesis. In CVPR.","DOI":"10.1109\/CVPR52729.2023.00976"},{"key":"2361_CR47","doi-asserted-by":"crossref","unstructured":"Karpathy, A., & Fei-Fei, L. (2015). Deep visual-semantic alignments for generating image descriptions. In CVPR.","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"2361_CR48","doi-asserted-by":"crossref","unstructured":"Kawar, B., Zada, S., Lang, O., Tov, O., Chang, H., Dekel, T., Mosseri, I., & Irani, M. (2023). Imagic: Text-based real image editing with diffusion models. In CVPR.","DOI":"10.1109\/CVPR52729.2023.00582"},{"key":"2361_CR49","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A.C., Lo, W.-Y., Dollar, P., & Girshick, R. (2023). Segment anything. In ICCV.","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"2361_CR50","doi-asserted-by":"crossref","unstructured":"Kumari, N., Zhang, B., Zhang, R., Shechtman, E., & Zhu, J.-Y. (2023). Multi-concept customization of text-to-image diffusion. In CVPR.","DOI":"10.1109\/CVPR52729.2023.00192"},{"key":"2361_CR51","doi-asserted-by":"crossref","unstructured":"Levin, A., Lischinski, D., & Weiss, Y. (2004). Colorization using optimization. In SIG.","DOI":"10.1145\/1186562.1015780"},{"key":"2361_CR52","unstructured":"Li, D., Li, J., & Hoi, S.C. (2023). Blip-diffusion: Pre-trained subject representation for controllable text-to-image generation and editing. arXiv preprint arXiv:2305.14720"},{"key":"2361_CR53","doi-asserted-by":"crossref","unstructured":"Li, Y., Liu, H., Wu, Q., Mu, F., Yang, J., Gao, J., Li, C., & Lee, Y.J. (2023). Gligen: Open-set grounded text-to-image generation. In CVPR.","DOI":"10.1109\/CVPR52729.2023.02156"},{"key":"2361_CR54","doi-asserted-by":"crossref","unstructured":"Li, J., Xu, Y., Lv, T., Cui, L., Zhang, C., & Wei, F. (2022). Dit: Self-supervised pre-training for document image transformer. In MM.","DOI":"10.1145\/3503161.3547911"},{"key":"2361_CR55","doi-asserted-by":"crossref","unstructured":"Li, C., Xu, H., Tian, J., Wang, W., Yan, M., Bi, B., Ye, J., Chen, H., Xu, G., Cao, Z., Zhang, J., Huang, S., Huang, F., Zhou, J., & Si, L. (2022). mplug: Effective and efficient vision-language learning by cross-modal skip-connections. In EMNLP.","DOI":"10.18653\/v1\/2022.emnlp-main.488"},{"key":"2361_CR56","doi-asserted-by":"crossref","unstructured":"Litt, G., Lim, S., Kleppmann, M., & Hardenberg, P. (2022). Peritext: A crdt for collaborative rich text editing. In Proceedings of the ACM on human-computer interaction (PACMHCI).","DOI":"10.1145\/3555644"},{"key":"2361_CR57","doi-asserted-by":"crossref","unstructured":"Liu, R., Wu, R., Van\u00a0Hoorick, B., Tokmakov, P., Zakharov, S., & Vondrick, C. (2023). Zero-1-to-3: Zero-shot one image to 3d object. In ICCV.","DOI":"10.1109\/ICCV51070.2023.00853"},{"key":"2361_CR58","doi-asserted-by":"crossref","unstructured":"Liu, S., Zeng, Z., Ren, T., Li, F., Zhang, H., Yang, J., Li, C., Yang, J., Su, H., Zhu, J., & Zhang, L. (2023). Grounding dino: Marrying dino with grounded pre-training for open-set object detection. arXiv preprint arXiv:2303.05499","DOI":"10.1007\/978-3-031-72970-6_3"},{"key":"2361_CR59","doi-asserted-by":"crossref","unstructured":"Liu, S., Zhang, Y., Li, W., Lin, Z., & Jia, J. (2023). Video-p2p: Video editing with cross-attention control. arXiv:2303.04761","DOI":"10.1109\/CVPR52733.2024.00821"},{"key":"2361_CR60","doi-asserted-by":"crossref","unstructured":"Luan, F., Paris, S., Shechtman, E., & Bala, K. (2017). Deep photo style transfer. In CVPR.","DOI":"10.1109\/CVPR.2017.740"},{"key":"2361_CR61","doi-asserted-by":"crossref","unstructured":"Ma, Y., He, Y., Cun, X., Wang, X., Shan, Y., Li, X., & Chen, Q. (2023). Follow your pose: Pose-guided text-to-video generation using pose-free videos.","DOI":"10.1609\/aaai.v38i5.28206"},{"key":"2361_CR62","doi-asserted-by":"crossref","unstructured":"Ma, W.-D.K., Lewis, J., Kleijn, W.B., & Leung, T. (2023). Directed diffusion: Direct control of object placement through attention guidance. arXiv preprint arXiv:2302.13153","DOI":"10.1609\/aaai.v38i5.28204"},{"key":"2361_CR63","unstructured":"Mansimov, E., Parisotto, E., Ba, J.L., & Salakhutdinov, R. (2016). Generating images from captions with attention. In ICLR."},{"key":"2361_CR64","unstructured":"Meng, C., Song, Y., Song, J., Wu, J., Zhu, J.-Y., & Ermon, S. (2022). Sdedit: Image synthesis and editing with stochastic differential equations. In ICLR."},{"key":"2361_CR65","unstructured":"Meng, Y., Wu, W., Wang, F., Li, X., Nie, P., Yin, F., Li, M., Han, Q., Sun, X., & Li, J. (2019). Glyce: Glyph-vectors for chinese character representations. In NeurIPS. vol. 32."},{"key":"2361_CR66","unstructured":"Nichol, A.Q., Dhariwal, P., Ramesh, A., Shyam, P., Mishkin, P., Mcgrew, B., Sutskever, I., & Chen, M. Glide. (2022). Towards photorealistic image generation and editing with text-guided diffusion models. In ICML"},{"key":"2361_CR67","unstructured":"OpenAI: GPT-4 Technical Report (2023)."},{"key":"2361_CR68","doi-asserted-by":"crossref","unstructured":"Park, T., Liu, M.-Y., Wang, T.-C., & Zhu, J.-Y. (2019). Semantic image synthesis with spatially-adaptive normalization. In CVPR .","DOI":"10.1109\/CVPR.2019.00244"},{"key":"2361_CR69","doi-asserted-by":"crossref","unstructured":"Park, M., Yun, J., Choi, S., & Choo, J. (2023). Learning to generate semantic layouts for higher text-image correspondence in text-to-image synthesis. In ICCV.","DOI":"10.1109\/ICCV51070.2023.00698"},{"key":"2361_CR70","doi-asserted-by":"crossref","unstructured":"Parmar, G., Singh, K.K., Zhang, R., Li, Y., Lu, J., & Zhu, J.-Y. (2023). Zero-shot image-to-image translation. In SIGGRAPH.","DOI":"10.1145\/3588432.3591513"},{"key":"2361_CR71","doi-asserted-by":"crossref","unstructured":"Patashnik, O., Garibi, D., Azuri, I., Averbuch-Elor, H., & Cohen-Or, D. (2023). Localizing object-level shape variations with text-to-image diffusion models. In ICCV.","DOI":"10.1109\/ICCV51070.2023.02107"},{"key":"2361_CR72","doi-asserted-by":"crossref","unstructured":"Patel, M., Gokhale, T., Baral, C., & Yang, Y. (2024). Conceptbed: Evaluating concept learning abilities of text-to-image diffusion models. In AAAI.","DOI":"10.1609\/aaai.v38i13.29371"},{"key":"2361_CR73","doi-asserted-by":"crossref","unstructured":"Phung, Q., Ge, S., & Huang, J.-B. (2024). Grounded text-to-image synthesis with attention refocusing. In CVPR.","DOI":"10.1109\/CVPR52733.2024.00758"},{"key":"2361_CR74","unstructured":"Podell, D., English, Z., Lacey, K., Blattmann, A., Dockhorn, T., M\u00fcller, J., Penna, J., & Rombach, R. (2024). SDXL: Improving latent diffusion models for high-resolution image synthesis. In ICLR."},{"key":"2361_CR75","doi-asserted-by":"crossref","unstructured":"QI, C., Cun, X., Zhang, Y., Lei, C., Wang, X., Shan, Y., & Chen, Q. (2023). Fatezero: Fusing attentions for zero-shot text-based video editing. In ICCV","DOI":"10.1109\/ICCV51070.2023.01460"},{"key":"2361_CR76","doi-asserted-by":"crossref","unstructured":"Qu, L., Wu, S., Fei, H., Nie, L., & Chua, T.-S. (2023). Layoutllm-t2i: Eliciting layout guidance from llm for text-to-image generation. In ACM MM.","DOI":"10.1145\/3581783.3612012"},{"key":"2361_CR77","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., & Sutskever, I. (2021). Learning transferable visual models from natural language supervision. In ICML, pp. 8748\u20138763. PMLR"},{"key":"2361_CR78","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., & Chen, M. (2022). Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125"},{"key":"2361_CR79","unstructured":"Ramesh, A., Pavlov, M., Goh, G., Gray, S., Voss, C., Radford, A., Chen, M., & Sutskever, I. (2021). Zero-shot text-to-image generation. In ICML, (pp. 8821\u20138831)."},{"issue":"5","key":"2361_CR80","doi-asserted-by":"publisher","first-page":"34","DOI":"10.1109\/38.946629","volume":"21","author":"E Reinhard","year":"2001","unstructured":"Reinhard, E., Adhikhmin, M., Gooch, B., & Shirley, P. (2001). Color transfer between images. IEEE Computer Graphics and Applications, 21(5), 34\u201341. https:\/\/doi.org\/10.1109\/38.946629","journal-title":"IEEE Computer Graphics and Applications"},{"key":"2361_CR81","unstructured":"Ren, T., Liu, S., Zeng, A., Lin, J., Li, K., Cao, H., Chen, J., Huang, X., Chen, Y., Yan, F., Zeng, Z., Zhang, H., Li, F., Yang, J., Li, H., Jiang, Q., & Zhang, L. (2024). Grounded SAM: Assembling open-world models for diverse visual tasks."},{"key":"2361_CR82","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2361_CR83","doi-asserted-by":"crossref","unstructured":"Ruiz, N., Li, Y., Jampani, V., & Pritch, Y., Rubinstein, M., Aberman, K. (2023). Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation. In CVPR.","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"2361_CR84","doi-asserted-by":"crossref","unstructured":"Saharia, C., Chan, W., Saxena, S., Li, L., Whang, J., Denton, E., Ghasemipour, S.K.S., Ayan, B.K., Mahdavi, S.S., Lopes, R.G., Salimans, T., Ho, J., Fleet, D.J., & Norouzi, M. (2022). Photorealistic text-to-image diffusion models with deep language understanding. In NeurIPS.","DOI":"10.1145\/3528233.3530757"},{"key":"2361_CR85","unstructured":"Sahuguet, A., & Azavant, F. (1999). Wysiwyg web wrapper factory (w4f)"},{"key":"2361_CR86","unstructured":"Sarukkai, V., Li, L., Ma, A., R\u2019e, C., & Fatahalian, K. (2023). Collage diffusion. ArXiv abs\/2303.00262"},{"key":"2361_CR87","unstructured":"Sauer, A., Karras, T., Laine, S., Geiger, A., & Aila, T. (2023). Stylegan-t: Unlocking the power of gans for fast large-scale text-to-image synthesis. arXiv preprint arXiv:2301.09515"},{"key":"2361_CR88","unstructured":"Schuhmann, C., Beaumont, R., Vencu, R., Gordon, C., Wightman, R., Cherti, M., Coombes, T., Katta, A., Mullis, C., Wortsman, M., Schramowski P., Kundurthy, S., Crowson, K., Schmidt, L., Kaczmarczyk, R., & Jitsev, J. (2022). Laion-5b: An open large-scale dataset for training next generation image-text models. In NeurIPS."},{"key":"2361_CR89","doi-asserted-by":"crossref","unstructured":"Shi, J., Xiong, W., Lin, Z., & Jung, H.J. (2023). Instantbooth: Personalized text-to-image generation without test-time finetuning. arXiv preprint arXiv:2304.03411","DOI":"10.1109\/CVPR52733.2024.00816"},{"issue":"8","key":"2361_CR90","doi-asserted-by":"publisher","first-page":"888","DOI":"10.1109\/34.868688","volume":"22","author":"J Shi","year":"2000","unstructured":"Shi, J., & Malik, J. (2000). Normalized cuts and image segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 22(8), 888\u2013905. https:\/\/doi.org\/10.1109\/34.868688","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"2361_CR91","unstructured":"Song, J., Meng, C., & Ermon, S. (2021). Denoising diffusion implicit models. In ICLR"},{"key":"2361_CR92","doi-asserted-by":"crossref","unstructured":"Sun, Z., Li, X., Sun, X., Meng, Y., Ao, X., He, Q., Wu, F., & Li, J. (2021). Chinesebert: Chinese pretraining enhanced by glyph and pinyin information. In ACL.","DOI":"10.18653\/v1\/2021.acl-long.161"},{"key":"2361_CR93","unstructured":"Tai, Y.-W., Jia, J., & Tang, C.-K. (2005). Local color transfer via probabilistic segmentation by expectation-maximization. In CVPR."},{"key":"2361_CR94","doi-asserted-by":"crossref","unstructured":"Tang, R., Pandey, A., Jiang, Z., Yang, G., Kumar, K.V.S.M., Lin, J., & Ture, F. (2022). What the daam: Interpreting stable diffusion using cross attention. ArXiv abs\/2210.04885","DOI":"10.18653\/v1\/2023.acl-long.310"},{"key":"2361_CR95","doi-asserted-by":"crossref","unstructured":"Tseng, H.-Y., Li, Q., Kim, C., Alsisan, S., Huang, J.-B., & Kopf, J. (2023). Consistent view synthesis with pose-guided diffusion models. In CVPR.","DOI":"10.1109\/CVPR52729.2023.01609"},{"key":"2361_CR96","doi-asserted-by":"crossref","unstructured":"Tumanyan, N., Geyer, M., Bagon, S., & Dekel, T. (2023). Plug-and-play diffusion features for text-driven image-to-image translation. In CVPR","DOI":"10.1109\/CVPR52729.2023.00191"},{"key":"2361_CR97","doi-asserted-by":"publisher","first-page":"395","DOI":"10.1007\/s11222-007-9033-z","volume":"17","author":"U Von Luxburg","year":"2007","unstructured":"Von Luxburg, U. (2007). A tutorial on spectral clustering. Statistics and computing, 17, 395\u2013416.","journal-title":"Statistics and computing"},{"key":"2361_CR98","doi-asserted-by":"crossref","unstructured":"Wang, X., Darrell, T., Rambhatla, S.S., Girdhar, R., & Misra, I. (2024). Instancediffusion: Instance-level control for image generation. arXiv preprint arXiv:2402.03290","DOI":"10.1109\/CVPR52733.2024.00596"},{"key":"2361_CR99","unstructured":"Watson, D., Chan, W., Martin-Brualla, R., Ho, J., Tagliasacchi, A., & Norouzi, M. (2022). Novel view synthesis with diffusion models."},{"key":"2361_CR100","unstructured":"Wen, Y., Jain, N., Kirchenbauer, J., Goldblum, M., Geiping, J., & Goldstein, T. (2023). Hard prompts made easy: Gradient-based discrete optimization for prompt tuning and discovery. In NeurIPS."},{"key":"2361_CR101","unstructured":"Witten, I.H., Bainbridge, D., & Nichols, D.M. (2009). How to build a digital library."},{"key":"2361_CR102","unstructured":"Wu, C.H., & Torre, F. (2022). Unifying diffusion models\u2019 latent space, with applications to cyclediffusion and guidance. arXiv preprint arXiv:2210.05559"},{"key":"2361_CR103","doi-asserted-by":"crossref","unstructured":"Wu, J.Z., Ge, Y., Wang, X., Lei, S.W., Gu, Y., Shi, Y., Hsu, W., Shan, Y., Qie, X., & Shou, M.Z. (2023). Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation, pp. 7623\u20137633.","DOI":"10.1109\/ICCV51070.2023.00701"},{"key":"2361_CR104","unstructured":"Wu, W., Li, Z., He, Y., Shou, M.Z., Shen, C., Cheng, L., Li, Y., Gao, T., Zhang, D., & Wang, Z. (2023). Paragraph-to-image generation with information-enriched diffusion model. arXiv preprint arXiv:2311.14284"},{"key":"2361_CR105","doi-asserted-by":"crossref","unstructured":"Xiao, G., Yin, T., Freeman, W.T., Durand, F., & Han, S. (2023). Fastcomposer: Tuning-free multi-subject image generation with localized attention. arXiv preprint arXiv:2305.10431","DOI":"10.1007\/s11263-024-02227-z"},{"key":"2361_CR106","doi-asserted-by":"crossref","unstructured":"Xu, Y., Li, M., Cui, L., Huang, S., Wei, F., & Zhou, M. (2020). Layoutlm: Pre-training of text and layout for document image understanding. In SIGKDD","DOI":"10.1145\/3394486.3403172"},{"key":"2361_CR107","first-page":"1","volume":"32","author":"L Xu","year":"2013","unstructured":"Xu, L., Yan, Q., & Jia, J. (2013). A sparse control model for image and video editing. ACM Transactions on Graphics (TOG), 32, 1\u201310.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"2361_CR108","unstructured":"Yu, J., Xu, Y., Koh, J.Y., Luong, T., Baid, G., Wang, Z., Vasudevan, V., Ku, A., Yang, Y., Ayan, B.K., Hutchinson, B., Han , W., Parekh, Z., Li, X., Zhang, H., Baldridge, J., & Wu, Y. (2022). Scaling autoregressive models for content-rich text-to-image generation. Transactions on machine learning research."},{"key":"2361_CR109","doi-asserted-by":"crossref","unstructured":"Zhang, L., & Agrawala, M. (2023). Adding conditional control to text-to-image diffusion models. In: ICCV.","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"2361_CR110","doi-asserted-by":"crossref","unstructured":"Zhang, R., Isola, P., & Efros, A.A. (2016). Colorful image colorization. In ECCV.","DOI":"10.1007\/978-3-319-46487-9_40"},{"key":"2361_CR111","doi-asserted-by":"crossref","unstructured":"Zhang, Q., Song, J., Huang, X., Chen, Y., & Liu, M.-Y. (2023). Diffcollage: Parallel generation of large content with diffusion models.","DOI":"10.1109\/CVPR52729.2023.00982"},{"key":"2361_CR112","doi-asserted-by":"crossref","unstructured":"Zhang, R., Zhu, J.-Y., Isola, P., Geng, X., Lin, A.S., Yu, T., & Efros, A.A. (2017). Real-time user-guided image colorization with learned deep priors. ACM Transactions on Graphics (TOG), 9(4).","DOI":"10.1145\/3072959.3073703"},{"key":"2361_CR113","doi-asserted-by":"crossref","unstructured":"Zhao, L., Zhao, T., Lin, Z., Ning, X., Dai, G., Yang, H., & Wang, Y. (2024). Flasheval: Towards fast and accurate evaluation of text-to-image diffusion generative models. arXiv preprint arXiv:2403.16379","DOI":"10.1109\/CVPR52733.2024.01526"},{"key":"2361_CR114","unstructured":"Zhu, X., Goldberg, A.B., Eldawy, M., Dyer, C.R., & Strock, B. (2007). A text-to-picture synthesis system for augmenting communication. In AAAI."},{"key":"2361_CR115","doi-asserted-by":"crossref","unstructured":"Zhu, J.-Y., Park, T., Isola, P., & Efros, A.A. (2017). Unpaired image-to-image translation using cycle-consistent adversarial networks. In ICCV.","DOI":"10.1109\/ICCV.2017.244"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02361-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-025-02361-2\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-025-02361-2.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,7]],"date-time":"2025-06-07T06:00:49Z","timestamp":1749276049000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-025-02361-2"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,3,14]]},"references-count":115,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2025,7]]}},"alternative-id":["2361"],"URL":"https:\/\/doi.org\/10.1007\/s11263-025-02361-2","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,3,14]]},"assertion":[{"value":"1 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"6 January 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 March 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}