{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T04:55:07Z","timestamp":1781585707639,"version":"3.54.5"},"reference-count":84,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2025,1,14]],"date-time":"2025-01-14T00:00:00Z","timestamp":1736812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,14]],"date-time":"2025-01-14T00:00:00Z","timestamp":1736812800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62361166670"],"award-info":[{"award-number":["62361166670"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62276132"],"award-info":[{"award-number":["62276132"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61876085"],"award-info":[{"award-number":["61876085"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2025,6]]},"DOI":"10.1007\/s11263-024-02334-x","type":"journal-article","created":{"date-parts":[[2025,1,14]],"date-time":"2025-01-14T04:13:04Z","timestamp":1736827984000},"page":"3456-3480","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["UniCanvas: Affordance-Aware Unified Real Image Editing via Customized Text-to-Image Generation"],"prefix":"10.1007","volume":"133","author":[{"given":"Jian","family":"Jin","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yang","family":"Shen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinyang","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhenyong","family":"Fu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,1,14]]},"reference":[{"issue":"6","key":"2334_CR1","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3618322","volume":"42","author":"Y Alaluf","year":"2023","unstructured":"Alaluf, Y., Richardson, E., Metzer, G., & Cohen-Or, D. (2023). A neural space-time representation for text-to-image personalization. ACM TOG, 42(6), 1\u201310.","journal-title":"ACM TOG"},{"key":"2334_CR2","doi-asserted-by":"publisher","first-page":"2570","DOI":"10.1007\/s11263-020-01336-9","volume":"128","author":"S Azadi","year":"2020","unstructured":"Azadi, S., Pathak, D., Ebrahimi, S., & Darrell, T. (2020). Compositional gan: Learning image-conditional binary composition. International Journal of Computer Vision, 128, 2570\u20132585.","journal-title":"International Journal of Computer Vision"},{"key":"2334_CR3","doi-asserted-by":"crossref","unstructured":"Bobkov, D., Titov, V., Alanov, A., & Vetrov, D. (2024). The devil is in the details: Stylefeatureeditor for detail-rich stylegan inversion and high quality image editing. In CVPR (pp. 9337\u20139346) (2024)","DOI":"10.1109\/CVPR52733.2024.00892"},{"key":"2334_CR4","doi-asserted-by":"crossref","unstructured":"Brack, M., Friedrich, F., Kornmeier, K., Tsaban, L., Schramowski, P., Kersting, K., & Passos, A. (2024). Ledits++: Limitless image editing using text-to-image models. In CVPR (pp. 8861\u20138870) (2024)","DOI":"10.1109\/CVPR52733.2024.00846"},{"key":"2334_CR5","doi-asserted-by":"crossref","unstructured":"Brooks, T., Holynski, A., & Efros, A. A. (2023). Instructpix2pix: Learning to follow image editing instructions. In CVPR (pp. 18392\u201318402).","DOI":"10.1109\/CVPR52729.2023.01764"},{"key":"2334_CR6","doi-asserted-by":"crossref","unstructured":"Cao, M., Wang, X., Qi, Z., Shan, Y., Qie, X., & Zheng, Y. (2023). Masactrl: tuning-free mutual self-attention control for consistent image synthesis and editing. In ICCV (pp. 22560\u201322570) (2023)","DOI":"10.1109\/ICCV51070.2023.02062"},{"key":"2334_CR7","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P., & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. In ICCV (pp. 9650\u20139660).","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"2334_CR8","unstructured":"Chen, W., Hu, H., Li, Y., Ruiz, N., Jia, X., Chang, M. W., Cohen, W. W. (2024). Subject-driven text-to-image generation via apprenticeship learning. Advances in Neural Information Processing Systems 36."},{"key":"2334_CR9","doi-asserted-by":"crossref","unstructured":"Chen, X., Huang, L., Liu, Y., Shen, Y., Zhao, D., & Zhao, H. (2024). Anydoor: Zero-shot object-level image customization. In CVPR (6593\u20136602).","DOI":"10.1109\/CVPR52733.2024.00630"},{"key":"2334_CR10","doi-asserted-by":"crossref","unstructured":"Choi, J., Kim, S., Jeong, Y., Gwon, Y., & Yoon, S. (2021) Ilvr: Conditioning method for denoising diffusion probabilistic models. arXiv preprint arXiv:2108.02938.","DOI":"10.1109\/ICCV48922.2021.01410"},{"key":"2334_CR11","doi-asserted-by":"crossref","unstructured":"Collins, E., Bala, R., Price, B., & Susstrunk, S. (2020). Editing in style: Uncovering the local semantics of gans. In CVPR (5771\u20135780).","DOI":"10.1109\/CVPR42600.2020.00581"},{"key":"2334_CR12","doi-asserted-by":"crossref","unstructured":"Cong, W., Zhang, J., Niu, L., Liu, L., Ling, Z., Li, W., & Zhang, L. (2020). Dovenet: Deep image harmonization via domain verification. In CVPR (8394\u20138403).","DOI":"10.1109\/CVPR42600.2020.00842"},{"key":"2334_CR13","doi-asserted-by":"crossref","unstructured":"Couairon, G., Grechka, A., Verbeek, J., Schwenk, H., Cord, M. (2022). Flexit: Towards flexible semantic image translation. In CVPR (pp. 18270\u201318279)","DOI":"10.1109\/CVPR52688.2022.01773"},{"key":"2334_CR14","unstructured":"Couairon, G., Verbeek, J., Schwenk, H., & Cord, M. (2023). Diffedit: Diffusion-based semantic image editing with mask guidance. In ICLR."},{"key":"2334_CR15","doi-asserted-by":"crossref","unstructured":"Crowson, K., Biderman, S., Kornis, D., Stander, D., Hallahan, E., Castricato, L., & Raff, E. (2022). Vqgan-clip: Open domain image generation and editing with natural language guidance. In ECCV (pp. 88\u2013105).","DOI":"10.1007\/978-3-031-19836-6_6"},{"key":"2334_CR16","unstructured":"Ding, M., Yang, Z., Hong, W., Zheng, W., Zhou, C., Yin, D., Lin, J., Zou, X., Shao, Z., Yang, H., Tang, J. (2021). Cogview: Mastering text-to-image generation via transformers. In NeurIPS (19822\u201319835)."},{"key":"2334_CR17","unstructured":"Fu, T. J., Hu, W., Du, X., Wang, W. Y., Yang, Y., Gan, Z. (2024). Guiding instruction-based image editing via multimodal large language models. In ICLR."},{"key":"2334_CR18","unstructured":"Gal, R., Alaluf, Y., Atzmon, Y., Patashnik, O., Bermano, A. H., Chechik, G., & Cohen-Or, D. (2023). An image is worth one word: Personalizing text-to-image generation using textual inversion. In ICLR."},{"key":"2334_CR19","doi-asserted-by":"crossref","unstructured":"Gal, R., Arar, M., Atzmon, Y., Bermano, A.H., Chechik, G., & Cohen-Or, D. (2023). Designing an encoder for fast personalization of text-to-image models. In Siggraph.","DOI":"10.1145\/3610548.3618173"},{"key":"2334_CR20","unstructured":"Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., & Bengio, Y. (2014). Generative adversarial nets. In NeurIPS (pp. 2672\u20132680)."},{"key":"2334_CR21","unstructured":"Goodfellow, I., Pouget-Abadie, J., Mirza, M., Xu, B., Warde-Farley, D., Ozair, S., Courville, A., Bengio, Y. (2014) Generative adversarial nets. In NeurIPS (Vol.\u00a027)."},{"key":"2334_CR22","doi-asserted-by":"crossref","unstructured":"Gu, S., Bao, J., Chen, D., & Wen, F. (2020). Giqa: Generated image quality assessment. In ECCV (pp. 369\u2013385).","DOI":"10.1007\/978-3-030-58621-8_22"},{"key":"2334_CR23","unstructured":"Gu, Y., Wang, X., Wu, J.Z., Shi, Y., Chen, Y., Fan, Z., Xiao, W., Zhao, R., Chang, S., Wu, W., et\u00a0al. (2024). Mix-of-show: Decentralized low-rank adaptation for multi-concept customization of diffusion models. In NeurIPS (pp. 15890\u201315902)."},{"key":"2334_CR24","doi-asserted-by":"crossref","unstructured":"Gupta, A., Satkin, S., Efros, A. A., & Hebert, M. (2011). From 3d scene geometry to human workspace. In CVPR (pp. 1961\u20131968).","DOI":"10.1109\/CVPR.2011.5995448"},{"key":"2334_CR25","doi-asserted-by":"crossref","unstructured":"Han, L., Li, Y., Zhang, H., Milanfar, P., Metaxas, D., & Yang, F. (2023). Svdiff: Compact parameter space for diffusion fine-tuning. In ICCV (pp. 7323\u20137334).","DOI":"10.1109\/ICCV51070.2023.00673"},{"key":"2334_CR26","doi-asserted-by":"crossref","unstructured":"Han, L., Wen, S., Chen, Q., Zhang, Z., Song, K., Ren, M., Gao, R., Stathopoulos, A., He, X., Chen, Y., et\u00a0al. (2024). Proxedit: Improving tuning-free real image editing with proximal guidance. In WACV (pp. 4291\u20134301).","DOI":"10.1109\/WACV57701.2024.00424"},{"key":"2334_CR27","unstructured":"H\u00e4rk\u00f6nen, E., Hertzmann, A., Lehtinen, J., & Paris, S. (2020). Ganspace: Discovering interpretable gan controls. In NeurIPS (pp. 9841\u20139850)."},{"key":"2334_CR28","unstructured":"Hertz, A., Mokady, R., Tenenbaum, J., Aberman, K., Pritch, Y., & Cohen-Or, D. (2023). Prompt-to-prompt image editing with cross attention control. In ICLR."},{"key":"2334_CR29","doi-asserted-by":"crossref","unstructured":"Karras, T., Laine, S., & Aila, T. (2019) A style-based generator architecture for generative adversarial networks. In CVPR (pp. 4401\u20134410).","DOI":"10.1109\/CVPR.2019.00453"},{"key":"2334_CR30","doi-asserted-by":"crossref","unstructured":"Kawar, B., Zada, S., Lang, O., Tov, O., Chang, H., Dekel, T., Mosseri, I., & Irani, M. (2022). Imagic: Text-based real image editing with diffusion models. In CVPR (pp. 6007\u20136017).","DOI":"10.1109\/CVPR52729.2023.00582"},{"key":"2334_CR31","doi-asserted-by":"crossref","unstructured":"Kim, Y., Lee, J., Kim, J. H., Ha, J. W., Zhu, J. Y. (2023). Dense text-to-image generation with attention modulation. In ICCV (pp. 7701\u20137711).","DOI":"10.1109\/ICCV51070.2023.00708"},{"key":"2334_CR32","doi-asserted-by":"crossref","unstructured":"Kulal, S., Brooks, T., Aiken, A., Wu, J., Yang, J., Lu, J., Efros, A. A., Singh, K. K. (2023). Putting people in their place: Affordance-aware human insertion into scenes. In CVPR (pp. 17089\u201317099).","DOI":"10.1109\/CVPR52729.2023.01639"},{"key":"2334_CR33","doi-asserted-by":"crossref","unstructured":"Kumari, N., Zhang, B., Zhang, R., Shechtman, E., & Zhu, J. Y. (2023). Multi-concept customization of text-to-image diffusion. In CVPR (pp. 1931\u20131941).","DOI":"10.1109\/CVPR52729.2023.00192"},{"key":"2334_CR34","unstructured":"Li, B., Qi, X., Lukasiewicz, T., Torr, P. (2019). Controllable text-to-image generation. In NeurIPS (pp. 2065\u20132075)."},{"key":"2334_CR35","doi-asserted-by":"crossref","unstructured":"Li, S., Zeng, B., Feng, Y., Gao, S., Liu, X., Liu, J., Li, L., Tang, X., Hu, Y., Liu, J., et\u00a0al. (2024). Zone: Zero-shot instruction-guided local editing. In CVPR (pp. 6254\u20136263).","DOI":"10.1109\/CVPR52733.2024.00598"},{"key":"2334_CR36","doi-asserted-by":"crossref","unstructured":"Lin, C.H., Yumer, E., Wang, O., Shechtman, E., Lucey, S. (2018). St-gan: Spatial transformer generative adversarial networks for image compositing. In CVPR (pp. 9455\u20139464).","DOI":"10.1109\/CVPR.2018.00985"},{"key":"2334_CR37","doi-asserted-by":"crossref","unstructured":"Liu, D., Long, C., Zhang, H., Yu, H., Dong, X., & Xiao, C. (2020). Arshadowgan: Shadow generative adversarial network for augmented reality in single light scenes. In CVPR (pp. 8139\u20138148).","DOI":"10.1109\/CVPR42600.2020.00816"},{"key":"2334_CR38","unstructured":"Liu, Z., Feng, R., Zhu, K., Zhang, Y., Zheng, K., Liu, Y., Zhao, D., Zhou, J., & Cao, Y. (2023). Cones: Concept neurons in diffusion models for customized generation. arXiv preprint arXiv:2303.05125."},{"key":"2334_CR39","unstructured":"Lu, L., Zhang, B., Niu, L. (2023). Dreamcom: Finetuning text-guided inpainting model for image composition. arXiv preprint arXiv:2309.15508."},{"key":"2334_CR40","doi-asserted-by":"crossref","unstructured":"Lu, S., Liu, Y., Kong, A. W. K. (2023). Tf-icon: Diffusion-based training-free cross-domain image composition. In ICCV (pp. 2294\u20132305).","DOI":"10.1109\/ICCV51070.2023.00218"},{"key":"2334_CR41","unstructured":"Mansimov, E., Parisotto, E., Ba, J. L., Salakhutdinov, R. (2015). Generating images from captions with attention. In ICLR."},{"key":"2334_CR42","unstructured":"Meng, C., Song, Y., Song, J., Wu, J., Zhu, J. Y., & Ermon, S. (2021). Sdedit: Image synthesis and editing with stochastic differential equations. arXiv preprint arXiv:2108.01073."},{"key":"2334_CR43","doi-asserted-by":"crossref","unstructured":"Mokady, R., Hertz, A., Aberman, K., Pritch, Y., & Cohen-Or, D. (2023). Null-text inversion for editing real images using guided diffusion models. In CVPR (pp. 6038\u20136047.","DOI":"10.1109\/CVPR52729.2023.00585"},{"key":"2334_CR44","first-page":"9598","volume":"36","author":"T Nguyen","year":"2024","unstructured":"Nguyen, T., Li, Y., Ojha, U., & Lee, Y. J. (2024). Visual instruction inversion: Image editing via image prompting. NeurIPS, 36, 9598\u20139613.","journal-title":"NeurIPS"},{"key":"2334_CR45","unstructured":"Nichol, A., Dhariwal, P., Ramesh, A., Shyam, P., Mishkin, P., McGrew, B., Sutskever, I., Chen, M. (2022). Glide: Towards photorealistic image generation and editing with text-guided diffusion models. In ICML (pp. 16784\u201316804)."},{"key":"2334_CR46","doi-asserted-by":"crossref","unstructured":"Niu, L., Cao, J., Cong, W., & Zhang, L. (2023). Deep image harmonization with learnable augmentation. In ICCV (pp. 7482\u20137491).","DOI":"10.1109\/ICCV51070.2023.00688"},{"key":"2334_CR47","unstructured":"Niu, L., Cong, W., Liu, L., Hong, Y., Zhang, B., Liang, J., & Zhang, L. (2021) Making images real again: A comprehensive survey on deep image."},{"key":"2334_CR48","doi-asserted-by":"crossref","unstructured":"Patashnik, O., Wu, Z., Shechtman, E., Cohen-Or, D., Lischinski, D. (2021). Styleclip: Text-driven manipulation of stylegan imagery. In ICCV (pp. 2085\u20132094).","DOI":"10.1109\/ICCV48922.2021.00209"},{"key":"2334_CR49","unstructured":"Podell, D., English, Z., Lacey, K., Blattmann, A., Dockhorn, T., M\u00fcller, J., Penna, J., & Rombach, R. (2023). Sdxl: Improving latent diffusion models for high-resolution image synthesis. arXiv preprint arXiv:2307.01952."},{"key":"2334_CR50","unstructured":"Radford, A., Kim, J.W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et\u00a0al. (2021). Learning transferable visual models from natural language supervision. In ICML (pp. 8748\u20138763)."},{"key":"2334_CR51","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., & Chen, M. (2022). Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125."},{"key":"2334_CR52","unstructured":"Ramesh, A., Pavlov, M., Goh, G., Gray, S., Voss, C., Radford, A., Chen, M., Sutskever, I. (2021). Zero-shot text-to-image generation. In ICML (pp. 8821\u20138831)."},{"key":"2334_CR53","unstructured":"Reed, S., Akata, Z., Yan, X., Logeswaran, L., Schiele, B., & Lee, H. (2016). Generative adversarial text to image synthesis. In ICML (pp. 1060\u20131069)."},{"key":"2334_CR54","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., & Ommer, B. (2022). High-resolution image synthesis with latent diffusion models. In CVPR (10684\u201310695).","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"2334_CR55","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., Brox, T. (2015). U-Net: Convolutional networks for biomedical image segmentation. In MICCAI (pp. 234\u2013241).","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"2334_CR56","doi-asserted-by":"crossref","unstructured":"Ruiz, N., Li, Y., Jampani, V., Pritch, Y., Rubinstein, M., Aberman, K. (2023). Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation. In CVPR (pp. 22500\u201322510).","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"2334_CR57","doi-asserted-by":"crossref","unstructured":"Saharia, C., Chan, W., Saxena, S., Li, L., Whang, J., Denton, E.L., Ghasemipour, K., Gontijo\u00a0Lopes, R., Karagol\u00a0Ayan, B., Salimans, T., et\u00a0al. (2022). Photorealistic text-to-image diffusion models with deep language understanding. In NeurIPS (36479\u201336494).","DOI":"10.1145\/3528233.3530757"},{"key":"2334_CR58","unstructured":"Stable diffusion. https:\/\/huggingface.co\/CompVis\/stable-diffusion-v-1-4-original (2022). Version 1.4"},{"key":"2334_CR59","unstructured":"Schuhmann, C., Vencu, R., Beaumont, R., Kaczmarczyk, R., Mullis, C., Katta, A., Coombes, T., Jitsev, J., & Komatsuzaki, A. (2021). Laion-400m: Open dataset of clip-filtered 400 million image-text pairs. arXiv preprint arXiv:2111.02114."},{"key":"2334_CR60","doi-asserted-by":"crossref","unstructured":"Shen, Y., Gu, J., Tang, X., & Zhou, B. (2020). Interpreting the latent space of gans for semantic face editing. In CVPR (pp. 9243\u20139252).","DOI":"10.1109\/CVPR42600.2020.00926"},{"key":"2334_CR61","unstructured":"Sohl-Dickstein, J., Weiss, E., Maheswaranathan, N., & Ganguli, S. (2015). Deep unsupervised learning using nonequilibrium thermodynamics. In ICML (pp. 2256\u20132265)."},{"key":"2334_CR62","unstructured":"Song, J., Meng, C., & Ermon, S. (2021). Denoising diffusion implicit models. In ICLR."},{"key":"2334_CR63","doi-asserted-by":"crossref","unstructured":"Song, Y., Zhang, Z., Lin, Z., Cohen, S., Price, B., Zhang, J., Kim, S.Y., & Aliaga, D. (2023). Objectstitch: Object compositing with diffusion model. In CVPR (pp. 18310\u201318319).","DOI":"10.1109\/CVPR52729.2023.01756"},{"key":"2334_CR64","doi-asserted-by":"crossref","unstructured":"Tewel, Y., Gal, R., Chechik, G., & Atzmon, Y. (2023). Key-locked rank one editing for text-to-image personalization. In ACM SIGGRAPH (pp. 1\u201311).","DOI":"10.1145\/3588432.3591506"},{"key":"2334_CR65","doi-asserted-by":"crossref","unstructured":"Tumanyan, N., Geyer, M., Bagon, S., & Dekel, T. (2023). Plug-and-play diffusion features for text-driven image-to-image translation. In CVPR (pp. 1921\u20131930).","DOI":"10.1109\/CVPR52729.2023.00191"},{"key":"2334_CR66","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., & Polosukhin, I. (2017). Attention is all you need. In NeurIPS (pp. 5998\u20136008)."},{"key":"2334_CR67","doi-asserted-by":"crossref","unstructured":"Wang, T., Zhang, Y., Fan, Y., Wang, J., & Chen, Q. (2022). High-fidelity gan inversion for image attribute editing. In Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition (pp. 11379\u201311388).","DOI":"10.1109\/CVPR52688.2022.01109"},{"key":"2334_CR68","doi-asserted-by":"crossref","unstructured":"Wang, X., Girdhar, R., & Gupta, A. (2017). Binge watching: Scaling affordance learning from sitcoms. In CVPR (2596\u20132605).","DOI":"10.1109\/CVPR.2017.359"},{"key":"2334_CR69","doi-asserted-by":"crossref","unstructured":"Wei, Y., Zhang, Y., Ji, Z., Bai, J., Zhang, L., & Zuo, W. (2023). Elite: Encoding visual concepts into textual embeddings for customized text-to-image generation. In ICCV (pp. 15943\u201315953)","DOI":"10.1109\/ICCV51070.2023.01461"},{"key":"2334_CR70","doi-asserted-by":"crossref","unstructured":"Wu, C., Liang, J., Ji, L., Yang, F., Fang, Y., Jiang, D., & Duan, N. (2022). N\u00fcwa: Visual synthesis pre-training for neural visual world creation. In ECCV (pp. 720\u2013736).","DOI":"10.1007\/978-3-031-19787-1_41"},{"key":"2334_CR71","doi-asserted-by":"crossref","unstructured":"Xiao, G., Yin, T., Freeman, W.T., Durand, F., Han, S. (2023). Fastcomposer: Tuning-free multi-subject image generation with localized attention. arXiv preprint arXiv:2305.10431.","DOI":"10.1007\/s11263-024-02227-z"},{"key":"2334_CR72","doi-asserted-by":"crossref","unstructured":"Xie, S., Zhang, Z., Lin, Z., Hinz, T., Zhang, K.: Smartbrush: Text and shape guided object inpainting with diffusion model. In CVPR (pp. 22428\u201322437).","DOI":"10.1109\/CVPR52729.2023.02148"},{"key":"2334_CR73","doi-asserted-by":"crossref","unstructured":"Xu, N., Price, B., Cohen, S., & Huang, T. (2017). Deep image matting. In CVPR (pp. 2970\u20132979).","DOI":"10.1109\/CVPR.2017.41"},{"key":"2334_CR74","doi-asserted-by":"crossref","unstructured":"Xu, S., Huang, Y., Pan, J., Ma, Z., & Chai, J. (2024). Inversion-free image editing with language-guided diffusion models. In CVPR (pp. 9452\u20139461).","DOI":"10.1109\/CVPR52733.2024.00903"},{"key":"2334_CR75","doi-asserted-by":"crossref","unstructured":"Xu, T., Zhang, P., Huang, Q., Zhang, H., Gan, Z., Huang, X., & He, X. (2018). Attngan: Fine-grained text to image generation with attentional generative adversarial networks. In CVPR (pp. 1316\u20131324).","DOI":"10.1109\/CVPR.2018.00143"},{"key":"2334_CR76","doi-asserted-by":"crossref","unstructured":"Xue, B., Ran, S., Chen, Q., Jia, R., Zhao, B., & Tang, X. (2022). Dccf: Deep comprehensible color filter learning framework for high-resolution image harmonization. In ECCV (pp. 300\u2013316).","DOI":"10.1007\/978-3-031-20071-7_18"},{"key":"2334_CR77","doi-asserted-by":"crossref","unstructured":"Xue, H., Huang, Z., Sun, Q., Song, L., & Zhang, W. (2023). Freestyle layout-to-image synthesis. In CVPR (pp. 14256\u201314266).","DOI":"10.1109\/CVPR52729.2023.01370"},{"key":"2334_CR78","doi-asserted-by":"crossref","unstructured":"Yang, B., Gu, S., Zhang, B., Zhang, T., Chen, X., Sun, X., Chen, D., & Wen, F. (2023). Paint by example: Exemplar-based image editing with diffusion models. In CVPR (pp. 18381\u201318391).","DOI":"10.1109\/CVPR52729.2023.01763"},{"key":"2334_CR79","unstructured":"Yu, J., Xu, Y., Koh, J.Y., Luong, T., Baid, G., Wang, Z., Vasudevan, V., Ku, A., Yang, Y., Ayan, B.K., et\u00a0al. (2022). Scaling autoregressive models for content-rich text-to-image generation. TMLR."},{"key":"2334_CR80","unstructured":"Zhang, C., Zhang, C., Zhang, M., & Kweon, I.S. (2023). Text-to-image diffusion model in generative AI: A survey. arXiv preprint arXiv:2303.07909."},{"key":"2334_CR81","unstructured":"Zhang, H., Xu, T., Li, H., Zhang, S., Wang, X., Huang, X., Metaxas, D.N.: Stackgan: Text to photo-realistic image synthesis with stacked generative adversarial networks. In ICCV (pp. 5907\u20135915)."},{"key":"2334_CR82","unstructured":"Zhang, K., Mo, L., Chen, W., Sun, H., Su, Y.: Magicbrush: A manually annotated dataset for instruction-guided image editing. In NeurIPS (pp. 31428\u201331449)."},{"key":"2334_CR83","doi-asserted-by":"crossref","unstructured":"Zhang, R., Isola, P., Efros, A.A., Shechtman, E., & Wang, O. (2018). The unreasonable effectiveness of deep features as a perceptual metric. In CVPR (pp. 586\u2013595).","DOI":"10.1109\/CVPR.2018.00068"},{"key":"2334_CR84","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Han, L., Ghosh, A., Metaxas, D. N., Ren, J. (2023). Sine: Single image editing with text-to-image diffusion models. In CVPR (pp. 6027\u20136037).","DOI":"10.1109\/CVPR52729.2023.00584"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02334-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-024-02334-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-024-02334-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,5,10]],"date-time":"2025-05-10T06:57:50Z","timestamp":1746860270000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-024-02334-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,14]]},"references-count":84,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2025,6]]}},"alternative-id":["2334"],"URL":"https:\/\/doi.org\/10.1007\/s11263-024-02334-x","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,14]]},"assertion":[{"value":"28 April 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 December 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"14 January 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no Conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}