{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,5]],"date-time":"2026-03-05T01:41:19Z","timestamp":1772674879294,"version":"3.50.1"},"publisher-location":"Cham","reference-count":29,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031876592","type":"print"},{"value":"9783031876608","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-87660-8_25","type":"book-chapter","created":{"date-parts":[[2025,4,29]],"date-time":"2025-04-29T12:04:41Z","timestamp":1745928281000},"page":"337-352","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Controllable Face Synthesis with\u00a0Semantic Latent Diffusion Models"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-8110-9714","authenticated-orcid":false,"given":"Alex","family":"Ergasti","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9465-6753","authenticated-orcid":false,"given":"Claudio","family":"Ferrari","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6595-4874","authenticated-orcid":false,"given":"Tomaso","family":"Fontanini","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1463-5384","authenticated-orcid":false,"given":"Massimo","family":"Bertozzi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1211-529X","authenticated-orcid":false,"given":"Andrea","family":"Prati","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,4,30]]},"reference":[{"key":"25_CR1","unstructured":"Baranchuk, D., Rubachev, I., Voynov, A., Khrulkov, V., Babenko, A.: Label-efficient semantic segmentation with diffusion models. arXiv preprint arXiv:2112.03126 (2021)"},{"key":"25_CR2","doi-asserted-by":"crossref","unstructured":"Croitoru, F.A., Hondru, V., Ionescu, R.T., Shah, M.: Diffusion models in vision: A survey. IEEE Trans. Pattern Anal. Mach. Intell. (2023)","DOI":"10.1109\/TPAMI.2023.3261988"},{"key":"25_CR3","unstructured":"Dhariwal, P., Nichol, A.: Diffusion models beat gans on image synthesis. CoRR abs\/2105.05233 (2021). https:\/\/arxiv.org\/abs\/2105.05233"},{"key":"25_CR4","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1016\/j.patrec.2023.10.010","volume":"176","author":"T Fontanini","year":"2023","unstructured":"Fontanini, T., Ferrari, C., Lisanti, G., Galteri, L., Berretti, S., Bertozzi, M., Prati, A.: Frankenmask: manipulating semantic masks with transformers for face parts editing. Pattern Recogn. Lett. 176, 14\u201320 (2023)","journal-title":"Pattern Recogn. Lett."},{"key":"25_CR5","unstructured":"Gal, R., et al.: An image is worth one word: Personalizing text-to-image generation using textual inversion (2022)"},{"key":"25_CR6","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"25_CR7","unstructured":"Heusel, M., Ramsauer, H., Unterthiner, T., Nessler, B., Hochreiter, S.: Gans trained by a two time-scale update rule converge to a local nash equilibrium. Advances in neural information processing systems 30 (2017)"},{"key":"25_CR8","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models (2020)"},{"key":"25_CR9","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. CoRR abs\/2006.11239 (2020). https:\/\/arxiv.org\/abs\/2006.11239"},{"key":"25_CR10","unstructured":"Ho, J., Salimans, T.: Classifier-free diffusion guidance. In: NeurIPS 2021 Workshop on Deep Generative Models and Downstream Applications (2021). https:\/\/openreview.net\/forum?id=qw8AKxfYbI"},{"key":"25_CR11","unstructured":"Huang, L., Chen, D., Liu, Y., Shen, Y., Zhao, D., Zhou, J.: Composer: Creative and controllable image synthesis with composable conditions (2023)"},{"key":"25_CR12","doi-asserted-by":"crossref","unstructured":"Huang, Z., Chan, K.C.K., Jiang, Y., Liu, Z.: Collaborative diffusion for multi-modal face generation and editing (2023)","DOI":"10.1109\/CVPR52729.2023.00589"},{"key":"25_CR13","doi-asserted-by":"crossref","unstructured":"Karras, T., Laine, S., Aila, T.: A style-based generator architecture for generative adversarial networks (2019)","DOI":"10.1109\/CVPR.2019.00453"},{"key":"25_CR14","doi-asserted-by":"crossref","unstructured":"Lee, C.H., Liu, Z., Wu, L., Luo, P.: Maskgan: towards diverse and interactive facial image manipulation (2020)","DOI":"10.1109\/CVPR42600.2020.00559"},{"key":"25_CR15","unstructured":"liuziwei7: Celebamask-hq. https:\/\/github.com\/switchablenorms\/CelebAMask-HQ\/tree\/master\/face_parsing"},{"key":"25_CR16","doi-asserted-by":"crossref","unstructured":"Mou, C., et al.: T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models. arXiv preprint arXiv:2302.08453 (2023)","DOI":"10.1609\/aaai.v38i5.28226"},{"key":"25_CR17","doi-asserted-by":"crossref","unstructured":"Park, T., Liu, M.Y., Wang, T.C., Zhu, J.Y.: Semantic image synthesis with spatially-adaptive normalization (2019)","DOI":"10.1109\/CVPR.2019.00244"},{"key":"25_CR18","doi-asserted-by":"crossref","unstructured":"Richardson, E., et al.: Encoding in style: a stylegan encoder for image-to-image translation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2287\u20132296 (2021)","DOI":"10.1109\/CVPR46437.2021.00232"},{"key":"25_CR19","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"25_CR20","doi-asserted-by":"crossref","unstructured":"Ruiz, N., Li, Y., Jampani, V., Pritch, Y., Rubinstein, M., Aberman, K.: Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation (2023)","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"25_CR21","doi-asserted-by":"crossref","unstructured":"Shi, Y., Yang, X., Wan, Y., Shen, X.: Semanticstylegan: learning compositional generative priors for controllable image synthesis and editing (2022)","DOI":"10.1109\/CVPR52688.2022.01097"},{"key":"25_CR22","unstructured":"Song, J., Meng, C., Ermon, S.: Denoising diffusion implicit models (2022)"},{"key":"25_CR23","doi-asserted-by":"crossref","unstructured":"Tan, Z., et al.: Diverse semantic image synthesis via probability distribution modeling. In: IEEE\/CVF Conf. on Computer Vision and Pattern Recognition, pp. 7962\u20137971 (2021)","DOI":"10.1109\/CVPR46437.2021.00787"},{"key":"25_CR24","doi-asserted-by":"crossref","unstructured":"Tan, Z., et al.: Efficient semantic image synthesis via class-adaptive normalization (2021)","DOI":"10.1109\/TPAMI.2021.3076487"},{"key":"25_CR25","doi-asserted-by":"crossref","unstructured":"Tarollo, G., Fontanini, T., Ferrari, C., Borghi, G., Prati, A.: Adversarial identity injection for semantic face image synthesis. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 1471\u20131480 (2024)","DOI":"10.1109\/CVPRW63382.2024.00154"},{"key":"25_CR26","unstructured":"Wang, W., et al.: Semantic image synthesis via diffusion models (2022)"},{"key":"25_CR27","doi-asserted-by":"crossref","unstructured":"Zhang, L., Rao, A., Agrawala, M.: Adding conditional control to text-to-image diffusion models (2023)","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"25_CR28","doi-asserted-by":"crossref","unstructured":"Zhu, J., Shen, Y., Zhao, D., Zhou, B.: In-domain gan inversion for real image editing. In: European Conference on Computer Vision, pp. 592\u2013608. Springer (2020)","DOI":"10.1007\/978-3-030-58520-4_35"},{"key":"25_CR29","doi-asserted-by":"publisher","unstructured":"Zhu, P., Abdal, R., Qin, Y., Wonka, P.: Sean: Image synthesis with semantic region-adaptive normalization. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). IEEE, June 2020. https:\/\/doi.org\/10.1109\/cvpr42600.2020.00515","DOI":"10.1109\/cvpr42600.2020.00515"}],"container-title":["Lecture Notes in Computer Science","Pattern Recognition. ICPR 2024 International Workshops and Challenges"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-87660-8_25","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,4,29]],"date-time":"2025-04-29T12:05:17Z","timestamp":1745928317000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-87660-8_25"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"ISBN":["9783031876592","9783031876608"],"references-count":29,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-87660-8_25","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]},"assertion":[{"value":"30 April 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICPR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Pattern Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Kolkata","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"India","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"1 December 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 December 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"27","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icpr2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/icpr2024.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}