{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,26]],"date-time":"2026-02-26T15:24:25Z","timestamp":1772119465579,"version":"3.50.1"},"reference-count":55,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2025,1,15]],"date-time":"2025-01-15T00:00:00Z","timestamp":1736899200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,1,15]],"date-time":"2025-01-15T00:00:00Z","timestamp":1736899200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62472303"],"award-info":[{"award-number":["62472303"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U21B2024"],"award-info":[{"award-number":["U21B2024"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2025,2]]},"DOI":"10.1007\/s00530-024-01633-0","type":"journal-article","created":{"date-parts":[[2025,1,15]],"date-time":"2025-01-15T04:49:11Z","timestamp":1736916551000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Counterfactual GAN for debiased text-to-image synthesis"],"prefix":"10.1007","volume":"31","author":[{"given":"Xianghua","family":"Kong","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ning","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zefang","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhewen","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bolun","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chenggang","family":"Yan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinbo","family":"Cao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rongbao","family":"Kang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"An-An","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,1,15]]},"reference":[{"key":"1633_CR1","doi-asserted-by":"crossref","unstructured":"Abbasnejad, E., et al.: Counterfactual vision and language learning. In: CVPR, pp. 10044\u201310054 (2020)","DOI":"10.1109\/CVPR42600.2020.01006"},{"key":"1633_CR2","doi-asserted-by":"crossref","unstructured":"Ashual, O., Wolf, L: Specifying object attributes and relations in interactive scene generation. In: ICCV, pp. 4561\u20134569 (2019)","DOI":"10.1109\/ICCV.2019.00466"},{"key":"1633_CR3","unstructured":"Brock, A., Donahue, J., Simonyan, K.: Large scale GAN training for high fidelity natural image synthesis. In: ICLR (2019)"},{"key":"1633_CR4","doi-asserted-by":"crossref","unstructured":"Chen, S., Zhao, Q.: Rex: reasoning-aware and grounded explanation. In: CVPR, pp.\u00a015586\u201315595 (2022)","DOI":"10.1109\/CVPR52688.2022.01514"},{"key":"1633_CR5","doi-asserted-by":"crossref","unstructured":"Chen, L., et al.: Counterfactual critic multi-agent training for scene graph generation. In: CVPR, pp.\u00a04613\u20134623 (2019)","DOI":"10.1109\/ICCV.2019.00471"},{"key":"1633_CR6","doi-asserted-by":"crossref","unstructured":"Chen, L., et al.: Counterfactual samples synthesizing for robust visual question answering. In: CVPR, pp.\u00a010800\u201310809 (2020)","DOI":"10.1109\/CVPR42600.2020.01081"},{"key":"1633_CR7","doi-asserted-by":"crossref","unstructured":"Chen, L., Zheng, Y., Xiao, J.: Rethinking data augmentation for robust visual question answering. In: ECCV, pp.\u00a095\u2013112 (2022)","DOI":"10.1007\/978-3-031-20059-5_6"},{"key":"1633_CR8","doi-asserted-by":"crossref","unstructured":"Cheng, J., et al.: Rifegan: rich feature generation for text-to-image synthesis from prior knowledge. In: CVPR, pp.\u00a010911\u201310920 (2020)","DOI":"10.1109\/CVPR42600.2020.01092"},{"key":"1633_CR9","doi-asserted-by":"publisher","unstructured":"El Bar, O., Licht, O., Yosephian, N.: Gilt: generating images from long text. https:\/\/doi.org\/10.48550\/arXiv.1901.02404 (2019)","DOI":"10.48550\/arXiv.1901.02404"},{"key":"1633_CR10","first-page":"2112","volume":"24","author":"F Feng","year":"2021","unstructured":"Feng, F., et al.: Modality disentangled discriminator for text-to-image synthesis. TMM 24, 2112\u20132124 (2021)","journal-title":"TMM"},{"key":"1633_CR11","doi-asserted-by":"publisher","unstructured":"Frolov, S., et al.: Leveraging visual question answering to improve text-to-image synthesis. https:\/\/doi.org\/10.48550\/arXiv.2010.14953 (2020)","DOI":"10.48550\/arXiv.2010.14953"},{"key":"1633_CR12","doi-asserted-by":"crossref","unstructured":"Han, S.C., et al.: VICTR: visual information captured text representation for text-to-image multimodal tasks. arXiv:2010.03182 (2020)","DOI":"10.18653\/v1\/2020.coling-main.277"},{"key":"1633_CR13","unstructured":"Heusel, M., et al.: Gans trained by a two time-scale update rule converge to a local nash equilibrium. In: NIPS 30 (2017)"},{"key":"1633_CR14","doi-asserted-by":"crossref","unstructured":"Hinz, T., Heinrich, S., Wermter, S.: Semantic object accuracy for generative text-to-image synthesis. In: TPAMI, vol. 44(3), pp. 1552\u20131565 (2020)","DOI":"10.1109\/TPAMI.2020.3021209"},{"key":"1633_CR15","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. Adv. Neural. Inf. Process. Syst. 33, 6840\u20136851 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"1633_CR16","unstructured":"Huang, W., Da Xu, R.Y., Oppermann, I.: Realistic image generation using region-phrase attention. In: ICML, pp.\u00a0284\u2013299 (2019)"},{"key":"1633_CR17","doi-asserted-by":"crossref","unstructured":"Isola, P., et al.: Image-to-image translation with conditional adversarial networks. In: CVPR, pp.\u00a01125\u20131134 (2017)","DOI":"10.1109\/CVPR.2017.632"},{"key":"1633_CR18","doi-asserted-by":"crossref","unstructured":"Johnson, J., Gupta, A., Fei-Fei, L.: Image generation from scene graphs. In: CVPR, pp.\u00a01219\u20131228 (2018)","DOI":"10.1109\/CVPR.2018.00133"},{"key":"1633_CR19","doi-asserted-by":"crossref","unstructured":"Joseph, K.J., et al.: C4synth: cross-caption cycle-consistent text-to-image synthesis. In: WACV. IEEE, pp.\u00a0358\u2013366 (2019)","DOI":"10.1109\/WACV.2019.00044"},{"key":"1633_CR20","doi-asserted-by":"publisher","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. https:\/\/doi.org\/10.48550\/arXiv.1412.6980 (2014)","DOI":"10.48550\/arXiv.1412.6980"},{"key":"1633_CR21","unstructured":"Li, B., et al.: Controllable text-to-image generation. In: NeurIPS, pp.\u00a02063\u20132073 (2019)"},{"key":"1633_CR22","doi-asserted-by":"crossref","unstructured":"Li, W., et al.: Object-driven text-to-image synthesis via adversarial training. In: CVPR (2019)","DOI":"10.1109\/CVPR.2019.01245"},{"key":"1633_CR23","doi-asserted-by":"crossref","unstructured":"Li, Y., et al.: Storygan: a sequential conditional gan for story visualization. In: CVPR, pp.\u00a06329\u20136338 (2019)","DOI":"10.1109\/CVPR.2019.00649"},{"key":"1633_CR24","doi-asserted-by":"crossref","unstructured":"Liao, W., et al.: Text to image generation with semantic-spatial aware gan. In: CVPR, pp.\u00a018187\u201318196 (2022)","DOI":"10.1109\/CVPR52688.2022.01765"},{"key":"1633_CR25","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., et al.: Microsoft coco: common objects in context. In: ECCV, pp.\u00a0740\u2013755 (2014)","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1633_CR26","doi-asserted-by":"crossref","unstructured":"Mihalcea, R., Tarau, P.: Textrank: bringing order into text. In: Proceedings of the 2004 Conference on Empirical Methods in Natural Language Processing, pp.\u00a0404\u2013411 (2004)","DOI":"10.3115\/1220575.1220627"},{"key":"1633_CR27","unstructured":"Mirza, M., Osindero, S.: Conditional generative adversarial nets. In: CoRR (2014)"},{"key":"1633_CR28","doi-asserted-by":"crossref","unstructured":"Niu, T., et al.: Image synthesis from locally related texts. In: Proceedings of the 2020 International Conference on Multimedia Retrieval, pp.\u00a0145\u2013153 (2020)","DOI":"10.1145\/3372278.3390684"},{"key":"1633_CR29","first-page":"3","volume-title":"Models, Reasoning and Inference","author":"J Pearl","year":"2000","unstructured":"Pearl, J., et al.: Models, Reasoning and Inference, vol. 19, 2nd edn., p. 3. Cambridge University Press, Cambridge, UK (2000)","edition":"2"},{"key":"1633_CR30","doi-asserted-by":"crossref","unstructured":"Qi, J., et al.: Two causal principles for improving visual dialog. In: CVPR. pp.\u00a010860\u201310869 (2020)","DOI":"10.1109\/CVPR42600.2020.01087"},{"key":"1633_CR31","unstructured":"Qiao, T., et al.: Learn, imagine and create: text-to-image generation from prior knowledge. In: NIPS 32 (2019)"},{"key":"1633_CR32","doi-asserted-by":"crossref","unstructured":"Qiao, T., et al.: MirrorGAN: learning text-to-image generation by redescription. In: CVPR, pp.\u00a01505\u20131514 (2019)","DOI":"10.1109\/CVPR.2019.00160"},{"key":"1633_CR33","doi-asserted-by":"crossref","unstructured":"Ruan, S., et al.: Dae-gan: dynamic aspect-aware gan for text-to-image synthesis. In: CVPR, pp.\u00a013960\u201313969 (2021)","DOI":"10.1109\/ICCV48922.2021.01370"},{"key":"1633_CR34","unstructured":"Salimans, T., et al.: Improved techniques for training gans. In: NIPS 29 (2016)"},{"key":"1633_CR35","doi-asserted-by":"crossref","unstructured":"Salvador, A., et al.: Learning cross-modal embeddings for cooking recipes and food images. In: CVPR, pp.\u00a03020\u20133028 (2017)","DOI":"10.1109\/CVPR.2017.327"},{"key":"1633_CR36","doi-asserted-by":"publisher","unstructured":"Sharma, S., et al.: Chatpainter: improving text to image generation using dialogue. https:\/\/doi.org\/10.48550\/arXiv.1802.08216 (2018)","DOI":"10.48550\/arXiv.1802.08216"},{"key":"1633_CR37","doi-asserted-by":"publisher","first-page":"1882","DOI":"10.1109\/TMM.2020.3004963","volume":"23","author":"G Song","year":"2020","unstructured":"Song, G., et al.: Learning feature representation and partial correlation for multimodal multi-label data. IIEEE Trans. Multimed. 23, 1882\u20131894 (2020)","journal-title":"IEEE Trans. Multimed."},{"key":"1633_CR38","doi-asserted-by":"crossref","unstructured":"Sun, J., et al.: Multi-caption text-to-face synthesis: dataset and algorithm. In: ACM MM, pp.\u00a02290\u20132298 (2021)","DOI":"10.1145\/3474085.3475391"},{"key":"1633_CR39","unstructured":"Sun, W., Wu, T.: Learning layout and style reconfigurable gans for controllable image synthesis. In: TPAMI, vol.44, 9th edn., pp.\u00a05070\u20135087 (2021)"},{"key":"1633_CR40","doi-asserted-by":"crossref","unstructured":"Tan, H., et al.: Semantics-enhanced adversarial nets for text-to-image synthesis. In: CVPR, pp.\u00a010501\u201310510 (2019)","DOI":"10.1109\/ICCV.2019.01060"},{"key":"1633_CR41","doi-asserted-by":"crossref","unstructured":"Tang, K., et al.: Unbiased scene graph generation from biased training. In: CVPR, pp.\u00a03716\u20133725 (2020)","DOI":"10.1109\/CVPR42600.2020.00377"},{"key":"1633_CR42","doi-asserted-by":"crossref","unstructured":"Tao, M., et al.: Df-gan: a simple and effective baseline for text-to-image synthesis. In: CVPR, pp.\u00a016515\u201316525 (2022)","DOI":"10.1109\/CVPR52688.2022.01602"},{"key":"1633_CR43","unstructured":"Wah, C., et al.: The caltech-ucsd birds-200-2011 dataset (2011)"},{"key":"1633_CR44","doi-asserted-by":"crossref","unstructured":"Wu, C., et al.: N\u00fcwa: visual synthesis pre-training for neural visual world creation. In: ECCV. Springer, pp.\u00a0720\u2013736 (2022)","DOI":"10.1007\/978-3-031-19787-1_41"},{"key":"1633_CR45","first-page":"8658","volume":"30","author":"W Xintian","year":"2021","unstructured":"Xintian, W., et al.: F$$^3$$A-GAN: facial flow for face animation with generative adversarial networks. TIP 30, 8658\u20138670 (2021)","journal-title":"TIP"},{"key":"1633_CR46","doi-asserted-by":"crossref","unstructured":"Xiao, S., et al.: Rethinking multi-modal alignment in multi-choice VideoQA from feature and sample perspectives. In: EMNLP, pp.\u00a08188\u20138198 (2022)","DOI":"10.18653\/v1\/2022.emnlp-main.561"},{"key":"1633_CR47","doi-asserted-by":"crossref","unstructured":"Xu, T., et al.: Attngan: fine-grained text to image generation with attentional generative adversarial networks. In: CVPR, pp.\u00a01316\u20131324 (2018)","DOI":"10.1109\/CVPR.2018.00143"},{"key":"1633_CR48","doi-asserted-by":"crossref","unstructured":"Yang, X., Zhang, H., Cai, J.: Deconfounded image captioning: a causal retrospect. In: TPAMI (2021)","DOI":"10.1109\/TPAMI.2021.3121705"},{"key":"1633_CR49","first-page":"2798","volume":"30","author":"Y Yang","year":"2021","unstructured":"Yang, Y., et al.: Multi-sentence auxiliary adversarial networks for fine-grained text-to-image synthesis. TIP 30, 2798\u20132809 (2021)","journal-title":"TIP"},{"key":"1633_CR50","doi-asserted-by":"crossref","unstructured":"Zhang, H., Xu, T., Li, H.: StackGAN: text to photo-realistic image synthesis with stacked generative adversarial networks. In: ICCV, pp.\u00a05908\u20135916 (2017)","DOI":"10.1109\/ICCV.2017.629"},{"key":"1633_CR51","doi-asserted-by":"crossref","unstructured":"Zhang, H., et al.: Stackgan++: realistic image synthesis with stacked generative adversarial networks. In: TPAMI, pp.\u00a01947\u20131962 (2018)","DOI":"10.1109\/TPAMI.2018.2856256"},{"key":"1633_CR52","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Schomaker, L.: Dtgan: dual attention generative adversarial networks for text-to-image generation. In: IJCNN (2021)","DOI":"10.1109\/IJCNN52387.2021.9533527"},{"key":"1633_CR53","doi-asserted-by":"crossref","unstructured":"Zhao, B., et al.: Image generation from layout. In: CVPR, pp.\u00a08584\u20138593 (2019)","DOI":"10.1109\/CVPR.2019.00878"},{"key":"1633_CR54","doi-asserted-by":"crossref","unstructured":"Zhu, M., et al.: \u201cDM-GAN: Dynamic Memory Generative Adversarial Networks for Text-To-Image Synthesis\u201d. In: CVPR. pp.\u00a05802\u20135810 (2019)","DOI":"10.1109\/CVPR.2019.00595"},{"key":"1633_CR55","doi-asserted-by":"crossref","unstructured":"Zhu, B., Ngo, C.-W.: CookGAN: causality based text-to-image synthesis. In: CVPR, pp.\u00a05519\u20135527 (2020)","DOI":"10.1109\/CVPR42600.2020.00556"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-024-01633-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-024-01633-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-024-01633-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,2,28]],"date-time":"2025-02-28T06:04:12Z","timestamp":1740722652000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-024-01633-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,1,15]]},"references-count":55,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2025,2]]}},"alternative-id":["1633"],"URL":"https:\/\/doi.org\/10.1007\/s00530-024-01633-0","relation":{"has-preprint":[{"id-type":"doi","id":"10.21203\/rs.3.rs-5177265\/v1","asserted-by":"object"}]},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,1,15]]},"assertion":[{"value":"30 September 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 December 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"15 January 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"69"}}