{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,25]],"date-time":"2026-07-25T01:43:35Z","timestamp":1784943815767,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":65,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3612012","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:30Z","timestamp":1698391650000},"page":"643-654","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":83,"title":["LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-6555-3834","authenticated-orcid":false,"given":"Leigang","family":"Qu","sequence":"first","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6192-1194","authenticated-orcid":false,"given":"Shengqiong","family":"Wu","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3026-6347","authenticated-orcid":false,"given":"Hao","family":"Fei","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1476-0273","authenticated-orcid":false,"given":"Liqiang","family":"Nie","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology (Shenzhen), Shenzhen, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6097-7807","authenticated-orcid":false,"given":"Tat-Seng","family":"Chua","sequence":"additional","affiliation":[{"name":"National University of Singapore, Singapore, Singapore"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"SpaText: Spatio-Textual Representation for Controllable Image Generation. CoRR","author":"Avrahami Omri","year":"2022","unstructured":"Omri Avrahami, Thomas Hayes, Oran Gafni, Sonal Gupta, Yaniv Taigman, Devi Parikh, Dani Lischinski, Ohad Fried, and Xi Yin. 2022. SpaText: Spatio-Textual Representation for Controllable Image Generation. CoRR, Vol. abs\/2211.14305 (2022)."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Jianmin Bao Dong Chen Fang Wen Houqiang Li and Gang Hua. 2017. CVAE-GAN: Fine-Grained Image Generation through Asymmetric Training. In ICCV. 2764--2773.","DOI":"10.1109\/ICCV.2017.299"},{"key":"e_1_3_2_1_3_1","volume-title":"MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation. CoRR","author":"Bar-Tal Omer","year":"2023","unstructured":"Omer Bar-Tal, Lior Yariv, Yaron Lipman, and Tali Dekel. 2023. MultiDiffusion: Fusing Diffusion Paths for Controlled Image Generation. CoRR, Vol. abs\/2302.08113 (2023)."},{"key":"e_1_3_2_1_4_1","volume-title":"Natural language processing with Python: analyzing text with the natural language toolkit. \"O'Reilly Media","author":"Bird Steven","unstructured":"Steven Bird, Ewan Klein, and Edward Loper. 2009. Natural language processing with Python: analyzing text with the natural language toolkit. \"O'Reilly Media, Inc.\"."},{"key":"e_1_3_2_1_5_1","volume-title":"Freeman","author":"Chang Huiwen","year":"2022","unstructured":"Huiwen Chang, Han Zhang, Lu Jiang, Ce Liu, and William T. Freeman. 2022. MaskGIT: Masked Generative Image Transformer. In CVPR. 11305--11315."},{"key":"e_1_3_2_1_6_1","volume-title":"LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation. CoRR","author":"Cheng Jiaxin","year":"2023","unstructured":"Jiaxin Cheng, Xiao Liang, Xingjian Shi, Tong He, Tianjun Xiao, and Mu Li. 2023. LayoutDiffuse: Adapting Foundational Diffusion Models for Layout-to-Image Generation. CoRR, Vol. abs\/2302.08908 (2023)."},{"key":"e_1_3_2_1_7_1","unstructured":"Aakanksha Chowdhery Sharan Narang Jacob Devlin Maarten Bosma Gaurav Mishra Adam Roberts Paul Barham Hyung Won Chung Charles Sutton Sebastian Gehrmann Parker Schuh Kensen Shi Sasha Tsvyashchenko Joshua Maynez Abhishek Rao Parker Barnes Yi Tay Noam Shazeer Vinodkumar Prabhakaran Emily Reif Nan Du Ben Hutchinson Reiner Pope James Bradbury Jacob Austin Michael Isard Guy Gur-Ari Pengcheng Yin Toju Duke Anselm Levskaya Sanjay Ghemawat Sunipa Dev Henryk Michalewski Xavier Garcia Vedant Misra Kevin Robinson Liam Fedus Denny Zhou Daphne Ippolito David Luan Hyeontaek Lim Barret Zoph Alexander Spiridonov Ryan Sepassi David Dohan Shivani Agrawal Mark Omernick Andrew M. Dai Thanumalayan Sankaranarayana Pillai Marie Pellat Aitor Lewkowycz Erica Moreira Rewon Child Oleksandr Polozov Katherine Lee Zongwei Zhou Xuezhi Wang Brennan Saeta Mark Diaz Orhan Firat Michele Catasta Jason Wei Kathy Meier-Hellstern Douglas Eck Jeff Dean Slav Petrov and Noah Fiedel. 2022. PaLM: Scaling Language Modeling with Pathways. CoRR Vol. abs\/2204.02311 (2022)."},{"key":"e_1_3_2_1_8_1","unstructured":"Prafulla Dhariwal and Alexander Quinn Nichol. 2021. Diffusion Models Beat GANs on Image Synthesis. In NeurIPS. 8780--8794."},{"key":"e_1_3_2_1_9_1","unstructured":"Ming Ding Zhuoyi Yang Wenyi Hong Wendi Zheng Chang Zhou Da Yin Junyang Lin Xu Zou Zhou Shao Hongxia Yang and Jie Tang. 2021. CogView: Mastering Text-to-Image Generation via Transformers. In NeurIPS. 19822--19835."},{"key":"e_1_3_2_1_10_1","volume-title":"Xin Eric Wang, and William Yang Wang","author":"Feng Weixi","year":"2022","unstructured":"Weixi Feng, Xuehai He, Tsu-Jui Fu, Varun Jampani, Arjun R. Akula, Pradyumna Narayana, Sugato Basu, Xin Eric Wang, and William Yang Wang. 2022. Training-Free Structured Diffusion Guidance for Compositional Text-to-Image Synthesis. CoRR, Vol. abs\/2212.05032 (2022)."},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"crossref","unstructured":"Oran Gafni Adam Polyak Oron Ashual Shelly Sheynin Devi Parikh and Yaniv Taigman. 2022. Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors. In ECCV. 89--106.","DOI":"10.1007\/978-3-031-19784-0_6"},{"key":"e_1_3_2_1_12_1","unstructured":"Ian J. Goodfellow Jean Pouget-Abadie Mehdi Mirza Bing Xu David Warde-Farley Sherjil Ozair Aaron C. Courville and Yoshua Bengio. 2014. Generative Adversarial Nets. In NeurIPS. 2672--2680."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Shuyang Gu Dong Chen Jianmin Bao Fang Wen Bo Zhang Dongdong Chen Lu Yuan and Baining Guo. 2022. Vector Quantized Diffusion Model for Text-to-Image Synthesis. In CVPR. 10686--10696.","DOI":"10.1109\/CVPR52688.2022.01043"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Kamal Gupta Justin Lazarow Alessandro Achille Larry Davis Vijay Mahadevan and Abhinav Shrivastava. 2021. LayoutTransformer: Layout Generation and Completion with Self-attention. In ICCV. 984--994.","DOI":"10.1109\/ICCV48922.2021.00104"},{"key":"e_1_3_2_1_15_1","volume-title":"Yongxin Yang, Yi-Zhe Song, Bodo Rosenhahn, and Tao Xiang.","author":"He Sen","year":"2021","unstructured":"Sen He, Wentong Liao, Michael Ying Yang, Yongxin Yang, Yi-Zhe Song, Bodo Rosenhahn, and Tao Xiang. 2021. Context-Aware Layout to Image Generation With Enhanced Object Appearance. In CVPR. 15049--15058."},{"key":"e_1_3_2_1_16_1","unstructured":"Martin Heusel Hubert Ramsauer Thomas Unterthiner Bernhard Nessler and Sepp Hochreiter. 2017. GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium. In NeurIPS. 6626--6637."},{"key":"e_1_3_2_1_17_1","unstructured":"Tobias Hinz Stefan Heinrich and Stefan Wermter. 2019. Generating Multiple Objects at Spatially Distinct Locations. In ICLR."},{"key":"e_1_3_2_1_18_1","unstructured":"Jonathan Ho Ajay Jain and Pieter Abbeel. 2020. Denoising Diffusion Probabilistic Models. In NeurIPS."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"crossref","unstructured":"Seunghoon Hong Dingdong Yang Jongwook Choi and Honglak Lee. 2018. Inferring Semantic Layout for Hierarchical Text-to-Image Synthesis. In CVPR. 7986--7994.","DOI":"10.1109\/CVPR.2018.00833"},{"key":"e_1_3_2_1_20_1","volume-title":"LayoutDM: Discrete Diffusion Model for Controllable Layout Generation. CoRR","author":"Inoue Naoto","year":"2023","unstructured":"Naoto Inoue, Kotaro Kikuchi, Edgar Simo-Serra, Mayu Otani, and Kota Yamaguchi. 2023. LayoutDM: Discrete Diffusion Model for Controllable Layout Generation. CoRR, Vol. abs\/2303.08137 (2023)."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Justin Johnson Agrim Gupta and Li Fei-Fei. 2018. Image Generation From Scene Graphs. In CVPR. 1219--1228.","DOI":"10.1109\/CVPR.2018.00133"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"crossref","unstructured":"Kotaro Kikuchi Edgar Simo-Serra Mayu Otani and Kota Yamaguchi. 2021. Constrained Graphic Layout Generation via Latent Optimization. In ACM MM. 88--96.","DOI":"10.1145\/3474085.3475497"},{"key":"e_1_3_2_1_23_1","volume-title":"Kingma and Max Welling","author":"Diederik","year":"2014","unstructured":"Diederik P. Kingma and Max Welling. 2014. Auto-Encoding Variational Bayes. In ICLR."},{"key":"e_1_3_2_1_24_1","first-page":"474","article-title":"BLT: Bidirectional Layout Transformer for Controllable Layout Generation","volume":"13677","author":"Kong Xiang","year":"2022","unstructured":"Xiang Kong, Lu Jiang, Huiwen Chang, Han Zhang, Yuan Hao, Haifeng Gong, and Irfan Essa. 2022. BLT: Bidirectional Layout Transformer for Controllable Layout Generation. In ICLR, Vol. 13677. 474--490.","journal-title":"ICLR"},{"key":"e_1_3_2_1_25_1","volume-title":"2023 a. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. arXiv","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven Hoi. 2023 a. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. arXiv (2023)."},{"key":"e_1_3_2_1_26_1","volume-title":"2023 b. GLIGEN: Open-Set Grounded Text-to-Image Generation. arXiv","author":"Li Yuheng","year":"2023","unstructured":"Yuheng Li, Haotian Liu, Qingyang Wu, Fangzhou Mu, Jianwei Yang, Jianfeng Gao, Chunyuan Li, and Yong Jae Lee. 2023 b. GLIGEN: Open-Set Grounded Text-to-Image Generation. arXiv (2023)."},{"key":"e_1_3_2_1_27_1","first-page":"740","article-title":"Microsoft COCO: Common Objects in Context","volume":"8693","author":"Lin Tsung-Yi","year":"2014","unstructured":"Tsung-Yi Lin, Michael Maire, Serge J. Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll\u00e1r, and C. Lawrence Zitnick. 2014. Microsoft COCO: Common Objects in Context. In ECCV, Vol. 8693. 740--755.","journal-title":"ECCV"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Yao Lu Max Bartolo Alastair Moore Sebastian Riedel and Pontus Stenetorp. 2022. Fantastically Ordered Prompts and Where to Find Them: Overcoming Few-Shot Prompt Order Sensitivity. In ACL. 8086--8098.","DOI":"10.18653\/v1\/2022.acl-long.556"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"crossref","unstructured":"Ke Ma Bo Zhao and Leonid Sigal. 2020. Attribute-Guided Image Generation from Layout. In BMVC.","DOI":"10.5244\/C.34.101"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Sewon Min Xinxi Lyu Ari Holtzman Mikel Artetxe Mike Lewis Hannaneh Hajishirzi and Luke Zettlemoyer. 2022. Rethinking the Role of Demonstrations: What Makes In-Context Learning Work?. In NeurIPS. 11048--11064.","DOI":"10.18653\/v1\/2022.emnlp-main.759"},{"key":"e_1_3_2_1_31_1","volume-title":"T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models. arXiv preprint arXiv:2302.08453","author":"Mou Chong","year":"2023","unstructured":"Chong Mou, Xintao Wang, Liangbin Xie, Jian Zhang, Zhongang Qi, Ying Shan, and Xiaohu Qie. 2023. T2I-Adapter: Learning Adapters to Dig out More Controllable Ability for Text-to-Image Diffusion Models. arXiv preprint arXiv:2302.08453 (2023)."},{"key":"e_1_3_2_1_32_1","volume-title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models. In ICML. 16784--16804.","author":"Nichol Alexander Quinn","year":"2022","unstructured":"Alexander Quinn Nichol, Prafulla Dhariwal, Aditya Ramesh, Pranav Shyam, Pamela Mishkin, Bob McGrew, Ilya Sutskever, and Mark Chen. 2022. GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models. In ICML. 16784--16804."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Liqiang Nie Leigang Qu Dai Meng Min Zhang Qi Tian and Alberto Del Bimbo. 2022. Search-oriented micro-video captioning. In ACM MM. 3234--3243.","DOI":"10.1145\/3503161.3548180"},{"key":"e_1_3_2_1_34_1","unstructured":"OpenAI. 2023. GPT-4 Technical Report. CoRR Vol. abs\/2303.08774 (2023)."},{"key":"e_1_3_2_1_35_1","unstructured":"Long Ouyang Jeff Wu Xu Jiang Diogo Almeida Carroll L Wainwright Pamela Mishkin Chong Zhang Sandhini Agarwal Katarina Slama Alex Ray et al. 2022. Training language models to follow instructions with human feedback. arXiv preprint arXiv:2203.02155 (2022)."},{"key":"e_1_3_2_1_36_1","volume-title":"READ: Recursive Autoencoders for Document Layout Generation. In CVPR. 2316--2325.","author":"Patil Akshay Gadi","year":"2020","unstructured":"Akshay Gadi Patil, Omri Ben-Eliezer, Or Perel, and Hadar Averbuch-Elor. 2020. READ: Recursive Autoencoders for Document Layout Generation. In CVPR. 2316--2325."},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"crossref","unstructured":"Leigang Qu Meng Liu Jianlong Wu Zan Gao and Liqiang Nie. 2021. Dynamic modality interaction modeling for image-text retrieval. In SIGIR. 1104--1113.","DOI":"10.1145\/3404835.3462829"},{"key":"e_1_3_2_1_38_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In ICML. 8748--8763."},{"key":"e_1_3_2_1_39_1","volume-title":"Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125","author":"Ramesh Aditya","year":"2022","unstructured":"Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen. 2022a. Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125 (2022)."},{"key":"e_1_3_2_1_40_1","volume-title":"Hierarchical Text-Conditional Image Generation with CLIP Latents. CoRR","author":"Ramesh Aditya","year":"2022","unstructured":"Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen. 2022b. Hierarchical Text-Conditional Image Generation with CLIP Latents. CoRR, Vol. abs\/2204.06125 (2022)."},{"key":"e_1_3_2_1_41_1","unstructured":"Aditya Ramesh Mikhail Pavlov Gabriel Goh Scott Gray Chelsea Voss Alec Radford Mark Chen and Ilya Sutskever. 2021. Zero-Shot Text-to-Image Generation. In ICML. 8821--8831."},{"key":"e_1_3_2_1_42_1","unstructured":"Scott E. Reed Zeynep Akata Santosh Mohan Samuel Tenka Bernt Schiele and Honglak Lee. 2016a. Learning What and Where to Draw. In NeurIPS. 217--225."},{"key":"e_1_3_2_1_43_1","unstructured":"Scott E. Reed Zeynep Akata Xinchen Yan Lajanugen Logeswaran Bernt Schiele and Honglak Lee. 2016b. Generative Adversarial Text to Image Synthesis. In ICML. 1060--1069."},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6rn Ommer. 2022a. High-resolution image synthesis with latent diffusion models. In CVPR. 10684--10695.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6 rn Ommer. 2022b. High-Resolution Image Synthesis with Latent Diffusion Models. In CVPR. 10674--10685.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"crossref","unstructured":"Olaf Ronneberger Philipp Fischer and Thomas Brox. 2015. U-Net: Convolutional Networks for Biomedical Image Segmentation. In MICCAI. 234--241.","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"e_1_3_2_1_47_1","volume-title":"DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation. CoRR","author":"Ruiz Nataniel","year":"2022","unstructured":"Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Yael Pritch, Michael Rubinstein, and Kfir Aberman. 2022. DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation. CoRR, Vol. abs\/2208.12242 (2022)."},{"key":"e_1_3_2_1_48_1","volume-title":"Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J. Fleet, and Mohammad Norouzi.","author":"Saharia Chitwan","year":"2022","unstructured":"Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily Denton, Seyed Kamyar Seyed Ghasemipour, Burcu Karagol Ayan, S. Sara Mahdavi, Rapha Gontijo Lopes, Tim Salimans, Jonathan Ho, David J. Fleet, and Mohammad Norouzi. 2022. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. CoRR, Vol. abs\/2205.11487 (2022)."},{"key":"e_1_3_2_1_49_1","unstructured":"Christoph Schuhmann Romain Beaumont Richard Vencu Cade Gordon Ross Wightman Mehdi Cherti Theo Coombes Aarush Katta Clayton Mullis Mitchell Wortsman et al. 2022. Laion-5b: An open large-scale dataset for training next generation image-text models. arXiv (2022)."},{"key":"e_1_3_2_1_50_1","volume-title":"Monte Carlo sampling methods. Handbooks in operations research and management science","author":"Shapiro Alexander","year":"2003","unstructured":"Alexander Shapiro. 2003. Monte Carlo sampling methods. Handbooks in operations research and management science, Vol. 10 (2003), 353--425."},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Wei Sun and Tianfu Wu. 2019. Image Synthesis From Reconfigurable Layout and Style. In ICCV. 10530--10539.","DOI":"10.1109\/ICCV.2019.01063"},{"key":"e_1_3_2_1_52_1","unstructured":"Matthew Tancik Pratul P. Srinivasan Ben Mildenhall Sara Fridovich-Keil Nithin Raghavan Utkarsh Singhal Ravi Ramamoorthi Jonathan T. Barron and Ren Ng. 2020. Fourier Features Let Networks Learn High Frequency Functions in Low Dimensional Domains. In NeurIPS."},{"key":"e_1_3_2_1_53_1","volume-title":"Llama: Open and efficient foundation language models. arXiv","author":"Touvron Hugo","year":"2023","unstructured":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timoth\u00e9e Lacroix, Baptiste Rozi\u00e8re, Naman Goyal, Eric Hambro, Faisal Azhar, et al. 2023. Llama: Open and efficient foundation language models. arXiv (2023)."},{"key":"e_1_3_2_1_54_1","doi-asserted-by":"crossref","unstructured":"Duc Minh Vo and Akihiro Sugimoto. 2020. Visual-Relation Conscious Image Generation from Structured-Text. In ECCV. 290--306.","DOI":"10.1007\/978-3-030-58604-1_18"},{"key":"e_1_3_2_1_55_1","volume-title":"Sketch-Guided Text-to-Image Diffusion Models. CoRR","author":"Voynov Andrey","year":"2022","unstructured":"Andrey Voynov, Kfir Aberman, and Daniel Cohen-Or. 2022. Sketch-Guided Text-to-Image Diffusion Models. CoRR, Vol. abs\/2211.13752 (2022)."},{"key":"e_1_3_2_1_56_1","volume-title":"Quoc Le, and Denny Zhou.","author":"Wei Jason","year":"2022","unstructured":"Jason Wei, Xuezhi Wang, Dale Schuurmans, Maarten Bosma, Ed H. Chi, Quoc Le, and Denny Zhou. 2022. Chain of Thought Prompting Elicits Reasoning in Large Language Models. CoRR, Vol. abs\/2201.11903 (2022)."},{"key":"e_1_3_2_1_57_1","volume-title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning. Reinforcement learning","author":"Williams Ronald J","year":"1992","unstructured":"Ronald J Williams. 1992. Simple statistical gradient-following algorithms for connectionist reinforcement learning. Reinforcement learning (1992), 5--32."},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"crossref","unstructured":"Tao Xu Pengchuan Zhang Qiuyuan Huang Han Zhang Zhe Gan Xiaolei Huang and Xiaodong He. 2018. AttnGAN: Fine-Grained Text to Image Generation With Attentional Generative Adversarial Networks. In CVPR. 1316--1324.","DOI":"10.1109\/CVPR.2018.00143"},{"key":"e_1_3_2_1_59_1","volume-title":"Thang Luong, Gunjan Baid, Zirui Wang, Vijay Vasudevan, Alexander Ku, Yinfei Yang, Burcu Karagol Ayan, Ben Hutchinson, Wei Han, Zarana Parekh, Xin Li, Han Zhang, Jason Baldridge, and Yonghui Wu.","author":"Yu Jiahui","year":"2022","unstructured":"Jiahui Yu, Yuanzhong Xu, Jing Yu Koh, Thang Luong, Gunjan Baid, Zirui Wang, Vijay Vasudevan, Alexander Ku, Yinfei Yang, Burcu Karagol Ayan, Ben Hutchinson, Wei Han, Zarana Parekh, Xin Li, Han Zhang, Jason Baldridge, and Yonghui Wu. 2022. Scaling Autoregressive Models for Content-Rich Text-to-Image Generation. CoRR, Vol. abs\/2206.10789 (2022)."},{"key":"e_1_3_2_1_60_1","doi-asserted-by":"crossref","unstructured":"Han Zhang Tao Xu and Hongsheng Li. 2017. StackGAN: Text to Photo-Realistic Image Synthesis with Stacked Generative Adversarial Networks. In ICCV. 5908--5916.","DOI":"10.1109\/ICCV.2017.629"},{"key":"e_1_3_2_1_61_1","volume-title":"2023 a. Adding Conditional Control to Text-to-Image Diffusion Models. CoRR","author":"Zhang Lvmin","year":"2023","unstructured":"Lvmin Zhang and Maneesh Agrawala. 2023 a. Adding Conditional Control to Text-to-Image Diffusion Models. CoRR, Vol. abs\/2302.05543 (2023)."},{"key":"e_1_3_2_1_62_1","volume-title":"2023 b. Adding Conditional Control to Text-to-Image Diffusion Models. arXiv preprint arXiv:2302.05543","author":"Zhang Lvmin","year":"2023","unstructured":"Lvmin Zhang and Maneesh Agrawala. 2023 b. Adding Conditional Control to Text-to-Image Diffusion Models. arXiv preprint arXiv:2302.05543 (2023)."},{"key":"e_1_3_2_1_63_1","doi-asserted-by":"crossref","unstructured":"Yiming Zhang Shi Feng and Chenhao Tan. 2022. Active Example Selection for In-Context Learning. In NeurIPS. 9134--9148.","DOI":"10.18653\/v1\/2022.emnlp-main.622"},{"key":"e_1_3_2_1_64_1","volume-title":"ICML (Proceedings of Machine Learning Research","volume":"12706","author":"Zhao Zihao","year":"2021","unstructured":"Zihao Zhao, Eric Wallace, Shi Feng, Dan Klein, and Sameer Singh. 2021. Calibrate Before Use: Improving Few-shot Performance of Language Models. In ICML (Proceedings of Machine Learning Research, Vol. 139). 12697--12706."},{"key":"e_1_3_2_1_65_1","volume-title":"LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation. CoRR","author":"Zheng Guangcong","year":"2023","unstructured":"Guangcong Zheng, Xianpan Zhou, Xuewei Li, Zhongang Qi, Ying Shan, and Xi Li. 2023. LayoutDiffusion: Controllable Diffusion Model for Layout-to-image Generation. CoRR, Vol. abs\/2303.17189 (2023)."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","location":"Ottawa ON Canada","acronym":"MM '23","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3612012","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3612012","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:02:20Z","timestamp":1755820940000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3612012"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":65,"alternative-id":["10.1145\/3581783.3612012","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3612012","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}