{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,8]],"date-time":"2026-07-08T22:45:07Z","timestamp":1783550707681,"version":"3.55.0"},"reference-count":43,"publisher":"SPIE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,3,5]]},"DOI":"10.1117\/12.2622734","type":"proceedings-article","created":{"date-parts":[[2022,3,4]],"date-time":"2022-03-04T19:56:51Z","timestamp":1646423811000},"page":"23","source":"Crossref","is-referenced-by-count":3,"title":["Text-based sequential image generation"],"prefix":"10.1117","author":[{"given":"Valeriia","family":"Efimova","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Andrey","family":"Filchenkov","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"189","reference":[{"key":"c1","first-page":"27","article-title":"Generative adversarial nets","author":"Goodfellow","year":"2014","journal-title":"Advances in neural information processing systems"},{"key":"c2","article-title":"Semantic object accuracy for generative text-to-image synthesis","author":"Hinz","year":"2019","journal-title":"arXiv preprint arXiv:1910.13321"},{"key":"c3","first-page":"9895","article-title":"Layoutvae: Stochastic scene layout generation from a label set","volume-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","author":"Jyothi","year":"2019"},{"key":"c4","first-page":"7986","article-title":"Inferring semantic layout for hierarchical text-to-image synthesis","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","author":"Hong","year":"2018"},{"key":"c5","first-page":"1316","article-title":"Attngan: Fine-grained text to image generation with attentional generative adversarial networks","volume-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","author":"Xu","year":"2018"},{"key":"c6","article-title":"Adversarial text-to-image synthesis: A review","author":"Frolov","year":"2021","journal-title":"arXiv preprint arXiv:2101.09983"},{"key":"c7","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.04.069"},{"key":"c8","first-page":"3","article-title":"Tutorial on Variational Autoencoders","volume":"1050","author":"Doersch","year":"2021","journal-title":"stat"},{"key":"c9","article-title":"Caltech-UCSD birds 200","author":"Welinder","year":"2010"},{"key":"c10","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1"},{"key":"c11","article-title":"Zero-shot text-to-image generation","author":"Ramesh","year":"2021","journal-title":"arXiv preprint arXiv:2102.12092"},{"key":"c12","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021","journal-title":"arXiv preprint arXiv:2103.00020"},{"key":"c13","article-title":"Large scale GAN training for high fidelity natural image synthesis","author":"Brock","year":"2018","journal-title":"arXiv preprint arXiv:1809.11096"},{"issue":"2","key":"c14","first-page":"4","article-title":"Object-centric image generation from layouts","volume":"1","author":"Sylvain","year":"2020","journal-title":"arXiv preprint arXiv:2003.07449"},{"key":"c15","doi-asserted-by":"publisher","DOI":"10.1162\/leon_a_01930"},{"key":"c16","first-page":"4401","article-title":"A style-based generator architecture for generative adversarial networks","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Karras","year":"2019"},{"key":"c17","first-page":"8110","article-title":"Analyzing and improving the image quality of stylegan","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Karras","year":"2020"},{"key":"c18","article-title":"Natural language processing with Python: analyzing text with the natural language toolkit","author":"Bird","year":"2009"},{"issue":"1","key":"c19","first-page":"1","article-title":"An overview of graph-based keyword extraction methods and approaches","volume":"39","author":"Beliga","year":"2015","journal-title":"Journal of information and organizational sciences"},{"key":"c20","article-title":"Multi-task deep neural networks for natural language understanding","author":"Liu","year":"2019","journal-title":"arXiv preprint arXiv:1901.11504"},{"key":"c21","article-title":"Simple unsupervised keyphrase extraction using sentence embeddings","author":"Bennani-Smires","year":"2018","journal-title":"arXiv preprint arXiv:1801.04470"},{"key":"c22","article-title":"Efficient estimation of word representations in vector space","author":"Mikolov","year":"2013","journal-title":"arXiv preprint arXiv:1301.3781"},{"key":"c23","first-page":"5998","article-title":"Attention is all you need","author":"Vaswani","year":"2017","journal-title":"Advances in neural information processing systems"},{"key":"c24","article-title":"Bert: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2018","journal-title":"arXiv preprint arXiv:1810.04805"},{"key":"c25","first-page":"2790","article-title":"Parameter-efficient transfer learning for NLP","volume-title":"International Conference on Machine Learning","author":"Houlsby","year":"2019"},{"key":"c26","first-page":"15","article-title":"Transfer learning in natural language processing","volume-title":"Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Tutorials","author":"Ruder","year":"2019"},{"key":"c27","article-title":"Layoutgan: Generating graphic layouts with wireframe discriminators","author":"Li","year":"2019","journal-title":"arXiv preprint arXiv:1901.06767"},{"key":"c28","first-page":"2940","article-title":"Learning aligned cross-modal representations from weakly aligned data","volume-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","author":"Castrejon","year":"2016"},{"key":"c29","article-title":"Layout Generation and Completion with Self-attention","author":"Gupta","year":"2020","journal-title":"arXiv preprint arXiv:2006.14615"},{"key":"c30","first-page":"9455","article-title":"St-gan: Spatial transformer generative adversarial networks for image compositing","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","author":"Lin","year":"2018"},{"key":"c31","first-page":"1746","article-title":"Semantic scene completion from a single depth image","volume-title":"In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","author":"Song","year":"2017"},{"key":"c32","first-page":"3730","article-title":"Deep learning face attributes in the wild","volume-title":"Proceedings of the IEEE international conference on computer vision","author":"Liu","year":"2015"},{"key":"c33","doi-asserted-by":"publisher","DOI":"10.1145\/3306346.3322971"},{"key":"c34","first-page":"1219","article-title":"Image generation from scene graphs","volume-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","author":"Johnson","year":"2018"},{"key":"c35","article-title":"Is a Green Screen Really Necessary for Real-Time Portrait Matting?","author":"Ke","year":"2020","journal-title":"arXiv preprint arXiv:2011.11961"},{"key":"c36","article-title":"F, B, Alpha Matting","author":"Forte","year":"2020","journal-title":"arXiv preprint arXiv:2003.07711"},{"key":"c37","first-page":"1620","article-title":"Foreground-aware Semantic Representations for Image Harmonization","volume-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","author":"Sofiiuk","year":"2021"},{"key":"c38","first-page":"12873","article-title":"Taming transformers for high-resolution image synthesis","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Esser","year":"2021"},{"key":"c39","first-page":"2655","article-title":"Copyright infringement in ai-generated artworks","volume":"53","author":"Gillotte","year":"2019","journal-title":"UC Davis L. Rev"},{"key":"c40","article-title":"Resnest: Split-attention networks","author":"Zhang","year":"2020","journal-title":"arXiv preprint arXiv:2004.08955"},{"key":"c41","article-title":"Yolov4: Optimal speed and accuracy of object detection","author":"Bochkovskiy","year":"2020","journal-title":"arXiv preprint arXiv:2004.10934"},{"key":"c42","article-title":"Knapsack pruning with inner distillation","author":"Aflalo","year":"2020","journal-title":"arXiv preprint arXiv:2002.08258"},{"key":"c43","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2699184"}],"event":{"name":"Fourteenth International Conference on Machine Vision (ICMV 2021)","location":"Rome, Italy","start":{"date-parts":[[2021,11,8]]},"end":{"date-parts":[[2021,11,12]]}},"container-title":["Fourteenth International Conference on Machine Vision (ICMV 2021)"],"original-title":[],"deposited":{"date-parts":[[2022,6,21]],"date-time":"2022-06-21T18:32:00Z","timestamp":1655836320000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.spiedigitallibrary.org\/conference-proceedings-of-spie\/12084\/2622734\/Text-based-sequential-image-generation\/10.1117\/12.2622734.full"}},"subtitle":[],"editor":[{"given":"Wolfgang","family":"Osten","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]},{"given":"Dmitry","family":"Nikolaev","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]},{"given":"Jianhong","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]}],"short-title":[],"issued":{"date-parts":[[2022,3,5]]},"references-count":43,"URL":"https:\/\/doi.org\/10.1117\/12.2622734","relation":{},"subject":[],"published":{"date-parts":[[2022,3,5]]}}}