{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T14:01:42Z","timestamp":1784210502968,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":40,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3612707","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:12Z","timestamp":1698391632000},"page":"9313-9319","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":30,"title":["MovieFactory: Automatic Movie Creation from Text using Large Generative Models for Language and Images"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3872-6689","authenticated-orcid":false,"given":"Junchen","family":"Zhu","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8612-0702","authenticated-orcid":false,"given":"Huan","family":"Yang","sequence":"additional","affiliation":[{"name":"Microsoft, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1419-059X","authenticated-orcid":false,"given":"Huiguo","family":"He","sequence":"additional","affiliation":[{"name":"Microsoft, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3951-3877","authenticated-orcid":false,"given":"Wenjing","family":"Wang","sequence":"additional","affiliation":[{"name":"Peking University, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-5402-0458","authenticated-orcid":false,"given":"Zixi","family":"Tuo","sequence":"additional","affiliation":[{"name":"Xi'an Jiaotong University, Xi'an, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4662-7875","authenticated-orcid":false,"given":"Wen-Huang","family":"Cheng","sequence":"additional","affiliation":[{"name":"National Taiwan University, Taipei, Taiwan Roc"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2522-6394","authenticated-orcid":false,"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2549-8322","authenticated-orcid":false,"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1025-2012","authenticated-orcid":false,"given":"Jianlong","family":"Fu","sequence":"additional","affiliation":[{"name":"Microsoft, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_2_1_1","volume-title":"G\u00fc l Varol, and Andrew Zisserman","author":"Bain Max","year":"2021","unstructured":"Max Bain, Arsha Nagrani, G\u00fc l Varol, and Andrew Zisserman. 2021. Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval. In ICCV."},{"key":"e_1_3_2_2_2_1","volume-title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers. arXiv","author":"Balaji Yogesh","year":"2022","unstructured":"Yogesh Balaji, Seungjun Nah, Xun Huang, Arash Vahdat, Jiaming Song, Karsten Kreis, Miika Aittala, Timo Aila, Samuli Laine, Bryan Catanzaro, Tero Karras, and Ming-Yu Liu. 2022. eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers. arXiv (2022)."},{"key":"e_1_3_2_2_3_1","volume-title":"Sanja Fidler, and Karsten Kreis.","author":"Blattmann Andreas","year":"2023","unstructured":"Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, and Karsten Kreis. 2023. Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models. In CVPR."},{"key":"e_1_3_2_2_4_1","unstructured":"Kelvin C.K. Chan Shangchen Zhou Xiangyu Xu and Chen Change Loy. 2022. Investigating Tradeoffs in Real-World Video Super-Resolution. In CVPR."},{"key":"e_1_3_2_2_5_1","unstructured":"Prafulla Dhariwal and Alexander Quinn Nichol. 2021. Diffusion Models Beat GANs on Image Synthesis. In NeurIPS Marc'Aurelio Ranzato Alina Beygelzimer Yann N. Dauphin Percy Liang and Jennifer Wortman Vaughan (Eds.)."},{"key":"e_1_3_2_2_6_1","unstructured":"Ian J. Goodfellow Jean Pouget-Abadie Mehdi Mirza Bing Xu David Warde-Farley Sherjil Ozair Aaron C. Courville and Yoshua Bengio. 2014. Generative Adversarial Nets. In NeurIPS."},{"key":"e_1_3_2_2_7_1","volume-title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation. arXiv","author":"He Yingqing","year":"2022","unstructured":"Yingqing He, Tianyu Yang, Yong Zhang, Ying Shan, and Qifeng Chen. 2022. Latent Video Diffusion Models for High-Fidelity Long Video Generation. arXiv (2022)."},{"key":"e_1_3_2_2_8_1","volume-title":"Imagen Video: High Definition Video Generation with Diffusion Models. arXiv","author":"Ho Jonathan","year":"2022","unstructured":"Jonathan Ho, William Chan, Chitwan Saharia, Jay Whang, Ruiqi Gao, Alexey A. Gritsenko, Diederik P. Kingma, Ben Poole, Mohammad Norouzi, David J. Fleet, and Tim Salimans. 2022. Imagen Video: High Definition Video Generation with Diffusion Models. arXiv (2022)."},{"key":"e_1_3_2_2_9_1","unstructured":"Jonathan Ho Ajay Jain and Pieter Abbeel. 2020. Denoising Diffusion Probabilistic Models. NeurIPS."},{"key":"e_1_3_2_2_10_1","volume-title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers. arXiv","author":"Hong Wenyi","year":"2022","unstructured":"Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, and Jie Tang. 2022. CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers. arXiv (2022)."},{"key":"e_1_3_2_2_11_1","volume-title":"Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators. arXiv","author":"Khachatryan Levon","year":"2023","unstructured":"Levon Khachatryan, Andranik Movsisyan, Vahram Tadevosyan, Roberto Henschel, Zhangyang Wang, Shant Navasardyan, and Humphrey Shi. 2023. Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators. arXiv (2023)."},{"key":"e_1_3_2_2_12_1","volume-title":"Kingma and Max Welling","author":"Diederik","year":"2014","unstructured":"Diederik P. Kingma and Max Welling. 2014. Auto-Encoding Variational Bayes. In ICLR."},{"key":"e_1_3_2_2_13_1","volume-title":"Audio Retrieval with Natural Language Queries: A Benchmark Study","author":"Koepke A. Sophia","year":"2022","unstructured":"A. Sophia Koepke, Andreea-Maria Oncescu, Joao Henriques, Zeynep Akata, and Samuel Albanie. 2022. Audio Retrieval with Natural Language Queries: A Benchmark Study. IEEE TMM (2022), 1--1."},{"key":"e_1_3_2_2_14_1","volume-title":"Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation. arXiv","author":"Liu Jiawei","year":"2023","unstructured":"Jiawei Liu, Weining Wang, Sihan Chen, Xinxin Zhu, and Jing Liu. 2023. Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation. arXiv (2023)."},{"key":"e_1_3_2_2_15_1","unstructured":"Zhengxiong Luo Dayou Chen Yingya Zhang Yan Huang Liang Wang Yujun Shen Deli Zhao Jingren Zhou and Tieniu Tan. 2023. VideoFusion: Decomposed Diffusion Models for High-Quality Video Generation. In CVPR."},{"key":"e_1_3_2_2_16_1","volume-title":"Music Artist Classification with Convolutional Recurrent Neural Networks","author":"Nasrullah Zain","unstructured":"Zain Nasrullah and Yue Zhao. 2019. Music Artist Classification with Convolutional Recurrent Neural Networks. In IEEE IJCNN."},{"key":"e_1_3_2_2_17_1","volume-title":"https:\/\/chat.openai.com\/chat","author":"AI.","year":"2022","unstructured":"OpenAI. 2022. ChatGPT. (2022). https:\/\/chat.openai.com\/chat"},{"key":"e_1_3_2_2_18_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In ICML."},{"key":"e_1_3_2_2_19_1","volume-title":"Hierarchical Text-Conditional Image Generation with CLIP Latents. arXiv","author":"Ramesh Aditya","year":"2022","unstructured":"Aditya Ramesh, Prafulla Dhariwal, Alex Nichol, Casey Chu, and Mark Chen. 2022. Hierarchical Text-Conditional Image Generation with CLIP Latents. arXiv (2022)."},{"key":"e_1_3_2_2_20_1","unstructured":"John Reich. 2017. Exploring Movie Construction & Production: What's So Exciting about Movies? Open SUNY Textbooks."},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6 rn Ommer. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_2_22_1","volume-title":"Qin Jin, and Baining Guo.","author":"Ruan Ludan","year":"2023","unstructured":"Ludan Ruan, Yiyang Ma, Huan Yang, Huiguo He, Bei Liu, Jianlong Fu, Nicholas Jing Yuan, Qin Jin, and Baining Guo. 2023. MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation. (2023)."},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"crossref","unstructured":"Nataniel Ruiz Yuanzhen Li Varun Jampani Yael Pritch Michael Rubinstein and Kfir Aberman. 2023. DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation. In CVPR.","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"e_1_3_2_2_24_1","volume-title":"Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, Jonathan Ho, David J. Fleet, and Mohammad Norouzi.","author":"Saharia Chitwan","year":"2022","unstructured":"Chitwan Saharia, William Chan, Saurabh Saxena, Lala Li, Jay Whang, Emily L. Denton, Seyed Kamyar Seyed Ghasemipour, Raphael Gontijo Lopes, Burcu Karagol Ayan, Tim Salimans, Jonathan Ho, David J. Fleet, and Mohammad Norouzi. 2022. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. In NeurIPS."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"publisher","DOI":"10.1145\/2702123.2702229"},{"key":"e_1_3_2_2_26_1","unstructured":"Christoph Schuhmann Romain Beaumont Richard Vencu Cade Gordon Ross Wightman Mehdi Cherti Theo Coombes Aarush Katta Clayton Mullis Mitchell Wortsman Patrick Schramowski Srivatsa Kundurthy Katherine Crowson Ludwig Schmidt Robert Kaczmarczyk and Jenia Jitsev. 2022. LAION-5B: An open large-scale dataset for training next generation image-text models. In NeurIPS."},{"key":"e_1_3_2_2_27_1","unstructured":"Jinhong Shen Seiya Miyazaki Teruamsa AOKI and Hiroshi Yasuda. 2002. The Framework of an Automatic Digital Movie Producer. (2002) 15--18."},{"key":"e_1_3_2_2_28_1","unstructured":"Uriel Singer Adam Polyak Thomas Hayes Xi Yin Jie An Songyang Zhang Qiyuan Hu Harry Yang Oron Ashual Oran Gafni et al. 2022. Make-A-Video: Text-to-video generation without text-video data. arXiv (2022)."},{"key":"e_1_3_2_2_29_1","unstructured":"Stability-AI. 2022. Stable Diffusion. https:\/\/github.com\/Stability-AI\/StableDiffusion."},{"key":"e_1_3_2_2_30_1","volume-title":"ECCV Workshops.","author":"Sur'is Didac","year":"2018","unstructured":"Didac Sur'is, Amanda Duarte, Amaia Salvador, Jordi Torres, and Xavier Gir\u00f3-i Nieto. 2018. Cross-modal embeddings for video and audio retrieval. In ECCV Workshops."},{"key":"e_1_3_2_2_31_1","volume-title":"Marcin Michalski, and Sylvain Gelly.","author":"Unterthiner Thomas","year":"2018","unstructured":"Thomas Unterthiner, Sjoerd van Steenkiste, Karol Kurach, Rapha\u00eb l Marinier, Marcin Michalski, and Sylvain Gelly. 2018. Towards Accurate Generative Models of Video: A New Metric & Challenges. arXiv (2018)."},{"key":"e_1_3_2_2_32_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NeurIPS."},{"key":"e_1_3_2_2_33_1","volume-title":"Santiago Castro, Julius Kunze, and Dumitru Erhan.","author":"Villegas Ruben","year":"2022","unstructured":"Ruben Villegas, Mohammad Babaeizadeh, Pieter-Jan Kindermans, Hernan Moraldo, Han Zhang, Mohammad Taghi Saffar, Santiago Castro, Julius Kunze, and Dumitru Erhan. 2022. Phenaki: Variable Length Video Generation From Open Domain Textual Description. arXiv (2022)."},{"key":"e_1_3_2_2_34_1","volume-title":"VideoFactory: Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation. arXiv","author":"Wang Wenjing","year":"2023","unstructured":"Wenjing Wang, Huan Yang, Zixi Tuo, Huiguo He, Junchen Zhu, Jianlong Fu, and Jiaying Liu. 2023. VideoFactory: Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation. arXiv (2023)."},{"key":"e_1_3_2_2_35_1","unstructured":"Chenfei Wu Jian Liang Lei Ji Fan Yang Yuejian Fang Daxin Jiang and Nan Duan. 2022b. N\u00fcWA: Visual synthesis pre-training for neural visual world creation. In ECCV."},{"key":"e_1_3_2_2_36_1","volume-title":"Yuchao Gu, Wynne Hsu, Ying Shan, Xiaohu Qie, and Mike Zheng Shou.","author":"Wu Jay Zhangjie","year":"2022","unstructured":"Jay Zhangjie Wu, Yixiao Ge, Xintao Wang, Stan Weixian Lei, Yuchao Gu, Wynne Hsu, Ying Shan, Xiaohu Qie, and Mike Zheng Shou. 2022a. Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation. arXiv (2022)."},{"key":"e_1_3_2_2_37_1","unstructured":"Hongwei Xue Tiankai Hang Yanhong Zeng Yuchong Sun Bei Liu Huan Yang Jianlong Fu and Baining Guo. 2022. Advancing High-Resolution Video-Language Representation with Large-Scale Video Transcriptions. In CVPR."},{"key":"e_1_3_2_2_38_1","volume-title":"MAGVIT: Masked Generative Video Transformer. arXiv","author":"Yu Lijun","year":"2022","unstructured":"Lijun Yu, Yong Cheng, Kihyuk Sohn, Jos\u00e9 Lezama, Han Zhang, Huiwen Chang, Alexander G. Hauptmann, Ming-Hsuan Yang, Yuan Hao, Irfan Essa, and Lu Jiang. 2022. MAGVIT: Masked Generative Video Transformer. arXiv (2022)."},{"key":"e_1_3_2_2_39_1","volume-title":"Adding Conditional Control to Text-to-Image Diffusion Models. arXiv","author":"Zhang Lvmin","year":"2023","unstructured":"Lvmin Zhang and Maneesh Agrawala. 2023. Adding Conditional Control to Text-to-Image Diffusion Models. arXiv (2023)."},{"key":"e_1_3_2_2_40_1","volume-title":"MagicVideo: Efficient video generation with latent diffusion models. arXiv","author":"Zhou Daquan","year":"2022","unstructured":"Daquan Zhou, Weimin Wang, Hanshu Yan, Weiwei Lv, Yizhe Zhu, and Jiashi Feng. 2022. MagicVideo: Efficient video generation with latent diffusion models. arXiv (2022)."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","location":"Ottawa ON Canada","acronym":"MM '23","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3612707","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3612707","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,21]],"date-time":"2025-08-21T23:59:39Z","timestamp":1755820779000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3612707"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":40,"alternative-id":["10.1145\/3581783.3612707","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3612707","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}