{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:41:24Z","timestamp":1755823284439,"version":"3.44.0"},"publisher-location":"New York, NY, USA","reference-count":16,"publisher":"ACM","license":[{"start":{"date-parts":[[2023,10,26]],"date-time":"2023-10-26T00:00:00Z","timestamp":1698278400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2023,10,26]]},"DOI":"10.1145\/3581783.3612667","type":"proceedings-article","created":{"date-parts":[[2023,10,27]],"date-time":"2023-10-27T07:27:40Z","timestamp":1698391660000},"page":"9371-9373","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":3,"title":["MobileVidFactory: Automatic Diffusion-Based Social Media Video Generation for Mobile Devices from Text"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3872-6689","authenticated-orcid":false,"given":"Junchen","family":"Zhu","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8612-0702","authenticated-orcid":false,"given":"Huan","family":"Yang","sequence":"additional","affiliation":[{"name":"Microsoft Research, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3951-3877","authenticated-orcid":false,"given":"Wenjing","family":"Wang","sequence":"additional","affiliation":[{"name":"Microsoft Research, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1419-059X","authenticated-orcid":false,"given":"Huiguo","family":"He","sequence":"additional","affiliation":[{"name":"Microsoft Research, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-5402-0458","authenticated-orcid":false,"given":"Zixi","family":"Tuo","sequence":"additional","affiliation":[{"name":"Microsoft Research, Xi'an, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1386-859X","authenticated-orcid":false,"given":"Yongsheng","family":"Yu","sequence":"additional","affiliation":[{"name":"University of Rochester, Rochester, NY, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4662-7875","authenticated-orcid":false,"given":"Wen-Huang","family":"Cheng","sequence":"additional","affiliation":[{"name":"National Taiwan University, Taipei, Taiwan Roc"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2522-6394","authenticated-orcid":false,"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2549-8322","authenticated-orcid":false,"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1025-2012","authenticated-orcid":false,"given":"Jianlong","family":"Fu","sequence":"additional","affiliation":[{"name":"Microsoft Research, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4516-9729","authenticated-orcid":false,"given":"Jiebo","family":"Luo","sequence":"additional","affiliation":[{"name":"University of Rochester, Rochester, NY, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2023,10,27]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"crossref","unstructured":"Max Bain Arsha Nagrani G\u00fcl Varol and Andrew Zisserman. 2021. Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval. In ICCV.","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"e_1_3_2_2_2_1","volume-title":"Sanja Fidler, and Karsten Kreis.","author":"Blattmann Andreas","year":"2023","unstructured":"Andreas Blattmann, Robin Rombach, Huan Ling, Tim Dockhorn, Seung Wook Kim, Sanja Fidler, and Karsten Kreis. 2023. Align your Latents: High-Resolution Video Synthesis with Latent Diffusion Models. In CVPR."},{"key":"e_1_3_2_2_3_1","volume-title":"Audio Retrieval with Natural Language Queries: A Benchmark Study","author":"Koepke A. Sophia","year":"2022","unstructured":"A. Sophia Koepke, Andreea-Maria Oncescu, JoHenriques, Zeynep Akata, and Samuel Albanie. 2022. Audio Retrieval with Natural Language Queries: A Benchmark Study. IEEE TMM (2022)."},{"key":"e_1_3_2_2_4_1","volume-title":"AMT: All-Pairs Multi-Field Transforms for Efficient Frame Interpolation. In CVPR.","author":"Li Zhen","year":"2023","unstructured":"Zhen Li, Zuo-Liang Zhu, Linghao Han, Qibin Hou, Chun-Le Guo, and Ming-Ming Cheng. 2023. AMT: All-Pairs Multi-Field Transforms for Efficient Frame Interpolation. In CVPR."},{"key":"e_1_3_2_2_5_1","volume-title":"TTVFI: Learning Trajectory-Aware Transformer for Video Frame Interpolation. arXiv","author":"Liu Chengxu","year":"2022","unstructured":"Chengxu Liu, Huan Yang, Jianlong Fu, and Xueming Qian. 2022. TTVFI: Learning Trajectory-Aware Transformer for Video Frame Interpolation. arXiv (2022)."},{"key":"e_1_3_2_2_6_1","volume-title":"Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation. arXiv","author":"Liu Jiawei","year":"2023","unstructured":"Jiawei Liu, Weining Wang, Sihan Chen, Xinxin Zhu, and Jing Liu. 2023. Sounding Video Generator: A Unified Framework for Text-guided Sounding Video Generation. arXiv (2023)."},{"key":"e_1_3_2_2_7_1","volume-title":"Zeynep Akata, and Samuel Albanie.","author":"Oncescu Andreea-Maria","year":"2021","unstructured":"Andreea-Maria Oncescu, A. Sophia Koepke, o F. Henriques, Zeynep Akata, and Samuel Albanie. 2021. Audio Retrieval with Natural Language Queries. In Interspeech."},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6rn Ommer. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. In CVPR.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"crossref","unstructured":"Olaf Ronneberger Philipp Fischer and Thomas Brox. 2015. U-Net: Convolutional Networks for Biomedical Image Segmentation. In MICCAI.","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"e_1_3_2_2_10_1","volume-title":"Qin Jin, and Baining Guo.","author":"Ruan Ludan","year":"2023","unstructured":"Ludan Ruan, Yiyang Ma, Huan Yang, Huiguo He, Bei Liu, Jianlong Fu, Nicholas Jing Yuan, Qin Jin, and Baining Guo. 2023. MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation. (2023)."},{"key":"e_1_3_2_2_11_1","unstructured":"Uriel Singer Adam Polyak Thomas Hayes Xi Yin Jie An Songyang Zhang Qiyuan Hu Harry Yang Oron Ashual Oran Gafni et al. 2022. Make-A-Video: Text-to-video generation without text-video data. arXiv (2022)."},{"key":"e_1_3_2_2_12_1","unstructured":"Stability-AI. 2022. Stable Diffusion. https:\/\/github.com\/Stability-AI\/StableDiffusion."},{"key":"e_1_3_2_2_13_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention is All you Need. In NeurIPS."},{"key":"e_1_3_2_2_14_1","volume-title":"2023 a. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers. arXiv","author":"Wang Chengyi","year":"2023","unstructured":"Chengyi Wang, Sanyuan Chen, Yu Wu, Ziqiang Zhang, Long Zhou, Shujie Liu, Zhuo Chen, Yanqing Liu, Huaming Wang, Jinyu Li, Lei He, Sheng Zhao, and Furu Wei. 2023 a. Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers. arXiv (2023)."},{"key":"e_1_3_2_2_15_1","volume-title":"2023 b. VideoFactory: Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation. arXiv","author":"Wang Wenjing","year":"2023","unstructured":"Wenjing Wang, Huan Yang, Zixi Tuo, Huiguo He, Junchen Zhu, Jianlong Fu, and Jiaying Liu. 2023 b. VideoFactory: Swap Attention in Spatiotemporal Diffusions for Text-to-Video Generation. arXiv (2023)."},{"key":"e_1_3_2_2_16_1","volume-title":"MovieFactory: Automatic Movie Creation from Text using Large Generative Models for Language and Images. arXiv","author":"Zhu Junchen","year":"2023","unstructured":"Junchen Zhu, Huan Yang, Huiguo He, Wenjing Wang, Zixi Tuo, Wen-Huang Cheng, Lianli Gao, Jingkuan Song, and Jianlong Fu. 2023. MovieFactory: Automatic Movie Creation from Text using Large Generative Models for Language and Images. arXiv (2023)."}],"event":{"name":"MM '23: The 31st ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Ottawa ON Canada","acronym":"MM '23"},"container-title":["Proceedings of the 31st ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3612667","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3581783.3612667","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T00:03:43Z","timestamp":1755821023000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3581783.3612667"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,10,26]]},"references-count":16,"alternative-id":["10.1145\/3581783.3612667","10.1145\/3581783"],"URL":"https:\/\/doi.org\/10.1145\/3581783.3612667","relation":{},"subject":[],"published":{"date-parts":[[2023,10,26]]},"assertion":[{"value":"2023-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}