{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:16:39Z","timestamp":1777655799166,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,12,3]],"date-time":"2024-12-03T00:00:00Z","timestamp":1733184000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Shanghai Pujiang Program","award":["23PJ1421800"],"award-info":[{"award-number":["23PJ1421800"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,12,3]]},"DOI":"10.1145\/3696409.3700181","type":"proceedings-article","created":{"date-parts":[[2024,12,28]],"date-time":"2024-12-28T09:55:23Z","timestamp":1735379723000},"page":"1-8","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":2,"title":["LoopAnimate: Loopable Salient Object Animation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8685-4300","authenticated-orcid":false,"given":"Fanyi","family":"Wang","sequence":"first","affiliation":[{"name":"Honor, shanghai, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-5642-2656","authenticated-orcid":false,"given":"Peng","family":"Liu","sequence":"additional","affiliation":[{"name":"OPPO AI Center, shenzhen, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3690-5085","authenticated-orcid":false,"given":"Haotian","family":"Hu","sequence":"additional","affiliation":[{"name":"Zhejiang Leapmotor Technology CO., LTD., hangzhou, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1980-9283","authenticated-orcid":false,"given":"Dan","family":"Meng","sequence":"additional","affiliation":[{"name":"OPPO Research Institute, shanghai, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7285-6922","authenticated-orcid":false,"given":"Jingwen","family":"Su","sequence":"additional","affiliation":[{"name":"OPPO AI Center, beijing, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2428-0305","authenticated-orcid":false,"given":"Jinjin","family":"Xu","sequence":"additional","affiliation":[{"name":"OPPO research institute, shanghai, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-6300-8590","authenticated-orcid":false,"given":"Yanhao","family":"Zhang","sequence":"additional","affiliation":[{"name":"OPPO AI Center, beijing, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-4578-6666","authenticated-orcid":false,"given":"Xiaoming","family":"Ren","sequence":"additional","affiliation":[{"name":"OPPO, beijing, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8867-3888","authenticated-orcid":false,"given":"Zhiwang","family":"Zhang","sequence":"additional","affiliation":[{"name":"NingboTech University, ningbo, CN"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,12,28]]},"reference":[{"key":"e_1_3_3_2_2_2","unstructured":"2022. Midjourney. https:\/\/www.midjourney.com\/\/"},{"key":"e_1_3_3_2_3_2","unstructured":"2023. Pika Labs. https:\/\/www.pika.art\/"},{"key":"e_1_3_3_2_4_2","unstructured":"2023. sd-image-variations-diffusers. https:\/\/huggingface.co\/lambdalabs\/sd-image-variations-diffusers"},{"key":"e_1_3_3_2_5_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00175"},{"key":"e_1_3_3_2_6_2","doi-asserted-by":"crossref","unstructured":"Omer Bar-Tal Hila Chefer Omer Tov Charles Herrmann Roni Paiss Shiran Zada Ariel Ephrat Junhwa Hur Guanghui Liu Amit Raj Yuanzhen Li Michael Rubinstein Tomer Michaeli Oliver Wang Deqing Sun Tali Dekel and Inbar Mosseri. 2024. Lumiere: A Space-Time Diffusion Model for Video Generation. arxiv:https:\/\/arXiv.org\/abs\/2401.12945\u00a0[cs.CV]","DOI":"10.1145\/3680528.3687614"},{"key":"e_1_3_3_2_7_2","unstructured":"Samyadeep Basu Nanxuan Zhao Vlad Morariu Soheil Feizi and Varun Manjunatha. 2023. Localizing and Editing Knowledge in Text-to-Image Generative Models. arxiv:https:\/\/arXiv.org\/abs\/2310.13730\u00a0[cs.CV]"},{"key":"e_1_3_3_2_8_2","unstructured":"Andreas Blattmann Tim Dockhorn Sumith Kulal Daniel Mendelevitch Maciej Kilian Dominik Lorenz Yam Levi Zion English Vikram Voleti Adam Letts Varun Jampani and Robin Rombach. 2023. Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. arxiv:https:\/\/arXiv.org\/abs\/2311.15127\u00a0[cs.CV]"},{"key":"e_1_3_3_2_9_2","unstructured":"Andreas Blattmann Robin Rombach Huan Ling Tim Dockhorn SeungWook Kim Sanja Fidler and Karsten Kreis. 2023. Align your Latents. (Apr 2023)."},{"key":"e_1_3_3_2_10_2","doi-asserted-by":"crossref","unstructured":"Duygu Ceylan Chun-Hao\u00a0Paul Huang and Niloy\u00a0J. Mitra. 2023. Pix2Video: Video Editing using Image Diffusion. arxiv:https:\/\/arXiv.org\/abs\/2303.12688\u00a0[cs.CV]","DOI":"10.1109\/ICCV51070.2023.02121"},{"key":"e_1_3_3_2_11_2","unstructured":"Junsong Chen Jincheng Yu Chongjian Ge Lewei Yao Enze Xie Yue Wu Zhongdao Wang James Kwok Ping Luo Huchuan Lu and Zhenguo Li. [n. d.]. PIXART-\u03b1: FAST TRAINING OF DIFFUSION TRANS-FORMER FOR PHOTOREALISTIC TEXT-TO-IMAGE SYNTHESIS. ([n. d.])."},{"key":"e_1_3_3_2_12_2","unstructured":"Tsai-Shien Chen Chieh\u00a0Hubert Lin Hung-Yu Tseng Tsung-Yi Lin and Ming-Hsuan Yang. 2023. Motion-conditioned diffusion model for controllable video synthesis. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2304.14404 (2023)."},{"key":"e_1_3_3_2_13_2","unstructured":"Xi Chen Zhiheng Liu Mengting Chen Yutong Feng Yu Liu Yujun Shen and Hengshuang Zhao. 2023. LivePhoto: Real Image Animation with Text-guided Motion Control. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.02928 (2023)."},{"key":"e_1_3_3_2_14_2","doi-asserted-by":"crossref","unstructured":"Xun Guo Mingwu Zheng Liang Hou Yuan Gao Yufan Deng Pengfei Wan Di Zhang Yufan Liu Weiming Hu Zhengjun Zha Haibin Huang and Chongyang Ma. 2024. I2V-Adapter: A General Image-to-Video Adapter for Diffusion Models. arxiv:https:\/\/arXiv.org\/abs\/2312.16693\u00a0[cs.CV]","DOI":"10.1145\/3641519.3657407"},{"key":"e_1_3_3_2_15_2","unstructured":"Yuwei Guo Ceyuan Yang Anyi Rao Yaohui Wang Yu Qiao Dahua Lin and Bo Dai. 2023. Animatediff: Animate your personalized text-to-image diffusion models without specific tuning. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2307.04725 (2023)."},{"key":"e_1_3_3_2_16_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01768"},{"key":"e_1_3_3_2_17_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02073"},{"key":"e_1_3_3_2_18_2","doi-asserted-by":"crossref","unstructured":"Levon Khachatryan Andranik Movsisyan Vahram Tadevosyan Roberto Henschel Zhangyang Wang Shant Navasardyan and Humphrey Shi. 2023. Text2Video-Zero: Text-to-Image Diffusion Models are Zero-Shot Video Generators. arxiv:https:\/\/arXiv.org\/abs\/2303.13439\u00a0[cs.CV]","DOI":"10.1109\/ICCV51070.2023.01462"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00715"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP48485.2024.10446680"},{"key":"e_1_3_3_2_21_2","unstructured":"Yixin Liu Kai Zhang Yuan Li Zhiling Yan Chujie Gao Ruoxi Chen Zhengqing Yuan Yue Huang Hanchi Sun Jianfeng Gao et\u00a0al. 2024. Sora: A Review on Background Technology Limitations and Opportunities of Large Vision Models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2402.17177 (2024)."},{"key":"e_1_3_3_2_22_2","unstructured":"Haoyu Ma Shahin Mahdizadehaghdam Bichen Wu Zhipeng Fan Yuchao Gu Wenliang Zhao Lior Shapira and Xiaohui Xie. 2023. MaskINT: Video Editing via Interpolative Non-autoregressive Masked Transformers. arxiv preprint (2023)."},{"key":"e_1_3_3_2_23_2","unstructured":"Xin Ma Yaohui Wang Gengyun Jia Xinyuan Chen Ziwei Liu Yuan-Fang Li Cunjian Chen and Yu Qiao. 2024. Latte: Latent diffusion transformer for video generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.03048 (2024)."},{"key":"e_1_3_3_2_24_2","unstructured":"Yue Ma Yingqing He Hongfa Wang Andong Wang Chenyang Qi Chengfei Cai Xiu Li Zhifeng Li Heung-Yeung Shum Wei Liu and Qifeng Chen. 2024. Follow-Your-Click: Open-domain Regional Image Animation via Short Prompts. arxiv:https:\/\/arXiv.org\/abs\/2403.08268\u00a0[cs.CV]"},{"key":"e_1_3_3_2_25_2","unstructured":"William Peebles and Saining Xie. 2023. Scalable Diffusion Models with Transformers. arxiv:https:\/\/arXiv.org\/abs\/2212.09748\u00a0[cs.CV]"},{"key":"e_1_3_3_2_26_2","unstructured":"Chenyang Qi Xiaodong Cun Yong Zhang Chenyang Lei Xintao Wang Ying Shan and Qifeng Chen. 2023. FateZero: Fusing Attentions for Zero-shot Text-based Video Editing. arxiv:https:\/\/arXiv.org\/abs\/2303.09535\u00a0[cs.CV]"},{"key":"e_1_3_3_2_27_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i5.28255"},{"key":"e_1_3_3_2_28_2","unstructured":"Leigang Qu Shengqiong Wu Hao Fei Liqiang Nie and Tat-Seng Chua. 2023. LayoutLLM-T2I: Eliciting Layout Guidance from LLM for Text-to-Image Generation. Proceedings of the ACM International Conference on Multimedia (2023)."},{"key":"e_1_3_3_2_29_2","unstructured":"Runway reseachers. 2023.10. 2 6 7 8. Gen-2: The next step forward for generative ai. https:\/\/research.runwayml.com\/"},{"key":"e_1_3_3_2_30_2","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6rn Ommer. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. arxiv:https:\/\/arXiv.org\/abs\/2112.10752\u00a0[cs.CV]","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_3_2_31_2","doi-asserted-by":"crossref","unstructured":"Olaf Ronneberger Philipp Fischer and Thomas Brox. 2015. U-Net: Convolutional Networks for Biomedical Image Segmentation. arxiv:https:\/\/arXiv.org\/abs\/1505.04597\u00a0[cs.CV]","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"e_1_3_3_2_32_2","unstructured":"Chitwan Saharia William Chan Saurabh Saxena Lala Li Jay Whang Emily Denton Seyed Kamyar Seyed Ghasemipour Burcu Karagol SSara Mahdavi RaphaGontijo Lopes Tim Salimans Jonathan Ho DavidJ Fleet and Mohammad Norouzi. [n. d.]. Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding. ([n. d.])."},{"key":"e_1_3_3_2_33_2","doi-asserted-by":"crossref","unstructured":"Xiaoyu Shi Zhaoyang Huang Fu-Yun Wang Weikang Bian Dasong Li Yi Zhang Manyuan Zhang Ka\u00a0Chun Cheung Simon See Hongwei Qin Jifeng Dai and Hongsheng Li. 2024. Motion-I2V: Consistent and Controllable Image-to-Video Generation with Explicit Motion Modeling. arxiv:https:\/\/arXiv.org\/abs\/2401.15977\u00a0[cs.CV]","DOI":"10.1145\/3641519.3657497"},{"key":"e_1_3_3_2_34_2","unstructured":"Uriel Singer Adam Polyak Thomas Hayes Xi Yin Jie An Songyang Zhang Qiyuan Hu Harry Yang Oron Ashual Oran Gafni Devi Parikh Sonal Gupta and Yaniv Taigman. 2022. Make-A-Video: Text-to-Video Generation without Text-Video Data. (Sep 2022)."},{"key":"e_1_3_3_2_35_2","doi-asserted-by":"publisher","DOI":"10.1145\/3581783.3613806"},{"key":"e_1_3_3_2_36_2","doi-asserted-by":"crossref","unstructured":"Zachary Teed and Jia Deng. 2020. RAFT: Recurrent All-Pairs Field Transforms for Optical Flow. arxiv:https:\/\/arXiv.org\/abs\/2003.12039\u00a0[cs.CV]","DOI":"10.1007\/978-3-030-58536-5_24"},{"key":"e_1_3_3_2_37_2","unstructured":"Aaron van\u00a0den Oord Oriol Vinyals and Koray Kavukcuoglu. 2018. Neural Discrete Representation Learning. arxiv:https:\/\/arXiv.org\/abs\/1711.00937\u00a0[cs.LG]"},{"key":"e_1_3_3_2_38_2","unstructured":"Qinghe Wang Xu Jia Xiaomin Li Taiqing Li Liqian Ma Yunzhi Zhuge and Huchuan Lu. 2024. StableIdentity: Inserting Anybody into Anywhere at First Sight. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.15975 (2024)."},{"key":"e_1_3_3_2_39_2","unstructured":"Xiang Wang Hangjie Yuan Shiwei Zhang Dayou Chen Jiuniu Wang Yingya Zhang Yujun Shen Deli Zhao and Jingren Zhou. 2023. VideoComposer: Compositional Video Synthesis with Motion Controllability. arxiv:https:\/\/arXiv.org\/abs\/2306.02018\u00a0[cs.CV]"},{"key":"e_1_3_3_2_40_2","doi-asserted-by":"crossref","unstructured":"Zhou Wang Alan\u00a0C Bovik Hamid\u00a0R Sheikh and Eero\u00a0P Simoncelli. 2004. Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing 13 4 (2004) 600\u2013612.","DOI":"10.1109\/TIP.2003.819861"},{"key":"e_1_3_3_2_41_2","unstructured":"JayZhangjie Wu Yixiao Ge Xintao Wang Weixian Lei Yuchao Gu Wynne Hsu Ying Shan Xiaohu Qie and MikeZheng Shou. 2022. Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation. (Dec 2022)."},{"key":"e_1_3_3_2_42_2","unstructured":"Jinbo Xing Menghan Xia Yong Zhang Haoxin Chen Xintao Wang Tien-Tsin Wong and Ying Shan. 2023. Dynamicrafter: Animating open-domain images with video diffusion priors. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2310.12190 (2023)."},{"key":"e_1_3_3_2_43_2","unstructured":"Zeyue Xue Guanglu Song Qiushan Guo Boxiao Liu Zhuofan Zong Yu Liu Ping Luo and RaffaelloSanzioDa Urbino. [n. d.]. RAPHAEL: Text-to-Image Generation via Large Mixture of Diffusion Paths. ([n. d.])."},{"key":"e_1_3_3_2_44_2","unstructured":"Yan Zeng Guoqiang Wei Jiani Zheng Jiaxin Zou Yang Wei Yuchen Zhang and Hang Li. 2023. Make pixels dance: High-dynamic video generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2311.10982 (2023)."},{"key":"e_1_3_3_2_45_2","unstructured":"Jianfeng Zhang Hanshu Yan Zhongcong Xu Jiashi Feng and JunHao Liew. [n. d.]. MagicAvatar: Multimodal Avatar Generation and Animation. ([n. d.])."},{"key":"e_1_3_3_2_46_2","unstructured":"Shiwei Zhang Jiayu Wang Yingya Zhang Kang Zhao Hangjie Yuan Zhiwu Qin Xiang Wang Deli Zhao and Jingren Zhou. 2023. I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models. arxiv:https:\/\/arXiv.org\/abs\/2311.04145\u00a0[cs.CV]"},{"key":"e_1_3_3_2_47_2","unstructured":"Yiming Zhang Zhening Xing Yanhong Zeng Youqing Fang and Kai Chen. 2023. Pia: Your personalized image animator via plug-and-play modules in text-to-image models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.13964 (2023)."}],"event":{"name":"MMAsia '24: ACM Multimedia Asia","location":"Auckland New Zealand","acronym":"MMAsia '24","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 6th ACM International Conference on Multimedia in Asia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3696409.3700181","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3696409.3700181","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:10:11Z","timestamp":1750295411000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3696409.3700181"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,3]]},"references-count":46,"alternative-id":["10.1145\/3696409.3700181","10.1145\/3696409"],"URL":"https:\/\/doi.org\/10.1145\/3696409.3700181","relation":{},"subject":[],"published":{"date-parts":[[2024,12,3]]},"assertion":[{"value":"2024-12-28","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}