{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,23]],"date-time":"2026-04-23T07:59:50Z","timestamp":1776931190994,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":64,"publisher":"ACM","content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,12,15]]},"DOI":"10.1145\/3757377.3764007","type":"proceedings-article","created":{"date-parts":[[2025,12,8]],"date-time":"2025-12-08T16:27:29Z","timestamp":1765211249000},"page":"1-11","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["FairyGen: Storied Cartoon Video from a Single Child-Drawn Character"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-9573-479X","authenticated-orcid":false,"given":"Jiayi","family":"Zheng","sequence":"first","affiliation":[{"name":"GVC Lab, Great Bay University, Dongguan, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3607-2236","authenticated-orcid":false,"given":"Xiaodong","family":"Cun","sequence":"additional","affiliation":[{"name":"GVC Lab, Great Bay University, Dongguan, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,12,14]]},"reference":[{"key":"e_1_3_3_1_2_1","doi-asserted-by":"crossref","unstructured":"Rameen Abdal Or Patashnik Ivan Skorokhodov Willi Menapace Aliaksandr Siarohin Sergey Tulyakov Daniel Cohen-Or and Kfir Aberman. 2025. Dynamic Concepts Personalization from Single Videos. arxiv:https:\/\/arXiv.org\/abs\/2502.14844\u00a0[cs.GR]","DOI":"10.1145\/3721238.3730644"},{"key":"e_1_3_3_1_3_1","unstructured":"Adobe Inc.2022. Mixamo. https:\/\/www.mixamo.com. Accessed: May 5 2024."},{"key":"e_1_3_3_1_4_1","unstructured":"Jianhong Bai Menghan Xia Xiao Fu Xintao Wang Lianrui Mu Jinwen Cao Zuozhu Liu Haoji Hu Xiang Bai Pengfei Wan and Di Zhang. 2025. ReCamMaster: Camera-Controlled Generative Rendering from A Single Video. arxiv:https:\/\/arXiv.org\/abs\/2503.11647\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2503.11647"},{"key":"e_1_3_3_1_5_1","unstructured":"Xiuli Bi Jian Lu Bo Liu Xiaodong Cun Yong Zhang WeiSheng Li and Bin Xiao. 2024. CustomTTT: Motion and Appearance Customized Video Generation via Test-Time Training. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2412.15646 (2024)."},{"key":"e_1_3_3_1_6_1","unstructured":"Andreas Blattmann Tim Dockhorn Sumith Kulal Daniel Mendelevitch Maciej Kilian Dominik Lorenz Yam Levi Zion English Vikram Voleti Adam Letts et\u00a0al. 2023. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2311.15127 (2023)."},{"key":"e_1_3_3_1_7_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19787-1_29"},{"key":"e_1_3_3_1_8_1","doi-asserted-by":"crossref","unstructured":"Hong Chen Rujun Han Te-Lin Wu Hideki Nakayama and Nanyun Peng. 2022. Character-centric story visualization via visual planning and token alignment. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2210.08465 (2022).","DOI":"10.18653\/v1\/2022.emnlp-main.565"},{"key":"e_1_3_3_1_9_1","unstructured":"Haoxin Chen Menghan Xia Yingqing He Yong Zhang Xiaodong Cun Shaoshu Yang Jinbo Xing Yaofang Liu Qifeng Chen Xintao Wang et\u00a0al. 2023. Videocrafter1: Open diffusion models for high-quality video generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2310.19512 (2023)."},{"key":"e_1_3_3_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00698"},{"key":"e_1_3_3_1_11_1","unstructured":"DeepSeek. 2025. DeepSeek-R1: A Reasoning Model. https:\/\/deepseek.com\/."},{"key":"e_1_3_3_1_12_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72684-2_11"},{"key":"e_1_3_3_1_13_1","unstructured":"Rinon Gal Yuval Alaluf Yuval Atzmon Or Patashnik Amit\u00a0H Bermano Gal Chechik and Daniel Cohen-Or. 2022. An image is worth one word: Personalizing text-to-image generation using textual inversion. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2208.01618 (2022)."},{"key":"e_1_3_3_1_14_1","doi-asserted-by":"crossref","unstructured":"Yuan Gong Youxin Pang Xiaodong Cun Menghan Xia Yingqing He Haoxin Chen Longyue Wang Yong Zhang Xintao Wang Ying Shan and Yujiu Yang. 2023. TaleCrafter: Interactive Story Visualization with Multiple Characters. arxiv:https:\/\/arXiv.org\/abs\/2305.18247\u00a0[cs.CV]","DOI":"10.1145\/3610548.3618184"},{"key":"e_1_3_3_1_15_1","unstructured":"Huiguo He Huan Yang Zixi Tuo Yuan Zhou Qiuyue Wang Yuhang Zhang Zeyu Liu Wenhao Huang Hongyang Chao and Jian Yin. 2024. Dreamstory: Open-domain story visualization by llm-guided multi-subject consistent diffusion. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2407.12899 (2024)."},{"key":"e_1_3_3_1_16_1","unstructured":"Yingqing He Menghan Xia Haoxin Chen Xiaodong Cun Yuan Gong Jinbo Xing Yong Zhang Xintao Wang Chao Weng Ying Shan et\u00a0al. 2023. Animate-a-story: Storytelling with retrieval-augmented video generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2307.06940 (2023)."},{"key":"e_1_3_3_1_17_1","unstructured":"Jonathan Ho Ajay Jain and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Advances in neural information processing systems 33 (2020) 6840\u20136851."},{"key":"e_1_3_3_1_18_1","unstructured":"Edward\u00a0J Hu Yelong Shen Phillip Wallis Zeyuan Allen-Zhu Yuanzhi Li Shean Wang Lu Wang and Weizhu Chen. 2021. Lora: Low-rank adaptation of large language models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2106.09685 (2021)."},{"key":"e_1_3_3_1_19_1","unstructured":"Panwen Hu Jin Jiang Jianqi Chen Mingfei Han Shengcai Liao Xiaojun Chang and Xiaodan Liang. 2024. StoryAgent: Customized Storytelling Video Generation via Multi-Agent Collaboration. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2411.04925 (2024)."},{"key":"e_1_3_3_1_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02060"},{"key":"e_1_3_3_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00639"},{"key":"e_1_3_3_1_22_1","unstructured":"Xuan Ju Xian Liu Xintao Wang Yuxuan Bian Ying Shan and Qiang Xu. 2024. BrushNet: A Plug-and-Play Image Inpainting Model with Decomposed Dual-Branch Diffusion. arxiv:https:\/\/arXiv.org\/abs\/2403.06976\u00a0[cs.CV]"},{"key":"e_1_3_3_1_23_1","unstructured":"Weijie Kong Qi Tian Zijian Zhang Rox Min Zuozhuo Dai Jin Zhou Jiangfeng Xiong Xin Li Bo Wu Jianwei Zhang et\u00a0al. 2024. Hunyuanvideo: A systematic framework for large video generative models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2412.03603 (2024)."},{"key":"e_1_3_3_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01639"},{"key":"e_1_3_3_1_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00192"},{"key":"e_1_3_3_1_26_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_20"},{"key":"e_1_3_3_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00649"},{"key":"e_1_3_3_1_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00592"},{"key":"e_1_3_3_1_29_1","volume-title":"Forty-first International Conference on Machine Learning","author":"Liu Shih-Yang","year":"2024","unstructured":"Shih-Yang Liu, Chien-Yi Wang, Hongxu Yin, Pavlo Molchanov, Yu-Chiang\u00a0Frank Wang, Kwang-Ting Cheng, and Min-Hung Chen. 2024b. Dora: Weight-decomposed low-rank adaptation. In Forty-first International Conference on Machine Learning."},{"key":"e_1_3_3_1_30_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.02090"},{"key":"e_1_3_3_1_31_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19836-6_5"},{"key":"e_1_3_3_1_32_1","first-page":"401","volume-title":"European Conference on Computer Vision","author":"Oh Gyeongrok","year":"2024","unstructured":"Gyeongrok Oh, Jaehwan Jeong, Sieun Kim, Wonmin Byeon, Jinkyu Kim, Sungwoong Kim, and Sangpil Kim. 2024. Mevg: Multi-event video generation with text-to-video models. In European Conference on Computer Vision. Springer, 401\u2013418."},{"key":"e_1_3_3_1_33_1","unstructured":"OpenAI. 2022. ChatGPT. https:\/\/openai.com\/blog\/chatgpt."},{"key":"e_1_3_3_1_34_1","doi-asserted-by":"crossref","unstructured":"Boxiao Pan Zhan Xu Chun-Hao Huang Krishna\u00a0Kumar Singh Yang Zhou Leonidas\u00a0J Guibas and Jimei Yang. 2024b. Actanywhere: Subject-aware video background generation. Advances in Neural Information Processing Systems 37 (2024) 29754\u201329776.","DOI":"10.52202\/079017-0936"},{"key":"e_1_3_3_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00290"},{"key":"e_1_3_3_1_36_1","unstructured":"Dustin Podell Zion English Kyle Lacey Andreas Blattmann Tim Dockhorn Jonas M\u00fcller Joe Penna and Robin Rombach. 2023. Sdxl: Improving latent diffusion models for high-resolution image synthesis. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2307.01952 (2023)."},{"key":"e_1_3_3_1_37_1","unstructured":"Qwen. 2025. Qwen Model. https:\/\/help.aliyun.com\/product\/170553.html."},{"key":"e_1_3_3_1_38_1","first-page":"8748","volume-title":"International conference on machine learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In International conference on machine learning. PmLR, 8748\u20138763."},{"key":"e_1_3_3_1_39_1","unstructured":"Colin Raffel Noam Shazeer Adam Roberts Katherine Lee Sharan Narang Michael Matena Yanqi Zhou Wei Li and Peter\u00a0J Liu. 2020. Exploring the limits of transfer learning with a unified text-to-text transformer. Journal of machine learning research 21 140 (2020) 1\u201367."},{"key":"e_1_3_3_1_40_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00246"},{"key":"e_1_3_3_1_41_1","unstructured":"Rokoko. 2023. Rokoko Studio Live Blender. https:\/\/github.com\/Rokoko\/rokoko-studiolive-blender. Accessed: May 5 2024."},{"key":"e_1_3_3_1_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_3_1_43_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_3_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"e_1_3_3_1_45_1","doi-asserted-by":"publisher","unstructured":"Harrison\u00a0Jesse Smith Qingyuan Zheng Yifei Li Somya Jain and Jessica\u00a0K. Hodgins. 2023a. A Method for Animating Children\u2019s Drawings of the Human Figure. ACM Trans. Graph. 42 3 Article 32 (jun 2023) 15\u00a0pages. 10.1145\/3592788","DOI":"10.1145\/3592788"},{"key":"e_1_3_3_1_46_1","unstructured":"Harrison\u00a0Jesse Smith Qingyuan Zheng Yifei Li Somya Jain and Jessica\u00a0K. Hodgins. 2023b. One Model to Rig Them All: Diverse Skeleton Rigging with UniRig. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2303.12741 (2023)."},{"key":"e_1_3_3_1_47_1","unstructured":"Kihyuk Sohn Nataniel Ruiz Kimin Lee Daniel\u00a0Castro Chin Irina Blok Huiwen Chang Jarred Barber Lu Jiang Glenn Entis Yuanzhen Li et\u00a0al. 2023. Styledrop: Text-to-image generation in any style. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2306.00983 (2023)."},{"key":"e_1_3_3_1_48_1","unstructured":"Sitong Su Litao Guo Lianli Gao Heng\u00a0Tao Shen and Jingkuan Song. 2023. Make-a-storyboard: A general framework for storyboard with disentangled and merged control. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2312.07549 (2023)."},{"key":"e_1_3_3_1_49_1","unstructured":"Shuai Tan Biao Gong Xiang Wang Shiwei Zhang Dandan Zheng Ruobin Zheng Kecheng Zheng Jingdong Chen and Ming Yang. 2024. Animate-X: Universal Character Image Animation with Enhanced Motion Representation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2410.10306 (2024)."},{"key":"e_1_3_3_1_50_1","first-page":"479","volume-title":"European Conference on Computer Vision","author":"Tao Ming","year":"2024","unstructured":"Ming Tao, Bing-Kun Bao, Hao Tang, Yaowei Wang, and Changsheng Xu. 2024. Storyimager: A unified and efficient framework for coherent story visualization and completion. In European Conference on Computer Vision. Springer, 479\u2013495."},{"key":"e_1_3_3_1_51_1","unstructured":"Team Wan Ang Wang Baole Ai Bin Wen Chaojie Mao Chen-Wei Xie Di Chen Feiwu Yu Haiming Zhao Jianxiao Yang Jianyuan Zeng Jiayu Wang Jingfeng Zhang Jingren Zhou Jinkai Wang Jixuan Chen Kai Zhu Kang Zhao Keyu Yan Lianghua Huang Mengyang Feng Ningyi Zhang Pandeng Li Pingyu Wu Ruihang Chu Ruili Feng Shiwei Zhang Siyang Sun Tao Fang Tianxing Wang Tianyi Gui Tingyu Weng Tong Shen Wei Lin Wei Wang Wei Wang Wenmeng Zhou Wente Wang Wenting Shen Wenyuan Yu Xianzhong Shi Xiaoming Huang Xin Xu Yan Kou Yangyu Lv Yifei Li Yijing Liu Yiming Wang Yingya Zhang Yitong Huang Yong Li You Wu Yu Liu Yulin Pan Yun Zheng Yuntao Hong Yupeng Shi Yutong Feng Zeyinzi Jiang Zhen Han Zhi-Fan Wu and Ziyu Liu. 2025. Wan: Open and Advanced Large-Scale Video Generative Models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2503.20314 (2025)."},{"key":"e_1_3_3_1_52_1","unstructured":"Wen Wang Canyu Zhao Hao Chen Zhekai Chen Kecheng Zheng and Chunhua Shen. 2024. AutoStory: Generating Diverse Storytelling Images with Minimal Human Efforts. International Journal of Computer Vision (2024) 1\u201322."},{"key":"e_1_3_3_1_53_1","first-page":"6537","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Wei Yujie","year":"2024","unstructured":"Yujie Wei, Shiwei Zhang, Zhiwu Qing, Hangjie Yuan, Zhiheng Liu, Yu Liu, Yingya Zhang, Jingren Zhou, and Hongming Shan. 2024. Dreamvideo: Composing your dream videos with customized subject and motion. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. 6537\u20136549."},{"key":"e_1_3_3_1_54_1","unstructured":"Shuai Yang Yuying Ge Yang Li Yukang Chen Yixiao Ge Ying Shan and Yingcong Chen. 2024a. Seed-story: Multimodal long story generation with large language model. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2407.08683 (2024)."},{"key":"e_1_3_3_1_55_1","unstructured":"Zhuoyi Yang Jiayan Teng Wendi Zheng Ming Ding Shiyu Huang Jiazheng Xu Yuanming Yang Wenyi Hong Xiaohan Zhang Guanyu Feng et\u00a0al. 2024b. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2408.06072 (2024)."},{"key":"e_1_3_3_1_56_1","unstructured":"Ge Yuan Xiaodong Cun Yong Zhang Maomao Li Chenyang Qi Xintao Wang Ying Shan and Huicheng Zheng. 2023. Inserting Anybody in Diffusion Models via Celeb Basis. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2306.00926 (2023)."},{"key":"e_1_3_3_1_57_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i9.33079"},{"key":"e_1_3_3_1_58_1","unstructured":"Jia-Peng Zhang Cheng-Feng Pu Meng-Hao Guo Yan-Pei Cao and Shi-Min Hu. 2025a. One Model to Rig Them All: Diverse Skeleton Rigging with UniRig. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2504.12451 (2025)."},{"key":"e_1_3_3_1_59_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"e_1_3_3_1_60_1","unstructured":"Canyu Zhao Mingyu Liu Wen Wang Weihua Chen Fan Wang Hao Chen Bo Zhang and Chunhua Shen. 2024. Moviedreamer: Hierarchical generation for coherent long visual sequence. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2407.16655 (2024)."},{"key":"e_1_3_3_1_61_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72992-8_16"},{"key":"e_1_3_3_1_62_1","doi-asserted-by":"crossref","unstructured":"Jie Zhou Chufeng Xiao Miu-Ling Lam and Hongbo Fu. 2024a. DrawingSpinUp: 3D Animation from Single Character Drawings. SIGGRAPH Asia 2024 Conference Papers (2024). https:\/\/api.semanticscholar.org\/CorpusID:272654016","DOI":"10.1145\/3680528.3687593"},{"key":"e_1_3_3_1_63_1","unstructured":"Yupeng Zhou Daquan Zhou Ming-Ming Cheng Jiashi Feng and Qibin Hou. 2024b. StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation. NeurIPS 2024 (2024)."},{"key":"e_1_3_3_1_64_1","doi-asserted-by":"crossref","unstructured":"Zhongyang Zhu and Jie Tang. 2025. Cogcartoon: towards practical story visualization. International Journal of Computer Vision 133 4 (2025) 1808\u20131833.","DOI":"10.1007\/s11263-024-02267-5"},{"key":"e_1_3_3_1_65_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00841"}],"event":{"name":"SA Conference Papers '25: SIGGRAPH Asia 2025 Conference Papers","location":"Hong Kong Hong Kong","acronym":"SA Conference Papers '25","sponsor":["SIGGRAPH ACM Special Interest Group on Computer Graphics and Interactive Techniques"]},"container-title":["Proceedings of the SIGGRAPH Asia 2025 Conference Papers"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3757377.3764007","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,9]],"date-time":"2025-12-09T03:25:46Z","timestamp":1765250746000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3757377.3764007"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,14]]},"references-count":64,"alternative-id":["10.1145\/3757377.3764007","10.1145\/3757377"],"URL":"https:\/\/doi.org\/10.1145\/3757377.3764007","relation":{},"subject":[],"published":{"date-parts":[[2025,12,14]]},"assertion":[{"value":"2025-12-14","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}