{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T19:05:37Z","timestamp":1784228737457,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":64,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T00:00:00Z","timestamp":1784419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,7,19]]},"DOI":"10.1145\/3799902.3811062","type":"proceedings-article","created":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T16:15:27Z","timestamp":1784218527000},"page":"1-12","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Motion4Motion: Motion Transfer Across Subjects at Inference"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2528-6178","authenticated-orcid":false,"given":"Ling-Hao","family":"Chen","sequence":"first","affiliation":[{"name":"Tsinghua University, Shenzhen, China and Stepfun, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0443-7915","authenticated-orcid":false,"given":"Zixin","family":"Yin","sequence":"additional","affiliation":[{"name":"Hong Kong University of Science and Technology, Hong Kong, China and Stepfun, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-9507-6741","authenticated-orcid":false,"given":"Duomin","family":"Wang","sequence":"additional","affiliation":[{"name":"Stepfun, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1251-2129","authenticated-orcid":false,"given":"Xianfang","family":"Zeng","sequence":"additional","affiliation":[{"name":"Stepfun, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5570-2710","authenticated-orcid":false,"given":"Gang","family":"Yu","sequence":"additional","affiliation":[{"name":"Stepfun, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,19]]},"reference":[{"key":"e_1_3_3_1_2_1","doi-asserted-by":"crossref","unstructured":"Kfir Aberman Peizhuo Li Dani Lischinski Olga Sorkine-Hornung Daniel Cohen-Or and Baoquan Chen. 2020. Skeleton-aware networks for deep motion retargeting. ACM TOG 39 4 (2020) 62\u20131.","DOI":"10.1145\/3386569.3392462"},{"key":"e_1_3_3_1_3_1","doi-asserted-by":"publisher","DOI":"10.1145\/3641519.3657423"},{"key":"e_1_3_3_1_4_1","unstructured":"Artell. 2025. Auto-Rig Pro. https:\/\/superhivemarket.com\/products\/auto-rig-pro. Accessed: 2025-05-21."},{"key":"e_1_3_3_1_5_1","unstructured":"Ryan Burgert Charles Herrmann Forrester Cole Michael\u00a0S Ryoo Neal Wadhwa Andrey Voynov and Nataniel Ruiz. 2025a. MotionV2V: Editing Motion in a Video. arxiv:https:\/\/arXiv.org\/abs\/2511.20640\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2511.20640"},{"key":"e_1_3_3_1_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00011"},{"key":"e_1_3_3_1_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00727"},{"key":"e_1_3_3_1_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.02062"},{"key":"e_1_3_3_1_9_1","unstructured":"Ling-Hao Chen Shunlin Lu Wenxun Dai Zhiyang Dou Xuan Ju Jingbo Wang Taku Komura and Lei Zhang. 2024. Pay attention and move better: Harnessing attention for interactive motion generation and training-free editing. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2410.18977 (2024)."},{"key":"e_1_3_3_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00875"},{"key":"e_1_3_3_1_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3757377.3763811"},{"key":"e_1_3_3_1_12_1","unstructured":"Gang Cheng Xin Gao Li Hu Siqi Hu Mingyang Huang Chaonan Ji Ju Li Dechao Meng Jinwei Qi Penchong Qiao et\u00a0al. 2025. Wan-animate: Unified character animation and replacement with holistic replication. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2509.14055 (2025)."},{"key":"e_1_3_3_1_13_1","unstructured":"Ruihang Chu Yefei He Zhekai Chen Shiwei Zhang Xiaogang Xu Bin Xia Dingdong Wang Hongwei Yi Xihui Liu Hengshuang Zhao Yu Liu Yingya Zhang and Yujiu Yang. 2025. Wan-Move: Motion-controllable Video Generation via Latent Trajectory Guidance. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2512.08765 (2025)."},{"key":"e_1_3_3_1_14_1","first-page":"390","volume-title":"European Conference on Computer Vision","author":"Dai Wenxun","year":"2024","unstructured":"Wenxun Dai, Ling-Hao Chen, Jingbo Wang, Jinpeng Liu, Bo Dai, and Yansong Tang. 2024. Motionlcm: Real-time controllable motion generation via latent consistency model. In European Conference on Computer Vision. Springer, 390\u2013408."},{"key":"e_1_3_3_1_15_1","volume-title":"CVPR","author":"Deng Yingying","year":"2024","unstructured":"Yingying Deng, Xiangyu He, Fan Tang, and Weiming Dong. 2024. Z*: Zero-shot Style Transfer via Attention Rearrangement. In CVPR."},{"key":"e_1_3_3_1_16_1","volume-title":"Forty-first ICML","author":"Esser Patrick","year":"2024","unstructured":"Patrick Esser, Sumith Kulal, Andreas Blattmann, Rahim Entezari, Jonas M\u00fcller, Harry Saini, Yam Levi, Dominik Lorenz, Axel Sauer, Frederic Boesel, et\u00a0al. 2024. Scaling rectified flow transformers for high-resolution image synthesis. In Forty-first ICML."},{"key":"e_1_3_3_1_17_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-34710-8_13"},{"key":"e_1_3_3_1_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00010"},{"key":"e_1_3_3_1_19_1","doi-asserted-by":"publisher","DOI":"10.1145\/280814.280820"},{"key":"e_1_3_3_1_20_1","unstructured":"Ahmet\u00a0Berke Gokmen Yigit Ekin Bahri\u00a0Batuhan Bilecen and Aysegul Dundar. 2025. RoPECraft: Training-Free Motion Transfer with Trajectory-Guided RoPE Optimization on Diffusion Transformers. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2505.13344 (2025)."},{"key":"e_1_3_3_1_21_1","unstructured":"Zekai Gu Rui Yan Jiahao Lu Peng Li Zhiyang Dou Chenyang Si Zhen Dong Qifeng Liu Cheng Lin Ziwei Liu Wenping Wang and Yuan Liu. 2025. Diffusion as Shader: 3D-aware Video Diffusion for Versatile Video Generation Control. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2501.03847 (2025)."},{"key":"e_1_3_3_1_22_1","volume-title":"ICLR","author":"Guo Yuwei","year":"2024","unstructured":"Yuwei Guo, Ceyuan Yang, Anyi Rao, Zhengyang Liang, Yaohui Wang, Yu Qiao, Maneesh Agrawala, Dahua Lin, and Bo Dai. 2024. AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning. In ICLR."},{"key":"e_1_3_3_1_23_1","volume-title":"The Eleventh International Conference on Learning Representations","author":"Hertz Amir","year":"2023","unstructured":"Amir Hertz, Ron Mokady, Jay Tenenbaum, Kfir Aberman, Yael Pritch, and Daniel Cohen-or. 2023. Prompt-to-Prompt Image Editing with Cross-Attention Control. In The Eleventh International Conference on Learning Representations."},{"key":"e_1_3_3_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00457"},{"key":"e_1_3_3_1_25_1","unstructured":"Jonathan Ho Ajay Jain and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. NeurIPS 33 (2020) 6840\u20136851."},{"key":"e_1_3_3_1_26_1","first-page":"8153","volume-title":"CVPR","author":"Hu Li","year":"2024","unstructured":"Li Hu. 2024. Animate anyone: Consistent and controllable image-to-video synthesis for character animation. In CVPR. 8153\u20138163."},{"key":"e_1_3_3_1_27_1","unstructured":"Guanlong Jiao Biqing Huang Kuan-Chieh Wang and Renjie Liao. 2025. UniEdit-Flow: Unleashing Inversion and Editing in the Era of Flow Models. arxiv:https:\/\/arXiv.org\/abs\/2504.13109\u00a0[cs.CV] https:\/\/arxiv.org\/abs\/2504.13109"},{"key":"e_1_3_3_1_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.00568"},{"key":"e_1_3_3_1_29_1","doi-asserted-by":"publisher","DOI":"10.1145\/311535.311539"},{"key":"e_1_3_3_1_30_1","doi-asserted-by":"crossref","unstructured":"Shujie Li Lei Wang Wei Jia Yang Zhao and Liping Zheng. 2022. An iterative solution for improving the generalization ability of unsupervised skeleton motion retargeting. Computers & Graphics 104 (2022) 129\u2013139.","DOI":"10.1016\/j.cag.2022.04.001"},{"key":"e_1_3_3_1_31_1","volume-title":"30th British Machine Vision Conference (BMVC 2019)","author":"Lim Jongin","year":"2019","unstructured":"Jongin Lim, Hyung\u00a0Jin Chang, and Jin\u00a0Young Choi. 2019. Pmnet: Learning of disentangled pose and movement for unsupervised motion retargeting. In 30th British Machine Vision Conference (BMVC 2019). British Machine Vision Association, BMVA."},{"key":"e_1_3_3_1_32_1","volume-title":"ICLR","author":"Ling Pengyang","year":"2025","unstructured":"Pengyang Ling, Jiazi Bu, Pan Zhang, Xiaoyi Dong, Yuhang Zang, Tong Wu, Huaian Chen, Jiaqi Wang, and Yi Jin. 2025. MotionClone: Training-Free Motion Cloning for Controllable Video Generation. In ICLR."},{"key":"e_1_3_3_1_33_1","volume-title":"ICLR","author":"Lipman Yaron","unstructured":"Yaron Lipman, Ricky\u00a0TQ Chen, Heli Ben-Hamu, Maximilian Nickel, and Matthew Le. [n. d.]. Flow Matching for Generative Modeling. In ICLR."},{"key":"e_1_3_3_1_34_1","first-page":"38","volume-title":"European conference on computer vision","author":"Liu Shilong","year":"2024","unstructured":"Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Qing Jiang, Chunyuan Li, Jianwei Yang, Hang Su, et\u00a0al. 2024a. Grounding dino: Marrying dino with grounded pre-training for open-set object detection. In European conference on computer vision. Springer, 38\u201355."},{"key":"e_1_3_3_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00821"},{"key":"e_1_3_3_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01103"},{"key":"e_1_3_3_1_37_1","unstructured":"Shunlin Lu Ling-Hao Chen Ailing Zeng Jing Lin Ruimao Zhang Lei Zhang and Heung-Yeung Shum. 2023. Humantomato: Text-aligned whole-body motion generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2310.12978 (2023)."},{"key":"e_1_3_3_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"e_1_3_3_1_39_1","first-page":"8748","volume-title":"ICML","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et\u00a0al. 2021. Learning transferable visual models from natural language supervision. In ICML. PmLR, 8748\u20138763."},{"key":"e_1_3_3_1_40_1","unstructured":"Nikhila Ravi Valentin Gabeur Yuan-Ting Hu Ronghang Hu Chaitanya Ryali Tengyu Ma Haitham Khedr Roman R\u00e4dle Chloe Rolland Laura Gustafson et\u00a0al. 2024. Sam 2: Segment anything in images and videos. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2408.00714 (2024)."},{"key":"e_1_3_3_1_41_1","first-page":"1060","volume-title":"ICML","author":"Reed Scott","year":"2016","unstructured":"Scott Reed, Zeynep Akata, Xinchen Yan, Lajanugen Logeswaran, Bernt Schiele, and Honglak Lee. 2016. Generative adversarial text to image synthesis. In ICML. PMLR, 1060\u20131069."},{"key":"e_1_3_3_1_42_1","unstructured":"Tianhe Ren Shilong Liu Ailing Zeng Jing Lin Kunchang Li He Cao Jiayu Chen Xinyu Huang Yukang Chen Feng Yan et\u00a0al. 2024. Grounded sam: Assembling open-world models for diverse visual tasks. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2401.14159 (2024)."},{"key":"e_1_3_3_1_43_1","unstructured":"Rokoko. 2021. Rokoko Motion Capture Solutions. https:\/\/www.rokoko.com\/."},{"key":"e_1_3_3_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_3_1_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01619"},{"key":"e_1_3_3_1_46_1","volume-title":"ICLR","author":"Shin Joonghyuk","year":"2026","unstructured":"Joonghyuk Shin, Zhengqi Li, Richard Zhang, Jun-Yan Zhu, Jaesik Park, Eli Shechtman, and Xun Huang. 2026. MotionStream: Real-Time Video Generation with Interactive Motion Controls. In ICLR."},{"key":"e_1_3_3_1_47_1","doi-asserted-by":"crossref","unstructured":"Jianlin Su Murtadha Ahmed Yu Lu Shengfeng Pan Wen Bo and Yunfeng Liu. 2024. Roformer: Enhanced transformer with rotary position embedding. Neurocomputing 568 (2024) 127063.","DOI":"10.1016\/j.neucom.2023.127063"},{"key":"e_1_3_3_1_48_1","doi-asserted-by":"publisher","DOI":"10.52202\/075280-0068"},{"key":"e_1_3_3_1_49_1","doi-asserted-by":"crossref","unstructured":"Yoad Tewel Omri Kaduri Rinon Gal Yoni Kasten Lior Wolf Gal Chechik and Yuval Atzmon. 2024. Training-free consistent text-to-image generation. ACM Transactions on Graphics (TOG) 43 4 (2024) 1\u201318.","DOI":"10.1145\/3658157"},{"key":"e_1_3_3_1_50_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00191"},{"key":"e_1_3_3_1_51_1","unstructured":"Team Wan Ang Wang Baole Ai Bin Wen Chaojie Mao Chen-Wei Xie Di Chen Feiwu Yu Haiming Zhao Jianxiao Yang Jianyuan Zeng Jiayu Wang Jingfeng Zhang Jingren Zhou Jinkai Wang Jixuan Chen Kai Zhu Kang Zhao Keyu Yan Lianghua Huang Mengyang Feng Ningyi Zhang Pandeng Li Pingyu Wu Ruihang Chu Ruili Feng Shiwei Zhang Siyang Sun Tao Fang Tianxing Wang Tianyi Gui Tingyu Weng Tong Shen Wei Lin Wei Wang Wei Wang Wenmeng Zhou Wente Wang Wenting Shen Wenyuan Yu Xianzhong Shi Xiaoming Huang Xin Xu Yan Kou Yangyu Lv Yifei Li Yijing Liu Yiming Wang Yingya Zhang Yitong Huang Yong Li You Wu Yu Liu Yulin Pan Yun Zheng Yuntao Hong Yupeng Shi Yutong Feng Zeyinzi Jiang Zhen Han Zhi-Fan Wu and Ziyu Liu. 2025. Wan: Open and Advanced Large-Scale Video Generative Models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2503.20314 (2025)."},{"key":"e_1_3_3_1_52_1","unstructured":"Angtian Wang Haibin Huang Jacob\u00a0Zhiyuan Fang Yiding Yang and Chongyang Ma. 2025b. ATI: Any Trajectory Instruction for Controllable Video Generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2505.22944 (2025)."},{"key":"e_1_3_3_1_53_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01724"},{"key":"e_1_3_3_1_54_1","unstructured":"Duomin Wang Wei Zuo Aojie Li Ling-Hao Chen Xinyao Liao Deyu Zhou Zixin Yin Xili Dai Daxin Jiang and Gang Yu. 2025d. UniVerse-1: Unified Audio-Video Generation via Stitching of Experts. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2509.06155 (2025)."},{"key":"e_1_3_3_1_55_1","volume-title":"Forty-second ICML","author":"Wang Jiangshan","year":"2025","unstructured":"Jiangshan Wang, Junfu Pu, Zhongang Qi, Jiayi Guo, Yue Ma, Nisha Huang, Yuxin Chen, Xiu Li, and Ying Shan. 2025c. Taming Rectified Flow for Inversion and Editing. In Forty-second ICML."},{"key":"e_1_3_3_1_56_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01490"},{"key":"e_1_3_3_1_57_1","first-page":"249","volume-title":"European Conference on Computer Vision","author":"Yang Jie","year":"2024","unstructured":"Jie Yang, Ailing Zeng, Ruimao Zhang, and Lei Zhang. 2024. X-pose: Detecting any keypoints. In European Conference on Computer Vision. Springer, 249\u2013268."},{"key":"e_1_3_3_1_58_1","volume-title":"ICLR","author":"Yang Zhuoyi","year":"2025","unstructured":"Zhuoyi Yang, Jiayan Teng, Wendi Zheng, Ming Ding, Shiyu Huang, Jiazheng Xu, Yuanming Yang, Wenyi Hong, Xiaohan Zhang, Guanyu Feng, et\u00a0al. 2025. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer. In ICLR."},{"key":"e_1_3_3_1_59_1","doi-asserted-by":"publisher","DOI":"10.1145\/3757377.3763909"},{"key":"e_1_3_3_1_60_1","unstructured":"Zixin Yin Xili Dai Ling-Hao Chen Deyu Zhou Jianan Wang Duomin Wang Gang Yu Lionel\u00a0M Ni Lei Zhang and Heung-Yeung Shum. 2025b. Training-Free Text-Guided Color Editing with Multi-Modal Diffusion Transformer. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2508.09131 (2025)."},{"key":"e_1_3_3_1_61_1","unstructured":"Zixin Yin Xili Dai Duomin Wang Xianfang Zeng Lionel\u00a0M Ni Gang Yu and Heung-Yeung Shum. 2025c. LazyDrag: Enabling Stable Drag-Based Editing on Multi-Modal Diffusion Transformers via Explicit Correspondence. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2509.12203 (2025)."},{"key":"e_1_3_3_1_62_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00703"},{"key":"e_1_3_3_1_63_1","doi-asserted-by":"publisher","DOI":"10.1145\/3721238.3730683"},{"key":"e_1_3_3_1_64_1","volume-title":"Forty-second ICML","author":"Zhang Yuang","year":"2025","unstructured":"Yuang Zhang, Jiaxi Gu, Li-Wen Wang, Han Wang, Yuefeng Zhu, FangYuan Zou, et\u00a0al. 2025a. MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance. In Forty-second ICML."},{"key":"e_1_3_3_1_65_1","first-page":"273","volume-title":"European Conference on Computer Vision","author":"Zhao Rui","year":"2024","unstructured":"Rui Zhao, Yuchao Gu, Jay\u00a0Zhangjie Wu, David\u00a0Junhao Zhang, Jia-Wei Liu, Weijia Wu, Jussi Keppo, and Mike\u00a0Zheng Shou. 2024. Motiondirector: Motion customization of text-to-video diffusion models. In European Conference on Computer Vision. Springer, 273\u2013290."}],"event":{"name":"SIGGRAPH Conference Papers '26: Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers","location":"Los Angeles CA USA","acronym":"SIGGRAPH Conference Papers '26","sponsor":["SIGGRAPH ACM Special Interest Group on Computer Graphics and Interactive Techniques"]},"container-title":["Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers"],"original-title":[],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T18:18:17Z","timestamp":1784225897000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3799902.3811062"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,19]]},"references-count":64,"alternative-id":["10.1145\/3799902.3811062","10.1145\/3799902"],"URL":"https:\/\/doi.org\/10.1145\/3799902.3811062","relation":{},"subject":[],"published":{"date-parts":[[2026,7,19]]},"assertion":[{"value":"2026-07-19","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}