{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T19:06:41Z","timestamp":1784228801529,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":68,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T00:00:00Z","timestamp":1784419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,7,19]]},"DOI":"10.1145\/3799902.3811131","type":"proceedings-article","created":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T16:15:27Z","timestamp":1784218527000},"page":"1-12","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["MV-S2V: Multi-View Subject-Consistent Video Generation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7458-2491","authenticated-orcid":false,"given":"Ziyang","family":"Song","sequence":"first","affiliation":[{"name":"The Hong Kong Polytechnic University, Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6993-136X","authenticated-orcid":false,"given":"Xinyu","family":"Gong","sequence":"additional","affiliation":[{"name":"The University of Texas at Austin, Austin, Texas, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-4758-0734","authenticated-orcid":false,"given":"Bangya","family":"Liu","sequence":"additional","affiliation":[{"name":"University of Wisconsin-Madison, Madison, Wisconsin, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2638-0414","authenticated-orcid":false,"given":"Zelin","family":"Zhao","sequence":"additional","affiliation":[{"name":"Georgia Institute of Technology, Atlanta, Georgia, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,19]]},"reference":[{"key":"e_1_3_3_1_2_1","doi-asserted-by":"crossref","unstructured":"Mohammad Asim Christopher Wewer Thomas Wimmer Bernt Schiele and Jan\u00a0Eric Lenssen. 2025. MET3R: Measuring Multi-View Consistency in Generated Images. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.00566"},{"key":"e_1_3_3_1_3_1","unstructured":"Yunpeng Bai Haoxiang Li and Qixing Huang. 2026. Positional Encoding Field. ICLR (2026)."},{"key":"e_1_3_3_1_4_1","unstructured":"Andreas Blattmann Tim Dockhorn Sumith Kulal Daniel Mendelevitch Maciej Kilian Dominik Lorenz Yam Levi Zion English Vikram Voleti Adam Letts Varun Jampani and Robin Rombach. 2023. Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets. arXiv:https:\/\/arXiv.org\/abs\/2311.15127 (2023)."},{"key":"e_1_3_3_1_5_1","unstructured":"Chenjie Cao Jingkai Zhou Shikai Li Jingyun Liang Chaohui Yu Fan Wang Xiangyang Xue and Yanwei Fu. 2025. Uni3C: Unifying Precisely 3D-Enhanced Camera and Human Motion Controls for Video Generation. arXiv:https:\/\/arXiv.org\/abs\/2504.14899 (2025)."},{"key":"e_1_3_3_1_6_1","doi-asserted-by":"crossref","unstructured":"Tsai-Shien Chen Aliaksandr Siarohin Willi Menapace Yuwei Fang Kwot\u00a0Sin Lee Ivan Skorokhodov Kfir Aberman Jun-Yan Zhu Ming-Hsuan Yang and Sergey Tulyakov. 2025b. Multi-subject Open-set Personalization in Video Generation. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.00572"},{"key":"e_1_3_3_1_7_1","doi-asserted-by":"crossref","unstructured":"Xi Chen Zhifei Zhang He Zhang Yuqian Zhou Soo\u00a0Ye Kim Qing Liu Yijun Li Jianming Zhang Nanxuan Zhao Yilin Wang Hui Ding Zhe Lin and Hengshuang Zhao. 2025c. UniReal: Universal Image Generation and Editing via Learning Real-world Dynamics. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.01166"},{"key":"e_1_3_3_1_8_1","doi-asserted-by":"crossref","unstructured":"Zhuowei Chen Shancheng Fang Wei Liu Qian He Mengqi Huang and Zhendong Mao. 2024. DreamIdentity: Enhanced Editability for Efficient Face-Identity Preserved Image Generation. AAAI (2024).","DOI":"10.1609\/aaai.v38i2.27891"},{"key":"e_1_3_3_1_9_1","unstructured":"Zhuowei Chen Bingchuan Li Tianxiang Ma Lijie Liu Mingcong Liu Yi Zhang Gen Li Xinghui Li Siyu Zhou Qian He and Xinglong Wu. 2025a. Phantom-Data : Towards a General Subject-Consistent Video Generation Dataset. arXiv:https:\/\/arXiv.org\/abs\/2506.18851 (2025)."},{"key":"e_1_3_3_1_10_1","doi-asserted-by":"crossref","unstructured":"Mehdi Cherti Romain Beaumont Ross Wightman Mitchell Wortsman Gabriel Ilharco Cade Gordon Christoph Schuhmann Ludwig Schmidt and Jenia Jitsev. 2023. Reproducible Scaling Laws for Contrastive Language-Image Learning. CVPR (2023).","DOI":"10.1109\/CVPR52729.2023.00276"},{"key":"e_1_3_3_1_11_1","unstructured":"Yufan Deng Xun Guo Yuanyang Yin Jacob\u00a0Zhiyuan Fang Yiding Yang Yizhi Wang Shenghai Yuan Angtian Wang Bo Liu Haibin Huang and Chongyang Ma. 2025. MAGREF: Masked Guidance for Any-Reference Video Generation. arXiv:https:\/\/arXiv.org\/abs\/2505.23742 (2025)."},{"key":"e_1_3_3_1_12_1","unstructured":"Patrick Esser Sumith Kulal Andreas Blattmann Rahim Entezari Jonas M\u00fcller Harry Saini Yam Levi Dominik Lorenz Axel Sauer Frederic Boesel Dustin Podell Tim Dockhorn Zion English and Robin Rombach. 2024. Scaling Rectified Flow Transformers for High-Resolution Image Synthesis. ICML (2024)."},{"key":"e_1_3_3_1_13_1","unstructured":"Rinon Gal Yuval Alaluf Yuval Atzmon Or Patashnik Amit\u00a0Haim Bermano Gal Chechik and Daniel Cohen-Or. 2023. An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion. ICLR (2023)."},{"key":"e_1_3_3_1_14_1","unstructured":"Google. 2025a. Gemini. https:\/\/gemini.google.com."},{"key":"e_1_3_3_1_15_1","unstructured":"Google. 2025b. Nano Banana. https:\/\/aistudio.google.com\/models\/gemini-2-5-flash-image."},{"key":"e_1_3_3_1_16_1","unstructured":"Yuwei Guo Ceyuan Yang Anyi Rao Zhengyang Liang Yaohui Wang Yu Qiao Maneesh Agrawala Dahua Lin and Bo Dai. 2024c. AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning. ICLR (2024)."},{"key":"e_1_3_3_1_17_1","doi-asserted-by":"crossref","unstructured":"Zinan Guo Yanze Wu Zhuowei Chen Lang Chen Peng Zhang and Qian He. 2024a. PuLID: Pure and Lightning ID Customization via Contrastive Alignment. NeurIPS (2024).","DOI":"10.52202\/079017-1159"},{"key":"e_1_3_3_1_18_1","doi-asserted-by":"crossref","unstructured":"Zinan Guo Yanze Wu Zhuowei Chen Lang Chen Peng Zhang and Qian He. 2024b. PuLID: Pure and Lightning ID Customization via Contrastive Alignment. NeurIPS (2024).","DOI":"10.52202\/079017-1159"},{"key":"e_1_3_3_1_19_1","unstructured":"Zhen Han Zeyinzi Jiang Yulin Pan Jingfeng Zhang Chaojie Mao Chen-Wei Xie Yu Liu and Jingren Zhou. 2025. ACE: All-round Creator and Editor Following Instructions via Diffusion Transformer. ICLR (2025)."},{"key":"e_1_3_3_1_20_1","unstructured":"Xuanhua He Quande Liu Shengju Qian Xin Wang Tao Hu Ke Cao Keyu Yan Man Zhou and Jie Zhang. 2024. ID-Animator: Zero-Shot Identity-Preserving Human Video Generation. arXiv:https:\/\/arXiv.org\/abs\/2404.15275 (2024)."},{"key":"e_1_3_3_1_21_1","unstructured":"Jonathan Ho Ajay Jain and Pieter Abbeel. 2020. Denoising Diffusion Probabilistic Models. NeurIPS (2020)."},{"key":"e_1_3_3_1_22_1","unstructured":"Edward\u00a0J. Hu Yelong Shen Phillip Wallis Zeyuan Allen-Zhu Yuanzhi Li Shean Wang Lu Wang and Weizhu Chen. 2022. LoRA: Low-Rank Adaptation of Large Language Models. ICLR (2022)."},{"key":"e_1_3_3_1_23_1","unstructured":"Lianghua Huang Wei Wang Zhi-Fan Wu Yupeng Shi Huanzhang Dou Chen Liang Yutong Feng Yu Liu and Jingren Zhou. 2024. In-Context LoRA for Diffusion Transformers. arXiv:https:\/\/arXiv.org\/abs\/2410.23775 (2024)."},{"key":"e_1_3_3_1_24_1","unstructured":"Yuzhou Huang Ziyang Yuan Quande Liu Qiulin Wang Xintao Wang Ruimao Zhang Pengfei Wan Di Zhang and Kun Gai. 2025. ConceptMaster: Multi-Concept Video Customization on Diffusion Transformer Models Without Test-Time Tuning. arXiv:https:\/\/arXiv.org\/abs\/2501.04698 (2025)."},{"key":"e_1_3_3_1_25_1","unstructured":"HuggingFace. 2025. Phantom-Wan. https:\/\/huggingface.co\/bytedance-research\/Phantom."},{"key":"e_1_3_3_1_26_1","doi-asserted-by":"crossref","unstructured":"Varun Jampani Kevis-Kokitsi Maninis Andreas Engelhardt Arjun Karpur Karen Truong Kyle Sargent Stefan Popov Andr\u00e9 Ara\u00fajo Ricardo Martin-Brualla Kaushal Patel Daniel Vlasic Vittorio Ferrari Ameesh Makadia Ce Liu Yuanzhen Li and Howard Zhou. 2023. NAVI: Category-Agnostic Image Collections with High-Quality 3D Shape and Pose Annotations. NeurIPS (2023).","DOI":"10.52202\/075280-3323"},{"key":"e_1_3_3_1_27_1","doi-asserted-by":"crossref","unstructured":"Zeyinzi Jiang Zhen Han Chaojie Mao Jingfeng Zhang Yulin Pan and Yu Liu. 2025. VACE: All-in-One Video Creation and Editing. ICCV (2025).","DOI":"10.1109\/ICCV51701.2025.01597"},{"key":"e_1_3_3_1_28_1","unstructured":"Kling. 2024. Image to Video. https:\/\/app.klingai.com\/global\/image-to-video\/multi-id\/new."},{"key":"e_1_3_3_1_29_1","unstructured":"Weijie Kong Qi Tian Zijian Zhang Rox Min Zuozhuo Dai Jin Zhou Jiangfeng Xiong Xin Li Bo Wu Jianwei Zhang Kathrina Wu Qin Lin Junkun Yuan Yanxin Long Aladdin Wang Andong Wang Changlin Li Duojun Huang Fang Yang Hao Tan Hongmei Wang Jacob Song Jiawang Bai Jianbing Wu Jinbao Xue Joey Wang Kai Wang Mengyang Liu Pengyu Li Shuai Li Weiyan Wang Wenqing Yu Xinchi Deng Yang Li Yi Chen Yutao Cui Yuanbo Peng Zhentao Yu Zhiyu He Zhiyong Xu Zixiang Zhou Zunnan Xu Yangyu Tao Qinglin Lu Songtao Liu Daquan Zhou Hongfa Wang Yong Yang Di Wang Yuhong Liu Jie Jiang and Caesar Zhong. 2024. HunyuanVideo: A Systematic Framework For Large Video Generative Models. arXiv:https:\/\/arXiv.org\/abs\/2412.03603 (2024)."},{"key":"e_1_3_3_1_30_1","doi-asserted-by":"crossref","unstructured":"Feng Liang Haoyu Ma Zecheng He Tingbo Hou Ji Hou Kunpeng Li Xiaoliang Dai Felix Juefei-Xu Samaneh Azadi Animesh Sinha Peizhao Zhang Peter Vajda and Diana Marculescu. 2025. Movie Weaver: Tuning-Free Multi-Concept Video Personalization with Anchored Prompts. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.01227"},{"key":"e_1_3_3_1_31_1","unstructured":"Yaron Lipman Ricky T.\u00a0Q. Chen Heli Ben-Hamu Maximilian Nickel and Matt Le. 2022. Flow Matching for Generative Modeling. ICLR (2022)."},{"key":"e_1_3_3_1_32_1","unstructured":"Bangya Liu Xinyu Gong Zelin Zhao Ziyang Song Yulei Lu Suhui Wu Jun Zhang Suman Banerjee and Hao Zhang. 2025a. ByteLoom: Weaving Geometry-Consistent Human-Object Interactions through Progressive Curriculum Learning. arXiv:https:\/\/arXiv.org\/abs\/2512.22854 (2025)."},{"key":"e_1_3_3_1_33_1","doi-asserted-by":"crossref","unstructured":"Kun Liu Qi Liu Xinchen Liu Jie Li Yongdong Zhang Jiebo Luo Xiaodong He and Wu Liu. 2025b. HOIGen-1M: A Large-scale Dataset for Human-Object Interaction Video Generation. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.02235"},{"key":"e_1_3_3_1_34_1","doi-asserted-by":"crossref","unstructured":"Lijie Liu Tianxiang Ma Bingchuan Li Zhuowei Chen Jiawei Liu Qian He and Xinglong Wu. 2025c. Phantom: Subject-consistent video generation via cross-modal alignment. ICCV (2025).","DOI":"10.1109\/ICCV51701.2025.01387"},{"key":"e_1_3_3_1_35_1","unstructured":"Xingchao Liu Chengyue Gong and Qiang Liu. 2022. Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow. ICLR (2022)."},{"key":"e_1_3_3_1_36_1","unstructured":"Yuanxun Lu Yiheng Du Chao Xu Hang Zhou Tianshu Hu Lin Ma and Hao Zhao. 2024. SyncDreamer: Generating Multiview-consistent Images from a Single-view Image. CVPR (2024)."},{"key":"e_1_3_3_1_37_1","unstructured":"OpenAI. 2023. Sora. https:\/\/openai.com."},{"key":"e_1_3_3_1_38_1","unstructured":"Maxime Oquab Timoth\u00e9e Darcet Th\u00e9o Moutakanni Huy\u00a0V. Vo Marc Szafraniec Vasil Khalidov Pierre Fernandez Daniel Haziza Francisco Massa Alaaeldin El-Nouby Mido Assran Nicolas Ballas Wojciech Galuba Russell Howes Po-Yao Huang Shang-Wen Li Ishan Misra Michael Rabbat Vasu Sharma Gabriel Synnaeve Hu Xu Herv\u00e9 J\u00e9gou Julien Mairal Patrick Labatut Armand Joulin and Piotr Bojanowski. 2024. DINOv2: Learning Robust Visual Features without Supervision. Trans. Mach. Learn. Res. (2024)."},{"key":"e_1_3_3_1_39_1","doi-asserted-by":"crossref","unstructured":"William Peebles and Saining Xie. 2023. Scalable Diffusion Models with Transformers. ICCV (2023).","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"e_1_3_3_1_40_1","doi-asserted-by":"crossref","unstructured":"Guocheng Qian Kuan-Chieh Wang Or Patashnik Negin Heravi Daniil Ostashev Sergey Tulyakov Daniel Cohen-Or and Kfir Aberman. 2025. Omni-ID: Holistic Identity Representation Designed for Generative Tasks. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.00821"},{"key":"e_1_3_3_1_41_1","unstructured":"Colin Raffel Noam\u00a0M. Shazeer Adam Roberts Katherine Lee Sharan Narang Michael Matena Yanqi Zhou Wei Li and Peter\u00a0J. Liu. 2019. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J. Mach. Learn. Res. (2019)."},{"key":"e_1_3_3_1_42_1","doi-asserted-by":"crossref","unstructured":"Jeremy Reizenstein Roman Shapovalov Philipp Henzler Luca Sbordone Patrick Labatut and David Novotn\u00fd. 2021. Common Objects in 3D: Large-Scale Learning and Evaluation of Real-life 3D Category Reconstruction. ICCV (2021).","DOI":"10.1109\/ICCV48922.2021.01072"},{"key":"e_1_3_3_1_43_1","unstructured":"Tianhe Ren Shilong Liu Ailing Zeng Jing Lin Kunchang Li He Cao Jiayu Chen Xinyu Huang Yukang Chen Feng Yan Zhaoyang Zeng Hao Zhang Feng Li Jie Yang Hongyang Li Qing Jiang and Lei Zhang. 2024. Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks. arXiv:https:\/\/arXiv.org\/abs\/2401.14159 (2024)."},{"key":"e_1_3_3_1_44_1","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6rn Ommer. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. CVPR (2022).","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_3_1_45_1","doi-asserted-by":"crossref","unstructured":"Olaf Ronneberger Philipp Fischer and Thomas Brox. 2015. U-Net: Convolutional Networks for Biomedical Image Segmentation. MICCAI (2015).","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"e_1_3_3_1_46_1","doi-asserted-by":"crossref","unstructured":"Nataniel Ruiz Yuanzhen Li Varun Jampani Yael Pritch Michael Rubinstein and Kfir Aberman. 2023. DreamBooth: Fine Tuning Text-to-Image Diffusion Models for Subject-Driven Generation. CVPR (2023).","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"e_1_3_3_1_47_1","doi-asserted-by":"crossref","unstructured":"Viraj Shah Nataniel Ruiz Forrester Cole Erika Lu Svetlana Lazebnik Yuanzhen Li and Varun Jampani. 2024. ZipLoRA: Any Subject in Any Style by Effectively Merging LoRAs. ECCV (2024).","DOI":"10.1007\/978-3-031-73232-4_24"},{"key":"e_1_3_3_1_48_1","unstructured":"Yichun Shi Peng Wang Jianglong Ye Yang Xiao Long Lian and Yijun Li. 2023. MVDream: Multi-view Diffusion for 3D Generation. NeurIPS (2023)."},{"key":"e_1_3_3_1_49_1","unstructured":"Uriel Singer Adam Polyak Thomas Hayes Xi Yin Jie An Songyang Zhang Qiyuan Hu Harry Yang Oron Ashual Oran Gafni Devi Parikh Sonal Gupta and Yaniv Taigman. 2023. Make-A-Video: Text-to-Video Generation without Text-Video Data. ICLR (2023)."},{"key":"e_1_3_3_1_50_1","unstructured":"Jianlin Su Murtadha H.\u00a0M. Ahmed Yu Lu Shengfeng Pan Wen Bo and Yunfeng Liu. 2024. RoFormer: Enhanced transformer with Rotary Position Embedding. Neurocomputing (2024)."},{"key":"e_1_3_3_1_51_1","unstructured":"Ruoxi Tang Junfeng Yang Yuxue Yang Hongyu Yang Peng Wang and Yichun Shi. 2024. LGM: Large Multi-View Gaussian Model for High-Fidelity 3D Generation. SIGGRAPH Asia (2024)."},{"key":"e_1_3_3_1_52_1","doi-asserted-by":"crossref","unstructured":"Vikram Voleti Chun-Han Yao Mark Boss Adam\u00a0W. Harley Leonid Sigal Christian Theobalt and Varun Jampani. 2024. SV3D: Novel Multi-view Synthesis and 3D Generation from a Single Image using Latent Video Diffusion. arXiv:https:\/\/arXiv.org\/abs\/2403.12008 (2024).","DOI":"10.1007\/978-3-031-73232-4_25"},{"key":"e_1_3_3_1_53_1","unstructured":"Ang Wang Baole Ai Bin Wen Chaojie Mao Chen-Wei Xie Di Chen Feiwu Yu Haiming Zhao Jianxiao Yang Jianyuan Zeng Jiayu Wang Jingfeng Zhang Jingren Zhou Jinkai Wang Jixuan Chen Kai Zhu Kang Zhao Keyu Yan Lianghua Huang Xiaofeng Meng Ningyi Zhang Pandeng Li Pingyu Wu Ruihang Chu Ruili Feng Shiwei Zhang Siyang Sun Tao Fang Tianxing Wang Tianyi Gui Tingyu Weng Tong Shen Wei Lin Wei Wang Wei Wang Wenmeng Zhou Wente Wang Wenting Shen Wenyuan Yu Xianzhong Shi Xiaoming Huang Xin Xu Yan Kou Yangyu Lv Yifei Li Yijing Liu Yiming Wang Yingya Zhang Yitong Huang Yong Li You Wu Yu Liu Yulin Pan Yun Zheng Yuntao Hong Yupeng Shi Yutong Feng Zeyinzi Jiang Zhen Han Zhi-Fan Wu and Ziyu Liu. 2025a. Wan: Open and Advanced Large-Scale Video Generative Models. arXiv:https:\/\/arXiv.org\/abs\/2503.20314 (2025)."},{"key":"e_1_3_3_1_54_1","doi-asserted-by":"crossref","unstructured":"Jianyi Wang Zhijie Lin Meng Wei Yang Zhao Ceyuan Yang Chen\u00a0Change Loy and Lu Jiang. 2025b. SeedVR: Seeding Infinity in Diffusion Transformer Towards Generic Video Restoration. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.00207"},{"key":"e_1_3_3_1_55_1","unstructured":"Qixun Wang Xu Bai Haofan Wang Zekui Qin and Anthony Chen. 2024. InstantID: Zero-shot Identity-Preserving Generation in Seconds. arXiv:https:\/\/arXiv.org\/abs\/2401.07519 (2024)."},{"key":"e_1_3_3_1_56_1","unstructured":"Yifan Wang Jianjun Zhou Haoyi Zhu Wenzheng Chang Yang Zhou Zizun Li Junyi Chen Jiangmiao Pang Chunhua Shen and Tong He. 2025c. \u03c03: Scalable Permutation-Equivariant Visual Geometry Learning. arXiv:https:\/\/arXiv.org\/abs\/2507.13347 (2025)."},{"key":"e_1_3_3_1_57_1","unstructured":"Chenfei Wu Jiahao Li Jingren Zhou Junyang Lin Kaiyuan Gao Kun Yan Shengming Yin Shuai Bai Xiao Xu Yilei Chen Yuxiang Chen Zecheng Tang Zekai Zhang Zhengyi Wang An Yang Bowen Yu Chen Cheng Dayiheng Liu Deqing Li Hang Zhang Hao Meng Hu Wei Jingyuan Ni Kai Chen Kuan Cao Liang Peng Lin Qu Minggang Wu Peng Wang Shuting Yu Tingkun Wen Wensen Feng Xiaoxiao Xu Yi Wang Yichang Zhang Yongqiang Zhu Yujia Wu Yuxuan Cai and Zenan Liu. 2025a. Qwen-Image Technical Report. arXiv:https:\/\/arXiv.org\/abs\/2508.02324 (2025)."},{"key":"e_1_3_3_1_58_1","unstructured":"Ziyi Wu Aliaksandr Siarohin Willi Menapace Ivan Skorokhodov Yuwei Fang Varnith Chordia Igor Gilitschenski and Sergey Tulyakov. 2025b. Mind the Time: Temporally-Controlled Multi-Event Video Generation. CVPR (2025)."},{"key":"e_1_3_3_1_59_1","doi-asserted-by":"crossref","unstructured":"Jianfeng Xiang Zelong Lv Sicheng Xu Yu Deng Ruicheng Wang Bowen Zhang Dong Chen Xin Tong and Jiaolong Yang. 2025. Structured 3D Latents for Scalable and Versatile 3D Generation. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.02000"},{"key":"e_1_3_3_1_60_1","doi-asserted-by":"crossref","unstructured":"Shitao Xiao Yueze Wang Junjie Zhou Huaying Yuan Xingrun Xing Ruiran Yan Chaofan Li Shuting Wang Tiejun Huang and Zheng Liu. 2025. OmniGen: Unified Image Generation. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.01241"},{"key":"e_1_3_3_1_61_1","unstructured":"Zhuoyi Yang Jiayan Teng Wendi Zheng Ming Ding Shiyu Huang Jiazheng Xu Yuanming Yang Wenyi Hong Xiaohan Zhang Guanyu Feng Da Yin Yuxuan Zhang Weihan Wang Yean Cheng Bin Xu Xiaotao Gu Yuxiao Dong and Jie Tang. 2025. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer. ICLR (2025)."},{"key":"e_1_3_3_1_62_1","unstructured":"Hu Ye Jun Zhang Sibo Liu Xiao Han and Wei Yang. 2023. IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models. arXiv:https:\/\/arXiv.org\/abs\/2308.06721 (2023)."},{"key":"e_1_3_3_1_63_1","doi-asserted-by":"crossref","unstructured":"Liping Yuan Jiawei Wang Haomiao Sun Yuchen Zhang and Yuan Lin. 2025b. Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding. arXiv:https:\/\/arXiv.org\/abs\/2501.07888 (2025).","DOI":"10.32388\/X26ILU"},{"key":"e_1_3_3_1_64_1","doi-asserted-by":"crossref","unstructured":"Shenghai Yuan Jinfa Huang Xianyi He Yunyang Ge Yujun Shi Liuhan Chen Jiebo Luo and Li Yuan. 2025a. Identity-Preserving Text-to-Video Generation by Frequency Decomposition. CVPR (2025).","DOI":"10.1109\/CVPR52734.2025.01211"},{"key":"e_1_3_3_1_65_1","unstructured":"Jiexuan Zhang Yiheng Du Qian Wang Weiqi Li Yu Gu and Jian Zhang. 2025a. AlignedGen: Aligning Style Across Generated Images. NeurIPS (2025)."},{"key":"e_1_3_3_1_66_1","unstructured":"Zhenxing Zhang Jiayan Teng Zhuoyi Yang Tiankun Cao Cheng Wang Xiaotao Gu Jie Tang Dan Guo and Meng Wang. 2025b. Kaleido: Open-Sourced Multi-Subject Reference Video Generation Model. arXiv:https:\/\/arXiv.org\/abs\/2510.18573 (2025)."},{"key":"e_1_3_3_1_67_1","doi-asserted-by":"crossref","unstructured":"Wenliang Zhao Lujia Bai Yongming Rao Jie Zhou and Jiwen Lu. 2023. UniPC: A Unified Predictor-Corrector Framework for Fast Sampling of Diffusion Models. NeurIPS (2023).","DOI":"10.52202\/075280-2170"},{"key":"e_1_3_3_1_68_1","unstructured":"Zelin Zhao Xinyu Gong Bangya Liu Ziyang Song Jun Zhang Suhui Wu Yongxin Chen and Hao Zhang. 2025. CETCAM: Camera-Controllable Video Generation via Consistent and Extensible Tokenization. arXiv:https:\/\/arXiv.org\/abs\/2512.19020 (2025)."},{"key":"e_1_3_3_1_69_1","unstructured":"Chuanxia Zheng Long Lian Yijun Li Jingyi Yu Trevor Darrell Eli Shechtman and Richard Zhang. 2023. Zero-1-to-3: Zero-shot One Image to 3D Object. ICCV (2023)."}],"event":{"name":"SIGGRAPH Conference Papers '26: Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers","location":"Los Angeles CA USA","acronym":"SIGGRAPH Conference Papers '26","sponsor":["SIGGRAPH ACM Special Interest Group on Computer Graphics and Interactive Techniques"]},"container-title":["Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers"],"original-title":[],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T18:27:42Z","timestamp":1784226462000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3799902.3811131"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,19]]},"references-count":68,"alternative-id":["10.1145\/3799902.3811131","10.1145\/3799902"],"URL":"https:\/\/doi.org\/10.1145\/3799902.3811131","relation":{},"subject":[],"published":{"date-parts":[[2026,7,19]]},"assertion":[{"value":"2026-07-19","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}