{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T19:05:14Z","timestamp":1784228714995,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":45,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T00:00:00Z","timestamp":1784419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,7,19]]},"DOI":"10.1145\/3799902.3811180","type":"proceedings-article","created":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T16:15:27Z","timestamp":1784218527000},"page":"1-12","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["OmniRoam: World Wandering via Long-Horizon Panoramic Video Generation"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-3690-5659","authenticated-orcid":false,"given":"Yuheng","family":"Liu","sequence":"first","affiliation":[{"name":"University of California Irvine, Irvine, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-3258-463X","authenticated-orcid":false,"given":"Xin","family":"Lin","sequence":"additional","affiliation":[{"name":"University of California San Diego, La Jolla, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9209-2154","authenticated-orcid":false,"given":"Xinke","family":"Li","sequence":"additional","affiliation":[{"name":"City University of Hong Kong, Hong Kong, Hong Kong"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-6607-8040","authenticated-orcid":false,"given":"Baihan","family":"Yang","sequence":"additional","affiliation":[{"name":"University of California San Diego, La Jolla, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9315-3780","authenticated-orcid":false,"given":"Chen","family":"Wang","sequence":"additional","affiliation":[{"name":"University of Pennsylvania, Philadelphia, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6030-2348","authenticated-orcid":false,"given":"Kalyan","family":"Sunkavalli","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1060-6941","authenticated-orcid":false,"given":"Yannick","family":"Hold-Geoffroy","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9755-9040","authenticated-orcid":false,"given":"Hao","family":"Tan","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1727-1689","authenticated-orcid":false,"given":"Kai","family":"Zhang","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5479-6345","authenticated-orcid":false,"given":"Xiaohui","family":"Xie","sequence":"additional","affiliation":[{"name":"University of California Irvine, Irvine, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0692-2869","authenticated-orcid":false,"given":"Zifan","family":"Shi","sequence":"additional","affiliation":[{"name":"Adobe Research, London, United Kingdom"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3674-295X","authenticated-orcid":false,"given":"Yiwei","family":"Hu","sequence":"additional","affiliation":[{"name":"Adobe Research, San Jose, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,19]]},"reference":[{"key":"e_1_3_3_2_2_1","unstructured":"Jianhong Bai Menghan Xia Xiao Fu Xintao Wang Lianrui Mu Jinwen Cao Zuozhu Liu Haoji Hu Xiang Bai Pengfei Wan et\u00a0al. 2025. Recammaster: Camera-controlled generative rendering from a single video. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2503.11647 (2025)."},{"key":"e_1_3_3_2_3_1","unstructured":"Andreas Blattmann Tim Dockhorn Sumith Kulal Daniel Mendelevitch Maciej Kilian Dominik Lorenz Yam Levi Zion English Vikram Voleti Adam Letts et\u00a0al. 2023. Stable video diffusion: Scaling latent video diffusion models to large datasets. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2311.15127 (2023)."},{"key":"e_1_3_3_2_4_1","first-page":"475","volume-title":"European Conference on Computer Vision","author":"Chen Xi","year":"2024","unstructured":"Xi Chen, Zhiheng Liu, Mengting Chen, Yutong Feng, Yu Liu, Yujun Shen, and Hengshuang Zhao. 2024. Livephoto: Real image animation with text-guided motion control. In European Conference on Computer Vision. Springer, 475\u2013491."},{"key":"e_1_3_3_2_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01649"},{"key":"e_1_3_3_2_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01212"},{"key":"e_1_3_3_2_7_1","first-page":"330","volume-title":"European Conference on Computer Vision","author":"Guo Yuwei","year":"2024","unstructured":"Yuwei Guo, Ceyuan Yang, Anyi Rao, Maneesh Agrawala, Dahua Lin, and Bo Dai. 2024. Sparsectrl: Adding sparse controls to text-to-video diffusion models. In European Conference on Computer Vision. Springer, 330\u2013348."},{"key":"e_1_3_3_2_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01801"},{"key":"e_1_3_3_2_9_1","unstructured":"Jonathan Ho Ajay Jain and Pieter Abbeel. 2020. Denoising diffusion probabilistic models. Advances in neural information processing systems 33 (2020) 6840\u20136851."},{"key":"e_1_3_3_2_10_1","doi-asserted-by":"crossref","unstructured":"Jonathan Ho Tim Salimans Alexey Gritsenko William Chan Mohammad Norouzi and David\u00a0J Fleet. 2022. Video diffusion models. Advances in neural information processing systems 35 (2022) 8633\u20138646.","DOI":"10.52202\/068431-0628"},{"key":"e_1_3_3_2_11_1","unstructured":"Yicong Hong Yiqun Mei Chongjian Ge Yiran Xu Yang Zhou Sai Bi Yannick Hold-Geoffroy Mike Roberts Matthew Fisher Eli Shechtman et\u00a0al. 2025. RELIC: Interactive Video World Model with Long-Horizon Memory. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2512.04040 (2025)."},{"key":"e_1_3_3_2_12_1","unstructured":"Xun Huang Zhengqi Li Guande He Mingyuan Zhou and Eli Shechtman. 2025. Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2506.08009 (2025)."},{"key":"e_1_3_3_2_13_1","doi-asserted-by":"publisher","DOI":"10.1145\/3757377.3763990"},{"key":"e_1_3_3_2_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01414"},{"key":"e_1_3_3_2_15_1","doi-asserted-by":"crossref","unstructured":"Bernhard Kerbl Georgios Kopanas Thomas Leimk\u00fchler and George Drettakis. 2023. 3D Gaussian Splatting for Real-Time Radiance Field Rendering. TOG (2023).","DOI":"10.1145\/3592433"},{"key":"e_1_3_3_2_16_1","doi-asserted-by":"crossref","unstructured":"Jihwan Kim Junoh Kang Jinyoung Choi and Bohyung Han. 2024. Fifo-diffusion: Generating infinite videos from text without training. Advances in Neural Information Processing Systems 37 (2024) 89834\u201389868.","DOI":"10.52202\/079017-2853"},{"key":"e_1_3_3_2_17_1","unstructured":"Weijie Kong Qi Tian Zijian Zhang Rox Min Zuozhuo Dai Jin Zhou Jiangfeng Xiong Xin Li Bo Wu Jianwei Zhang et\u00a0al. 2024. Hunyuanvideo: A systematic framework for large video generative models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2412.03603 (2024)."},{"key":"e_1_3_3_2_18_1","unstructured":"Wuyang Li Wentao Pan Po-Chien Luan Yang Gao and Alexandre Alahi. 2025. Stable video infinity: Infinite-length video generation with error recycling. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2510.09212 (2025)."},{"key":"e_1_3_3_2_19_1","unstructured":"Xin Lin Xian Ge Dizhe Zhang Zhaoliang Wan Xianshun Wang Xiangtai Li Wenjie Jiang Bo Du Dacheng Tao Ming-Hsuan Yang et\u00a0al. 2025a. One flight over the gap: A survey from perspective to panoramic vision. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2509.04444 (2025)."},{"key":"e_1_3_3_2_20_1","unstructured":"Xin Lin Meixi Song Dizhe Zhang Wenxuan Lu Haodong Li Bo Du Ming-Hsuan Yang Truong Nguyen and Lu Qi. 2025b. Depth Any Panoramas: A Foundation Model for Panoramic Depth Estimation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2512.16913 (2025)."},{"key":"e_1_3_3_2_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.00576"},{"key":"e_1_3_3_2_22_1","unstructured":"Fuchen Long Zhaofan Qiu Ting Yao and Tao Mei. 2024. Videodrafter: Content-consistent multi-scene video generation with llm. CoRR (2024)."},{"key":"e_1_3_3_2_23_1","first-page":"401","volume-title":"European Conference on Computer Vision","author":"Oh Gyeongrok","year":"2024","unstructured":"Gyeongrok Oh, Jaehwan Jeong, Sieun Kim, Wonmin Byeon, Jinkyu Kim, Sungwoong Kim, and Sangpil Kim. 2024. Mevg: Multi-event video generation with text-to-video models. In European Conference on Computer Vision. Springer, 401\u2013418."},{"key":"e_1_3_3_2_24_1","unstructured":"OpenAI. 2024. (2024). https:\/\/openai.com\/index\/sora"},{"key":"e_1_3_3_2_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"e_1_3_3_2_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.445"},{"key":"e_1_3_3_2_27_1","first-page":"2256","volume-title":"International conference on machine learning","author":"Sohl-Dickstein Jascha","year":"2015","unstructured":"Jascha Sohl-Dickstein, Eric Weiss, Niru Maheswaranathan, and Surya Ganguli. 2015. Deep unsupervised learning using nonequilibrium thermodynamics. In International conference on machine learning. 2256\u20132265."},{"key":"e_1_3_3_2_28_1","unstructured":"Manycore Tech\u00a0Inc. SpatialVerse Research\u00a0Team. 2025. InteriorGS: A 3D Gaussian Splatting Dataset of Semantically Labeled Indoor Scenes. https:\/\/huggingface.co\/datasets\/spatialverse\/InteriorGS."},{"key":"e_1_3_3_2_29_1","unstructured":"Jing Tan Shuai Yang Tong Wu Jingwen He Yuwei Guo Ziwei Liu and Dahua Lin. 2024. Imagine360: Immersive 360 video generation from perspective anchor. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2412.03552 (2024)."},{"key":"e_1_3_3_2_30_1","unstructured":"Team Wan Ang Wang Baole Ai Bin Wen Chaojie Mao Chen-Wei Xie Di Chen Feiwu Yu Haiming Zhao Jianxiao Yang Jianyuan Zeng Jiayu Wang Jingfeng Zhang Jingren Zhou Jinkai Wang Jixuan Chen Kai Zhu Kang Zhao Keyu Yan Lianghua Huang Mengyang Feng Ningyi Zhang Pandeng Li Pingyu Wu Ruihang Chu Ruili Feng Shiwei Zhang Siyang Sun Tao Fang Tianxing Wang Tianyi Gui Tingyu Weng Tong Shen Wei Lin Wei Wang Wei Wang Wenmeng Zhou Wente Wang Wenting Shen Wenyuan Yu Xianzhong Shi Xiaoming Huang Xin Xu Yan Kou Yangyu Lv Yifei Li Yijing Liu Yiming Wang Yingya Zhang Yitong Huang Yong Li You Wu Yu Liu Yulin Pan Yun Zheng Yuntao Hong Yupeng Shi Yutong Feng Zeyinzi Jiang Zhen Han Zhi-Fan Wu and Ziyu Liu. 2025. Wan: Open and Advanced Large-Scale Video Generative Models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2503.20314 (2025)."},{"key":"e_1_3_3_2_31_1","unstructured":"Jiahao Wang Luoxin Ye TaiMing Lu Junfei Xiao Jiahan Zhang Yuxiang Guo Xijun Liu Rama Chellappa Cheng Peng Alan Yuille et\u00a0al. 2025. EvoWorld: Evolving Panoramic World Generation with Explicit 3D Memory. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2510.01183 (2025)."},{"key":"e_1_3_3_2_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00660"},{"key":"e_1_3_3_2_33_1","doi-asserted-by":"publisher","DOI":"10.1145\/3641519.3657518"},{"key":"e_1_3_3_2_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.01781"},{"key":"e_1_3_3_2_35_1","unstructured":"Kevin Xie Amirmojtaba Sabour Jiahui Huang Despoina Paschalidou Greg Klar Umar Iqbal Sanja Fidler and Xiaohui Zeng. 2025. VideoPanda: Video panoramic diffusion with multi-view attention. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2504.11389 (2025)."},{"key":"e_1_3_3_2_36_1","doi-asserted-by":"crossref","unstructured":"Ke Xing Hanwen Liang Dejia Xu Yuyang Yin Konstantinos\u00a0N Plataniotis Yao Zhao and Yunchao Wei. 2025. TiP4GEN: Text to Immersive Panorama 4D Scene Generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2508.12415 (2025).","DOI":"10.1145\/3746027.3754704"},{"key":"e_1_3_3_2_37_1","unstructured":"Zhongqi Yang Wenhang Ge Yuqi Li Jiaqi Chen Haoyuan Li Mengyin An Fei Kang Hua Xue Baixin Xu Yuyang Yin et\u00a0al. 2025. Matrix-3D: Omnidirectional Explorable 3D World Generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2508.08086 (2025)."},{"key":"e_1_3_3_2_38_1","unstructured":"Zhuoyi Yang Jiayan Teng Wendi Zheng Ming Ding Shiyu Huang Jiazheng Xu Yuanming Yang Wenyi Hong Xiaohan Zhang Guanyu Feng et\u00a0al. 2024. Cogvideox: Text-to-video diffusion models with an expert transformer. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2408.06072 (2024)."},{"key":"e_1_3_3_2_39_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02138"},{"key":"e_1_3_3_2_40_1","doi-asserted-by":"publisher","DOI":"10.1145\/3757377.3763833"},{"key":"e_1_3_3_2_41_1","unstructured":"Yifei Yu Xiaoshan Wu Xinting Hu Tao Hu Yangtian Sun Xiaoyang Lyu Bo Wang Lin Ma Yuewen Ma Zhongrui Wang et\u00a0al. 2025b. VideoSSM: Autoregressive Long Video Generation with Hybrid State-Space Memory. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2512.04519 (2025)."},{"key":"e_1_3_3_2_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00607"},{"key":"e_1_3_3_2_43_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v39i10.33089"},{"key":"e_1_3_3_2_44_1","unstructured":"Shilong Zhang Wenbo Li Shoufa Chen Chongjian Ge Peize Sun Yida Zhang Yi Jiang Zehuan Yuan Binyue Peng and Ping Luo. 2025c. Flashvideo: Flowing fidelity to detail for efficient high-resolution video generation. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2502.05179 (2025)."},{"key":"e_1_3_3_2_45_1","doi-asserted-by":"publisher","DOI":"10.1145\/3757377.3763876"},{"key":"e_1_3_3_2_46_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.02604"}],"event":{"name":"SIGGRAPH Conference Papers '26: Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers","location":"Los Angeles CA USA","acronym":"SIGGRAPH Conference Papers '26","sponsor":["SIGGRAPH ACM Special Interest Group on Computer Graphics and Interactive Techniques"]},"container-title":["Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers"],"original-title":[],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T18:17:45Z","timestamp":1784225865000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3799902.3811180"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,19]]},"references-count":45,"alternative-id":["10.1145\/3799902.3811180","10.1145\/3799902"],"URL":"https:\/\/doi.org\/10.1145\/3799902.3811180","relation":{},"subject":[],"published":{"date-parts":[[2026,7,19]]},"assertion":[{"value":"2026-07-19","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}