{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:59:59Z","timestamp":1765342799933,"version":"3.46.0"},"publisher-location":"New York, NY, USA","reference-count":71,"publisher":"ACM","funder":[{"name":"Graduate Research Scholarships of The University of Melbourne"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,10,27]]},"DOI":"10.1145\/3746027.3754779","type":"proceedings-article","created":{"date-parts":[[2025,10,25]],"date-time":"2025-10-25T07:27:39Z","timestamp":1761377259000},"page":"9375-9384","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-7159-676X","authenticated-orcid":false,"given":"Xueyang","family":"Kang","sequence":"first","affiliation":[{"name":"University of Melbourne, Melbourne, VIC, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-8322-8696","authenticated-orcid":false,"given":"Zhengkang","family":"Xiang","sequence":"additional","affiliation":[{"name":"University of Melbourne, Melbourne, VIC, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2853-7729","authenticated-orcid":false,"given":"Zezheng","family":"Zhang","sequence":"additional","affiliation":[{"name":"University of Melbourne, Melbourne, VIC, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6639-1727","authenticated-orcid":false,"given":"Kourosh","family":"Khoshelham","sequence":"additional","affiliation":[{"name":"University of Melbourne, Melbourne, VIC, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,10,27]]},"reference":[{"key":"e_1_3_2_2_1_1","unstructured":"Sherwin Bahmani Ivan Skorokhodov Aliaksandr Siarohin Willi Menapace Guocheng Qian Michael Vasilkovsky Hsin-Ying Lee Chaoyang Wang Jiaxu Zou Andrea Tagliasacchi et al. 2024. VD3D: Taming Large Video Diffusion Transformers for 3D Camera Control. arXiv preprint arXiv:2407.12781 (2024)."},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00382"},{"key":"e_1_3_2_2_3_1","volume-title":"Lumiere: A space-time diffusion model for video generation. arXiv preprint arXiv:2401.12945","author":"Bar-Tal Omer","year":"2024","unstructured":"Omer Bar-Tal, Hila Chefer, Omer Tov, Charles Herrmann, Roni Paiss, Shiran Zada, Ariel Ephrat, Junhwa Hur, Yuanzhen Li, Tomer Michaeli, et al., 2024. Lumiere: A space-time diffusion model for video generation. arXiv preprint arXiv:2401.12945 (2024)."},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01999"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/3DV.2017.00081"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"crossref","unstructured":"Haoxin Chen Yong Zhang Xiaodong Cun Menghan Xia Xintao Wang Chao Weng and Ying Shan. 2024b. VideoCrafter2: Overcoming Data Limitations for High-Quality Video Diffusion Models. arXiv:2401.09047 [cs.CV]","DOI":"10.1109\/CVPR52733.2024.00698"},{"key":"e_1_3_2_2_7_1","volume-title":"V3d: Video diffusion models are effective 3d generators. arXiv preprint arXiv:2403.06738","author":"Chen Zilong","year":"2024","unstructured":"Zilong Chen, Yikai Wang, Feng Wang, Zhengyi Wang, and Huaping Liu. 2024a. V3d: Video diffusion models are effective 3d generators. arXiv preprint arXiv:2403.06738 (2024)."},{"key":"e_1_3_2_2_8_1","volume-title":"LDMVFI: Video Frame Interpolation with Latent Diffusion Models. arXiv preprint arXiv:2303.09508","author":"Danier Duolikun","year":"2023","unstructured":"Duolikun Danier, Fan Zhang, and David Bull. 2023. LDMVFI: Video Frame Interpolation with Latent Diffusion Models. arXiv preprint arXiv:2303.09508 (2023)."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00675"},{"key":"e_1_3_2_2_10_1","volume-title":"Diffusion360: Seamless 360 degree panoramic image generation based on diffusion models. arXiv preprint arXiv:2311.13141","author":"Feng Mengyang","year":"2023","unstructured":"Mengyang Feng, Jinlin Liu, Miaomiao Cui, and Xuansong Xie. 2023. Diffusion360: Seamless 360 degree panoramic image generation based on diffusion models. arXiv preprint arXiv:2311.13141 (2023)."},{"key":"e_1_3_2_2_11_1","volume-title":"Advances in Neural Information Processing Systems","volume":"36","author":"Fridman Rafail","year":"2024","unstructured":"Rafail Fridman, Amit Abecasis, Yoni Kasten, and Tali Dekel. 2024. Scenescape: Text-driven consistent scene generation. Advances in Neural Information Processing Systems, Vol. 36 (2024)."},{"key":"e_1_3_2_2_12_1","volume-title":"CAT3D: Create Anything in 3D with Multi-View Diffusion Models. arXiv preprint arXiv:2405.10314","author":"Gao Ruiqi","year":"2024","unstructured":"Ruiqi Gao, Aleksander Holynski, Philipp Henzler, Arthur Brussee, Ricardo Martin-Brualla, Pratul Srinivasan, Jonathan T Barron, and Ben Poole. 2024. CAT3D: Create Anything in 3D with Multi-View Diffusion Models. arXiv preprint arXiv:2405.10314 (2024)."},{"key":"e_1_3_2_2_13_1","volume-title":"Cameractrl: Enabling camera control for text-to-video generation.","author":"He Hao","year":"2025","unstructured":"Hao He, Yinghao Xu, Yuwei Guo, Gordon Wetzstein, Bo Dai, Hongsheng Li, and Ceyuan Yang. 2025. Cameractrl: Enabling camera control for text-to-video generation. (2025)."},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_2_15_1","volume-title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium. Advances in neural information processing systems","author":"Heusel Martin","year":"2017","unstructured":"Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, and Sepp Hochreiter. 2017. Gans trained by a two time-scale update rule converge to a local nash equilibrium. Advances in neural information processing systems, Vol. 30 (2017)."},{"key":"e_1_3_2_2_16_1","unstructured":"Jonathan Ho William Chan Chitwan Saharia Jay Whang Ruiqi Gao Alexey Gritsenko Diederik P Kingma Ben Poole Mohammad Norouzi David J Fleet et al. 2022a. Imagen video: High definition video generation with diffusion models. arXiv preprint arXiv:2210.02303 (2022)."},{"key":"e_1_3_2_2_17_1","first-page":"8633","article-title":"Video diffusion models","volume":"35","author":"Ho Jonathan","year":"2022","unstructured":"Jonathan Ho, Tim Salimans, Alexey Gritsenko, William Chan, Mohammad Norouzi, and David J Fleet. 2022b. Video diffusion models. Advances in Neural Information Processing Systems, Vol. 35 (2022), 8633-8646.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19781-9_36"},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00433"},{"key":"e_1_3_2_2_20_1","volume-title":"Multi-view Geometry-Aware Diffusion Transformer for Indoor Novel View Synthesis. In ICLR 2025 Workshop on Deep Generative Model in Machine Learning: Theory, Principle and Efficacy.","author":"Kang Xueyang","year":"2025","unstructured":"Xueyang Kang, Zhengkang Xiang, Zezheng Zhang, and Kourosh Khoshelham. 2025. Multi-view Geometry-Aware Diffusion Transformer for Indoor Novel View Synthesis. In ICLR 2025 Workshop on Deep Generative Model in Machine Learning: Theory, Principle and Efficacy."},{"key":"e_1_3_2_2_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.01462"},{"key":"e_1_3_2_2_22_1","volume-title":"Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114","author":"Kingma Diederik P","year":"2013","unstructured":"Diederik P Kingma and Max Welling. 2013. Auto-encoding variational bayes. arXiv preprint arXiv:1312.6114 (2013)."},{"key":"e_1_3_2_2_23_1","unstructured":"Zhengfei Kuang Shengqu Cai Hao He Yinghao Xu Hongsheng Li Leonidas Guibas and Gordon. Wetzstein. 2024. Collaborative Video Diffusion: Consistent Multi-video Generation with Camera Control. In arXiv."},{"key":"e_1_3_2_2_24_1","volume-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. 6775-6785","author":"Dong Erqun","year":"2024","unstructured":"Jeong-gi Kwak, Erqun Dong, Yuhe Jin, Hanseok Ko, Shweta Mahajan, and Kwang Moo Yi. 2024. Vivid-1-to-3: Novel view synthesis with video diffusion models. In Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. 6775-6785."},{"key":"e_1_3_2_2_25_1","volume-title":"Albert Y. C. Chen, Cheng-Hao Kuo, and Min Sun.","author":"Li Ming-Feng","year":"2024","unstructured":"Ming-Feng Li, Yueh-Feng Ku, Hong-Xuan Yen, Yu-Lun Liu Chi Liu, Albert Y. C. Chen, Cheng-Hao Kuo, and Min Sun. 2024. GenRC: 3D Indoor Scene Generation from Sparse Image Collections. In ECCV."},{"key":"e_1_3_2_2_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00037"},{"key":"e_1_3_2_2_27_1","volume-title":"PanoFree: Tuning-Free Holistic Multi-view Image Generation with Cross-view Self-Guidance. arXiv preprint arXiv:2408.02157","author":"Liu Aoming","year":"2024","unstructured":"Aoming Liu, Zhong Li, Zhang Chen, Nannan Li, Yi Xu, and Bryan A Plummer. 2024. PanoFree: Tuning-Free Holistic Multi-view Image Generation with Cross-view Self-Guidance. arXiv preprint arXiv:2408.02157 (2024)."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018794"},{"key":"e_1_3_2_2_29_1","volume-title":"International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=0cpM2ApF9p6","author":"Liu Zhen","year":"2023","unstructured":"Zhen Liu, Yao Feng, Michael J. Black, Derek Nowrouzezahrai, Liam Paull, and Weiyang Liu. 2023. MeshDiffusion: Score-based Generative 3D Mesh Modeling. In International Conference on Learning Representations. https:\/\/openreview.net\/forum?id=0cpM2ApF9p6"},{"key":"e_1_3_2_2_30_1","volume-title":"Im-3d: Iterative multiview diffusion and reconstruction for high-quality 3d generation. arXiv preprint arXiv:2402.08682","author":"Melas-Kyriazi Luke","year":"2024","unstructured":"Luke Melas-Kyriazi, Iro Laina, Christian Rupprecht, Natalia Neverova, Andrea Vedaldi, Oran Gafni, and Filippos Kokkinos. 2024. Im-3d: Iterative multiview diffusion and reconstruction for high-quality 3d generation. arXiv preprint arXiv:2402.08682 (2024)."},{"key":"e_1_3_2_2_31_1","volume-title":"LT3SD: Latent Trees for 3D Scene Diffusion. arXiv preprint arXiv:2409.08215","author":"Meng Quan","year":"2024","unstructured":"Quan Meng, Lei Li, Matthias Nie\u00dfner, and Angela Dai. 2024. LT3SD: Latent Trees for 3D Scene Diffusion. arXiv preprint arXiv:2409.08215 (2024)."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00977"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.37"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"e_1_3_2_2_35_1","volume-title":"Dreamfusion: Text-to-3D using 2d diffusion. arXiv preprint arXiv:2209.14988","author":"Poole Ben","year":"2022","unstructured":"Ben Poole, Ajay Jain, Jonathan T Barron, and Ben Mildenhall. 2022. Dreamfusion: Text-to-3D using 2d diffusion. arXiv preprint arXiv:2209.14988 (2022)."},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00355"},{"key":"e_1_3_2_2_37_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00943"},{"key":"e_1_3_2_2_38_1","volume-title":"Ditto-nerf: Diffusion-based iterative text to omni-directional 3D model. arXiv preprint arXiv:2304.02827","author":"Seo Hoigi","year":"2023","unstructured":"Hoigi Seo, Hayeon Kim, Gwanghyun Kim, and Se Young Chun. 2023. Ditto-nerf: Diffusion-based iterative text to omni-directional 3D model. arXiv preprint arXiv:2304.02827 (2023)."},{"key":"e_1_3_2_2_39_1","volume-title":"Advances in Neural Information Processing Systems","volume":"37","author":"Seo Junyoung","year":"2024","unstructured":"Junyoung Seo, Kazumi Fukuda, Takashi Shibuya, Takuya Narihira, Naoki Murata, Shoukang Hu, Chieh-Hsin Lai, Seungryong Kim, and Yuki Mitsufuji. 2024. GenWarp: Single Image to Novel Views with Semantic-Preserving Generative Warping. Advances in Neural Information Processing Systems, Vol. 37 (2024)."},{"key":"e_1_3_2_2_40_1","volume-title":"Zero123: a single image to consistent multi-view diffusion base model. arXiv preprint arXiv:2310.15110","author":"Shi Ruoxi","year":"2023","unstructured":"Ruoxi Shi, Hansheng Chen, Zhuoyang Zhang, Minghua Liu, Chao Xu, Xinyue Wei, Linghao Chen, Chong Zeng, and Hao Su. 2023. Zero123: a single image to consistent multi-view diffusion base model. arXiv preprint arXiv:2310.15110 (2023)."},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01696"},{"key":"e_1_3_2_2_42_1","volume-title":"Make-a-video: Text-to-video generation without text-video data. arXiv preprint arXiv:2209.14792","author":"Singer Uriel","year":"2022","unstructured":"Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, et al., 2022. Make-a-video: Text-to-video generation without text-video data. arXiv preprint arXiv:2209.14792 (2022)."},{"key":"e_1_3_2_2_43_1","unstructured":"Gabriela Ben Melech Stan Diana Wofk Scottie Fox Alex Redden Will Saxton Jean Yu Estelle Aflalo Shao-Yen Tseng Fabio Nonato Matthias Muller et al. 2023. Ldm3D: Latent diffusion model for 3D. arXiv preprint arXiv:2305.10853 (2023)."},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.01938"},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01609"},{"key":"e_1_3_2_2_46_1","volume-title":"Karol Kurach, Raphael Marinier, Marcin Michalski, and Sylvain Gelly.","author":"Unterthiner Thomas","year":"2018","unstructured":"Thomas Unterthiner, Sjoerd Van Steenkiste, Karol Kurach, Raphael Marinier, Marcin Michalski, and Sylvain Gelly. 2018. Towards accurate generative models of video: A new metric & challenges. arXiv preprint arXiv:1812.01717 (2018)."},{"key":"e_1_3_2_2_47_1","volume-title":"European Conference on Computer Vision. Springer, 439-457","author":"Voleti Vikram","year":"2024","unstructured":"Vikram Voleti, Chun-Han Yao, Mark Boss, Adam Letts, David Pankratz, Dmitry Tochilkin, Christian Laforte, Robin Rombach, and Varun Jampani. 2024. Sv3d: Novel multi-view synthesis and 3d generation from a single image using latent video diffusion. In European Conference on Computer Vision. Springer, 439-457."},{"key":"e_1_3_2_2_48_1","volume-title":"VistaDream: Sampling multiview consistent images for single-view scene reconstruction. arXiv preprint arXiv:2410.16892","author":"Wang Haiping","year":"2024","unstructured":"Haiping Wang, Yuan Liu, Ziwei Liu, Zhen Dong, Wenping Wang, and Bisheng Yang. 2024a. VistaDream: Sampling multiview consistent images for single-view scene reconstruction. arXiv preprint arXiv:2410.16892 (2024)."},{"key":"e_1_3_2_2_49_1","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00486"},{"key":"e_1_3_2_2_50_1","volume-title":"Generative Inbetweening: Adapting Image-to-Video Models for Keyframe Interpolation.","author":"Wang Xiaojuan","year":"2025","unstructured":"Xiaojuan Wang, Boyang Zhou, Brian Curless, Ira Kemelmacher-Shlizerman, Aleksander Holynski, and Steven M Seitz. 2025. Generative Inbetweening: Adapting Image-to-Video Models for Keyframe Interpolation. (2025)."},{"key":"e_1_3_2_2_51_1","volume-title":"Image quality assessment: from error visibility to structural similarity","author":"Wang Zhou","year":"2004","unstructured":"Zhou Wang, Alan C Bovik, Hamid R Sheikh, and Eero P Simoncelli. 2004. Image quality assessment: from error visibility to structural similarity. IEEE transactions on image processing, Vol. 13, 4 (2004), 600-612."},{"key":"e_1_3_2_2_52_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00701"},{"key":"e_1_3_2_2_53_1","unstructured":"Kailu Wu Fangfu Liu Zhihan Cai Runjie Yan Hanyang Wang Yating Hu Yueqi Duan and Kaisheng Ma. 2024. Unique3D: High-Quality and Efficient 3D Mesh Generation from a Single Image. arXiv:2405.20343 [cs.CV]"},{"key":"e_1_3_2_2_54_1","volume-title":"The Twelfth International Conference on Learning Representations.","author":"Wu Tianhao","year":"2023","unstructured":"Tianhao Wu, Chuanxia Zheng, and Tat-Jen Cham. 2023b. PanoDiffusion: 360-degree Panorama Outpainting via Diffusion. In The Twelfth International Conference on Learning Representations."},{"key":"e_1_3_2_2_55_1","unstructured":"Tianhao Wu Chuanxia Zheng and Tat-Jen Cham. 2023c. PanoDiffusion: Depth-aided 360-degree Indoor RGB Panorama Outpainting via Latent Diffusion Model. arXiv:2307.03177 [cs.CV]"},{"key":"e_1_3_2_2_56_1","volume-title":"2017 2nd international conference on image, vision and computing (ICIVC). IEEE, 783-787","author":"Xia Xiaoling","year":"2017","unstructured":"Xiaoling Xia, Cui Xu, and Bing Nan. 2017. Inception-v3 for flower classification. In 2017 2nd international conference on image, vision and computing (ICIVC). IEEE, 783-787."},{"key":"e_1_3_2_2_57_1","volume-title":"InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models. arXiv preprint arXiv:2404.07191","author":"Xu Jiale","year":"2024","unstructured":"Jiale Xu, Weihao Cheng, Yiming Gao, Xintao Wang, Shenghua Gao, and Ying Shan. 2024. InstantMesh: Efficient 3D Mesh Generation from a Single Image with Sparse-view Large Reconstruction Models. arXiv preprint arXiv:2404.07191 (2024)."},{"key":"e_1_3_2_2_58_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01617"},{"key":"e_1_3_2_2_59_1","volume-title":"Depth Anything V2. arXiv:2406.09414","author":"Yang Lihe","year":"2024","unstructured":"Lihe Yang, Bingyi Kang, Zilong Huang, Zhen Zhao, Xiaogang Xu, Jiashi Feng, and Hengshuang Zhao. 2024b. Depth Anything V2. arXiv:2406.09414 (2024)."},{"key":"e_1_3_2_2_60_1","volume-title":"Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion. arXiv preprint arXiv:2402.03162","author":"Yang Shiyuan","year":"2024","unstructured":"Shiyuan Yang, Liang Hou, Haibin Huang, Chongyang Ma, Pengfei Wan, Di Zhang, Xiaodong Chen, and Jing Liao. 2024a. Direct-a-Video: Customized Video Generation with User-Directed Camera Movement and Object Motion. arXiv preprint arXiv:2402.03162 (2024)."},{"key":"e_1_3_2_2_61_1","doi-asserted-by":"crossref","unstructured":"Shuai Yang Jing Tan Mengchen Zhang Tong Wu Yixuan Li Gordon Wetzstein Ziwei Liu and Dahua Lin. 2024d. LayerPano3D: Layered 3D Panorama for Hyper-Immersive Scene Generation. arXiv:2408.13252 [cs.CV] https:\/\/arxiv.org\/abs\/2408.13252","DOI":"10.1145\/3721238.3730643"},{"key":"e_1_3_2_2_62_1","volume-title":"SceneCraft: Layout-Guided 3D Scene Generation. arXiv preprint arXiv:2410.09049","author":"Yang Xiuyu","year":"2024","unstructured":"Xiuyu Yang, Yunze Man, Jun-Kun Chen, and Yu-Xiong Wang. 2024c. SceneCraft: Layout-Guided 3D Scene Generation. arXiv preprint arXiv:2410.09049 (2024)."},{"key":"e_1_3_2_2_63_1","unstructured":"Zhuoyi Yang Jiayan Teng Wendi Zheng Ming Ding Shiyu Huang Jiazheng Xu Yuanming Yang Wenyi Hong Xiaohan Zhang Guanyu Feng et al. 2024 e. CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer. arXiv preprint arXiv:2408.06072 (2024)."},{"key":"e_1_3_2_2_64_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00636"},{"key":"e_1_3_2_2_65_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00653"},{"key":"e_1_3_2_2_66_1","volume-title":"ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis. arXiv preprint arXiv:2409.02048","author":"Yu Wangbo","year":"2024","unstructured":"Wangbo Yu, Jinbo Xing, Li Yuan, Wenbo Hu, Xiaoyu Li, Zhipeng Huang, Xiangjun Gao, Tien-Tsin Wong, Ying Shan, and Yonghong Tian. 2024b. ViewCrafter: Taming Video Diffusion Models for High-fidelity Novel View Synthesis. arXiv preprint arXiv:2409.02048 (2024)."},{"key":"e_1_3_2_2_67_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00607"},{"key":"e_1_3_2_2_68_1","volume-title":"International Conference on Learning Representations (ICLR).","author":"Zhang Jason Y","year":"2024","unstructured":"Jason Y Zhang, Amy Lin, Moneish Kumar, Tzu-Hsuan Yang, Deva Ramanan, and Shubham Tulsiani. 2024a. Cameras as Rays: Pose Estimation via Ray Diffusion. In International Conference on Learning Representations (ICLR)."},{"key":"e_1_3_2_2_69_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00068"},{"key":"e_1_3_2_2_70_1","volume-title":"Controlvideo: Training-free controllable text-to-video generation. arXiv preprint arXiv:2305.13077","author":"Zhang Yabo","year":"2023","unstructured":"Yabo Zhang, Yuxiang Wei, Dongsheng Jiang, Xiaopeng Zhang, Wangmeng Zuo, and Qi Tian. 2023. Controlvideo: Training-free controllable text-to-video generation. arXiv preprint arXiv:2305.13077 (2023)."},{"key":"e_1_3_2_2_71_1","volume-title":"Stereo magnification: Learning view synthesis using multiplane images. arXiv preprint arXiv:1805.09817","author":"Zhou Tinghui","year":"2018","unstructured":"Tinghui Zhou, Richard Tucker, John Flynn, Graham Fyffe, and Noah Snavely. 2018. Stereo magnification: Learning view synthesis using multiplane images. arXiv preprint arXiv:1805.09817 (2018)."}],"event":{"name":"MM '25: The 33rd ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Dublin Ireland","acronym":"MM '25"},"container-title":["Proceedings of the 33rd ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3746027.3754779","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,10]],"date-time":"2025-12-10T04:57:56Z","timestamp":1765342676000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3746027.3754779"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,10,27]]},"references-count":71,"alternative-id":["10.1145\/3746027.3754779","10.1145\/3746027"],"URL":"https:\/\/doi.org\/10.1145\/3746027.3754779","relation":{},"subject":[],"published":{"date-parts":[[2025,10,27]]},"assertion":[{"value":"2025-10-27","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}