{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T19:06:30Z","timestamp":1784228790402,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T00:00:00Z","timestamp":1784419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,7,19]]},"DOI":"10.1145\/3799902.3811220","type":"proceedings-article","created":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T16:15:27Z","timestamp":1784218527000},"page":"1-11","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Autoregressive Modeling of Film with Applications in Video Montage"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-3227-9195","authenticated-orcid":false,"given":"Marcelo","family":"Sandoval-Casta\u00f1eda","sequence":"first","affiliation":[{"name":"TTIC, Chicago, USA and Adobe, Chicago, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3129-1985","authenticated-orcid":false,"given":"Fabian","family":"Caba Heilbron","sequence":"additional","affiliation":[{"name":"Adobe, San Jose, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7362-1401","authenticated-orcid":false,"given":"Shiry","family":"Ginosar","sequence":"additional","affiliation":[{"name":"TTIC, Chicago, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8656-543X","authenticated-orcid":false,"given":"Bryan","family":"Russell","sequence":"additional","affiliation":[{"name":"Adobe, San Francisco, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2554-5301","authenticated-orcid":false,"given":"Josef","family":"Sivic","sequence":"additional","affiliation":[{"name":"Adobe, Prague, Czech Republic and CTU, Prague, Prague, Czech Republic"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5720-8070","authenticated-orcid":false,"given":"Alexei","family":"Efros","sequence":"additional","affiliation":[{"name":"University of California Berkeley, Berkeley, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4700-9398","authenticated-orcid":false,"given":"Gregory","family":"Shakhnarovich","sequence":"additional","affiliation":[{"name":"TTIC, Chicago, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,19]]},"reference":[{"key":"e_1_3_3_3_2_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20074-8_12"},{"key":"e_1_3_3_3_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52733.2024.00711"},{"key":"e_1_3_3_3_4_1","volume-title":"Grammar of the Film Language","author":"Arijon Daniel","year":"1991","unstructured":"Daniel Arijon. 1991. Grammar of the Film Language. Silman-James Press."},{"key":"e_1_3_3_3_5_1","unstructured":"Andr\u00e9 Bazin Charles Bitsch and Jean Domarchi. 1958. Interview with Orson Welles. Cahiers du Cin\u00e9ma84 (June 1958) 1\u201313."},{"key":"e_1_3_3_3_6_1","unstructured":"Iz Beltagy Matthew\u00a0E. Peters and Arman Cohan. 2020. Longformer: The Long-Document Transformer. arXiv:https:\/\/arXiv.org\/abs\/2004.05150 (2020)."},{"key":"e_1_3_3_3_7_1","doi-asserted-by":"crossref","unstructured":"Floraine Berthouzoz Wilmot Li and Maneesh Agrawala. 2012. Tools for placing cuts and transitions in interview video. ACM TOG 31 4 (2012) 1\u20138.","DOI":"10.1145\/2185520.2185563"},{"key":"e_1_3_3_3_8_1","first-page":"148","volume-title":"AAAI","author":"Christianson David\u00a0B","year":"1996","unstructured":"David\u00a0B Christianson, Sean\u00a0E Anderson, Li-wei He, David\u00a0H Salesin, Daniel\u00a0S Weld, and Michael\u00a0F Cohen. 1996. Declarative Camera Control for Automatic Cinematography. In AAAI. 148\u2013155."},{"key":"e_1_3_3_3_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462506"},{"key":"e_1_3_3_3_10_1","unstructured":"Abhimanyu Dubey Abhinav Jauhri and et. al. 2024. The Llama 3 Herd of Models. arxiv:https:\/\/arXiv.org\/abs\/2407.21783\u00a0[cs.AI] https:\/\/arxiv.org\/abs\/2407.21783"},{"key":"e_1_3_3_3_11_1","unstructured":"EditStock. 2025. EditStock. (2025). https:\/\/editstock.com"},{"key":"e_1_3_3_3_12_1","unstructured":"Arushi Goel Sreyan Ghosh Jaehyeon Kim Sonal Kumar Zhifeng Kong Sang-gil Lee Chao-Han\u00a0Huck Yang Ramani Duraiswami Dinesh Manocha Rafael Valle et\u00a0al. 2025. Audio Flamingo 3: Advancing Audio Intelligence with Fully Open Large Audio Language Models. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2507.08128 (2025)."},{"key":"e_1_3_3_3_13_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-72989-8_11"},{"key":"e_1_3_3_3_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.114"},{"key":"e_1_3_3_3_15_1","doi-asserted-by":"publisher","DOI":"10.1145\/237170.237259"},{"key":"e_1_3_3_3_16_1","volume-title":"Out of Order: Storytelling Techniques for Video and Cinema Editors","author":"Hockrow Ross","year":"2014","unstructured":"Ross Hockrow. 2014. Out of Order: Storytelling Techniques for Video and Cinema Editors. Peachpit Press, San Francisco, CA."},{"key":"e_1_3_3_3_17_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P17-1141"},{"key":"e_1_3_3_3_18_1","doi-asserted-by":"publisher","DOI":"10.1145\/3290605.3300311"},{"key":"e_1_3_3_3_19_1","doi-asserted-by":"publisher","DOI":"10.1145\/3544548.3581494"},{"key":"e_1_3_3_3_20_1","first-page":"307","volume-title":"AAAI","author":"Jhala Arnav","year":"2005","unstructured":"Arnav Jhala and Robert\u00a0Michael Young. 2005. A Discourse Planning Approach to Cinematic Camera Control for Narratives in Virtual Environments. In AAAI , Vol.\u00a05. 307\u2013312."},{"key":"e_1_3_3_3_21_1","first-page":"118","volume-title":"Graphics Interface","author":"Karp Peter","year":"1993","unstructured":"Peter Karp and Steven Feiner. 1993. Automated Presentation Planning of Animation Using Task Decomposition with Heuristic Reasoning. In Graphics Interface. Canadian Information Processing Society, 118\u2013118."},{"key":"e_1_3_3_3_22_1","volume-title":"Film Directing: Shot by Shot: Visualizing from Concept to Screen","author":"Katz Steven\u00a0D.","year":"1991","unstructured":"Steven\u00a0D. Katz. 1991. Film Directing: Shot by Shot: Visualizing from Concept to Screen. Michael Wiese Productions."},{"key":"e_1_3_3_3_23_1","doi-asserted-by":"publisher","DOI":"10.4324\/9781003473152"},{"key":"e_1_3_3_3_24_1","doi-asserted-by":"crossref","unstructured":"Mackenzie Leake Abe Davis Anh Truong and Maneesh Agrawala. 2017. Computational Video Editing for Dialogue-Driven Scenes. ACM TOG 36 4 (2017) 130\u20131.","DOI":"10.1145\/3072959.3073653"},{"key":"e_1_3_3_3_25_1","doi-asserted-by":"crossref","unstructured":"Dawon Lee Jung\u00a0Eun Yoo Kyungmin Cho Bumki Kim Gyeonghun Im and Junyong Noh. 2022. PopStage: The Generation of Stage Cross-Editing Video based on Spatio-Temporal Matching. ACM TOG 41 6 (2022) 1\u201313.","DOI":"10.1145\/3550454.3555467"},{"key":"e_1_3_3_3_26_1","unstructured":"Yuzhi Li Haojun Xu and Feng Tian. 2025. Shot Sequence Ordering for Video Editing: Benchmarks Metrics and Cinematology-inspired Computing Methods. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2503.17975 (2025)."},{"key":"e_1_3_3_3_27_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-25289-1_35"},{"key":"e_1_3_3_3_28_1","doi-asserted-by":"publisher","DOI":"10.1111\/cgf.12775"},{"key":"e_1_3_3_3_29_1","volume-title":"Film Theory and Criticism: Introductory Readings","author":"Metz Christian","year":"1992","unstructured":"Christian Metz. 1992. Some Points in the Semiotics of the Cinema. In Film Theory and Criticism: Introductory Readings, Gerald Mast, Marshall Cohen, and Leo Braudy (Eds.). Oxford University Press."},{"key":"e_1_3_3_3_30_1","doi-asserted-by":"publisher","DOI":"10.1145\/3313831.3376544"},{"key":"e_1_3_3_3_31_1","unstructured":"Alejandro Pardo Jui-Hsien Wang Bernard Ghanem Josef Sivic Bryan Russell and Fabian\u00a0Caba Heilbron. 2024. Generative Timelines for Instructed Visual Assembly. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/2411.12293 (2024)."},{"key":"e_1_3_3_3_32_1","volume-title":"ICML","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong\u00a0Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In ICML."},{"key":"e_1_3_3_3_33_1","unstructured":"R\u00e9mi Ronfard Vineet Gandhi Laurent Boiron and Vaishnavi\u00a0Ameya Murukutla. 2015. The Prose Storyboard Language: A Tool for Annotating and Directing Movies. arXiv preprint arXiv:https:\/\/arXiv.org\/abs\/1508.07593 (2015)."},{"key":"e_1_3_3_3_34_1","first-page":"1","volume-title":"SIGGRAPH \u201925","author":"Sandoval-Casta\u00f1eda Marcelo","year":"2025","unstructured":"Marcelo Sandoval-Casta\u00f1eda, Bryan Russell, Josef Sivic, Gregory Shakhnarovich, and Fabian Caba\u00a0Heilbron. 2025. EditDuet: A Multi-Agent System for Video Non-Linear Editing. In SIGGRAPH \u201925. 1\u201311."},{"key":"e_1_3_3_3_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01107"},{"key":"e_1_3_3_3_36_1","doi-asserted-by":"crossref","unstructured":"Arno Sch\u00f6dl Richard Szeliski David\u00a0H. Salesin and Irfan Essa. 2000. Video Textures(SIGGRAPH \u201900).","DOI":"10.1145\/344779.345012"},{"key":"e_1_3_3_3_37_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19839-7_17"},{"key":"e_1_3_3_3_38_1","doi-asserted-by":"publisher","DOI":"10.1145\/3664647.3685517"},{"key":"e_1_3_3_3_39_1","doi-asserted-by":"publisher","DOI":"10.1145\/3640543.3645164"},{"key":"e_1_3_3_3_40_1","volume-title":"The Screenwriter\u2019s Bible: A Complete Guide to Writing, Formatting, and Selling Your Spec Script","author":"Trottier David","year":"1994","unstructured":"David Trottier. 1994. The Screenwriter\u2019s Bible: A Complete Guide to Writing, Formatting, and Selling Your Spec Script. Screenwriting Center."},{"key":"e_1_3_3_3_41_1","doi-asserted-by":"publisher","DOI":"10.1145\/3640543.3645143"},{"key":"e_1_3_3_3_42_1","doi-asserted-by":"publisher","DOI":"10.1145\/3643834.3661591"},{"key":"e_1_3_3_3_43_1","doi-asserted-by":"publisher","DOI":"10.5555\/3056983.3056988"},{"key":"e_1_3_3_3_44_1","doi-asserted-by":"crossref","unstructured":"Hui-Yin Wu Francesca Pal\u00f9 Roberto Ranon and Marc Christie. 2018. Thinking Like a Director: Film Editing Patterns for Virtual Cinematographic Storytelling. ACM Transactions on Multimedia Computing Communications and Applications (TOMM) 14 4 (2018) 1\u201322.","DOI":"10.1145\/3241057"},{"key":"e_1_3_3_3_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00135"},{"key":"e_1_3_3_3_46_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3548268"},{"key":"e_1_3_3_3_47_1","unstructured":"Qihang Yu Mark Weber Xueqing Deng Xiaohui Shen Daniel Cremers and Liang-Chieh Chen. 2024. An Image is Worth 32 Tokens for Reconstruction and Generation. NeurIPS (2024)."}],"event":{"name":"SIGGRAPH Conference Papers '26: Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers","location":"Los Angeles CA USA","acronym":"SIGGRAPH Conference Papers '26","sponsor":["SIGGRAPH ACM Special Interest Group on Computer Graphics and Interactive Techniques"]},"container-title":["Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers"],"original-title":[],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T18:25:12Z","timestamp":1784226312000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3799902.3811220"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,19]]},"references-count":46,"alternative-id":["10.1145\/3799902.3811220","10.1145\/3799902"],"URL":"https:\/\/doi.org\/10.1145\/3799902.3811220","relation":{},"subject":[],"published":{"date-parts":[[2026,7,19]]},"assertion":[{"value":"2026-07-19","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}