{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T11:02:37Z","timestamp":1781002957831,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":27,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T00:00:00Z","timestamp":1780876800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"name":"MCIN\/AEI\/10.13039\/501100011033","award":["RYC2020-030679-I"],"award-info":[{"award-number":["RYC2020-030679-I"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,9]]},"DOI":"10.1145\/3788851.3815032","type":"proceedings-article","created":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T10:23:26Z","timestamp":1780914206000},"page":"504-508","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Toward an AI Director: Automating Live Presentations with Local Vision-Language Models"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-0991-643X","authenticated-orcid":false,"given":"Eugenio Giuseppe","family":"Nerelli","sequence":"first","affiliation":[{"name":"Department of Informatics, University of Val\u00e8ncia, Val\u00e8ncia, Val\u00e8ncia, Spain"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-9070-8269","authenticated-orcid":false,"given":"Alberto","family":"Robazza","sequence":"additional","affiliation":[{"name":"University of Udine, Udine, Italy"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-4125-2019","authenticated-orcid":false,"given":"Andrea","family":"Turchet","sequence":"additional","affiliation":[{"name":"University of Udine, Udine, Italy"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2398-1505","authenticated-orcid":false,"given":"Mario","family":"Montagud Climent","sequence":"additional","affiliation":[{"name":"Department of Informatics, University of Valencia, Valencia, Spain and Media &amp; Internet Area, i2cat Foundation, Barcelona, Spain"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,6,8]]},"reference":[{"key":"e_1_3_3_1_2_2","unstructured":"Alpha Cephei. 2024. Vosk Speech Recognition Toolkit. https:\/\/alphacephei.com\/vosk\/. Open-source offline speech recognition toolkit. Supports 20+ languages lightweight models (\u00a050MB) streaming API and bindings for Java C# JavaScript. [Online]. Available: https:\/\/alphacephei.com\/vosk\/."},{"key":"e_1_3_3_1_3_2","unstructured":"Artifex Software Inc.2024. PyMuPDF: High-Performance Python Library for PDF Data Extraction and Manipulation. https:\/\/pymupdf.readthedocs.io\/en\/latest\/. Version 1.27.2.2. High-performance Python library for data extraction analysis conversion and manipulation of PDF and other documents. Hosted on GitHub registered on PyPI. [Online]. Available: https:\/\/pymupdf.readthedocs.io\/en\/latest\/."},{"key":"e_1_3_3_1_4_2","unstructured":"Shuai Bai Yuxuan Cai Ruizhe Chen Keqin Chen Xionghui Chen Zesen Cheng Lianghao Deng Wei Ding Chang Gao Chunjiang Ge Wenbin Ge Zhifang Guo Qidong Huang Jie Huang Fei Huang Binyuan Hui Shutong Jiang Zhaohai Li Mingsheng Li Mei Li Kaixin Li Zicheng Lin Junyang Lin Xuejing Liu Jiawei Liu Chenglong Liu Yang Liu Dayiheng Liu Shixuan Liu Dunjie Lu Ruilin Luo Chenxu Lv Rui Men Lingchen Meng Xuancheng Ren Xingzhang Ren Sibo Song Yuchong Sun Jun Tang Jianhong Tu Jianqiang Wan Peng Wang Pengfei Wang Qiuyue Wang Yuxuan Wang Tianbao Xie Yiheng Xu Haiyang Xu Jin Xu Zhibo Yang Mingkun Yang Jianxin Yang An Yang Bowen Yu Fei Zhang Hang Zhang Xi Zhang Bo Zheng Humen Zhong Jingren Zhou Fan Zhou Jing Zhou Yuanzhi Zhu and Ke Zhu. 2025. Qwen3-VL Technical Report. arxiv:https:\/\/arXiv.org\/abs\/2511.21631\u00a0[cs.CV]"},{"key":"e_1_3_3_1_5_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCAR64901.2025.11073044"},{"key":"e_1_3_3_1_6_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51701.2025.02097"},{"key":"e_1_3_3_1_7_2","doi-asserted-by":"publisher","DOI":"10.1145\/3761667.3761945"},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-93806-1_19"},{"key":"e_1_3_3_1_9_2","unstructured":"Quentin Galvane. 2015. Automatic Cinematography and Editing in Virtual Environments. Theses. Universit\u00e9 Grenoble Alpes. https:\/\/theses.hal.science\/tel-01258572"},{"key":"e_1_3_3_1_10_2","unstructured":"ggml.org. 2024. llama.cpp: LLM Inference in C\/C++. https:\/\/github.com\/ggml-org\/llama.cpp. Accessed: 2026."},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"publisher","DOI":"10.1145\/3708359.3712113"},{"key":"e_1_3_3_1_12_2","doi-asserted-by":"publisher","unstructured":"Koushi Hiraoka Yugo Nakamura and Yutaka Arakawa. 2026. EdgeVLM as a Privacy Filter: Toward Privacy-Aware Activity Recognition From Wearable Camera Using Image Captions. IEEE Access 14 (2026) 22445\u201322456. 10.1109\/ACCESS.2026.3659343","DOI":"10.1109\/ACCESS.2026.3659343"},{"key":"e_1_3_3_1_13_2","doi-asserted-by":"publisher","unstructured":"Xinmeng Hou Wuqi Wang Long Yang Hao Lin Jinglun Feng Haigen Min and Xiangmo Zhao. 2025. DriveAgent: Multi-Agent Structured Reasoning With LLM and Multimodal Sensor Fusion for Autonomous Driving. IEEE Robotics and Automation Letters 10 11 (2025) 12189\u201312196. 10.1109\/LRA.2025.3619807","DOI":"10.1109\/LRA.2025.3619807"},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"publisher","unstructured":"Yifei Huang Jilan Xu Baoqi Pei Lijin Yang Mingfang Zhang Yuping He Guo Chen Xinyuan Chen Yaohui Wang Zheng Nie Jinyao Liu Dechen Lin Fang Fang Kunpeng Li Chang Yuan Yu Qiao Yali Wang and Limin Wang. 2025. Vinci: A Real-time Smart Assistant Based on Egocentric Vision-language Model for Portable Devices. Proc. ACM Interact. Mob. Wearable Ubiquitous Technol. 9 3 Article 88 (Sept. 2025) 33\u00a0pages. 10.1145\/3749513","DOI":"10.1145\/3749513"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"publisher","DOI":"10.1109\/WACV57701.2024.00451"},{"key":"e_1_3_3_1_16_2","unstructured":"Alexander Kapitanov Andrey Makhliarchuk and hukenovs. 2021. HaGRID Classification and Detection Vision Models. https:\/\/github.com\/hukenovs\/hagrid-models. Pretrained classification (MobileNetV3 ResNet ViT) and detection (SSDLite SwinS\/SwinT FasterRCNN) models for hand gesture recognition. BSD-3-Clause license. [Online]. Available: https:\/\/github.com\/hukenovs\/hagrid-models."},{"key":"e_1_3_3_1_17_2","doi-asserted-by":"publisher","unstructured":"Zikang Leng Megha Thukral Yaqi Liu Hrudhai Rajasekhar Shruthi\u00a0K. Hiremath Jiaman He and Thomas Pl\u00f6tz. 2026. AgentSense: Virtual Sensor Data Generation Using LLM Agents in Simulated Home Environments. Proceedings of the AAAI Conference on Artificial Intelligence 40 3 (Mar. 2026) 1891\u20131899. 10.1609\/aaai.v40i3.37169","DOI":"10.1609\/aaai.v40i3.37169"},{"key":"e_1_3_3_1_18_2","doi-asserted-by":"publisher","DOI":"10.1109\/CCWC67433.2026.11393769"},{"key":"e_1_3_3_1_19_2","unstructured":"Souvik Mandal and Nanonets. 2025. Nanonets-OCR-s: OCR with Semantic Understanding. https:\/\/nanonets.com\/research\/nanonets-ocr-s\/. State-of-the-art image-to-markdown OCR model based on Qwen2.5-VL-3B trained on 250 000+ pages. Supports LaTeX equation recognition signature detection watermark extraction checkbox handling and complex table extraction. [Online]. Available: https:\/\/nanonets.com\/research\/nanonets-ocr-s\/."},{"key":"e_1_3_3_1_20_2","unstructured":"Andr\u00e9s Marafioti Orr Zohar Miquel Farr\u00e9 Merve Noyan Elie Bakouch Pedro Cuenca Cyril Zakka Loubna Ben\u00a0Allal Anton Lozhkov Nouamane Tazi Vaibhav Srivastav Joshua Lochner Hugo Larcher Mathieu Morlon Lewis Tunstall Leandro von Werra and Thomas Wolf. 2025. SmolVLM: Redefining Small and Efficient Multimodal Models. arxiv:https:\/\/arXiv.org\/abs\/2504.05299\u00a0[cs.AI] Used in initial prototyping."},{"key":"e_1_3_3_1_21_2","first-page":"4","volume-title":"Game Developers Conference","volume":"2","author":"Mateas Michael","year":"2003","unstructured":"Michael Mateas and Andrew Stern. 2003. Fa\u00e7ade: An Experiment in Building a Fully-Realized Interactive Drama. In Game Developers Conference , Vol.\u00a02. CMP Media LLC, San Jose, CA, USA, 4\u20138."},{"key":"e_1_3_3_1_22_2","doi-asserted-by":"publisher","DOI":"10.1145\/3706598.3713305"},{"key":"e_1_3_3_1_23_2","doi-asserted-by":"publisher","unstructured":"Mark\u00a0O. Riedl and Vadim Bulitko. 2013. Interactive Narrative: An Intelligent Systems Approach. AI Magazine 34 1 (2013) 67\u201377. 10.1609\/aimag.v34i1.2449","DOI":"10.1609\/aimag.v34i1.2449"},{"key":"e_1_3_3_1_24_2","doi-asserted-by":"publisher","unstructured":"Hao Wang Fang Liu Licheng Jiao Jiahao Wang Shuo Li Lingling Li Puhua Chen and Xu Liu. 2026. Learning to Prompt with Refining Text Knowledge for Zero-shot Video Action Recognition. IEEE Transactions on Multimedia (Early Access). 10.1109\/TMM.2026.3660143Early access.","DOI":"10.1109\/TMM.2026.3660143"},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52734.2025.01763"},{"key":"e_1_3_3_1_26_2","doi-asserted-by":"publisher","unstructured":"Xinyi Wu Haohong Wang and Aggelos\u00a0K. Katsaggelos. 2025. Automatic Camera Movement Generation With Enhanced Immersion for Virtual Cinematography. IEEE Transactions on Multimedia 27 (2025) 5241\u20135254. 10.1109\/TMM.2025.3542956","DOI":"10.1109\/TMM.2025.3542956"},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"publisher","unstructured":"Sicheng Yang Yukai Huang Weitong Cai Shitong Sun You He Jiankang Deng Hang Zhang Jifei Song and Zhensong Zhang. 2026. Plug-and-Play Clarifier: A Zero-Shot Multimodal Framework for Egocentric Intent Disambiguation. Proceedings of the AAAI Conference on Artificial Intelligence 40 21 (Mar. 2026) 17921\u201317929. 10.1609\/aaai.v40i21.38851","DOI":"10.1609\/aaai.v40i21.38851"},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","unstructured":"Yang Zhang Hanling Wang Qing Bai Haifeng Liang Peican Zhu Gabriel-Miro Muntean and Qing Li. 2025. VaVLM: Toward Efficient Edge-Cloud Video Analytics With Vision-Language Models. IEEE Transactions on Broadcasting 71 2 (2025) 529\u2013541. 10.1109\/TBC.2025.3549983","DOI":"10.1109\/TBC.2025.3549983"}],"event":{"name":"IMX '26: ACM International Conference on Interactive Media Experiences","location":"Athlone Ireland","acronym":"IMX '26","sponsor":["SIGCHI ACM Special Interest Group on Computer-Human Interaction"]},"container-title":["Proceedings of the 2026 ACM International Conference on Interactive Media Experiences"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3788851.3815032","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T10:44:50Z","timestamp":1781001890000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3788851.3815032"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,8]]},"references-count":27,"alternative-id":["10.1145\/3788851.3815032","10.1145\/3788851"],"URL":"https:\/\/doi.org\/10.1145\/3788851.3815032","relation":{},"subject":[],"published":{"date-parts":[[2026,6,8]]},"assertion":[{"value":"2026-06-08","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}