{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T05:06:23Z","timestamp":1784610383093,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":46,"publisher":"ACM","license":[{"start":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T00:00:00Z","timestamp":1781568000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2026,6,16]]},"DOI":"10.1145\/3810987.3815535","type":"proceedings-article","created":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T04:55:12Z","timestamp":1784609712000},"page":"1-6","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Reducing Prompt Sensitivity in Video Anomaly Understanding via Conditional Prompt Learning"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-4321-0796","authenticated-orcid":false,"given":"Arsen","family":"Ignatosyan","sequence":"first","affiliation":[{"name":"Leiden Institute of Advanced Computer Science, Leiden University, Leiden, Zuid-Holland, Netherlands"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1847-068X","authenticated-orcid":false,"given":"Lu","family":"Cao","sequence":"additional","affiliation":[{"name":"Leiden Institute of Advanced Computer Science, Leiden University, Leiden, Zuid-Holland, Netherlands"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3670-3897","authenticated-orcid":false,"given":"Hazel","family":"Doughty","sequence":"additional","affiliation":[{"name":"Leiden Institute of Advanced Computer Science, Leiden University, Leiden, Zuid-Holland, Netherlands"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2026,7,20]]},"reference":[{"key":"e_1_3_3_1_2_2","doi-asserted-by":"publisher","unstructured":"Shuai Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Sibo Song Kai Dang Peng Wang Shijie Wang Jun Tang Humen Zhong Yuanzhi Zhu Mingkun Yang Zhaohai Li Jianqiang Wan Pengfei Wang Wei Ding Zheren Fu Yiheng Xu Jiabo Ye Xi Zhang Tianbao Xie Zesen Cheng Hang Zhang Zhibo Yang Haiyang Xu and Junyang Lin. 2025. Qwen2.5-VL Technical Report. (2 2025). 10.48550\/arXiv.2502.13923","DOI":"10.48550\/arXiv.2502.13923"},{"key":"e_1_3_3_1_3_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW56347.2022.00495"},{"key":"e_1_3_3_1_4_2","unstructured":"Zhe Chen Weiyun Wang Yue Cao Yangzhou Liu Zhangwei Gao Erfei Cui Jinguo Zhu Shenglong Ye Hao Tian Zhaoyang Liu Lixin Gu Xuehui Wang Qingyun Li Yimin Ren Zixuan Chen Jiapeng Luo Jiahao Wang Tan Jiang Bo Wang Conghui He Botian Shi Xingcheng Zhang Han Lv Yi Wang Wenqi Shao Pei Chu Zhongying Tu Tong He Zhiyong Wu Huipeng Deng Jiaye Ge Kai Chen Kaipeng Zhang Limin Wang Min Dou Lewei Lu Xizhou Zhu Tong Lu Dahua Lin Yu Qiao Jifeng Dai and Wenhai Wang. 2025. Expanding Performance Boundaries of Open-Source Multimodal Models with Model Data and Test-Time Scaling. (1 2025)."},{"key":"e_1_3_3_1_5_2","doi-asserted-by":"publisher","unstructured":"Zhe Chen Weiyun Wang Hao Tian Shenglong Ye Zhangwei Gao Erfei Cui Wenwen Tong Kongzhi Hu Jiapeng Luo Zheng Ma Ji Ma Jiaqi Wang Xiaoyi Dong Hang Yan Hewei Guo Conghui He Botian Shi Zhenjiang Jin Chao Xu Bin Wang Xingjian Wei Wei Li Wenjian Zhang Bo Zhang Pinlong Cai Licheng Wen Xiangchao Yan Min Dou Lewei Lu Xizhou Zhu Tong Lu Dahua Lin Yu Qiao Jifeng Dai and Wenhai Wang. 2024. How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites. Science China Information Sciences 67 12 (4 2024). 10.1007\/s11432-024-4231-5","DOI":"10.1007\/s11432-024-4231-5"},{"key":"e_1_3_3_1_6_2","doi-asserted-by":"publisher","unstructured":"Zhe Chen Jiannan Wu Wenhai Wang Weijie Su Guo Chen Sen Xing Muyan Zhong Qinglong Zhang Xizhou Zhu Lewei Lu Bin Li Ping Luo Tong Lu Yu Qiao and Jifeng Dai. 2023. InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks. Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition (12 2023) 24185\u201324198. 10.1109\/CVPR52733.2024.02283","DOI":"10.1109\/CVPR52733.2024.02283"},{"key":"e_1_3_3_1_7_2","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly Jakob Uszkoreit and Neil Houlsby. 2020. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. ICLR 2021 - 9th International Conference on Learning Representations (10 2020)."},{"key":"e_1_3_3_1_8_2","doi-asserted-by":"publisher","unstructured":"Hang Du Sicheng Zhang Binzhu Xie Guoshun Nan Jiayang Zhang Junrui Xu Hangyu Liu Sicong Leng Jiangming Liu Hehe Fan Dajiu Huang Jing Feng Linli Chen Can Zhang Xuhuan Li Hao Zhang Jianhang Chen Qimei Cui and Xiaofeng Tao. 2024. Uncovering What Why and How: A Comprehensive Benchmark for Causation Understanding of Video Anomaly. Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition (4 2024) 18793\u201318803. 10.1109\/CVPR52733.2024.01778","DOI":"10.1109\/CVPR52733.2024.01778"},{"key":"e_1_3_3_1_9_2","unstructured":"Edward Hu Yelong Shen Phillip Wallis Zeyuan Allen-Zhu Yuanzhi Li Shean Wang Lu Wang and Weizhu Chen. 2021. LoRA: Low-Rank Adaptation of Large Language Models. ICLR 2022 - 10th International Conference on Learning Representations (6 2021)."},{"key":"e_1_3_3_1_10_2","doi-asserted-by":"publisher","unstructured":"Zijie Huang and Yulei Wu. 2022. A Survey on Explainable Anomaly Detection for Industrial Internet of Things. 5th IEEE Conference on Dependable and Secure Computing DSC 2022 and SECSOC 2022 Workshop PASS4IoT 2022 Workshop SICSA International Paper\/Poster Competition in Cybersecurity (2022). 10.1109\/DSC54232.2022.9888874","DOI":"10.1109\/DSC54232.2022.9888874"},{"key":"e_1_3_3_1_11_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICIP49359.2023.10222289"},{"key":"e_1_3_3_1_12_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01832"},{"key":"e_1_3_3_1_13_2","doi-asserted-by":"publisher","unstructured":"Alon Lavie and Abhaya Agarwal. 2007. Meteor: An Automatic Metric for MT Evaluation with High Levels of Correlation with Human Judgments. (2007) 228\u2013231. 10.5555\/1626355.1626389","DOI":"10.5555\/1626355.1626389"},{"key":"e_1_3_3_1_14_2","doi-asserted-by":"publisher","unstructured":"Brian Lester Rami Al-Rfou and Noah Constant. 2021. The Power of Scale for Parameter-Efficient Prompt Tuning. EMNLP 2021 - 2021 Conference on Empirical Methods in Natural Language Processing Proceedings (4 2021) 3045\u20133059. 10.18653\/v1\/2021.emnlp-main.243","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"e_1_3_3_1_15_2","doi-asserted-by":"publisher","unstructured":"Xiang\u00a0Lisa Li and Percy Liang. 2021. Prefix-Tuning: Optimizing Continuous Prompts for Generation. ACL-IJCNLP 2021 - 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing Proceedings of the Conference 1 (1 2021) 4582\u20134597. 10.18653\/v1\/2021.acl-long.353","DOI":"10.18653\/v1\/2021.acl-long.353"},{"key":"e_1_3_3_1_16_2","doi-asserted-by":"crossref","unstructured":"Bin Lin Yang Ye Bin Zhu Jiaxi Cui Munan Ning Peng Jin and Li Yuan. 2024. Video-LLaVA: Learning United Visual Representation by Alignment Before Projection. (10 2024).","DOI":"10.18653\/v1\/2024.emnlp-main.342"},{"key":"e_1_3_3_1_17_2","unstructured":"Chin-Yew Lin. 2004. ROUGE: A Package for Automatic Evaluation of Summaries. 74\u201381\u00a0pages."},{"key":"e_1_3_3_1_18_2","unstructured":"Haotian Liu Chunyuan Li Yuheng Li and Yong\u00a0Jae Lee. 2024. Improved Baselines with Visual Instruction Tuning. (5 2024)."},{"key":"e_1_3_3_1_19_2","unstructured":"Jinfan Liu Yichao Yan Junjie Li Weiming Zhao Pengzhi Chu Xingdong Sheng Yunhui Liu and Xiaokang Yang. 2024. IPAD: Industrial Process Anomaly Detection Dataset. (4 2024)."},{"key":"e_1_3_3_1_20_2","doi-asserted-by":"publisher","unstructured":"Wen Liu Weixin Luo Dongze Lian and Shenghua Gao. 2017. Future Frame Prediction for Anomaly Detection \u2013 A New Baseline. Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition (12 2017) 6536\u20136545. 10.1109\/CVPR.2018.00684","DOI":"10.1109\/CVPR.2018.00684"},{"key":"e_1_3_3_1_21_2","doi-asserted-by":"publisher","unstructured":"Yang Liu Dingkang Yang Yan Wang Jing Liu Jun Liu Azzedine Boukerche Peng Sun and Liang Song. 2024. Generalized Video Anomaly Event Detection: Systematic Taxonomy and Comparison of Deep Models. Comput. Surveys 56 7 (4 2024). 10.1145\/3645101","DOI":"10.1145\/3645101"},{"key":"e_1_3_3_1_22_2","unstructured":"Ilya Loshchilov and Frank Hutter. 2017. Decoupled Weight Decay Regularization. 7th International Conference on Learning Representations ICLR 2019 (11 2017)."},{"key":"e_1_3_3_1_23_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.338"},{"key":"e_1_3_3_1_24_2","unstructured":"Haoyu Lu Wen Liu Bo Zhang Bingxuan Wang Kai Dong Bo Liu Jingxiang Sun Tongzheng Ren Zhuoshu Li Hao Yang Yaofeng Sun Chengqi Deng Hanwei Xu Zhenda Xie and Chong Ruan. 2024. DeepSeek-VL: Towards Real-World Vision-Language Understanding. (3 2024)."},{"key":"e_1_3_3_1_25_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.acl-long.679"},{"key":"e_1_3_3_1_26_2","doi-asserted-by":"publisher","unstructured":"Vijay Mahadevan Weixin Li Viral Bhalodia and Nuno Vasconcelos. 2010. Anomaly detection in crowded scenes. Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition (2010) 1975\u20131981. 10.1109\/CVPR.2010.5539872","DOI":"10.1109\/CVPR.2010.5539872"},{"key":"e_1_3_3_1_27_2","doi-asserted-by":"publisher","unstructured":"Yanjinlkham Myagmar-Ochir and Wooseong Kim. 2023. A Survey of Video Surveillance Systems in Smart City. Electronics 12 17 (2023). 10.3390\/electronics12173567","DOI":"10.3390\/electronics12173567"},{"key":"e_1_3_3_1_28_2","doi-asserted-by":"publisher","unstructured":"Kishore Papineni Salim Roukos Todd Ward and Wei-Jing Zhu. 2001. BLEU. Proceedings of the 40th Annual Meeting on Association for Computational Linguistics - ACL \u201902 (2001) 311. 10.3115\/1073083.1073135","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_3_1_29_2","doi-asserted-by":"publisher","unstructured":"Yujiang Pu Xiaoyu Wu Lulu Yang and Shengjin Wang. 2024. Learning Prompt-Enhanced Context Features for Weakly-Supervised Video Anomaly Detection. IEEE Transactions on Image Processing 33 (2024) 4923\u20134936. 10.1109\/TIP.2024.3451935","DOI":"10.1109\/TIP.2024.3451935"},{"key":"e_1_3_3_1_30_2","unstructured":"Qwen : An Yang Baosong Yang Beichen Zhang Binyuan Hui Bo Zheng Bowen Yu Chengyuan Li Dayiheng Liu Fei Huang Haoran Wei Huan Lin Jian Yang Jianhong Tu Jianwei Zhang Jianxin Yang Jiaxi Yang Jingren Zhou Junyang Lin Kai Dang Keming Lu Keqin Bao Kexin Yang Le Yu Mei Li Mingfeng Xue Pei Zhang Qin Zhu Rui Men Runji Lin Tianhao Li Tianyi Tang Tingyu Xia Xingzhang Ren Xuancheng Ren Yang Fan Yang Su Yichang Zhang Yu Wan Yuqiong Liu Zeyu Cui Zhenru Zhang and Zihan Qiu. 2024. Qwen2.5 Technical Report. (12 2024)."},{"key":"e_1_3_3_1_31_2","unstructured":"Alec Radford Jong\u00a0Wook Kim Chris Hallacy Aditya Ramesh Gabriel Goh Sandhini Agarwal Girish Sastry Amanda Askell Pamela Mishkin Jack Clark Gretchen Krueger and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. (2 2021)."},{"key":"e_1_3_3_1_32_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00678"},{"key":"e_1_3_3_1_33_2","doi-asserted-by":"crossref","unstructured":"Jiaqi Tang Hao Lu Ruizheng Wu Xiaogang Xu Ke Ma Cheng Fang Bin Guo Jiangbo Lu Qifeng Chen and Ying-Cong Chen. 2024. Hawk: Learning to Understand Open-World Video Anomalies. (5 2024).","DOI":"10.52202\/079017-4435"},{"key":"e_1_3_3_1_34_2","doi-asserted-by":"publisher","unstructured":"Ramakrishna Vedantam C.\u00a0Lawrence Zitnick and Devi Parikh. 2014. CIDEr: Consensus-based Image Description Evaluation. Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition 07-12-June-2015 (11 2014) 4566\u20134575. 10.1109\/CVPR.2015.7299087","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"e_1_3_3_1_35_2","unstructured":"Peng Wang Shuai Bai Sinan Tan Shijie Wang Zhihao Fan Jinze Bai Keqin Chen Xuejing Liu Jialin Wang Wenbin Ge Yang Fan Kai Dang Mengfei Du Xuancheng Ren Rui Men Dayiheng Liu Chang Zhou Jingren Zhou and Junyang Lin. 2024. Qwen2-VL: Enhancing Vision-Language Model\u2019s Perception of the World at Any Resolution. arxiv:https:\/\/arXiv.org\/abs\/2409.12191\u00a0[cs.CV]"},{"key":"e_1_3_3_1_36_2","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i6.28423"},{"key":"e_1_3_3_1_37_2","doi-asserted-by":"publisher","unstructured":"Yajun Xu Huan Hu Chuwen Huang Yibing Nan Yuyao Liu Kai Wang Zhaoxiang Liu and Shiguo Lian. 2025. TAD: A Large-Scale Benchmark for Traffic Accidents Detection From Video Surveillance. IEEE Access 13 (2025) 2018\u20132033. 10.1109\/ACCESS.2024.3522384","DOI":"10.1109\/ACCESS.2024.3522384"},{"key":"e_1_3_3_1_38_2","doi-asserted-by":"publisher","unstructured":"Zhiwei Yang Jing Liu and Peng Wu. 2024. Text Prompt with Normality Guidance for Weakly Supervised Video Anomaly Detection. Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition (4 2024) 18899\u201318908. 10.1109\/CVPR52733.2024.01788","DOI":"10.1109\/CVPR52733.2024.01788"},{"key":"e_1_3_3_1_39_2","doi-asserted-by":"publisher","unstructured":"Yu Yao Xizi Wang Mingze Xu Zelin Pu Yuchen Wang Ella Atkins and David\u00a0J. Crandall. 2023. DoTA: Unsupervised Detection of Traffic Anomaly in Driving Videos. IEEE Transactions on Pattern Analysis and Machine Intelligence 45 (1 2023) 444\u2013459. 10.1109\/TPAMI.2022.3150763","DOI":"10.1109\/TPAMI.2022.3150763"},{"key":"e_1_3_3_1_40_2","doi-asserted-by":"crossref","unstructured":"Luca Zanella Willi Menapace Massimiliano Mancini Yiming Wang and Elisa Ricci. 2024. Harnessing Large Language Models for Training-free Video Anomaly Detection. (4 2024).","DOI":"10.1109\/CVPR52733.2024.01753"},{"key":"e_1_3_3_1_41_2","doi-asserted-by":"crossref","unstructured":"Hang Zhang Xin Li and Lidong Bing. 2023. Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding. (10 2023).","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"e_1_3_3_1_42_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"e_1_3_3_1_43_2","doi-asserted-by":"crossref","unstructured":"Huaxin Zhang Xiaohao Xu Xiang Wang Jialong Zuo Xiaonan Huang Changxin Gao Shanjun Zhang Li Yu and Nong Sang. 2025. Holmes-VAU: Towards Long-term Video Anomaly Understanding at Any Granularity. (3 2025).","DOI":"10.1109\/CVPR52734.2025.01292"},{"key":"e_1_3_3_1_44_2","doi-asserted-by":"publisher","unstructured":"Zexuan Zhong Dan Friedman and Danqi Chen. 2021. Factual Probing Is [MASK]: Learning vs. Learning to Recall. NAACL-HLT 2021 - 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies Proceedings of the Conference (4 2021) 5017\u20135033. 10.18653\/v1\/2021.naacl-main.398","DOI":"10.18653\/v1\/2021.naacl-main.398"},{"key":"e_1_3_3_1_45_2","doi-asserted-by":"publisher","unstructured":"Kaiyang Zhou Jingkang Yang Chen\u00a0Change Loy and Ziwei Liu. 2022. Conditional Prompt Learning for Vision-Language Models. Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition 2022-June (3 2022) 16795\u201316804. 10.1109\/CVPR52688.2022.01631","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"e_1_3_3_1_46_2","doi-asserted-by":"publisher","unstructured":"Kaiyang Zhou Jingkang Yang Chen\u00a0Change Loy and Ziwei Liu. 2022. Learning to Prompt for Vision-Language Models. (10 2022). 10.1007\/s11263-022-01653-1","DOI":"10.1007\/s11263-022-01653-1"},{"key":"e_1_3_3_1_47_2","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2304.10592"}],"event":{"name":"ICDAR '26: International Conference on Multimedia Retrieval","location":"Amsterdam Netherlands","acronym":"ICDAR '26","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 7th International Workshop on Intelligent Cross-Data Analysis  and Retrieval"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3810987.3815535","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T04:55:21Z","timestamp":1784609721000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3810987.3815535"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6,16]]},"references-count":46,"alternative-id":["10.1145\/3810987.3815535","10.1145\/3810987"],"URL":"https:\/\/doi.org\/10.1145\/3810987.3815535","relation":{},"subject":[],"published":{"date-parts":[[2026,6,16]]},"assertion":[{"value":"2026-07-20","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}