{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T20:25:42Z","timestamp":1783628742103,"version":"3.55.0"},"reference-count":38,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"NSFC","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Pattern Recognition"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.patcog.2026.114369","type":"journal-article","created":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T06:40:23Z","timestamp":1783147223000},"page":"114369","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PD","title":["Event-aware temporal modeling and semantic alignment for long-form video question answering"],"prefix":"10.1016","volume":"180","author":[{"given":"Xichun","family":"Sheng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Haibo","family":"Gong","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Lian","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1943-8219","authenticated-orcid":false,"given":"Liang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jiehua","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chenggang","family":"Yan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tao","family":"Tan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.patcog.2026.114369_b1","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"11109","article-title":"Reasoning with heterogeneous graph alignment for video question answering","volume":"vol. 34","author":"Jiang","year":"2020"},{"key":"10.1016\/j.patcog.2026.114369_b2","doi-asserted-by":"crossref","unstructured":"J. Li, L. Niu, L. Zhang, From representation to reasoning: Towards both evidence and commonsense reasoning for video question-answering, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2022, pp. 21273\u201321282.","DOI":"10.1109\/CVPR52688.2022.02059"},{"key":"10.1016\/j.patcog.2026.114369_b3","doi-asserted-by":"crossref","first-page":"3300","DOI":"10.1109\/TMM.2026.3651115","article-title":"Admitting ignorance helps the video question answering models to answer","volume":"28","author":"Li","year":"2026","journal-title":"IEEE Trans. Multimed."},{"key":"10.1016\/j.patcog.2026.114369_b4","doi-asserted-by":"crossref","unstructured":"G. Chen, X. Liu, G. Wang, K. Zhang, P.H. Torr, X.-P. Zhang, Y. Tang, Tem-adapter: Adapting image-text pretraining for video question answer, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 13945\u201313955.","DOI":"10.1109\/ICCV51070.2023.01282"},{"key":"10.1016\/j.patcog.2026.114369_b5","doi-asserted-by":"crossref","unstructured":"T.T. Nguyen, Z. Hu, X. Wu, C.-D.T. Nguyen, S.-K. Ng, A.T. Luu, Encoding and Controlling Global Semantics for Long-form Video Question Answering, in: Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, 2024, pp. 7049\u20137066.","DOI":"10.18653\/v1\/2024.emnlp-main.400"},{"key":"10.1016\/j.patcog.2026.114369_b6","doi-asserted-by":"crossref","unstructured":"J. Xiao, A. Yao, Y. Li, T.-S. Chua, Can i trust your answer? visually grounded video question answering, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 13204\u201313214.","DOI":"10.1109\/CVPR52733.2024.01254"},{"key":"10.1016\/j.patcog.2026.114369_b7","series-title":"European Conference on Computer Vision","first-page":"92","article-title":"Timecraft: Navigate weakly-supervised temporal grounded video question answering via bi-directional reasoning","author":"Liu","year":"2024"},{"key":"10.1016\/j.patcog.2026.114369_b8","doi-asserted-by":"crossref","unstructured":"H. Wang, C. Lai, Y. Sun, W. Ge, Weakly Supervised Gaussian Contrastive Grounding with Large Multimodal Models for Video Question Answering, in: Proceedings of the 32nd ACM International Conference on Multimedia, 2024, pp. 5289\u20135298.","DOI":"10.1145\/3664647.3680826"},{"key":"10.1016\/j.patcog.2026.114369_b9","doi-asserted-by":"crossref","unstructured":"D. Gao, L. Zhou, L. Ji, L. Zhu, Y. Yang, M.Z. Shou, Mist: Multi-modal iterative spatial-temporal transformer for long-form video question answering, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 14773\u201314783.","DOI":"10.1109\/CVPR52729.2023.01419"},{"key":"10.1016\/j.patcog.2026.114369_b10","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"4542","article-title":"Nuscenes-qa: A multi-modal visual question answering benchmark for autonomous driving scenario","volume":"vol. 38","author":"Qian","year":"2024"},{"key":"10.1016\/j.patcog.2026.114369_b11","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2026.113421","article-title":"Refined generation-based framework for consistent and reliable visual question answering","volume":"178","author":"Xu","year":"2026","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114369_b12","doi-asserted-by":"crossref","unstructured":"D. Xue, S. Qian, C. Xu, Variational causal inference network for explanatory visual question answering, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 2515\u20132525.","DOI":"10.1109\/ICCV51070.2023.00238"},{"key":"10.1016\/j.patcog.2026.114369_b13","doi-asserted-by":"crossref","unstructured":"Y. Jang, Y. Song, Y. Yu, Y. Kim, G. Kim, Tgif-qa: Toward spatio-temporal reasoning in visual question answering, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2017, pp. 2758\u20132766.","DOI":"10.1109\/CVPR.2017.149"},{"key":"10.1016\/j.patcog.2026.114369_b14","doi-asserted-by":"crossref","unstructured":"D. Xu, Z. Zhao, J. Xiao, F. Wu, H. Zhang, X. He, Y. Zhuang, Video question answering via gradually refined attention over appearance and motion, in: Proceedings of the 25th ACM International Conference on Multimedia, 2017, pp. 1645\u20131653.","DOI":"10.1145\/3123266.3123427"},{"key":"10.1016\/j.patcog.2026.114369_b15","doi-asserted-by":"crossref","unstructured":"J. Gao, R. Ge, K. Chen, R. Nevatia, Motion-appearance co-memory networks for video question answering, in: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, 2018, pp. 6576\u20136585.","DOI":"10.1109\/CVPR.2018.00688"},{"issue":"11","key":"10.1016\/j.patcog.2026.114369_b16","doi-asserted-by":"crossref","first-page":"3027","DOI":"10.1007\/s11263-021-01514-3","article-title":"Hierarchical conditional relation networks for multimodal video question answering","volume":"129","author":"Le","year":"2021","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.patcog.2026.114369_b17","doi-asserted-by":"crossref","unstructured":"L.H. Dang, T.M. Le, V. Le, T. Tran, Hierarchical Object-oriented Spatio-Temporal Reasoning for Video Question Answering, in: Proceedings of the Thirtieth International Joint Conference on Artificial Intelligence, 2021, pp. 636\u2013642.","DOI":"10.24963\/ijcai.2021\/88"},{"key":"10.1016\/j.patcog.2026.114369_b18","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"8","key":"10.1016\/j.patcog.2026.114369_b19","first-page":"4065","article-title":"Dual encoding for video retrieval by text","volume":"44","author":"Dong","year":"2021","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.114369_b20","doi-asserted-by":"crossref","first-page":"296","DOI":"10.1016\/j.patrec.2025.06.014","article-title":"Dual-branch scale disentanglement for text\u2013video retrieval","volume":"196","author":"Koo","year":"2025","journal-title":"Pattern Recognit. Lett."},{"key":"10.1016\/j.patcog.2026.114369_b21","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2025.111770","article-title":"VLPA-CLIP: Video language prompting and adapting CLIP for efficient video action recognition","volume":"168","author":"Wang","year":"2025","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114369_b22","unstructured":"J. Yang, Z. YU, Nixiuming, H. Jia, H. Li, Kronecker Mask and Interpretive Prompts are Language-Action Video Learners, in: International Conference on Learning Representations, 2025, pp. 38952\u201338980."},{"key":"10.1016\/j.patcog.2026.114369_b23","doi-asserted-by":"crossref","DOI":"10.1109\/TPAMI.2023.3292266","article-title":"Contrastive video question answering via video graph transformer","author":"Xiao","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.patcog.2026.114369_b24","doi-asserted-by":"crossref","unstructured":"J. Wang, Y. Ge, R. Yan, Y. Ge, K.Q. Lin, S. Tsutsui, X. Lin, G. Cai, J. Wu, Y. Shan, et al., All in one: Exploring unified video-language pre-training, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2023, pp. 6598\u20136608.","DOI":"10.1109\/CVPR52729.2023.00638"},{"key":"10.1016\/j.patcog.2026.114369_b25","doi-asserted-by":"crossref","unstructured":"H. Li, P. Jin, Z. Cheng, S. Zhang, K. Chen, Z. Wang, C. Liu, J. Chen, TG-VQA: Ternary Game of Video Question Answering, in: Proceedings of the Thirty-Second International Joint Conference on Artificial Intelligence, 2023, pp. 1044\u20131052.","DOI":"10.24963\/ijcai.2023\/116"},{"key":"10.1016\/j.patcog.2026.114369_b26","doi-asserted-by":"crossref","unstructured":"D. Ko, J. Lee, W.-Y. Kang, B. Roh, H. Kim, Large Language Models are Temporal and Causal Reasoners for Video Question Answering, in: Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing, 2023, pp. 4300\u20134316.","DOI":"10.18653\/v1\/2023.emnlp-main.261"},{"key":"10.1016\/j.patcog.2026.114369_b27","series-title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","author":"Chen","year":"2024"},{"key":"10.1016\/j.patcog.2026.114369_b28","series-title":"Qwen2.5-VL technical report","author":"Bai","year":"2025"},{"key":"10.1016\/j.patcog.2026.114369_b29","series-title":"VideoLLaMA 3: Frontier multimodal foundation models for image and video understanding","author":"Zhang","year":"2025"},{"key":"10.1016\/j.patcog.2026.114369_b30","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2026.114009","article-title":"SFA: Scan, focus, and amplify toward guidance-aware answering for video TextVQA","author":"He","year":"2026","journal-title":"Pattern Recognit."},{"key":"10.1016\/j.patcog.2026.114369_b31","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2020.107248","article-title":"Long video question answering: A matching-guided attention model","volume":"102","author":"Wang","year":"2020","journal-title":"Pattern Recognit."},{"issue":"3","key":"10.1016\/j.patcog.2026.114369_b32","doi-asserted-by":"crossref","first-page":"931","DOI":"10.1109\/TCSVT.2020.2995959","article-title":"Long-term video question answering via multimodal hierarchical memory attentive networks","volume":"31","author":"Yu","year":"2020","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.patcog.2026.114369_b33","doi-asserted-by":"crossref","unstructured":"B. Zou, C. Yang, Y. Qiao, C. Quan, Y. Zhao, Language-aware Visual Semantic Distillation for Video Question Answering, in: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2024, pp. 27113\u201327123.","DOI":"10.1109\/CVPR52733.2024.02560"},{"key":"10.1016\/j.patcog.2026.114369_b34","article-title":"Multi-granularity contrastive cross-modal collaborative generation for end-to-end long-term video question answering","author":"Yu","year":"2024","journal-title":"IEEE Trans. Image Process."},{"key":"10.1016\/j.patcog.2026.114369_b35","doi-asserted-by":"crossref","unstructured":"Y. Li, J. Xiao, C. Feng, X. Wang, T.-S. Chua, Discovering spatio-temporal rationales for video question answering, in: Proceedings of the IEEE\/CVF International Conference on Computer Vision, 2023, pp. 13869\u201313878.","DOI":"10.1109\/ICCV51070.2023.01275"},{"key":"10.1016\/j.patcog.2026.114369_b36","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.patcog.2026.114369_b37","doi-asserted-by":"crossref","unstructured":"T. Yuan, W. Zhang, D. Chen, J. Wang, CG-Bench: Can Language Models Assist Call Graph Construction in the Real World?, in: Proceedings of the 1st ACM SIGPLAN International Workshop on Language Models and Programming Languages, 2025, pp. 12\u201320.","DOI":"10.1145\/3759425.3763379"},{"key":"10.1016\/j.patcog.2026.114369_b38","doi-asserted-by":"crossref","unstructured":"J. Devlin, M.-W. Chang, K. Lee, K. Toutanova, BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding, in: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, 2019, pp. 4171\u20134186.","DOI":"10.18653\/v1\/N19-1423"}],"container-title":["Pattern Recognition"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326013348?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0031320326013348?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T19:59:41Z","timestamp":1783627181000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0031320326013348"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":38,"alternative-id":["S0031320326013348"],"URL":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114369","relation":{},"ISSN":["0031-3203"],"issn-type":[{"value":"0031-3203","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Event-aware temporal modeling and semantic alignment for long-form video question answering","name":"articletitle","label":"Article Title"},{"value":"Pattern Recognition","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.patcog.2026.114369","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"114369"}}