{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,22]],"date-time":"2026-05-22T12:10:57Z","timestamp":1779451857046,"version":"3.53.1"},"reference-count":62,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T00:00:00Z","timestamp":1777593600000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100005024","name":"Beijing Postdoctoral Science Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100005024","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["52302397"],"award-info":[{"award-number":["52302397"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["52441202"],"award-info":[{"award-number":["52441202"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100004826","name":"Beijing Natural Science Foundation","doi-asserted-by":"publisher","award":["4262034"],"award-info":[{"award-number":["4262034"]}],"id":[{"id":"10.13039\/501100004826","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002858","name":"China Postdoctoral Science Foundation","doi-asserted-by":"publisher","award":["2025M781560"],"award-info":[{"award-number":["2025M781560"]}],"id":[{"id":"10.13039\/501100002858","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Knowledge-Based Systems"],"published-print":{"date-parts":[[2026,5]]},"DOI":"10.1016\/j.knosys.2026.115852","type":"journal-article","created":{"date-parts":[[2026,3,23]],"date-time":"2026-03-23T16:34:54Z","timestamp":1774283694000},"page":"115852","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Multi-faceted contrastive learning with inter-frame difference for traffic video question answering"],"prefix":"10.1016","volume":"341","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9828-1028","authenticated-orcid":false,"given":"Kan","family":"Guo","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qi","family":"Zuo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0440-438X","authenticated-orcid":false,"given":"Yongli","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6931-2630","authenticated-orcid":false,"given":"Lanping","family":"Qian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Daxin","family":"Tian","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7639-5289","authenticated-orcid":false,"given":"Jiapu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3450-7056","authenticated-orcid":false,"given":"Guixian","family":"Qu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tingzheng","family":"Jia","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9803-0256","authenticated-orcid":false,"given":"Junbin","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4164-6647","authenticated-orcid":false,"given":"Baocai","family":"Yin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.knosys.2026.115852_bib0001","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"4631","article-title":"MovieQA: understanding stories in movies through question-answering","author":"Tapaswi","year":"2016"},{"key":"10.1016\/j.knosys.2026.115852_bib0002","series-title":"Proceedings of the 26th International Joint Conference on Artificial Intelligence","first-page":"2016","article-title":"DeepStory: video story QA by deep embedded memory networks","author":"Kim","year":"2017"},{"key":"10.1016\/j.knosys.2026.115852_bib0003","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"2758","article-title":"TGIF-QA: toward spatio-temporal reasoning in visual question answering","author":"Jang","year":"2017"},{"key":"10.1016\/j.knosys.2026.115852_bib0004","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"11109","article-title":"Reasoning with heterogeneous graph alignment for video question answering","volume":"34","author":"Jiang","year":"2020"},{"key":"10.1016\/j.knosys.2026.115852_bib0005","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"9878","article-title":"SUTD-TRAFFICQA: a question answering benchmark and an efficient network for video reasoning over traffic events","author":"Xu","year":"2021"},{"issue":"11","key":"10.1016\/j.knosys.2026.115852_bib0006","doi-asserted-by":"crossref","first-page":"10538","DOI":"10.1109\/TCSVT.2024.3409453","article-title":"CFMMC-Align: coarse-fine multi-modal contrastive alignment network for traffic event video question answering","volume":"34","author":"Guo","year":"2024","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.knosys.2026.115852_bib0007","series-title":"International Conference on Document Analysis and Recognition","first-page":"137","article-title":"Reading between the lanes: text videoqa on the road","author":"Tom","year":"2023"},{"key":"10.1016\/j.knosys.2026.115852_bib0008","series-title":"Proceedings of the 29th ACM SIGKDD Conference on Knowledge Discovery and Data Mining","first-page":"3262","article-title":"A study of situational reasoning for traffic understanding","author":"Zhang","year":"2023"},{"key":"10.1016\/j.knosys.2026.115852_bib0009","series-title":"Advances in Neural Information Processing Systems (NeurIPS)","article-title":"Two-Stream convolutional networks for action recognition in videos","author":"Simonyan","year":"2014"},{"key":"10.1016\/j.knosys.2026.115852_bib0010","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","article-title":"PWC-Net: cnns For optical flow using pyramid, warping, and cost volume","author":"Sun","year":"2018"},{"key":"10.1016\/j.knosys.2026.115852_bib0011","doi-asserted-by":"crossref","unstructured":"H. Xu, G. Ghosh, P.-Y. Huang, D. Okhonko, A. Aghajanyan, F. Metze, L. Zettlemoyer, C. Feichtenhofer, Videoclip: contrastive pre-training for zero-shot video-text understanding, (2021) arXiv: 2109.14084.","DOI":"10.18653\/v1\/2021.emnlp-main.544"},{"key":"10.1016\/j.knosys.2026.115852_bib0012","doi-asserted-by":"crossref","unstructured":"H. Zhang, X. Li, L. Bing, Video-llama: An instruction-tuned audio-visual language model for video understanding, (2023) arXiv: 2306.02858.","DOI":"10.18653\/v1\/2023.emnlp-demo.49"},{"key":"10.1016\/j.knosys.2026.115852_bib0013","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"4015","article-title":"Segment anything","author":"Kirillov","year":"2023"},{"key":"10.1016\/j.knosys.2026.115852_bib0014","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"15638","article-title":"Flava: a foundational language and vision alignment model","author":"Singh","year":"2022"},{"key":"10.1016\/j.knosys.2026.115852_bib0015","first-page":"9125","article-title":"Detclip: dictionary-enriched visual-concept paralleled pre-training for open-world detection","volume":"35","author":"Yao","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115852_bib0016","series-title":"International Conference on Machine Learning","first-page":"23033","article-title":"Segclip: patch aggregation with learnable centers for open-vocabulary semantic segmentation","author":"Luo","year":"2023"},{"key":"10.1016\/j.knosys.2026.115852_bib0017","series-title":"Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XXX 16","first-page":"121","article-title":"Oscar: object-semantics aligned pre-training for vision-language tasks","author":"Li","year":"2020"},{"key":"10.1016\/j.knosys.2026.115852_bib0018","series-title":"International Conference on Machine Learning","first-page":"4904","article-title":"Scaling up visual and vision-language representation learning with noisy text supervision","author":"Jia","year":"2021"},{"key":"10.1016\/j.knosys.2026.115852_bib0019","first-page":"9694","article-title":"Align before fuse: vision and language representation learning with momentum distillation","volume":"34","author":"Li","year":"2021","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115852_bib0020","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.knosys.2026.115852_bib0021","unstructured":"L. Yao, R. Huang, L. Hou, G. Lu, M. Niu, H. Xu, X. Liang, Z. Li, X. Jiang, C. Xu, Filip: fine-grained interactive language-image pre-training, (2021) arXiv: 2111.07783."},{"key":"10.1016\/j.knosys.2026.115852_bib0022","unstructured":"J. Yu, Z. Wang, V. Vasudevan, L. Yeung, M. Seyedhosseini, Y. Wu, Coca: Contrastive captioners are image-text foundation models, (2022) arXiv: 2205.01917."},{"key":"10.1016\/j.knosys.2026.115852_bib0023","first-page":"25278","article-title":"Laion-5B: an open large-scale dataset for training next generation image-text models","volume":"35","author":"Schuhmann","year":"2022","journal-title":"Adv. Neural Inf. Process. Syst."},{"issue":"8","key":"10.1016\/j.knosys.2026.115852_bib0024","doi-asserted-by":"crossref","first-page":"5625","DOI":"10.1109\/TPAMI.2024.3369699","article-title":"Vision-language models for vision tasks: a survey","volume":"46","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.115852_bib0025","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"11006","article-title":"Clippo: image-and-language understanding from pixels only","author":"Tschannen","year":"2023"},{"key":"10.1016\/j.knosys.2026.115852_bib0026","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"980","article-title":"Unifying vision-language representation space with single-tower transformer","volume":"37","author":"Jang","year":"2023"},{"key":"10.1016\/j.knosys.2026.115852_bib0027","series-title":"IEEE International Conference on Computer Vision (ICCV)","first-page":"7083","article-title":"Temporal shift module for efficient video understanding","author":"Lin","year":"2019"},{"key":"10.1016\/j.knosys.2026.115852_bib0028","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1016\/j.cosrev.2014.04.001","article-title":"Traditional and recent approaches in background modeling for foreground detection: an overview","volume":"11\u201312","author":"Bouwmans","year":"2014","journal-title":"Computer Science Review"},{"key":"10.1016\/j.knosys.2026.115852_bib0029","doi-asserted-by":"crossref","first-page":"4","DOI":"10.1016\/j.cviu.2013.12.005","article-title":"A comprehensive review of background subtraction algorithms evaluated with synthetic and real videos","volume":"122","author":"Sobral","year":"2014","journal-title":"Comput. Vision Image Understanding"},{"key":"10.1016\/j.knosys.2026.115852_bib0030","series-title":"European Conference on Computer Vision (ECCV)","first-page":"20","article-title":"Temporal segment networks: towards good practices for deep action recognition","author":"Wang","year":"2016"},{"key":"10.1016\/j.knosys.2026.115852_bib0031","series-title":"IEEE International Conference on Computer Vision (ICCV)","first-page":"6202","article-title":"SlowFast networks for video recognition","author":"Feichtenhofer","year":"2019"},{"key":"10.1016\/j.knosys.2026.115852_bib0032","series-title":"IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","first-page":"6450","article-title":"A closer look at spatiotemporal convolutions for action recognition","author":"Tran","year":"2018"},{"key":"10.1016\/j.knosys.2026.115852_bib0033","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","article-title":"Leveraging video descriptions to learn video question answering","volume":"31","author":"Zeng","year":"2017"},{"key":"10.1016\/j.knosys.2026.115852_bib0034","series-title":"Proceedings of the 25th ACM International Conference on Multimedia","first-page":"1645","article-title":"Video question answering via gradually refined attention over appearance and motion","author":"Xu","year":"2017"},{"key":"10.1016\/j.knosys.2026.115852_bib0035","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"8658","article-title":"Beyond rnns: positional self-attention with co-attention for video question answering","volume":"33","author":"Li","year":"2019"},{"key":"10.1016\/j.knosys.2026.115852_bib0036","series-title":"Proceedings of the AAAI Conference on Artificial Intelligence","first-page":"11101","article-title":"Divide and conquer: question-guided spatio-temporal contextual attention for video question answering","volume":"34","author":"Jiang","year":"2020"},{"issue":"3","key":"10.1016\/j.knosys.2026.115852_bib0037","doi-asserted-by":"crossref","first-page":"1454","DOI":"10.1109\/TCSVT.2022.3212463","article-title":"ERM: energy-based refined-attention mechanism for video question answering","volume":"33","author":"Zhang","year":"2022","journal-title":"IEEE Trans. Circuits Syst. Video Technol."},{"key":"10.1016\/j.knosys.2026.115852_bib0038","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"1999","article-title":"Heterogeneous memory enhanced multimodal attention model for video question answering","author":"Fan","year":"2019"},{"key":"10.1016\/j.knosys.2026.115852_bib0039","article-title":"Attention is all you need","volume":"30","author":"Vaswani","year":"2017","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115852_bib0040","series-title":"European Conference on Computer Vision","first-page":"39","article-title":"Video graph transformer for video question answering","author":"Xiao","year":"2022"},{"issue":"3","key":"10.1016\/j.knosys.2026.115852_bib0041","doi-asserted-by":"crossref","first-page":"1571","DOI":"10.3390\/vehicles6030074","article-title":"Using multimodal large language models (MLLMs) for automated detection of traffic safety-critical events","volume":"6","author":"Abu Tami","year":"2024","journal-title":"Vehicles"},{"key":"10.1016\/j.knosys.2026.115852_bib0042","series-title":"The Thirteenth International Conference on Learning Representations","article-title":"TAU-106K: a new dataset for comprehensive understanding of traffic accident","author":"Zhou","year":"2025"},{"key":"10.1016\/j.knosys.2026.115852_bib0043","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"9777","article-title":"Next-QA: next phase of question-answering to explaining temporal actions","author":"Xiao","year":"2021"},{"key":"10.1016\/j.knosys.2026.115852_bib0044","article-title":"Exploring models and data for image question answering","volume":"28","author":"Ren","year":"2015","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"10.1016\/j.knosys.2026.115852_bib0045","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"6299","article-title":"Quo vadis, action recognition? a new model and the kinetics dataset","author":"Carreira","year":"2017"},{"key":"10.1016\/j.knosys.2026.115852_bib0046","series-title":"Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing","article-title":"TVQA: Localized, compositional video question answering","author":"Lei","year":"2018"},{"key":"10.1016\/j.knosys.2026.115852_bib0047","series-title":"Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision","first-page":"1556","article-title":"BERT representations for video question answering","author":"Yang","year":"2020"},{"key":"10.1016\/j.knosys.2026.115852_bib0048","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"9972","article-title":"Hierarchical conditional relation networks for video question answering","author":"Le","year":"2020"},{"key":"10.1016\/j.knosys.2026.115852_bib0049","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"1708","article-title":"Video question answering using language-guided deep compressed-domain video feature","author":"Kim","year":"2021"},{"key":"10.1016\/j.knosys.2026.115852_bib0050","doi-asserted-by":"crossref","first-page":"3369","DOI":"10.1109\/TMM.2021.3097171","article-title":"DualVGR: a dual-visual graph reasoning unit for video question answering","volume":"24","author":"Wang","year":"2021","journal-title":"IEEE Trans. Multimedia"},{"key":"10.1016\/j.knosys.2026.115852_bib0051","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"13945","article-title":"Tem-adapter: adapting image-text pretraining for video question answer","author":"Chen","year":"2023"},{"key":"10.1016\/j.knosys.2026.115852_bib0052","unstructured":"E.J. Hu, Y. Shen, P. Wallis, Z. Allen-Zhu, Y. Li, S. Wang, L. Wang, W. Chen, LoRA: Low-rank adaptation of large language models, (2021) arXiv: 2106.09685."},{"issue":"2","key":"10.1016\/j.knosys.2026.115852_bib0053","doi-asserted-by":"crossref","first-page":"581","DOI":"10.1007\/s11263-023-01891-x","article-title":"Clip-adapter: better vision-language models with feature adapters","volume":"132","author":"Gao","year":"2023","journal-title":"Int. J. Comput. Vis."},{"key":"10.1016\/j.knosys.2026.115852_bib0054","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"2917","article-title":"Revisiting the \u201cvideo\u201d in video-language understanding","author":"Buch","year":"2022"},{"issue":"10","key":"10.1016\/j.knosys.2026.115852_bib0055","doi-asserted-by":"crossref","first-page":"11624","DOI":"10.1109\/TPAMI.2023.3284038","article-title":"Cross-modal causal relational reasoning for event-level visual question answering","volume":"45","author":"Liu","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.knosys.2026.115852_bib0056","doi-asserted-by":"crossref","first-page":"1087","DOI":"10.1007\/s10489-025-06980-7","article-title":"MDIF: A multimodal dynamic inference framework for traffic video question answering","volume":"55","author":"Guo","year":"2025","journal-title":"Appl. Intell."},{"key":"10.1016\/j.knosys.2026.115852_bib0057","series-title":"202IEEE International Conference on Multimedia and Expo (ICME)","first-page":"1","article-title":"QTG-VQA: question-type-guided architectural for VideoQA systems","author":"He","year":"2025"},{"key":"10.1016\/j.knosys.2026.115852_bib0058","series-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","first-page":"6576","article-title":"Motion-appearance co-memory networks for video question answering","author":"Gao","year":"2018"},{"key":"10.1016\/j.knosys.2026.115852_bib0059","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"2928","article-title":"Invariant grounding for video question answering","author":"Li","year":"2022"},{"key":"10.1016\/j.knosys.2026.115852_bib0060","series-title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","first-page":"12585","article-title":"Video-Chatgpt: towards detailed video understanding via large vision and language models","author":"Maaz","year":"2024"},{"key":"10.1016\/j.knosys.2026.115852_bib0061","series-title":"Proceedings of the IEEE\/CVF International Conference on Computer Vision","first-page":"17675","article-title":"Mc-bench: a benchmark for multi-context visual grounding in the era of mllms","author":"Xu","year":"2025"},{"key":"10.1016\/j.knosys.2026.115852_bib0062","series-title":"Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition","first-page":"15565","article-title":"Visual abductive reasoning","author":"Liang","year":"2022"}],"container-title":["Knowledge-Based Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126005782?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0950705126005782?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,22]],"date-time":"2026-05-22T11:45:51Z","timestamp":1779450351000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0950705126005782"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,5]]},"references-count":62,"alternative-id":["S0950705126005782"],"URL":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115852","relation":{},"ISSN":["0950-7051"],"issn-type":[{"value":"0950-7051","type":"print"}],"subject":[],"published":{"date-parts":[[2026,5]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Multi-faceted contrastive learning with inter-frame difference for traffic video question answering","name":"articletitle","label":"Article Title"},{"value":"Knowledge-Based Systems","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.knosys.2026.115852","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"115852"}}