{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T18:15:23Z","timestamp":1783188923699,"version":"3.54.6"},"reference-count":61,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,12,1]],"date-time":"2026-12-01T00:00:00Z","timestamp":1796083200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/100007219","name":"Shanghai Municipal Natural Science Foundation","doi-asserted-by":"publisher","award":["25ZR1402184"],"award-info":[{"award-number":["25ZR1402184"]}],"id":[{"id":"10.13039\/100007219","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100007219","name":"Shanghai Municipal Natural Science Foundation","doi-asserted-by":"publisher","award":["25ZR1401156"],"award-info":[{"award-number":["25ZR1401156"]}],"id":[{"id":"10.13039\/100007219","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["52331012"],"award-info":[{"award-number":["52331012"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["52501420"],"award-info":[{"award-number":["52501420"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Expert Systems with Applications"],"published-print":{"date-parts":[[2026,12]]},"DOI":"10.1016\/j.eswa.2026.133153","type":"journal-article","created":{"date-parts":[[2026,6,8]],"date-time":"2026-06-08T16:37:13Z","timestamp":1780936633000},"page":"133153","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PA","title":["Geometry-guided explicit dual-stream alignment network for visual question answering"],"prefix":"10.1016","volume":"331","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0521-0184","authenticated-orcid":false,"given":"Chongqing","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dezhi","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3150-3407","authenticated-orcid":false,"given":"Huafeng","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kuan-Ching","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.eswa.2026.133153_sbref0001","series-title":"Gpt-4 technical report","author":"Achiam","year":"2023"},{"key":"10.1016\/j.eswa.2026.133153_bib0002","series-title":"2018 IEEE conference on computer vision and pattern recognition, CVPR 2018, Salt Lake City, UT, USA, June 18\u201322, 2018","first-page":"6077","article-title":"Bottom-up and top-down attention for image captioning and visual question answering","author":"Anderson","year":"2018"},{"key":"10.1016\/j.eswa.2026.133153_bib0003","series-title":"AAAI-25, sponsored by the association for the advancement of artificial intelligence, February 25\u2013March 4, 2025, Philadelphia, PA, USA","first-page":"23442","article-title":"Mitigating hallucinations in large vision-language models by adaptively constraining information flow","author":"Bai","year":"2025"},{"key":"10.1016\/j.eswa.2026.133153_bib0004","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2023.126991","article-title":"Confidence-based interactable neural-symbolic visual question answering","volume":"564","author":"Bao","year":"2024","journal-title":"Neurocomputing"},{"key":"10.1016\/j.eswa.2026.133153_bib0005","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2022.108980","article-title":"CAAN: Context-aware attention network for visual question answering","volume":"132","author":"Chen","year":"2022","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.eswa.2026.133153_bib0006","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2023.110084","article-title":"MPCCT: Multimodal vision-language learning paradigm with context-based compact transformer","volume":"147","author":"Chen","year":"2024","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.eswa.2026.133153_bib0007","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2024.125817","article-title":"Towards bias-aware visual question answering: Rectifying and mitigating comprehension biases","volume":"264","author":"Chen","year":"2025","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.eswa.2026.133153_bib0008","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2023.110706","article-title":"CLVIN: Complete language-vision interaction network for visual question answering","volume":"275","author":"Chen","year":"2023","journal-title":"Knowledge-Based Systems"},{"key":"10.1016\/j.eswa.2026.133153_bib0009","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2024.111047","article-title":"GEXMERT: Geometrically enhanced cross-modality encoder representations from transformers inspired by higher-order visual percepts","volume":"158","author":"Chen","year":"2025","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.eswa.2026.133153_bib0010","series-title":"Computer vision - ECCV 2020 - 16th European conference, Glasgow, UK, August 23\u201328, 2020, proceedings, part XXX","first-page":"104","article-title":"UNITER: Universal image-text representation learning","volume":"Vol. 12375","author":"Chen","year":"2020"},{"key":"10.1016\/j.eswa.2026.133153_bib0011","series-title":"9th international conference on learning representations, ICLR 2021, virtual event, Austria, May 3\u20137, 2021","article-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2021"},{"key":"10.1016\/j.eswa.2026.133153_bib0012","doi-asserted-by":"crossref","DOI":"10.1016\/j.epsr.2025.112521","article-title":"Bi-level integration of DSO with prosumers and parking lots under risk-based upper market involvement","volume":"253","author":"Fakour","year":"2026","journal-title":"Electric Power Systems Research"},{"key":"10.1016\/j.eswa.2026.133153_bib0013","series-title":"British machine vision conference 2018, BMVC 2018, newcastle, UK, September 3\u20136, 2018","first-page":"250","article-title":"Reciprocal attention fusion for visual question answering","author":"Farazi","year":"2018"},{"key":"10.1016\/j.eswa.2026.133153_bib0014","series-title":"The thirteenth international conference on learning representations, ICLR 2025, Singapore, April 24\u201328, 2025","article-title":"Visual description grounding reduces hallucinations and boosts reasoning in LVLMs","author":"Ghosh","year":"2025"},{"issue":"4","key":"10.1016\/j.eswa.2026.133153_bib0015","doi-asserted-by":"crossref","first-page":"398","DOI":"10.1007\/s11263-018-1116-0","article-title":"Making the V in VQA matter: Elevating the role of image understanding in visual question answering","volume":"127","author":"Goyal","year":"2019","journal-title":"International Journal of Computer Vision"},{"key":"10.1016\/j.eswa.2026.133153_bib0016","unstructured":"Grattafiori, A., Dubey, A., Jauhri, A., Pandey, A., Kadian, A., Al-Dahle, A., Letman, A., Mathur, A., Schelten, A., Vaughan, A. et al. (2024). The LLAMA 3 herd of models. 10.48550\/ARXIV.2407.21783."},{"issue":"2","key":"10.1016\/j.eswa.2026.133153_bib0017","doi-asserted-by":"crossref","first-page":"1023","DOI":"10.1109\/TNNLS.2021.3104937","article-title":"Bilinear graph networks for visual question answering","volume":"34","author":"Guo","year":"2023","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"10.1016\/j.eswa.2026.133153_bib0018","series-title":"IEEE conference on computer vision and pattern recognition, CVPR 2019, long beach, CA, USA, June 16\u201320, 2019","first-page":"6700","article-title":"GQA: A new dataset for real-world visual reasoning and compositional question answering","author":"Hudson","year":"2019"},{"key":"10.1016\/j.eswa.2026.133153_bib0019","series-title":"Advances in neural information processing systems 32: Annual conference on neural information processing systems 2019, neurIPS 2019, December 8\u201314, 2019, Vancouver, BC, Canada","first-page":"5901","article-title":"Learning by abstraction: The neural state machine","author":"Hudson","year":"2019"},{"key":"10.1016\/j.eswa.2026.133153_bib0020","series-title":"2020 IEEE\/CVF conference on computer vision and pattern recognition, CVPR 2020, Seattle, WA, USA, June 13\u201319, 2020","first-page":"10264","article-title":"In defense of grid features for visual question answering","author":"Jiang","year":"2020"},{"key":"10.1016\/j.eswa.2026.133153_bib0021","series-title":"IEEE\/CVF conference on computer vision and pattern recognition, CVPR 2022, New Orleans, LA, USA, June 18\u201324, 2022","first-page":"5089","article-title":"Maintaining reasoning consistency in compositional visual question answering","author":"Jing","year":"2022"},{"key":"10.1016\/j.eswa.2026.133153_bib0022","series-title":"Advances in neural information processing systems 38: Annual conference on neural information processing systems 2024, neurIPS 2024, Vancouver, BC, Canada, December 10, - 15, 2024","article-title":"Fineclip: Self-distilled region-based CLIP for better fine-grained understanding","author":"Jing","year":"2024"},{"key":"10.1016\/j.eswa.2026.133153_bib0023","series-title":"2021 IEEE\/CVF international conference on computer vision, ICCV 2021, Montreal, QC, Canada, October 10\u201317, 2021","first-page":"1760","article-title":"MDETR - modulated detection for end-to-end multi-modal understanding","author":"Kamath","year":"2021"},{"key":"10.1016\/j.eswa.2026.133153_bib0024","series-title":"Computer vision - ECCV 2020 - 16th European conference, glasgow, UK, August 23\u201328, 2020, proceedings","article-title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","author":"Li","year":"2020"},{"key":"10.1016\/j.eswa.2026.133153_bib0025","series-title":"IEEE\/CVF conference on computer vision and pattern recognition, CVPR 2024, Seattle, WA, USA, June 16\u201322, 2024","first-page":"26753","article-title":"Monkey: Image resolution and text label are important things for large multi-modal models","author":"Li","year":"2024"},{"key":"10.1016\/j.eswa.2026.133153_bib0026","series-title":"Annual conference on neural information processing systems 2023, neurIPS 2023, new orleans, LA, USA, December 10 - 16, 2023","article-title":"Visual instruction tuning","author":"Liu","year":"2023"},{"issue":"7","key":"10.1016\/j.eswa.2026.133153_bib0027","doi-asserted-by":"crossref","first-page":"3131","DOI":"10.1109\/TCYB.2025.3565754","article-title":"A weight-aware-based multisource unsupervised domain adaptation method for human motion intention recognition","volume":"55","author":"Liu","year":"2025","journal-title":"IEEE Transactions on Cybernetics"},{"key":"10.1016\/j.eswa.2026.133153_bib0028","first-page":"2286","article-title":"Dual-level collaborative transformer for image captioning","author":"Luo","year":"2021"},{"issue":"10","key":"10.1016\/j.eswa.2026.133153_bib0029","doi-asserted-by":"crossref","first-page":"420","DOI":"10.3390\/systems12100420","article-title":"Dynamic multi-granularity translation system: DAG-structured multi-granularity representation and self-attention","volume":"12","author":"Lv","year":"2024","journal-title":"Systems"},{"issue":"3","key":"10.1016\/j.eswa.2026.133153_bib0030","doi-asserted-by":"crossref","first-page":"1380","DOI":"10.1109\/TNNLS.2021.3105284","article-title":"Multitask learning for visual question answering","volume":"34","author":"Ma","year":"2023","journal-title":"IEEE Transactions on Neural Networks and Learning Systems"},{"key":"10.1016\/j.eswa.2026.133153_bib0031","doi-asserted-by":"crossref","first-page":"6997","DOI":"10.1109\/TMM.2022.3216770","article-title":"Positional attention guided transformer-like architecture for visual question answering","volume":"25","author":"Mao","year":"2023","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.eswa.2026.133153_bib0032","series-title":"29th international computer conference, computer society of Iran, CSICC 2025, Iran, February 5-6, 2025","first-page":"1","article-title":"Vitacap: A vision transformer-based framework for image captioning","author":"Nia","year":"2025"},{"key":"10.1016\/j.eswa.2026.133153_bib0033","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.131833","article-title":"Hierarchical encoder-decoder for image captioning","volume":"660","author":"Pan","year":"2026","journal-title":"Neurocomputing"},{"key":"10.1016\/j.eswa.2026.133153_bib0034","series-title":"Proceedings of the 38th international conference on machine learning, ICML 2021, 18\u201324 July 2021, virtual event","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume":"Vol. 139","author":"Radford","year":"2021"},{"key":"10.1016\/j.eswa.2026.133153_bib0035","doi-asserted-by":"crossref","DOI":"10.1016\/j.neunet.2025.107871","article-title":"A triple-branch hybrid dynamic-static alignment strategy for vision-language tasks","volume":"191","author":"Shen","year":"2025","journal-title":"Neural Networks"},{"key":"10.1016\/j.eswa.2026.133153_bib0036","article-title":"Multimodal context-aware consistency alignment for vision-language tasks","volume":"295","author":"Shen","year":"2025","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.eswa.2026.133153_bib0037","series-title":"Proceedings of the 2019 conference on empirical methods in natural language processing and the 9th international joint conference on natural language processing, EMNLP-IJCNLP 2019, Hong Kong, China, November 3\u20137, 2019","first-page":"5099","article-title":"LXMERT: Learning cross-modality encoder representations from transformers","author":"Tan","year":"2019"},{"key":"10.1016\/j.eswa.2026.133153_bib0038","unstructured":"G. Team, Anil, R., Borgeaud, S., Alayrac, J.-B., Yu, J., Soricut, R., Schalkwyk, J., Dai, A. M., Hauth, A., Millican, K. et al. (2023). Gemini: A family of highly capable multimodal models. 10.48550\/ARXIV.2312.11805."},{"key":"10.1016\/j.eswa.2026.133153_bib0039","doi-asserted-by":"crossref","DOI":"10.1016\/j.dsp.2022.103707","article-title":"Local-global visual interaction attention for image captioning","volume":"130","author":"Wang","year":"2022","journal-title":"Digital Signal Processing"},{"issue":"3","key":"10.1016\/j.eswa.2026.133153_bib0040","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2023.103288","article-title":"Learning double-level relationship networks for image captioning","volume":"60","author":"Wang","year":"2023","journal-title":"Information Processing & Management"},{"key":"10.1016\/j.eswa.2026.133153_bib0041","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2025.129536","article-title":"VCF: An effective vision-centric framework for visual question answering","volume":"625","author":"Wang","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.eswa.2026.133153_bib0042","unstructured":"Wang, P., Bai, S., Tan, S., Wang, S., Fan, Z., Bai, J., Chen, K., Liu, X., Wang, J., Ge, W., Fan, Y., Dang, K., Du, M., Ren, X., Men, R., Liu, D., Zhou, C., Zhou, J., & Lin, J. (2024). Qwen2-VL: Enhancing vision-language model\u2019s perception of the world at any resolution. 10.48550\/ARXIV.2409.12191."},{"issue":"4","key":"10.1016\/j.eswa.2026.133153_bib0043","doi-asserted-by":"crossref","DOI":"10.1002\/aisy.202200131","article-title":"TASTA: Text-assisted spatial and temporal attention network for video question answering","volume":"5","author":"Wang","year":"2023","journal-title":"Advanced Intelligent Systems"},{"key":"10.1016\/j.eswa.2026.133153_bib0044","doi-asserted-by":"crossref","DOI":"10.1016\/j.imavis.2025.105513","article-title":"Fusing grid and adaptive region features for image captioning","volume":"157","author":"Wei","year":"2025","journal-title":"Image and Vision Computing"},{"key":"10.1016\/j.eswa.2026.133153_bib0045","series-title":"MM \u201922: The 30th ACM international conference on multimedia, Lisboa, Portugal, October 10, - 14, 2022","first-page":"5055","article-title":"Improving fusion of region features and grid features via two-step interaction for image-text retrieval","author":"Wu","year":"2022"},{"key":"10.1016\/j.eswa.2026.133153_bib0046","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2026.113188","article-title":"Disco: Disentangled identity-action extraction and spatiotemporal context modeling for LLM-based identity-aware basketball video captioning","volume":"176","author":"Xi","year":"2026","journal-title":"Pattern Recognition"},{"key":"10.1016\/j.eswa.2026.133153_bib0047","series-title":"Image and graphics - 13th international conference, ICIG 2025, Xuzhou, China, October 31, - November 2, 2025, proceedings, Part I","first-page":"3","article-title":"SRG-Net: Semantic relation-guided network for commonsense video captioning","author":"Xi","year":"2025"},{"key":"10.1016\/j.eswa.2026.133153_bib0048","doi-asserted-by":"crossref","DOI":"10.1016\/j.neucom.2024.129177","article-title":"A simple yet effective knowledge guided method for entity-aware video captioning on a basketball benchmark","volume":"619","author":"Xi","year":"2025","journal-title":"Neurocomputing"},{"key":"10.1016\/j.eswa.2026.133153_bib0049","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2025.126906","article-title":"EIKA: Explicit & implicit knowledge-augmented network for entity-aware sports video captioning","volume":"274","author":"Xi","year":"2025","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.eswa.2026.133153_bib0050","series-title":"IEEE\/CVF international conference on computer vision, ICCV 2025, Honolulu, HI, USA, October 19\u201325, 2025","first-page":"24330","article-title":"Player-centric multimodal prompt generation for large language model based identity-aware basketball video captioning","author":"Xi","year":"2025"},{"key":"10.1016\/j.eswa.2026.133153_bib0051","series-title":"International conference on intelligent computing","first-page":"3","article-title":"EMAFN: Enhanced multimodal alignment and fusion for visual question answering networks","author":"Xu","year":"2025"},{"issue":"1","key":"10.1016\/j.eswa.2026.133153_bib0052","doi-asserted-by":"crossref","first-page":"549","DOI":"10.1007\/s00371-024-03346-x","article-title":"Modular dual-stream visual fusion network for visual question answering","volume":"41","author":"Xue","year":"2025","journal-title":"The Visual Computer"},{"issue":"10","key":"10.1016\/j.eswa.2026.133153_bib0053","doi-asserted-by":"crossref","first-page":"771","DOI":"10.32604\/cmes.2024.052622","article-title":"DPAL-BERT: A faster and lighter question answering model","volume":"141","author":"Yin","year":"2024","journal-title":"Computer Modeling in Engineering & Sciences"},{"key":"10.1016\/j.eswa.2026.133153_bib0054","series-title":"ECAI 2023 - 26th European conference on artificial intelligence, September 30, - October 4, 2023, Krak\u00f3w, Poland - including 12th conference on prestigious applications of intelligent systems (PAIS 2023)","first-page":"2930","article-title":"Boosting visual question answering through geometric perception and region features","volume":"Vol. 372","author":"Yu","year":"2023"},{"key":"10.1016\/j.eswa.2026.133153_bib0055","series-title":"IEEE conference on computer vision and pattern recognition, CVPR 2019, Long Beach, CA, USA, June 16\u201320, 2019","first-page":"6281","article-title":"Deep modular co-attention networks for visual question answering","author":"Yu","year":"2019"},{"issue":"6","key":"10.1016\/j.eswa.2026.133153_bib0056","doi-asserted-by":"crossref","first-page":"544","DOI":"10.1007\/s10489-025-06325-4","article-title":"Multi-scale dual-stream visual feature extraction and graph reasoning for visual question answering","volume":"55","author":"Yusuf","year":"2025","journal-title":"Applied Intelligence"},{"key":"10.1016\/j.eswa.2026.133153_bib0057","series-title":"IEEE conference on computer vision and pattern recognition, CVPR 2021, virtual, June 19\u201325, 2021","first-page":"5579","article-title":"VinVL: Revisiting visual representations in vision-language models","author":"Zhang","year":"2021"},{"key":"10.1016\/j.eswa.2026.133153_bib0058","first-page":"1","article-title":"S2DBFT: Spectral-spatial dual-branch fusion transformer for hyperspectral image classification","volume":"63","author":"Zhang","year":"2025","journal-title":"IEEE Transactions on Geoscience and Remote Sensing"},{"key":"10.1016\/j.eswa.2026.133153_bib0059","series-title":"IEEE\/CVF conference on computer vision and pattern recognition, CVPR 2022, New Orleans, LA, USA, June 18\u201324, 2022","first-page":"16772","article-title":"RegionCLIP: Region-based language-image pretraining","author":"Zhong","year":"2022"},{"key":"10.1016\/j.eswa.2026.133153_bib0060","doi-asserted-by":"crossref","DOI":"10.1016\/j.knosys.2025.113127","article-title":"From multi-scale grids to dynamic regions: Dual-relation enhanced transformer for image captioning","volume":"311","author":"Zhou","year":"2025","journal-title":"Knowledge-Based Systems"},{"key":"10.1016\/j.eswa.2026.133153_bib0061","series-title":"2021 IEEE\/CVF international conference on computer vision, ICCV 2021, Montreal, QC, Canada, October 10\u201317, 2021","first-page":"2054","article-title":"TRAR: Routing the attention spans in transformer for visual question answering","author":"Zhou","year":"2021"}],"container-title":["Expert Systems with Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426020634?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0957417426020634?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T17:20:33Z","timestamp":1783185633000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0957417426020634"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,12]]},"references-count":61,"alternative-id":["S0957417426020634"],"URL":"https:\/\/doi.org\/10.1016\/j.eswa.2026.133153","relation":{},"ISSN":["0957-4174"],"issn-type":[{"value":"0957-4174","type":"print"}],"subject":[],"published":{"date-parts":[[2026,12]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Geometry-guided explicit dual-stream alignment network for visual question answering","name":"articletitle","label":"Article Title"},{"value":"Expert Systems with Applications","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.eswa.2026.133153","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"133153"}}