{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,28]],"date-time":"2026-07-28T20:10:03Z","timestamp":1785269403017,"version":"3.55.0"},"reference-count":78,"publisher":"Springer Science and Business Media LLC","issue":"11","license":[{"start":{"date-parts":[[2024,7,22]],"date-time":"2024-07-22T00:00:00Z","timestamp":1721606400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,7,22]],"date-time":"2024-07-22T00:00:00Z","timestamp":1721606400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Knowl Inf Syst"],"published-print":{"date-parts":[[2024,11]]},"DOI":"10.1007\/s10115-024-02166-8","type":"journal-article","created":{"date-parts":[[2024,7,22]],"date-time":"2024-07-22T05:02:05Z","timestamp":1721624525000},"page":"6975-7003","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":6,"title":["Caption matters: a new perspective for knowledge-based visual question answering"],"prefix":"10.1007","volume":"66","author":[{"given":"Bin","family":"Feng","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Shulan","family":"Ruan","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Likang","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Huijie","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kai","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kun","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qi","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Enhong","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,7,22]]},"reference":[{"key":"2166_CR1","doi-asserted-by":"crossref","unstructured":"Marino K, Rastegari M, Farhadi A, Mottaghi R (2019) OK-VQA: a visual question answering benchmark requiring external knowledge. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 3195\u20133204","DOI":"10.1109\/CVPR.2019.00331"},{"key":"2166_CR2","unstructured":"Kim J-H, Jun J, Zhang B-T (2018) Bilinear attention networks. In: Advances in neural information processing systems, vol 31"},{"key":"2166_CR3","doi-asserted-by":"crossref","unstructured":"Li G, Wang X, Zhu W (2020) Boosting visual question answering with context-aware knowledge aggregation. In: Proceedings of the 28th ACM international conference on multimedia, pp 1227\u20131235","DOI":"10.1145\/3394171.3413943"},{"key":"2166_CR4","doi-asserted-by":"crossref","unstructured":"Ben-Younes H, Cadene R, Cord M, Thome N (2017) Mutan: Multimodal tucker fusion for visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2612\u20132620","DOI":"10.1109\/ICCV.2017.285"},{"key":"2166_CR5","doi-asserted-by":"publisher","first-page":"6730","DOI":"10.1109\/TIP.2021.3097180","volume":"30","author":"W Guo","year":"2021","unstructured":"Guo W, Zhang Y, Yang J, Yuan X (2021) Re-attention for visual question answering. IEEE Trans Image Process 30:6730\u20136743","journal-title":"IEEE Trans Image Process"},{"issue":"10","key":"2166_CR6","doi-asserted-by":"publisher","first-page":"2413","DOI":"10.1109\/TPAMI.2017.2754246","volume":"40","author":"P Wang","year":"2018","unstructured":"Wang P, Wu Q, Shen C, Dick A (2018) Hengel: FVQA: Fact-based visual question answering. IEEE Trans Pattern Anal Mach Intell 40(10):2413\u20132427","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2166_CR7","doi-asserted-by":"crossref","unstructured":"Simonyan K, Zisserman A (2015) Very deep convolutional networks for large-scale image recognition. In: International conference on learning representations","DOI":"10.1109\/ICCV.2015.314"},{"key":"2166_CR8","doi-asserted-by":"crossref","unstructured":"Wu J, Lu J, Sabharwal A, Mottaghi R (2022) Multi-modal answer validation for knowledge-based vqa. In: Proceedings of the AAAI conference on artificial intelligence, vol 36. pp 2712\u20132721","DOI":"10.1609\/aaai.v36i3.20174"},{"key":"2166_CR9","doi-asserted-by":"crossref","unstructured":"Marino K, Chen X, Parikh D, Gupta A, Rohrbach M (2021) Krisp: Integrating implicit and symbolic knowledge for open-domain knowledge-based VQA. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 14111\u201314121","DOI":"10.1109\/CVPR46437.2021.01389"},{"key":"2166_CR10","doi-asserted-by":"crossref","unstructured":"He K, Gkioxari G, Doll\u00e1r P, Girshick R (2017) Mask r-CNN. In: Proceedings of the IEEE international conference on computer vision, pp 2961\u20132969","DOI":"10.1109\/ICCV.2017.322"},{"key":"2166_CR11","unstructured":"Ren S, He K, Girshick R, Sun J (2015) Faster r-cnn: Towards real-time object detection with region proposal networks. In: Advances in neural information processing systems, vol 28"},{"key":"2166_CR12","unstructured":"Lu J, Batra D, Parikh D, Lee S (2019) Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. In: Advances in neural information processing systems, vol 32"},{"key":"2166_CR13","doi-asserted-by":"crossref","unstructured":"Tan H, Bansal M (2019) Lxmert: Learning cross-modality encoder representations from transformers. In: Proceedings of the 2019 conference on empirical methods in natural language processing and the 9th international joint conference on natural language processing (EMNLP-IJCNLP), pp 5100\u20135111","DOI":"10.18653\/v1\/D19-1514"},{"key":"2166_CR14","doi-asserted-by":"crossref","unstructured":"Gard\u00e8res F, Ziaeefard M, Abeloos B, Lecue F (2020) Conceptbert: Concept-aware representation for visual question answering. In: Findings of the association for computational linguistics: EMNLP 2020, pp 489\u2013498","DOI":"10.18653\/v1\/2020.findings-emnlp.44"},{"key":"2166_CR15","doi-asserted-by":"crossref","unstructured":"Zhu Z, Yu J, Wang Y, Sun Y, Hu Y, Wu Q (2021) Mucko: multi-layer cross-modal knowledge reasoning for fact-based visual question answering. In: Proceedings of the twenty-ninth international conference on international joint conferences on artificial intelligence, pp 1097\u20131103","DOI":"10.24963\/ijcai.2020\/153"},{"key":"2166_CR16","unstructured":"Kenton JDM-WC, Toutanova LK (2019) Bert: Pre-training of deep bidirectional transformers for language understanding. In: Proceedings of NAACL-HLT, pp 4171\u20134186"},{"key":"2166_CR17","unstructured":"Li LH, Yatskar M, Yin D, Hsieh C-J, Chang K-W (2019) Visualbert: a simple and performant baseline for vision and language. arXiv:1908.03557"},{"key":"2166_CR18","doi-asserted-by":"crossref","unstructured":"Malinowski M, Rohrbach M, Fritz M (2015) Ask your neurons: a neural-based approach to answering questions about images. In: Proceedings of the IEEE international conference on computer vision, pp 1\u20139","DOI":"10.1109\/ICCV.2015.9"},{"key":"2166_CR19","unstructured":"Ren M, Kiros R, Zemel R (2015) Exploring models and data for image question answering. In: Advances in neural information processing systems vol 28"},{"key":"2166_CR20","doi-asserted-by":"crossref","unstructured":"Sharma H, Jalal AS (2022) Convolutional neural networks-based VQA model. In: Proceedings of international conference on frontiers in computing and systems: COMSYS 2021, Springer, pp 109\u2013116","DOI":"10.1007\/978-981-19-0105-8_11"},{"issue":"8","key":"2166_CR21","doi-asserted-by":"publisher","first-page":"8312","DOI":"10.1109\/TKDE.2022.3201037","volume":"35","author":"F Wang","year":"2022","unstructured":"Wang F, Liu Q, Chen E, Huang Z, Yin Y, Wang S, Su Y (2022) NeuralCD: a general framework for cognitive diagnosis. IEEE Trans Knowl Data Eng 35(8):8312\u20138327","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"2166_CR22","doi-asserted-by":"crossref","unstructured":"Yu Z, Yu J, Fan J, Tao D (2017) Multi-modal factorized bilinear pooling with co-attention learning for visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 1821\u20131830","DOI":"10.1109\/ICCV.2017.202"},{"key":"2166_CR23","doi-asserted-by":"crossref","unstructured":"Ben-Younes H, Cadene R, Thome N, Cord M (2019) Block: bilinear superdiagonal fusion for visual question answering and visual relationship detection. In: Proceedings of the AAAI conference on artificial intelligence, vol 33. pp 8102\u20138109","DOI":"10.1609\/aaai.v33i01.33018102"},{"key":"2166_CR24","doi-asserted-by":"crossref","unstructured":"Yang Z, He X, Gao J, Deng L, Smola A (2016) Stacked attention networks for image question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 21\u201329","DOI":"10.1109\/CVPR.2016.10"},{"key":"2166_CR25","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C, Teney D, Johnson M, Gould S, Zhang L (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6077\u20136086","DOI":"10.1109\/CVPR.2018.00636"},{"key":"2166_CR26","doi-asserted-by":"crossref","unstructured":"Liang J, Jiang L, Cao L, Li L-J, Hauptmann AG (2018) Focal visual-text attention for visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6135\u20136143","DOI":"10.1109\/CVPR.2018.00642"},{"key":"2166_CR27","doi-asserted-by":"crossref","unstructured":"Changpinyo S, Kukliansy D, Szpektor I, Chen X, Ding N, Soricut R (2022) All you may need for VQA are image captions. In: Proceedings of the 2022 conference of the north american chapter of the association for computational linguistics: human language technologies, pp 1947\u20131963","DOI":"10.18653\/v1\/2022.naacl-main.142"},{"key":"2166_CR28","doi-asserted-by":"crossref","unstructured":"Wang P, Wu Q, Shen C, Dick A, Hengel A (2017) Explicit knowledge-based reasoning for visual question answering. In: Proceedings of the twenty-sixth international joint conference on artificial intelligence, IJCAI-17, pp 1290\u20131296","DOI":"10.24963\/ijcai.2017\/179"},{"key":"2166_CR29","doi-asserted-by":"crossref","unstructured":"Schwenk D, Khandelwal A, Clark C, Marino K, Mottaghi R (2022) A-okvqa: A benchmark for visual question answering using world knowledge. In: Computer Vision\u2013ECCV 2022: 17th European conference, Tel Aviv, Israel, October 23\u201327, 2022, Proceedings, Part VIII. Springer, pp 146\u2013162","DOI":"10.1007\/978-3-031-20074-8_9"},{"key":"2166_CR30","doi-asserted-by":"crossref","unstructured":"Shah S, Mishra A, Yadati N, Talukdar PP (2019) Kvqa: Knowledge-aware visual question answering. In: Proceedings of the AAAI conference on artificial intelligence, vol 33. pp 8876\u20138884","DOI":"10.1609\/aaai.v33i01.33018876"},{"key":"2166_CR31","doi-asserted-by":"crossref","unstructured":"Gao F, Ping Q, Thattai G, Reganti A, Wu YN, Natarajan P (2022) Transform-retrieve-generate: Natural language-centric outside-knowledge visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 5067\u20135077","DOI":"10.1109\/CVPR52688.2022.00501"},{"issue":"1","key":"2166_CR32","doi-asserted-by":"publisher","first-page":"453","DOI":"10.1007\/s10115-023-01966-8","volume":"66","author":"A Formica","year":"2024","unstructured":"Formica A, Mele I, Taglino F (2024) A template-based approach for question answering over knowledge bases. Knowl Inf Syst 66(1):453\u2013479","journal-title":"Knowl Inf Syst"},{"key":"2166_CR33","doi-asserted-by":"crossref","unstructured":"Lin W, Byrne B (2022) Retrieval augmented visual question answering with outside knowledge. In: Proceedings of the 2022 conference on empirical methods in natural language processing, pp 11238\u201311254","DOI":"10.18653\/v1\/2022.emnlp-main.772"},{"key":"2166_CR34","doi-asserted-by":"crossref","unstructured":"Shao Z, Yu Z, Wang M, Yu J (2023) Prompting large language models with answer heuristics for knowledge-based visual question answering. In: Computer vision and pattern recognition (CVPR)","DOI":"10.1109\/CVPR52729.2023.01438"},{"key":"2166_CR35","unstructured":"Lin Y, Xie Y, Chen D, Xu Y, Zhu C, Yuan L (2022) Revive: Regional visual representation matters in knowledge-based visual question answering. In: Advances in neural information processing systems"},{"issue":"7","key":"2166_CR36","doi-asserted-by":"publisher","first-page":"1937","DOI":"10.1007\/s10115-022-01698-1","volume":"64","author":"H Rathnayake","year":"2022","unstructured":"Rathnayake H, Sumanapala J, Rukshani R, Ranathunga S (2022) Adapter-based fine-tuning of pre-trained multilingual language models for code-mixed and code-switched text classification. Knowl Inf Syst 64(7):1937\u20131966","journal-title":"Knowl Inf Syst"},{"key":"2166_CR37","doi-asserted-by":"crossref","unstructured":"Yang Z, Gan Z, Wang J, Hu X, Lu Y, Liu Z, Wang L (2022) An empirical study of GPT-3 for few-shot knowledge-based vqa. In: Proceedings of the AAAI conference on artificial intelligence, vol 36. pp 3081\u20133089","DOI":"10.1609\/aaai.v36i3.20215"},{"key":"2166_CR38","doi-asserted-by":"crossref","unstructured":"Huang D, Wei Z, Yue A, Zhao X, Chen Z, Li R, Jiang K, Chang B, Zhang Q, Zhang S et al (2023) Dsqa-llm: Domain-specific intelligent question answering based on large language model. In: International conference on AI-generated content, Springer, pp 170\u2013180","DOI":"10.1007\/978-981-99-7587-7_14"},{"key":"2166_CR39","unstructured":"Yu Z, Ouyang X, Shao Z, Wang M, Yu J (2023) Prophet: Prompting large language models with complementary answer heuristics for knowledge-based visual question answering. arXiv:2303.01903"},{"key":"2166_CR40","doi-asserted-by":"crossref","unstructured":"Hu Y, Hua H, Yang Z, Shi W, Smith NA, Luo J (2022) Promptcap: prompt-guided task-aware image captioning. arXiv:2211.09699","DOI":"10.1109\/ICCV51070.2023.00277"},{"key":"2166_CR41","doi-asserted-by":"crossref","unstructured":"Gui L, Wang B, Huang Q, Hauptmann A, Bisk Y, Gao J (2021) Kat: a knowledge augmented transformer for vision-and-language. arXiv:2112.08614","DOI":"10.18653\/v1\/2022.naacl-main.70"},{"issue":"2","key":"2166_CR42","doi-asserted-by":"publisher","first-page":"921","DOI":"10.1007\/s10115-022-01775-5","volume":"65","author":"S Li","year":"2023","unstructured":"Li S, Luo C, Zhu Y, Wu W (2023) Bold driver and static restart fused adaptive momentum for visual question answering. Knowl Inf Syst 65(2):921\u2013943","journal-title":"Knowl Inf Syst"},{"issue":"5","key":"2166_CR43","doi-asserted-by":"publisher","first-page":"1283","DOI":"10.1007\/s10115-022-01669-6","volume":"64","author":"M Muscetti","year":"2022","unstructured":"Muscetti M, Rinaldi AM, Russo C, Tommasino C (2022) Multimedia ontology population through semantic analysis and hierarchical deep features extraction techniques. Knowl Inf Syst 64(5):1283\u20131303","journal-title":"Knowl Inf Syst"},{"issue":"10","key":"2166_CR44","doi-asserted-by":"publisher","first-page":"4021","DOI":"10.1007\/s10115-023-01886-7","volume":"65","author":"J Gao","year":"2023","unstructured":"Gao J, Al-Sabri R, Oloulade BM, Chen J, Lyu T, Wu Z (2023) Gm2nas: multitask multiview graph neural architecture search. Knowl Inf Syst 65(10):4021\u20134054","journal-title":"Knowl Inf Syst"},{"issue":"3","key":"2166_CR45","doi-asserted-by":"publisher","first-page":"2193","DOI":"10.1007\/s10115-023-02028-9","volume":"66","author":"Z Su","year":"2024","unstructured":"Su Z, Gou G (2024) Knowledge enhancement and scene understanding for knowledge-based visual question answering. Knowl Inf Syst 66(3):2193\u20132208","journal-title":"Knowl Inf Syst"},{"key":"2166_CR46","doi-asserted-by":"crossref","unstructured":"Ruan S, Zhang Y, Zhang K, Fan Y, Tang F, Liu Q, Chen E (2021) Dae-gan: dynamic aspect-aware gan for text-to-image synthesis. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 13960\u201313969","DOI":"10.1109\/ICCV48922.2021.01370"},{"key":"2166_CR47","unstructured":"Zhou B, Tian Y, Sukhbaatar S, Szlam A, Fergus R (2015) Simple baseline for visual question answering. arXiv:1512.02167"},{"key":"2166_CR48","doi-asserted-by":"crossref","unstructured":"Fukui A, Park DH, Yang D, Rohrbach A, Darrell T, Rohrbach M (2016) Multimodal compact bilinear pooling for visual question answering and visual grounding. In: Proceedings of the 2016 conference on empirical methods in natural language processing, pp 457\u2013468","DOI":"10.18653\/v1\/D16-1044"},{"key":"2166_CR49","doi-asserted-by":"crossref","unstructured":"Gao P, Jiang Z, You H, Lu P, Hoi SC, Wang X, Li H (2019) Dynamic fusion with intra-and inter-modality attention flow for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 6639\u20136648","DOI":"10.1109\/CVPR.2019.00680"},{"key":"2166_CR50","doi-asserted-by":"crossref","unstructured":"Hannan D, Jain A, Bansal M (2020) Manymodalqa: Modality disambiguation and qa over diverse inputs. In: Proceedings of the AAAI conference on artificial intelligence, vol 34, pp 7879\u20137886","DOI":"10.1609\/aaai.v34i05.6294"},{"key":"2166_CR51","unstructured":"Vaswani A, Shazeer N, Parmar N, Uszkoreit J, Jones L, Gomez AN, Kaiser \u0141, Polosukhin I (2017) Attention is all you need. Adv Neural Inform Process Syst 30"},{"key":"2166_CR52","doi-asserted-by":"publisher","DOI":"10.1007\/s10115-023-02053-8","author":"LG Singh","year":"2024","unstructured":"Singh LG, Singh SR (2024) Sentiment analysis of tweets using text and graph multi-views learning. Knowl Inform Syst. https:\/\/doi.org\/10.1007\/s10115-023-02053-8","journal-title":"Knowl Inform Syst"},{"key":"2166_CR53","doi-asserted-by":"crossref","unstructured":"Ding Y, Yu J, Liu B, Hu Y, Cui M, Wu Q (2022) Mukea: Multimodal knowledge extraction and accumulation for knowledge-based visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 5089\u20135098","DOI":"10.1109\/CVPR52688.2022.00503"},{"key":"2166_CR54","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2022.118669","volume":"212","author":"A Salaberria","year":"2023","unstructured":"Salaberria A, Azkune G, Lacalle OL, Soroa A, Agirre E (2023) Image captioning for effective use of language models in knowledge-based visual question answering. Expert Syst Appl 212:118669","journal-title":"Expert Syst Appl"},{"issue":"6","key":"2166_CR55","doi-asserted-by":"publisher","first-page":"1390","DOI":"10.3390\/electronics12061390","volume":"12","author":"L Jiang","year":"2023","unstructured":"Jiang L, Meng Z (2023) Knowledge-based visual question answering using multi-modal semantic graph. Electronics 12(6):1390","journal-title":"Electronics"},{"issue":"2","key":"2166_CR56","doi-asserted-by":"publisher","first-page":"457","DOI":"10.1007\/s10115-019-01388-5","volume":"62","author":"B Schelling","year":"2020","unstructured":"Schelling B, Plant C (2020) Dataset-transformation: improving clustering by enhancing the structure with dipscaling and diptransformation. Knowl Inf Syst 62(2):457\u2013484","journal-title":"Knowl Inf Syst"},{"key":"2166_CR57","doi-asserted-by":"publisher","DOI":"10.1007\/s10115-023-02056-5","author":"M Wang","year":"2024","unstructured":"Wang M, Zhou X, Chen Y (2024) JMFEEL-NET: a joint multi-scale feature enhancement and lightweight transformer network for crowd counting. Knowl Inform Syst. https:\/\/doi.org\/10.1007\/s10115-023-02056-5","journal-title":"Knowl Inform Syst"},{"key":"2166_CR58","doi-asserted-by":"crossref","unstructured":"Li G, Duan N, Fang Y, Gong M, Jiang D (2020) Unicoder-vl: a universal encoder for vision and language by cross-modal pre-training. In: Proceedings of the AAAI conference on artificial intelligence, vol 34, pp 11336\u201311344","DOI":"10.1609\/aaai.v34i07.6795"},{"key":"2166_CR59","unstructured":"Su W, Zhu X, Cao Y, Li B, Lu L, Wei F, Dai J (2019) Vl-bert: Pre-training of generic visual-linguistic representations. In: International conference on learning representations"},{"key":"2166_CR60","unstructured":"Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal S, Sastry G, Askell A, Mishkin P, Clark J et al (2021) Learning transferable visual models from natural language supervision. In: International conference on machine learning, PMLR, pp 8748\u20138763"},{"key":"2166_CR61","unstructured":"Li J, Li D, Xiong C, Hoi S (2022) Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In: International conference on machine learning, PMLR, pp 12888\u201312900"},{"key":"2166_CR62","doi-asserted-by":"crossref","unstructured":"Girdhar R, El-Nouby A, Liu Z, Singh M, Alwala KV, Joulin A, Misra I (2023) Imagebind: one embedding space to bind them all. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 15180\u201315190","DOI":"10.1109\/CVPR52729.2023.01457"},{"key":"2166_CR63","doi-asserted-by":"crossref","unstructured":"Zhang P, Li X, Hu X, Yang J, Zhang L, Wang L, Choi Y, Gao J (2021) Vinvl: revisiting visual representations in vision-language models. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 5579\u20135588","DOI":"10.1109\/CVPR46437.2021.00553"},{"issue":"1","key":"2166_CR64","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O, Johnson J, Hata K, Kravitz J, Chen S, Kalantidis Y, Li L-J, Shamma DA et al (2017) Visual genome: connecting language and vision using crowdsourced dense image annotations. Int J Comput Vision 123(1):32\u201373","journal-title":"Int J Comput Vision"},{"issue":"4","key":"2166_CR65","doi-asserted-by":"publisher","first-page":"652","DOI":"10.1109\/TPAMI.2016.2587640","volume":"39","author":"O Vinyals","year":"2016","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2016) Show and tell: Lessons learned from the 2015 mscoco image captioning challenge. IEEE Trans Pattern Anal Mach Intell 39(4):652\u2013663","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2166_CR66","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: Neural image caption generation with visual attention. In: International conference on machine learning, PMLR, pp 2048\u20132057"},{"key":"2166_CR67","unstructured":"Wu Y, Schuster M, Chen Z, Le QV, Norouzi M, Macherey W, Krikun M, Cao Y, Gao Q, Macherey K et al (2016) Google\u2019s neural machine translation system: Bridging the gap between human and machine translation. arXiv:1609.08144"},{"issue":"4","key":"2166_CR68","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1023\/B:BTTJ.0000047600.45421.6d","volume":"22","author":"H Liu","year":"2004","unstructured":"Liu H, Singh P (2004) Conceptnet-a practical commonsense reasoning tool-kit. BT Technol J 22(4):211\u2013226","journal-title":"BT Technol J"},{"key":"2166_CR69","doi-asserted-by":"crossref","unstructured":"Auer S, Bizer C, Kobilarov G, Lehmann J, Cyganiak R, Ives Z (2007) Dbpedia: a nucleus for a web of open data. In: International semantic web conference, Springer, pp 722\u2013735","DOI":"10.1007\/978-3-540-76298-0_52"},{"key":"2166_CR70","unstructured":"Bhakthavatsalam S, Richardson K, Tandon N, Clark P (2020) Do dogs have whiskers? a new knowledge base of haspart relations. arXiv:2006.07510"},{"key":"2166_CR71","doi-asserted-by":"crossref","unstructured":"Schlichtkrull M, Kipf TN, Bloem P, Berg Rvd, Titov I, Welling M (2018) Modeling relational data with graph convolutional networks. In: European semantic web conference. Springer, pp 593\u2013607","DOI":"10.1007\/978-3-319-93417-4_38"},{"key":"2166_CR72","unstructured":"Kipf TN, Welling M (2016) Semi-supervised classification with graph convolutional networks. In: International conference on learning representations"},{"key":"2166_CR73","doi-asserted-by":"crossref","unstructured":"Goyal Y, Khot T, Summers-Stay D, Batra D, Parikh D (2017) Making the v in vqa matter: elevating the role of image understanding in visual question answering. In: Proceedings of the ieee conference on computer vision and pattern recognition, pp 6904\u20136913","DOI":"10.1109\/CVPR.2017.670"},{"key":"2166_CR74","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2021.3118208","author":"S Ruan","year":"2021","unstructured":"Ruan S, Zhang K, Wu L, Xu T, Liu Q, Chen E (2021) Color enhanced cross correlation net for image sentiment analysis. IEEE Trans Multim. https:\/\/doi.org\/10.1109\/TMM.2021.3118208","journal-title":"IEEE Trans Multim"},{"key":"2166_CR75","doi-asserted-by":"crossref","unstructured":"Sun R, Tao H, Chen Y, Liu Q (2024) HACAN: a hierarchical answer-aware and context-aware network for question generation. Front Comput Sci 18(5):185321","DOI":"10.1007\/s11704-023-2246-2"},{"issue":"2","key":"2166_CR76","doi-asserted-by":"publisher","first-page":"1023","DOI":"10.1109\/TNNLS.2021.3104937","volume":"34","author":"D Guo","year":"2023","unstructured":"Guo D, Xu C, Tao D (2023) Bilinear graph networks for visual question answering. IEEE Trans Neural Netw Learn Syst 34(2):1023\u20131034. https:\/\/doi.org\/10.1109\/TNNLS.2021.3104937","journal-title":"IEEE Trans Neural Netw Learn Syst"},{"issue":"1","key":"2166_CR77","doi-asserted-by":"publisher","first-page":"81","DOI":"10.1109\/TAI.2022.3160418","volume":"4","author":"A Mishra","year":"2023","unstructured":"Mishra A, Anand A, Guha P (2023) Dual attention and question categorization-based visual question answering. IEEE Trans Artif Intell 4(1):81\u201391. https:\/\/doi.org\/10.1109\/TAI.2022.3160418","journal-title":"IEEE Trans Artif Intell"},{"key":"2166_CR78","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.109015","volume":"133","author":"L Song","year":"2023","unstructured":"Song L, Li J, Liu J, Yang Y, Shang X, Sun M (2023) Answering knowledge-based visual questions via the exploration of question purpose. Pattern Recogn 133:109015","journal-title":"Pattern Recogn"}],"container-title":["Knowledge and Information Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10115-024-02166-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10115-024-02166-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10115-024-02166-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,24]],"date-time":"2024-11-24T14:49:44Z","timestamp":1732459784000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10115-024-02166-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,7,22]]},"references-count":78,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2024,11]]}},"alternative-id":["2166"],"URL":"https:\/\/doi.org\/10.1007\/s10115-024-02166-8","relation":{},"ISSN":["0219-1377","0219-3116"],"issn-type":[{"value":"0219-1377","type":"print"},{"value":"0219-3116","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,7,22]]},"assertion":[{"value":"15 March 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"10 June 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 June 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 July 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}