{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,25]],"date-time":"2025-03-25T17:16:27Z","timestamp":1742922987543,"version":"3.40.3"},"publisher-location":"Singapore","reference-count":22,"publisher":"Springer Nature Singapore","isbn-type":[{"type":"print","value":"9789819756148"},{"type":"electronic","value":"9789819756155"}],"license":[{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,1,1]],"date-time":"2024-01-01T00:00:00Z","timestamp":1704067200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024]]},"DOI":"10.1007\/978-981-97-5615-5_20","type":"book-chapter","created":{"date-parts":[[2024,8,2]],"date-time":"2024-08-02T13:12:02Z","timestamp":1722604322000},"page":"240-251","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["A Reinforced Passage Interactive Retrieval Framework Incorporating Implicit Knowledge for KB-VQA"],"prefix":"10.1007","author":[{"given":"Hongyan","family":"Zheng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tao","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiping","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Hao","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gengchen","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhi","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaoyu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,8,3]]},"reference":[{"key":"20_CR1","doi-asserted-by":"crossref","unstructured":"Marino, K., Rastegari, M., Farhadi, A., Mottaghi, R.: OK-VQA: a visual question answering benchmark requiring external knowledge. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 3195\u20133204 (2019)","DOI":"10.1109\/CVPR.2019.00331"},{"key":"20_CR2","doi-asserted-by":"crossref","unstructured":"Antol, S., et al.: VQA: visual question answering. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2425\u20132433 (2015)","DOI":"10.1109\/ICCV.2015.279"},{"key":"20_CR3","doi-asserted-by":"crossref","unstructured":"Speer, R., Chin, J., Havasi, C.: ConceptNet 5.5: an open multilingual graph of general knowledge. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 31 (2017)","DOI":"10.1609\/aaai.v31i1.11164"},{"key":"20_CR4","doi-asserted-by":"crossref","unstructured":"Ding, Y., Yu, J., Liu, B., Hu, Y., Cui, M., Wu, Q.: MuKEA: multimodal knowledge extraction and accumulation for knowledge-based visual question answering. In: proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5089\u20135098 (2022)","DOI":"10.1109\/CVPR52688.2022.00503"},{"key":"20_CR5","first-page":"10560","volume":"35","author":"Y Lin","year":"2022","unstructured":"Lin, Y., Xie, Y., Chen, D., Xu, Y., Zhu, C., Yuan, L.: Revive: regional visual representation matters in knowledge-based visual question answering. Adv. Neural. Inf. Process. Syst. 35, 10560\u201310571 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"20_CR6","doi-asserted-by":"crossref","unstructured":"Yang, Z., et al.: An empirical study of gpt-3 for few-shot knowledge-based VQA. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 36, pp. 3081\u20133089 (2022)","DOI":"10.1609\/aaai.v36i3.20215"},{"key":"20_CR7","doi-asserted-by":"crossref","unstructured":"Shao, Z., Yu, Z., Wang, M., Yu, J.: Prompting large language models with answer heuristics for knowledge-based visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 14974\u201314983 (2023)","DOI":"10.1109\/CVPR52729.2023.01438"},{"key":"20_CR8","first-page":"1877","volume":"33","author":"T Brown","year":"2020","unstructured":"Brown, T., et al.: Language models are few-shot learners. Adv. Neural. Inf. Process. Syst. 33, 1877\u20131901 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"20_CR9","unstructured":"Li, Z., Yang, N., Wang, L., Wei, F.: Learning diverse document representations with deep query interactions for dense retrieval. arXiv preprint arXiv:2208.04232 (2022)"},{"key":"20_CR10","doi-asserted-by":"crossref","unstructured":"Qu, C., Zamani, H., Yang, L., Croft, W.B., Learned-Miller, E.: Passage retrieval for outside-knowledge visual question answering. In: Proceedings of the 44th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 1753\u20131757 (2021)","DOI":"10.1145\/3404835.3462987"},{"key":"20_CR11","doi-asserted-by":"crossref","unstructured":"Guo, Y., Nie, L., Wong, Y., Liu, Y., Cheng, Z., Kankanhalli, M.: A unified endto-end retriever-reader framework for knowledge-based VQA. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 2061\u20132069 (2022)","DOI":"10.1145\/3503161.3547870"},{"key":"20_CR12","doi-asserted-by":"crossref","unstructured":"Wu, J., Mooney, R.J.: Entity-focused dense passage retrieval for outside-knowledge visual question answering. arXiv preprint arXiv:2210.10176 (2022)","DOI":"10.18653\/v1\/2022.emnlp-main.551"},{"key":"20_CR13","doi-asserted-by":"crossref","unstructured":"You, J., Yang, Z., Li, Q., Liu, W.: A retriever-reader framework with visual entity linking for knowledge-based visual question answering. In: 2023 IEEE International Conference on Multimedia and Expo (ICME), pp. 13\u201318. IEEE (2023)","DOI":"10.1109\/ICME55011.2023.00011"},{"key":"20_CR14","doi-asserted-by":"crossref","unstructured":"Lin, W., Byrne, B.: Retrieval augmented visual question answering with outside knowledge. arXiv preprint arXiv:2210.03809 (2022)","DOI":"10.18653\/v1\/2022.emnlp-main.772"},{"key":"20_CR15","doi-asserted-by":"crossref","unstructured":"Chen, Z., et al.: LaKo: knowledge-driven visual question answering via late knowledge-to-text injection. In: Proceedings of the 11th International Joint Conference on Knowledge Graphs, pp. 20\u201329 (2022)","DOI":"10.1145\/3579051.3579053"},{"key":"20_CR16","doi-asserted-by":"crossref","unstructured":"Gui, L., Wang, B., Huang, Q., Hauptmann, A., Bisk, Y., Gao, J.: KAT: a knowledge augmented transformer for vision-and-language. arXiv preprint arXiv:2112.08614 (2021)","DOI":"10.18653\/v1\/2022.naacl-main.70"},{"key":"20_CR17","doi-asserted-by":"crossref","unstructured":"Hu, Y., Hua, H., Yang, Z., Shi, W., Smith, N.A., Luo, J.: PromptCap: prompt-guided task-aware image captioning. arXiv preprint arXiv:2211.09699 (2022)","DOI":"10.1109\/ICCV51070.2023.00277"},{"key":"20_CR18","doi-asserted-by":"crossref","unstructured":"Fu, X., et al.: Generate then select: open-ended visual question answering guided by world knowledge. arXiv preprint arXiv:2305.18842 (2023)","DOI":"10.18653\/v1\/2023.findings-acl.147"},{"key":"20_CR19","doi-asserted-by":"crossref","unstructured":"Si, Q., Mo, Y., Lin, Z., Ji, H., Wang, W.: Combo of thinking and observing for outside knowledge VQA. arXiv preprint arXiv:2305.06407 (2023)","DOI":"10.18653\/v1\/2023.acl-long.614"},{"key":"20_CR20","unstructured":"Wang, P., et al.: OFA: unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework. In: International Conference on Machine Learning, pp. 23318\u201323340. PMLR (2022)"},{"key":"20_CR21","doi-asserted-by":"crossref","unstructured":"Zhang, P., et al.: VinVL: revisiting visual representations in vision-language models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5579\u20135588 (2021)","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"20_CR22","doi-asserted-by":"crossref","unstructured":"Luo, M., Zeng, Y., Banerjee, P., Baral, C.: Weakly-supervised visual-retriever-reader for knowledge-based question answering. arXiv preprint arXiv:2109.04014 (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.517"}],"container-title":["Lecture Notes in Computer Science","Advanced Intelligent Computing Technology and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-97-5615-5_20","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,9]],"date-time":"2024-11-09T11:05:08Z","timestamp":1731150308000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-97-5615-5_20"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"ISBN":["9789819756148","9789819756155"],"references-count":22,"URL":"https:\/\/doi.org\/10.1007\/978-981-97-5615-5_20","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024]]},"assertion":[{"value":"3 August 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICIC","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Intelligent Computing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Tianjin","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"5 August 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 August 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"20","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icic2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.ic-icc.cn\/2024\/index.htm","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}