{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,12,12]],"date-time":"2025-12-12T08:45:56Z","timestamp":1765529156333,"version":"3.48.0"},"reference-count":34,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2025,6,24]],"date-time":"2025-06-24T00:00:00Z","timestamp":1750723200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2025,6,24]],"date-time":"2025-06-24T00:00:00Z","timestamp":1750723200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Data Sci. Eng."],"published-print":{"date-parts":[[2025,12]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:p>This paper addresses the issue of time-consuming manual prompt design and the limitations of current knowledge editing methods, which fail to utilize new knowledge fully. It integrates knowledge during the pre-training and answer prediction stages. Additionally, it proposes a medical visual question-and-answer model called DPDE, which is based on dynamic prompts and decoded knowledge editing. This model innovatively applies dynamic prompts to the field of medical visual question answering. It proposes a new paradigm for decoding knowledge editing, which enhances the language model\u2019s knowledge editing capabilities in the decoding stage. In order to verify the effectiveness of the DPDE model, we conducted multiple sets of experiments to explore the model performance on three data sets. Experiments have proven that the dynamic prompt module and decoding knowledge editing module used in this model can effectively improve the performance of medical visual question-answering tasks.<\/jats:p>","DOI":"10.1007\/s41019-025-00291-0","type":"journal-article","created":{"date-parts":[[2025,6,24]],"date-time":"2025-06-24T04:47:28Z","timestamp":1750740448000},"page":"681-691","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Effective Medical Visual Question Answering Using Dynamic Prompting and Decoding Knowledge Editing"],"prefix":"10.1007","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0009-0002-5211-3579","authenticated-orcid":false,"given":"ZhiJie","family":"Zhou","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"YeFan","family":"Huang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"XiaoLi","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaojie","family":"Hong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,6,24]]},"reference":[{"key":"291_CR1","doi-asserted-by":"crossref","unstructured":"Chen YC, Li L, Yu L, El\u00a0Kholy A, Ahmed F, Gan Z, Cheng Y, Liu J (2020) Uniter: Universal image-text representation learning. In: European conference on computer vision, pp. 104\u2013120. Springer","DOI":"10.1007\/978-3-030-58577-8_7"},{"key":"291_CR2","doi-asserted-by":"crossref","unstructured":"Chen Z, Du Y, Hu J, Liu Y, Li G, Wan X, Chang TH (2022) Multi-modal masked autoencoders for medical vision-and-language pre-training. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 679\u2013689. Springer","DOI":"10.1007\/978-3-031-16443-9_65"},{"key":"291_CR3","doi-asserted-by":"crossref","unstructured":"Cong F, Xu S, Guo L, Tian Y (2022) Caption-aware medical vqa via semantic focusing and progressive cross-modality comprehension. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 3569\u20133577","DOI":"10.1145\/3503161.3548122"},{"key":"291_CR4","doi-asserted-by":"crossref","unstructured":"Do T, Nguyen BX, Tjiputra E, Tran M, Tran QD, Nguyen A (2021) Multiple meta-model quantifying for medical visual question answering. In: Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2021: 24th International Conference, Strasbourg, France, September 27\u2013October 1, 2021, Proceedings, Part V 24, pp. 64\u201374. Springer","DOI":"10.1007\/978-3-030-87240-3_7"},{"key":"291_CR5","unstructured":"Eslami S, de\u00a0Melo G, Meinel C (2021) Does clip benefit visual question answering in the medical domain as much as it does in the general domain? arXiv preprint arXiv:2112.13906"},{"key":"291_CR6","unstructured":"Feng Z, Ma W, Yu W, Huang L, Wang H, Chen Q, Peng W, Feng X, Qin B, et\u00a0al (2023) Trends in integration of knowledge and large language models: A survey and taxonomy of methods, benchmarks, and applications. arXiv preprint arXiv:2311.05876"},{"key":"291_CR7","doi-asserted-by":"crossref","unstructured":"Gong H, Chen G, Liu S, Yu Y, Li G (2021) Cross-modal self-attention with multi-task pre-training for medical visual question answering. In: Proceedings of the 2021 international conference on multimedia retrieval, pp. 456\u2013460","DOI":"10.1145\/3460426.3463584"},{"issue":"11","key":"291_CR8","doi-asserted-by":"publisher","first-page":"3332","DOI":"10.1109\/TMI.2022.3185008","volume":"41","author":"H Gong","year":"2022","unstructured":"Gong H, Chen G, Mao M, Li Z, Li G (2022) Vqamix: Conditional triplet mixup for medical visual question answering. IEEE Trans Med Imaging 41(11):3332\u20133343","journal-title":"IEEE Trans Med Imaging"},{"key":"291_CR9","doi-asserted-by":"crossref","unstructured":"Huang SC, Shen L, Lungren MP, Yeung S (2021) Gloria: A multimodal global-local representation learning framework for label-efficient medical image recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 3942\u20133951","DOI":"10.1109\/ICCV48922.2021.00391"},{"key":"291_CR10","doi-asserted-by":"crossref","unstructured":"Huang Y, Wang X, Liu F, Huang G (2022) Ovqa: A clinically generated visual question answering dataset. In: Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 2924\u20132938","DOI":"10.1145\/3477495.3531724"},{"key":"291_CR11","unstructured":"Huang Z, Zeng Z, Liu B, Fu D, Fu J (2020) Pixel-bert: Aligning image pixels with text by deep multi-modal transformers. arXiv preprint arXiv:2004.00849"},{"key":"291_CR12","doi-asserted-by":"crossref","unstructured":"Khare Y, Bagal V, Mathew M, Devi A, Priyakumar UD, Jawahar C (2021) Mmbert: Multimodal bert pretraining for improved medical vqa. In: 2021 IEEE 18th International Symposium on Biomedical Imaging (ISBI), pp. 1033\u20131036. IEEE","DOI":"10.1109\/ISBI48211.2021.9434063"},{"key":"291_CR13","unstructured":"Kim JH, Jun J, Zhang BT (2018) Bilinear attention networks. Advances in neural information processing systems 31"},{"key":"291_CR14","unstructured":"Kim W, Son B, Kim I (2021) Vilt: Vision-and-language transformer without convolution or region supervision. In: International conference on machine learning, pp. 5583\u20135594. PMLR"},{"issue":"1","key":"291_CR15","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1038\/sdata.2018.251","volume":"5","author":"JJ Lau","year":"2018","unstructured":"Lau JJ, Gayen S, Ben Abacha A, Demner-Fushman D (2018) A dataset of clinically generated visual questions and answers about radiology images. Sci data 5(1):1\u201310","journal-title":"Sci data"},{"key":"291_CR16","doi-asserted-by":"crossref","unstructured":"Li P, Liu G, He J, Zhao Z, Zhong S (2023) Masked vision and language pre-training with unimodal and multimodal contrastive losses for medical visual question answering. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 374\u2013383. Springer","DOI":"10.1007\/978-3-031-43907-0_36"},{"key":"291_CR17","doi-asserted-by":"crossref","unstructured":"Li P, Liu G, Tan L, Liao J, Zhong S (2023) Self-supervised vision-language pretraining for medial visual question answering. In: 2023 IEEE 20th International Symposium on Biomedical Imaging (ISBI), pp. 1\u20135. IEEE","DOI":"10.1109\/ISBI53787.2023.10230743"},{"key":"291_CR18","doi-asserted-by":"crossref","unstructured":"Lin W, Zhao Z, Zhang X, Wu C, Zhang Y, Wang Y, Xie W (2023) Pmc-clip: Contrastive language-image pre-training using biomedical documents. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 525\u2013536. Springer","DOI":"10.1007\/978-3-031-43993-3_51"},{"key":"291_CR19","doi-asserted-by":"crossref","unstructured":"Lin Z, Zhang D, Tao Q, Shi D, Haffari G, Wu Q, He M, Ge Z (2023) Medical visual question answering: A survey. Artificial Intelligence in Medicine pp. 102611","DOI":"10.1016\/j.artmed.2023.102611"},{"key":"291_CR20","doi-asserted-by":"crossref","unstructured":"Liu B, Zhan LM, Wu XM (2021) Contrastive pre-training and representation distillation for medical visual question answering based on radiology images. In: Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2021: 24th International Conference, Strasbourg, France, September 27\u2013October 1, 2021, Proceedings, Part II 24, pp. 210\u2013220. Springer","DOI":"10.1007\/978-3-030-87196-3_20"},{"key":"291_CR21","doi-asserted-by":"crossref","unstructured":"Liu B, Zhan LM, Xu L, Ma L, Yang Y, Wu XM (2021) Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering. In: 2021 IEEE 18th International Symposium on Biomedical Imaging (ISBI), pp. 1650\u20131654. IEEE","DOI":"10.1109\/ISBI48211.2021.9434010"},{"key":"291_CR22","doi-asserted-by":"crossref","unstructured":"Nguyen BD, Do TT, Nguyen BX, Do T, Tjiputra E, Tran Q D (2019) Overcoming data limitation in medical visual question answering. In: Medical Image Computing and Computer Assisted Intervention\u2013MICCAI 2019: 22nd International Conference, Shenzhen, China, October 13\u201317, 2019, Proceedings, Part IV 22, pp. 522\u2013530. Springer","DOI":"10.1007\/978-3-030-32251-9_57"},{"key":"291_CR23","doi-asserted-by":"crossref","unstructured":"Ossowski T, Hu J (2023) Multimodal prompt retrieval for generative visual question answering. arXiv preprint arXiv:2306.17675","DOI":"10.18653\/v1\/2023.findings-acl.158"},{"key":"291_CR24","doi-asserted-by":"crossref","unstructured":"Pelka O, Koitka S, R\u00fcckert J, Nensa F, Friedrich CM (2018) Radiology objects in context (roco): a multimodal image dataset. In: Intravascular Imaging and Computer Assisted Stenting and Large-Scale Annotation of Biomedical Data and Expert Label Synthesis: 7th Joint International Workshop, CVII-STENT 2018 and Third International Workshop, LABELS 2018, Held in Conjunction with MICCAI 2018, Granada, Spain, September 16, 2018, Proceedings 3, pp. 180\u2013189. Springer","DOI":"10.1007\/978-3-030-01364-6_20"},{"key":"291_CR25","unstructured":"Radford A, Kim JW, Hallacy C, Ramesh A, Goh G, Agarwal S, Sastry G, Askell A, Mishkin P, Clark J, et\u00a0al (2021) Learning transferable visual models from natural language supervision. In: International conference on machine learning, pp. 8748\u20138763. PMLR"},{"key":"291_CR26","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky O, Deng J, Su H, Krause J, Satheesh S, Ma S, Huang Z, Karpathy A, Khosla A, Bernstein M et al (2015) Imagenet large scale visual recognition challenge. Int J Comput Vision 115:211\u2013252","journal-title":"Int J Comput Vision"},{"key":"291_CR27","doi-asserted-by":"crossref","unstructured":"Tan H, Bansal M (2019) Lxmert: Learning cross-modality encoder representations from transformers. arXiv preprint arXiv:1908.07490","DOI":"10.18653\/v1\/D19-1514"},{"key":"291_CR28","doi-asserted-by":"crossref","unstructured":"Van\u00a0Sonsbeek T, Derakhshani MM, Najdenkoska I, Snoek CG, Worring M (2023) Open-ended medical visual question answering through prefix tuning of language models. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 726\u2013736. Springer","DOI":"10.1007\/978-3-031-43904-9_70"},{"key":"291_CR29","unstructured":"Wu C, Zhang X, Zhang Y, Wang Y, Xie W (2023) Towards generalist foundation model for radiology. arXiv preprint arXiv:2308.02463"},{"key":"291_CR30","doi-asserted-by":"crossref","unstructured":"Yang Z, He X, Gao J, Deng L, Smola A (2016) Stacked attention networks for image question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp. 21\u201329","DOI":"10.1109\/CVPR.2016.10"},{"key":"291_CR31","unstructured":"Zang Y, Li W, Zhou K, Huang C, Loy CC (2022) Unified vision and language prompt learning. arXiv preprint arXiv:2210.07225"},{"key":"291_CR32","doi-asserted-by":"crossref","unstructured":"Zhan LM, Liu B, Fan L, Chen J, Wu XM (2020) Medical visual question answering via conditional reasoning. In: Proceedings of the 28th ACM International Conference on Multimedia, pp. 2345\u20132354","DOI":"10.1145\/3394171.3413761"},{"key":"291_CR33","doi-asserted-by":"crossref","unstructured":"Zhou K, Yang J, Loy CC, Liu Z (2022) Conditional prompt learning for vision-language models. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp. 16816\u201316825","DOI":"10.1109\/CVPR52688.2022.01631"},{"issue":"9","key":"291_CR34","doi-asserted-by":"publisher","first-page":"2337","DOI":"10.1007\/s11263-022-01653-1","volume":"130","author":"K Zhou","year":"2022","unstructured":"Zhou K, Yang J, Loy CC, Liu Z (2022) Learning to prompt for vision-language models. Int J Comput Vision 130(9):2337\u20132348","journal-title":"Int J Comput Vision"}],"container-title":["Data Science and Engineering"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s41019-025-00291-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s41019-025-00291-0\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s41019-025-00291-0.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,12,12]],"date-time":"2025-12-12T08:41:54Z","timestamp":1765528914000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s41019-025-00291-0"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,24]]},"references-count":34,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2025,12]]}},"alternative-id":["291"],"URL":"https:\/\/doi.org\/10.1007\/s41019-025-00291-0","relation":{},"ISSN":["2364-1185","2364-1541"],"issn-type":[{"type":"print","value":"2364-1185"},{"type":"electronic","value":"2364-1541"}],"subject":[],"published":{"date-parts":[[2025,6,24]]},"assertion":[{"value":"23 July 2024","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"5 April 2025","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 April 2025","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"24 June 2025","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"I declare that I have no confict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}