{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,7]],"date-time":"2026-05-07T15:23:49Z","timestamp":1778167429410,"version":"3.51.4"},"publisher-location":"Cham","reference-count":52,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031728549","type":"print"},{"value":"9783031728556","type":"electronic"}],"license":[{"start":{"date-parts":[[2024,11,9]],"date-time":"2024-11-09T00:00:00Z","timestamp":1731110400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,9]],"date-time":"2024-11-09T00:00:00Z","timestamp":1731110400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-72855-6_9","type":"book-chapter","created":{"date-parts":[[2024,11,8]],"date-time":"2024-11-08T18:48:44Z","timestamp":1731091724000},"page":"146-162","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":2,"title":["An Explainable Vision Question Answer Model via\u00a0Diffusion Chain-of-Thought"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-8024-4028","authenticated-orcid":false,"given":"Chunhao","family":"Lu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8217-2305","authenticated-orcid":false,"given":"Qiang","family":"Lu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3900-643X","authenticated-orcid":false,"given":"Jake","family":"Luo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,9]]},"reference":[{"key":"9_CR1","unstructured":"Achiam, J., et\u00a0al.: GPT-4 technical report. arXiv preprint arXiv:2303.08774 (2023)"},{"key":"9_CR2","doi-asserted-by":"crossref","unstructured":"Antol, S., et al.: VQA: visual question answering. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 2425\u20132433 (2015)","DOI":"10.1109\/ICCV.2015.279"},{"key":"9_CR3","doi-asserted-by":"crossref","unstructured":"Bao, F., Li, C., Cao, Y., Zhu, J.: All are worth words: a ViT backbone for score-based diffusion models. arXiv preprint arXiv:2209.12152 (2022)","DOI":"10.1109\/CVPR52729.2023.02171"},{"key":"9_CR4","unstructured":"Bao, F., Li, C., Zhu, J., Zhang, B.: Analytic-DPM: an analytic estimate of the optimal reverse variance in diffusion probabilistic models. arXiv preprint arXiv:2201.06503 (2022)"},{"key":"9_CR5","doi-asserted-by":"crossref","unstructured":"Boukhers, Z., Hartmann, T., J\u00fcrjens, J.: COIN: counterfactual image generation for VQA interpretation. arXiv preprint arXiv:2201.03342 (2022)","DOI":"10.3390\/s22062245"},{"key":"9_CR6","unstructured":"Brown, T., et al.: Language models are few-shot learners. Adv. Neural. Inf. Process. Syst. 33, 1877\u20131901 (2020)"},{"key":"9_CR7","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"213","DOI":"10.1007\/978-3-030-58452-8_13","volume-title":"Computer Vision \u2013 ECCV 2020","author":"N Carion","year":"2020","unstructured":"Carion, N., Massa, F., Synnaeve, G., Usunier, N., Kirillov, A., Zagoruyko, S.: End-to-end object detection with transformers. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12346, pp. 213\u2013229. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58452-8_13"},{"key":"9_CR8","doi-asserted-by":"crossref","unstructured":"Chen, C., Li, O., Tao, D., Barnett, A., Rudin, C., Su, J.K.: This looks like that: deep learning for interpretable image recognition. Adv. Neural Inf. Process. Syst. 32 (2019)","DOI":"10.1609\/hcomp.v7i1.5265"},{"key":"9_CR9","first-page":"22243","volume":"33","author":"T Chen","year":"2020","unstructured":"Chen, T., Kornblith, S., Swersky, K., Norouzi, M., Hinton, G.E.: Big self-supervised models are strong semi-supervised learners. Adv. Neural. Inf. Process. Syst. 33, 22243\u201322255 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"9_CR10","doi-asserted-by":"crossref","unstructured":"Chun, S., Oh, S.J., De\u00a0Rezende, R.S., Kalantidis, Y., Larlus, D.: Probabilistic embeddings for cross-modal retrieval. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 8415\u20138424 (2021)","DOI":"10.1109\/CVPR46437.2021.00831"},{"key":"9_CR11","doi-asserted-by":"crossref","unstructured":"Dai, D., Dong, L., Hao, Y., Sui, Z., Chang, B., Wei, F.: Knowledge neurons in pretrained transformers. arXiv preprint arXiv:2104.08696 (2022)","DOI":"10.18653\/v1\/2022.acl-long.581"},{"key":"9_CR12","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"466","DOI":"10.1007\/978-3-030-58598-3_28","volume-title":"Computer Vision \u2013 ECCV 2020","author":"TL Hayes","year":"2020","unstructured":"Hayes, T.L., Kafle, K., Shrestha, R., Acharya, M., Kanan, C.: REMIND your neural network to prevent catastrophic forgetting. In: Vedaldi, A., Bischof, H., Brox, T., Frahm, J.-M. (eds.) ECCV 2020. LNCS, vol. 12353, pp. 466\u2013483. Springer, Cham (2020). https:\/\/doi.org\/10.1007\/978-3-030-58598-3_28"},{"key":"9_CR13","first-page":"6840","volume":"33","author":"J Ho","year":"2020","unstructured":"Ho, J., Jain, A., Abbeel, P.: Denoising diffusion probabilistic models. Adv. Neural. Inf. Process. Syst. 33, 6840\u20136851 (2020)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"9_CR14","unstructured":"Ho, J., Salimans, T.: Classifier-free diffusion guidance. arXiv preprint arXiv:2207.12598 (2022)"},{"key":"9_CR15","doi-asserted-by":"crossref","unstructured":"Horawalavithana, S., Munikoti, S., Stewart, I., Kvinge, H.: SCITUNE: aligning large language models with scientific multimodal instructions. arXiv preprint arXiv:2307.01139 (2023)","DOI":"10.18653\/v1\/2024.nlp4science-1.7"},{"key":"9_CR16","doi-asserted-by":"crossref","unstructured":"Khashabi, D., et al.: UnifiedQA: crossing format boundaries with a single QA system. arXiv preprint arXiv:2005.00700 (2020)","DOI":"10.18653\/v1\/2020.findings-emnlp.171"},{"key":"9_CR17","first-page":"21696","volume":"34","author":"D Kingma","year":"2021","unstructured":"Kingma, D., Salimans, T., Poole, B., Ho, J.: Variational diffusion models. Adv. Neural. Inf. Process. Syst. 34, 21696\u201321707 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"9_CR18","first-page":"22199","volume":"35","author":"T Kojima","year":"2022","unstructured":"Kojima, T., Gu, S.S., Reid, M., Matsuo, Y., Iwasawa, Y.: Large language models are zero-shot reasoners. Adv. Neural. Inf. Process. Syst. 35, 22199\u201322213 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"9_CR19","unstructured":"Li, L.H., Yatskar, M., Yin, D., Hsieh, C.J., Chang, K.W.: VisualBERT: a simple and performant baseline for vision and language. arXiv preprint arXiv:1908.03557 (2019)"},{"key":"9_CR20","unstructured":"Liang, P.P., et al.: MultiViz: towards visualizing and understanding multimodal models. In: The Eleventh International Conference on Learning Representations (2022)"},{"key":"9_CR21","doi-asserted-by":"crossref","unstructured":"Lin, B.Y., Chen, X., Chen, J., Ren, X.: KagNet: knowledge-aware graph networks for commonsense reasoning. arXiv preprint arXiv:1909.02151 (2019)","DOI":"10.18653\/v1\/D19-1282"},{"key":"9_CR22","unstructured":"Lin, C.Y.: ROUGE: a package for automatic evaluation of summaries. In: Text Summarization Branches Out, pp. 74\u201381 (2004)"},{"issue":"8","key":"9_CR23","doi-asserted-by":"publisher","first-page":"7852","DOI":"10.1109\/TCYB.2021.3049537","volume":"52","author":"X Liu","year":"2021","unstructured":"Liu, X., Ji, Z., Pang, Y., Han, J., Li, X.: DGIG-Net: dynamic graph-in-graph networks for few-shot human-object interaction. IEEE Trans. Cybern. 52(8), 7852\u20137864 (2021)","journal-title":"IEEE Trans. Cybern."},{"key":"9_CR24","unstructured":"Loshchilov, I., Hutter, F.: Decoupled weight decay regularization. arXiv preprint arXiv:1711.05101 (2017)"},{"key":"9_CR25","first-page":"5775","volume":"35","author":"C Lu","year":"2022","unstructured":"Lu, C., Zhou, Y., Bao, F., Chen, J., Li, C., Zhu, J.: DPM-solver: a fast ODE solver for diffusion probabilistic model sampling in around 10 steps. Adv. Neural. Inf. Process. Syst. 35, 5775\u20135787 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"9_CR26","first-page":"2507","volume":"35","author":"P Lu","year":"2022","unstructured":"Lu, P., et al.: Learn to explain: multimodal reasoning via thought chains for science question answering. Adv. Neural. Inf. Process. Syst. 35, 2507\u20132521 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"9_CR27","unstructured":"Lu, P., et al.: Chameleon: plug-and-play compositional reasoning with large language models. Adv. Neural Inf. Process. Syst. 36 (2024)"},{"key":"9_CR28","doi-asserted-by":"crossref","unstructured":"Pan, S., Luo, L., Wang, Y., Chen, C., Wang, J., Wu, X.: Unifying large language models and knowledge graphs: a roadmap. IEEE Trans. Knowl. Data Eng. (2024)","DOI":"10.1109\/TKDE.2024.3352100"},{"key":"9_CR29","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.J.: BLEU: a method for automatic evaluation of machine translation. In: Proceedings of the 40th annual meeting of the Association for Computational Linguistics, pp. 311\u2013318 (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"9_CR30","doi-asserted-by":"crossref","unstructured":"Patro, B., Patel, S., Namboodiri, V.: Robust explanations for visual question answering. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 1577\u20131586 (2020)","DOI":"10.1109\/WACV45572.2020.9093295"},{"key":"9_CR31","doi-asserted-by":"crossref","unstructured":"Peebles, W., Xie, S.: Scalable diffusion models with transformers. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 4195\u20134205 (2023)","DOI":"10.1109\/ICCV51070.2023.00387"},{"key":"9_CR32","unstructured":"Petroni, F., et al.: Language models as knowledge bases? arXiv preprint arXiv:1909.01066 (2019)"},{"key":"9_CR33","unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning, pp. 8748\u20138763. PMLR (2021)"},{"issue":"1","key":"9_CR34","first-page":"5485","volume":"21","author":"C Raffel","year":"2020","unstructured":"Raffel, C., et al.: Exploring the limits of transfer learning with a unified text-to-text transformer. J. Mach. Learn. Res. 21(1), 5485\u20135551 (2020)","journal-title":"J. Mach. Learn. Res."},{"key":"9_CR35","doi-asserted-by":"crossref","unstructured":"Ribeiro, M.T., Singh, S., Guestrin, C.: \u201cWhy should i trust you?\u201d Explaining the predictions of any classifier. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, pp. 1135\u20131144 (2016)","DOI":"10.1145\/2939672.2939778"},{"key":"9_CR36","doi-asserted-by":"crossref","unstructured":"Rombach, R., Blattmann, A., Lorenz, D., Esser, P., Ommer, B.: High-resolution image synthesis with latent diffusion models. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10684\u201310695 (2022)","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"9_CR37","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"351","DOI":"10.1007\/978-3-031-19775-8_21","volume-title":"Computer Vision \u2013 ECCV 2022","author":"D Rymarczyk","year":"2022","unstructured":"Rymarczyk, D., Struski, \u0141, G\u00f3rszczak, M., Lewandowska, K., Tabor, J., Zieli\u0144ski, B.: Interpretable image classification with differentiable prototypes assignment. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13672, pp. 351\u2013368. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19775-8_21"},{"key":"9_CR38","unstructured":"Sohl-Dickstein, J., Weiss, E., Maheswaranathan, N., Ganguli, S.: Deep unsupervised learning using nonequilibrium thermodynamics. In: International Conference on Machine Learning, pp. 2256\u20132265. PMLR (2015)"},{"key":"9_CR39","unstructured":"Touvron, H., et\u00a0al.: LLaAMA: open and efficient foundation language models. arXiv preprint arXiv:2302.13971 (2023)"},{"key":"9_CR40","unstructured":"Vaswani, A., et al.: Attention is all you need. Adv. Neural Inf. Process. Syst. 30 (2017)"},{"key":"9_CR41","doi-asserted-by":"crossref","unstructured":"Wang, B., Pei, W., Xue, B., Zhang, M.: A multi-objective genetic algorithm to evolving local interpretable model-agnostic explanations for deep neural networks in image classification. IEEE Trans. Evol. Comput. (2022)","DOI":"10.1145\/3449726.3459452"},{"key":"9_CR42","first-page":"24824","volume":"35","author":"J Wei","year":"2022","unstructured":"Wei, J., et al.: Chain-of-thought prompting elicits reasoning in large language models. Adv. Neural. Inf. Process. Syst. 35, 24824\u201324837 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"9_CR43","doi-asserted-by":"crossref","unstructured":"Whitehead, S., Wu, H., Ji, H., Feris, R., Saenko, K.: Separating skills and concepts for novel visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5632\u20135641 (2021)","DOI":"10.1109\/CVPR46437.2021.00558"},{"key":"9_CR44","unstructured":"Wu, J., Chen, L., Mooney, R.J.: Improving vqa and its explanations$$\\backslash $$by comparing competing explanations. arXiv preprint arXiv:2006.15631 (2020)"},{"key":"9_CR45","doi-asserted-by":"crossref","unstructured":"Wu, J., Mooney, R.J.: Faithful multimodal explanation for visual question answering. arXiv preprint arXiv:1809.02805 (2018)","DOI":"10.18653\/v1\/W19-4812"},{"issue":"11","key":"9_CR46","doi-asserted-by":"publisher","first-page":"1778","DOI":"10.3390\/electronics11111778","volume":"11","author":"Q Xia","year":"2022","unstructured":"Xia, Q., Yu, C., Hou, Y., Peng, P., Zheng, Z., Chen, W.: Multi-modal alignment of visual question answering based on multi-hop attention mechanism. Electronics 11(11), 1778 (2022)","journal-title":"Electronics"},{"key":"9_CR47","doi-asserted-by":"crossref","unstructured":"Yasunaga, M., Ren, H., Bosselut, A., Liang, P., Leskovec, J.: QA-GNN: reasoning with language models and knowledge graphs for question answering. arXiv preprint arXiv:2104.06378 (2021)","DOI":"10.18653\/v1\/2021.naacl-main.45"},{"key":"9_CR48","doi-asserted-by":"crossref","unstructured":"Yu, Z., Yu, J., Cui, Y., Tao, D., Tian, Q.: Deep modular co-attention networks for visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6281\u20136290 (2019)","DOI":"10.1109\/CVPR.2019.00644"},{"key":"9_CR49","unstructured":"Zhang, R., et al.: Llama-adapter: efficient fine-tuning of language models with zero-init attention. arXiv preprint arXiv:2303.16199 (2023)"},{"key":"9_CR50","doi-asserted-by":"publisher","first-page":"70","DOI":"10.1016\/j.inffus.2021.02.006","volume":"72","author":"W Zhang","year":"2021","unstructured":"Zhang, W., Yu, J., Zhao, W., Ran, C.: DMRFNet: deep multimodal reasoning and fusion for visual question answering and explanation generation. Inf. Fusion 72, 70\u201379 (2021)","journal-title":"Inf. Fusion"},{"key":"9_CR51","unstructured":"Zhang, X., et al.: GreaseLM: graph REASoning enhanced language models. In: International Conference on Learning Representations (2021)"},{"key":"9_CR52","unstructured":"Zhang, Z., Zhang, A., Li, M., Smola, A.: Automatic chain of thought prompting in large language models. arXiv preprint arXiv:2210.03493 (2022)"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-72855-6_9","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,12,1]],"date-time":"2024-12-01T01:11:20Z","timestamp":1733015480000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-72855-6_9"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,9]]},"ISBN":["9783031728549","9783031728556"],"references-count":52,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-72855-6_9","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,11,9]]},"assertion":[{"value":"9 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}