{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,27]],"date-time":"2026-07-27T11:59:44Z","timestamp":1785153584471,"version":"3.55.0"},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2024,5,28]],"date-time":"2024-05-28T00:00:00Z","timestamp":1716854400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,5,28]],"date-time":"2024-05-28T00:00:00Z","timestamp":1716854400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key R &D Program of China","doi-asserted-by":"crossref","award":["2020YFC1512601"],"award-info":[{"award-number":["2020YFC1512601"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62106064"],"award-info":[{"award-number":["62106064"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2025,1]]},"DOI":"10.1007\/s00371-024-03346-x","type":"journal-article","created":{"date-parts":[[2024,5,28]],"date-time":"2024-05-28T19:01:32Z","timestamp":1716922892000},"page":"549-562","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":5,"title":["Modular dual-stream visual fusion network for visual question answering"],"prefix":"10.1007","volume":"41","author":[{"given":"Lixia","family":"Xue","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenhao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ronggui","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Juan","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,5,28]]},"reference":[{"key":"3346_CR1","doi-asserted-by":"crossref","unstructured":"Rahman, T., Xu, B., Sigal, L.: Watch, listen and tell: multi-modal weakly supervised dense event captioning. In: 2019 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 8907\u20138916 (2019)","DOI":"10.1109\/ICCV.2019.00900"},{"key":"3346_CR2","doi-asserted-by":"publisher","first-page":"38438","DOI":"10.1109\/ACCESS.2020.2975594","volume":"8","author":"Z Ji","year":"2020","unstructured":"Ji, Z., Lin, Z., Wang, H., He, Y.: Multi-modal memory enhancement attention network for image-text matching. IEEE Access 8, 38438\u201338447 (2020)","journal-title":"IEEE Access"},{"key":"3346_CR3","doi-asserted-by":"crossref","unstructured":"Diao, H., Zhang, Y., Ma, L., Lu, H.: Similarity reasoning and filtration for image-text matching. In: AAAI Conference on Artificial Intelligence (2021)","DOI":"10.1609\/aaai.v35i2.16209"},{"key":"3346_CR4","doi-asserted-by":"crossref","unstructured":"Anderson, P., Fernando, B., Johnson, M., Gould, S.: Spice: semantic propositional image caption evaluation. In: European Conference on Computer Vision (2016)","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"3346_CR5","doi-asserted-by":"crossref","unstructured":"Cornia, M., Stefanini, M., Baraldi, L., Cucchiara, R.: Meshed-memory transformer for image captioning. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 10575\u201310584 (2019)","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"3346_CR6","doi-asserted-by":"crossref","unstructured":"Luo, Y., Ji, J., Sun, X., Cao, L., Wu, Y., Huang, F., Lin, C.-W., Ji, R.: Dual-level collaborative transformer for image captioning. arXiv:2101.06462 (2021)","DOI":"10.1609\/aaai.v35i3.16328"},{"key":"3346_CR7","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Ren, T., Zhu, C., Sun, X., Liu, J., Ding, X.-h., Xu, M., Ji, R.: Trar: Routing the attention spans in transformer for visual question answering. In: 2021 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 2054\u20132064 (2021)","DOI":"10.1109\/ICCV48922.2021.00208"},{"key":"3346_CR8","doi-asserted-by":"crossref","unstructured":"Yu, Z., Yu, J., Cui, Y., Tao, D., Tian, Q.: Deep modular co-attention networks for visual question answering. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6274\u20136283 (2019)","DOI":"10.1109\/CVPR.2019.00644"},{"key":"3346_CR9","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TGRS.2022.3225843","volume":"60","author":"X Zheng","year":"2022","unstructured":"Zheng, X., Wang, B., Du, X., Lu, X.: Mutual attention inception network for remote sensing visual question answering. IEEE Trans. Geosci. Remote Sens. 60, 1\u201314 (2022)","journal-title":"IEEE Trans. Geosci. Remote Sens."},{"key":"3346_CR10","unstructured":"Kim, J.-H., Lee, S.-W., Kwak, D., Heo, M.-O., Kim, J., Ha, J.-W., Zhang, B.-T.: Multimodal residual learning for visual qa. In: NIPS (2016)"},{"key":"3346_CR11","unstructured":"Chen, K., Wang, J., Chen, L.-C., Gao, H., Xu, W., Nevatia, R.: Abc-cnn: An attention based convolutional neural network for visual question answering. arXiv:1511.05960 (2015)"},{"key":"3346_CR12","doi-asserted-by":"publisher","first-page":"1137","DOI":"10.1109\/TPAMI.2016.2577031","volume":"39","author":"S Ren","year":"2015","unstructured":"Ren, S., He, K., Girshick, R.B., Sun, J.: Faster r-cnn: towards real-time object detection with region proposal networks. IEEE Trans. Pattern Anal. Mach. Intell. 39, 1137\u20131149 (2015)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"3346_CR13","doi-asserted-by":"crossref","unstructured":"Jiang, H., Misra, I., Rohrbach, M., Learned-Miller, E.G., Chen, X.: In defense of grid features for visual question answering. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 10264\u201310273 (2020)","DOI":"10.1109\/CVPR42600.2020.01028"},{"key":"3346_CR14","doi-asserted-by":"crossref","unstructured":"Shih, K.J., Singh, S., Hoiem, D.: Where to look: Focus regions for visual question answering. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4613\u20134621 (2015)","DOI":"10.1109\/CVPR.2016.499"},{"key":"3346_CR15","doi-asserted-by":"crossref","unstructured":"Zhou, Y., Ji, R., Sun, X., Luo, G., Hong, X., Su, J., Ding, X., Shao, L.: K-armed bandit based multi-modal network architecture search for visual question answering. In: Proceedings of the 28th ACM International Conference on Multimedia (2020)","DOI":"10.1145\/3394171.3413998"},{"key":"3346_CR16","doi-asserted-by":"crossref","unstructured":"Ben-younes, H., Cad\u00e8ne, R., Cord, M., Thome, N.: Mutan: multimodal tucker fusion for visual question answering. In: 2017 IEEE International Conference on Computer Vision (ICCV), pp. 2631\u20132639 (2017)","DOI":"10.1109\/ICCV.2017.285"},{"key":"3346_CR17","doi-asserted-by":"crossref","unstructured":"Ben-younes, H., Cad\u00e8ne, R., Thome, N., Cord, M.: BLOCK: Bilinear Superdiagonal Fusion for Visual Question Answering and Visual Relationship Detection (2019)","DOI":"10.1609\/aaai.v33i01.33018102"},{"key":"3346_CR18","doi-asserted-by":"publisher","first-page":"398","DOI":"10.1007\/s11263-018-1116-0","volume":"127","author":"Y Goyal","year":"2016","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., Parikh, D.: Making the v in vqa matter: elevating the role of image understanding in visual question answering. Int. J. Comput. Vis. 127, 398\u2013414 (2016)","journal-title":"Int. J. Comput. Vis."},{"key":"3346_CR19","doi-asserted-by":"crossref","unstructured":"Hudson, C.D. Drew A. Manning: Gqa: a new dataset for real-world visual reasoning and compositional question answering. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6693\u20136702 (2019)","DOI":"10.1109\/CVPR.2019.00686"},{"key":"3346_CR20","doi-asserted-by":"publisher","first-page":"4","DOI":"10.1007\/s11263-016-0966-6","volume":"123","author":"A Agrawal","year":"2015","unstructured":"Agrawal, A., Lu, J., Antol, S., Mitchell, M., Zitnick, C.L., Parikh, D., Batra, D.: Vqa: visual question answering. Int. J. Comput. Vis. 123, 4\u201331 (2015)","journal-title":"Int. J. Comput. Vis."},{"key":"3346_CR21","doi-asserted-by":"crossref","unstructured":"Yang, Z., He, X., Gao, J., Deng, L., Smola, A.: Stacked attention networks for image question answering. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 21\u201329 (2015)","DOI":"10.1109\/CVPR.2016.10"},{"key":"3346_CR22","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., Zhang, L.: Bottom-up and top-down attention for image captioning and visual question answering. In: 2018 IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 6077\u20136086 (2017)","DOI":"10.1109\/CVPR.2018.00636"},{"key":"3346_CR23","unstructured":"Lu, J., Yang, J., Batra, D., Parikh, D.: Hierarchical question-image co-attention for visual question answering. arXiv:1606.00061 (2016)"},{"key":"3346_CR24","doi-asserted-by":"publisher","first-page":"5947","DOI":"10.1109\/TNNLS.2018.2817340","volume":"29","author":"Z Yu","year":"2017","unstructured":"Yu, Z., Yu, J., Xiang, C., Fan, J., Tao, D.: Beyond bilinear: generalized multimodal factorized high-order pooling for visual question answering. IEEE Trans. Neural Netw. Learn. Syst. 29, 5947\u20135959 (2017)","journal-title":"IEEE Trans. Neural Netw. Learn. Syst."},{"key":"3346_CR25","unstructured":"Zhou, B., Tian, Y., Sukhbaatar, S., Szlam, A.D., Fergus, R.: Simple baseline for visual question answering. arXiv:1512.02167 (2015)"},{"key":"3346_CR26","doi-asserted-by":"crossref","unstructured":"Nam, H., Ha, J.-W., Kim, J.: Dual attention networks for multimodal reasoning and matching. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 2156\u20132164 (2016)","DOI":"10.1109\/CVPR.2017.232"},{"key":"3346_CR27","doi-asserted-by":"crossref","unstructured":"Gao, P., Jiang, Z., You, H., Lu, P., Hoi, S., Wang, X., Li, H.: Dynamic fusion with intra- and inter-modality attention flow for visual question answering. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6632\u20136641 (2018)","DOI":"10.1109\/CVPR.2019.00680"},{"key":"3346_CR28","unstructured":"Ren, M., Kiros, R., Zemel, R.S.: Exploring models and data for image question answering. In: NIPS (2015)"},{"key":"3346_CR29","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. CoRR arxiv:1412.6980 (2014)"},{"key":"3346_CR30","unstructured":"Kim, J.-H., Jun, J., Zhang, B.-T.: Bilinear attention networks. In: Neural Information Processing Systems (2018)"},{"key":"3346_CR31","doi-asserted-by":"crossref","unstructured":"Yu, Z., Cui, Y., Yu, J., Wang, M., Tao, D., Tian, Q.: Deep multimodal neural architecture search. In: Proceedings of the 28th ACM International Conference on Multimedia (2020)","DOI":"10.1145\/3394171.3413977"},{"key":"3346_CR32","doi-asserted-by":"crossref","unstructured":"Shen, X., Han, D., Chang, C.C., Zong, L.: Dual self-guided attention with sparse question networks for visual question answering. IEICE Trans. Inf. Syst. 105-D, 785\u2013796 (2022)","DOI":"10.1587\/transinf.2021EDP7189"},{"key":"3346_CR33","unstructured":"Xiong, P., You, Q., Yu, P., Liu, Z., Wu, Y.: Sa-vqa: structured alignment of visual and semantic representations for visual question answering. arXiv:2201.10654 (2022)"},{"key":"3346_CR34","doi-asserted-by":"crossref","unstructured":"Nguyen, T.K.L.T.H.T.E.T.Q.D.N.A. Binh X.\u00a0Do: Coarse-to-fine reasoning for visual question answering. In: 2022 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pp. 4557\u20134565 (2021)","DOI":"10.1109\/CVPRW56347.2022.00502"},{"key":"3346_CR35","unstructured":"Liang, F.R.A.N.T.G.T.G. Weixin\u00a0Niu: Lrta: a transparent neural-symbolic reasoning framework with modular supervision for visual question answering. arXiv:2011.10731 (2020)"},{"key":"3346_CR36","doi-asserted-by":"crossref","unstructured":"Hu, A.D.T.S.K. Ronghang\u00a0Rohrbach: Language-conditioned graph networks for relational reasoning. In: 2019 IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 10293\u201310302 (2019)","DOI":"10.1109\/ICCV.2019.01039"},{"key":"3346_CR37","doi-asserted-by":"crossref","unstructured":"Tan, M. Hao Hao\u00a0Bansal: Lxmert: learning cross-modality encoder representations from transformers. In: Conference on Empirical Methods in Natural Language Processing (2019)","DOI":"10.18653\/v1\/D19-1514"},{"key":"3346_CR38","doi-asserted-by":"crossref","unstructured":"Li, X.L.C.H.X.Z.P.Z.L.W.L.H.H.D.L.W.F.C.Y.G.J. Xiujun\u00a0Yin: Oscar: Object-semantics aligned pre-training for vision-language tasks. In: European Conference on Computer Vision (2020)","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"3346_CR39","unstructured":"Hudson, C.D. Drew A.\u00a0Manning: Learning by abstraction: the neural state machine. In: Neural Information Processing Systems (2019)"},{"key":"3346_CR40","doi-asserted-by":"crossref","unstructured":"Zhang, X.H.X.Y.J.Z.L.W.L.C.Y.G.J. Pengchuan\u00a0Li: Vinvl: revisiting visual representations in vision-language models. In: 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 5575\u20135584 (2021)","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"3346_CR41","doi-asserted-by":"publisher","DOI":"10.1016\/j.ipm.2022.103207","volume":"60","author":"Z Xu","year":"2023","unstructured":"Xu, Z., Gu, J., Liu, M., Zhou, G., Fu, H., Qiu, C.: A question-guided multi-hop reasoning graph network for visual question answering. Inf. Process. Manag. 60, 103207 (2023)","journal-title":"Inf. Process. Manag."}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03346-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-024-03346-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-024-03346-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,24]],"date-time":"2025-01-24T13:02:54Z","timestamp":1737723774000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-024-03346-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,5,28]]},"references-count":41,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2025,1]]}},"alternative-id":["3346"],"URL":"https:\/\/doi.org\/10.1007\/s00371-024-03346-x","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,5,28]]},"assertion":[{"value":"26 February 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 May 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"(check journal-specific guidelines for which heading to use).","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"All authors certify that they have no affiliations with or involvement in any organization or entity with any financial interest or non-financial interest in the subject matter or materials discussed in this manuscript.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Financial interest or non-financial interest"}}]}}