{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,8]],"date-time":"2026-04-08T17:02:53Z","timestamp":1775667773663,"version":"3.50.1"},"reference-count":47,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2023,8,4]],"date-time":"2023-08-04T00:00:00Z","timestamp":1691107200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,8,4]],"date-time":"2023-08-04T00:00:00Z","timestamp":1691107200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"Chongqing Postgraduate Joint Training Base Project","award":["2019-45"],"award-info":[{"award-number":["2019-45"]}]},{"name":"PhD Start-up Fund\/Talent Introduction Project of Chongqing Normal University","award":["21XLB032"],"award-info":[{"award-number":["21XLB032"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Multimed Info Retr"],"published-print":{"date-parts":[[2023,12]]},"DOI":"10.1007\/s13735-023-00283-8","type":"journal-article","created":{"date-parts":[[2023,8,4]],"date-time":"2023-08-04T08:02:01Z","timestamp":1691136121000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Dual-feature collaborative relation-attention networks for visual question answering"],"prefix":"10.1007","volume":"12","author":[{"given":"Lu","family":"Yao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"You","family":"Yang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Juntao","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,8,4]]},"reference":[{"key":"283_CR1","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C, et\u00a0al. (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6077\u20136086","DOI":"10.1109\/CVPR.2018.00636"},{"key":"283_CR2","doi-asserted-by":"crossref","unstructured":"Antol S, Agrawal A, Lu J, et\u00a0al. (2015) Vqa: visual question answering. In: Proceedings of the IEEE international conference on computer vision, pp 2425\u20132433","DOI":"10.1109\/ICCV.2015.279"},{"key":"283_CR3","unstructured":"Ba JL, Kiros JR, Hinton GE (2016) Layer normalization. arXiv preprint arXiv:1607.06450"},{"key":"283_CR4","unstructured":"Bahdanau D, Cho K, Bengio Y (2014) Neural machine translation by jointly learning to align and translate. arXiv preprint arXiv:1409.0473"},{"key":"283_CR5","doi-asserted-by":"crossref","unstructured":"Carion N, Massa F, Synnaeve G, et\u00a0al. (2020) End-to-end object detection with transformers. In: European conference on computer vision, pp 213\u2013229","DOI":"10.1007\/978-3-030-58452-8_13"},{"key":"283_CR6","unstructured":"Gao H, Mao J, Zhou J, et\u00a0al. (2015) Are you talking to a machine? Dataset and methods for multilingual image question answering. In: Neural Information Processing Systems. MIT Press, pp 2296-2304"},{"key":"283_CR7","doi-asserted-by":"crossref","unstructured":"Goyal Y, Khot T, Summers-Stay D, et\u00a0al. (2017) Making the v in VQA matter: elevating the role of image understanding in visual question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 6904\u20136913","DOI":"10.1109\/CVPR.2017.670"},{"key":"283_CR8","doi-asserted-by":"crossref","unstructured":"Guo L, Liu J, Zhu X, et\u00a0al. (2020) Normalized and geometry-aware self-attention network for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 10,327\u201310,336","DOI":"10.1109\/CVPR42600.2020.01034"},{"key":"283_CR9","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, et\u00a0al. (2016) Deep residual learning for image recognition. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"key":"283_CR10","unstructured":"Heo B, Chun S, Oh SJ, et\u00a0al. (2021) Adamp: slowing down the slowdown for momentum optimizers on scale-invariant weights. In: International Conference on Learning Representations"},{"key":"283_CR11","doi-asserted-by":"crossref","unstructured":"Hu H, Gu J, Zhang Z, et\u00a0al. (2018) Relation networks for object detection. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 3588\u20133597","DOI":"10.1109\/CVPR.2018.00378"},{"key":"283_CR12","doi-asserted-by":"crossref","unstructured":"Huang L, Wang W, Chen J, et\u00a0al. (2019) Attention on attention for image captioning. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp 4634\u20134643","DOI":"10.1109\/ICCV.2019.00473"},{"key":"283_CR13","doi-asserted-by":"crossref","unstructured":"Jiang H, Misra I, Rohrbach M, et\u00a0al. (2020) In defense of grid features for visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp 10,267\u201310,276","DOI":"10.1109\/CVPR42600.2020.01028"},{"key":"283_CR14","unstructured":"Kim JH, Jun J, Zhang BT (2018) Bilinear attention networks. In: Neural Information Processing Systems, pp 1571\u20131581"},{"issue":"1","key":"283_CR15","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna R, Zhu Y, Groth O et al (2017) Visual genome: Connecting language and vision using crowdsourced dense image annotations. Int J Comput Vis 123(1):32\u201373","journal-title":"Int J Comput Vis"},{"key":"283_CR16","doi-asserted-by":"crossref","unstructured":"Lin TY, Maire M, Belongie S, et\u00a0al. (2014) Microsoft coco: common objects in context. In: European conference on computer vision, pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"issue":"107","key":"283_CR17","first-page":"956","volume":"117","author":"Y Liu","year":"2021","unstructured":"Liu Y, Zhang X, Zhang Q et al (2021) Dual self-attention with co-attention networks for visual question answering. Pattern Recognit 117(107):956","journal-title":"Pattern Recognit"},{"key":"283_CR18","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/TMM.2022.3197364","volume":"2022","author":"Y Liu","year":"2022","unstructured":"Liu Y, Wei W, Peng D et al (2022) Depth-aware and semantic guided relational attention network for visual question answering. IEEE Trans Multimed 2022:1\u201314","journal-title":"IEEE Trans Multimed"},{"key":"283_CR19","unstructured":"Lu J, Yang J, Batra D, et\u00a0al. (2016) Hierarchical question-image co-attention for visual question answering. In: Neural information processing systems, pp 289\u2013297"},{"key":"283_CR20","first-page":"2286","volume":"35","author":"Y Luo","year":"2021","unstructured":"Luo Y, Ji J, Sun X et al (2021) Dual-level collaborative transformer for image captioning. Proc AAAI Conf Artif Intell 35:2286\u20132293","journal-title":"Proc AAAI Conf Artif Intell"},{"key":"283_CR21","doi-asserted-by":"crossref","unstructured":"Malinowski M, Rohrbach M, Fritz M (2015) Ask your neurons: A neural-based approach to answering questions about images. In: Proceedings of the IEEE international conference on computer vision, pp 1\u20139","DOI":"10.1109\/ICCV.2015.9"},{"key":"283_CR22","first-page":"1","volume":"2022","author":"A Mao","year":"2022","unstructured":"Mao A, Yang Z, Lin K et al (2022) Positional attention guided transformer-like architecture for visual question answering. IEEE Trans Multimed 2022:1\u201313","journal-title":"IEEE Trans Multimed"},{"key":"283_CR23","unstructured":"Nguyen DK, Goswami V, Chen X (2021) Movie: revisiting modulated convolutions for visual counting and beyond. In: International conference on learning representations"},{"key":"283_CR24","doi-asserted-by":"crossref","unstructured":"Nguyen VQ, Suganuma M, Okatani T (2022) Grit: Faster and better image captioning transformer using dual visual features. arXiv preprint arXiv:2207.09666","DOI":"10.1007\/978-3-031-20059-5_10"},{"issue":"1","key":"283_CR25","doi-asserted-by":"publisher","first-page":"318","DOI":"10.1109\/TPAMI.2020.3004830","volume":"44","author":"L Peng","year":"2020","unstructured":"Peng L, Yang Y, Wang Z et al (2020) MRA-net: improving VQA via multi-modal relation attention network. IEEE Trans Pattern Anal Mach Intell 44(1):318\u2013329","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"issue":"4","key":"283_CR26","first-page":"1644","volume":"34","author":"L Peng","year":"2022","unstructured":"Peng L, Yang Y, Zhang X et al (2022) Answer again: improving VQA with cascaded-answering model. IEEE Trans Knowl Data Eng 34(4):1644\u20131655","journal-title":"IEEE Trans Knowl Data Eng"},{"key":"283_CR27","doi-asserted-by":"crossref","unstructured":"Pennington J, Socher R, Manning CD (2014) Glove: Global vectors for word representation. In: EMNLP, pp 1532\u20131543","DOI":"10.3115\/v1\/D14-1162"},{"key":"283_CR28","doi-asserted-by":"crossref","unstructured":"Rahman T, Chou SH, Sigal L, et\u00a0al. (2021) An improved attention for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 1653\u20131662","DOI":"10.1109\/CVPRW53098.2021.00181"},{"key":"283_CR29","unstructured":"Ren M, Kiros R, Zemel RS (2015a) Exploring models and data for image question answering. In: Neural information processing systems, pp 2953\u20132961"},{"key":"283_CR30","unstructured":"Ren S, He K, Girshick RB, et\u00a0al. (2015b) Faster r-CNN: towards real-time object detection with region proposal networks. In: Neural information processing systems, pp 91\u201399"},{"key":"283_CR31","doi-asserted-by":"crossref","unstructured":"Teney D, Anderson P, He X, et\u00a0al. (2018) Tips and tricks for visual question answering: Learnings from the 2017 challenge. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 4223\u20134232","DOI":"10.1109\/CVPR.2018.00444"},{"key":"283_CR32","unstructured":"Vaswani A, Shazeer N, Parmar N, et\u00a0al. (2017) Attention is all you need. In: Neural information processing systems, pp 6000\u20136010"},{"key":"283_CR33","doi-asserted-by":"crossref","unstructured":"Wu C, Liu J, Wang X, et\u00a0al. (2018a) Chain of reasoning for visual question answering. In: Neural Information Processing Systems, pp 273\u2013283","DOI":"10.1109\/CCIS.2018.8691361"},{"key":"283_CR34","doi-asserted-by":"crossref","unstructured":"Wu C, Liu J, Wang X, et\u00a0al. (2018b) Object-difference attention: a simple relational attention for visual question answering. In: Proceedings of the 26th ACM international conference on multimedia, pp 519\u2013527","DOI":"10.1145\/3240508.3240513"},{"key":"283_CR35","doi-asserted-by":"crossref","unstructured":"Wu M, Zhang X, Sun X, et\u00a0al. (2022) Difnet: Boosting visual information flow for image captioning. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 18,020\u201318,029","DOI":"10.1109\/CVPR52688.2022.01749"},{"key":"283_CR36","doi-asserted-by":"publisher","first-page":"21","DOI":"10.1016\/j.cviu.2017.05.001","volume":"163","author":"Q Wu","year":"2017","unstructured":"Wu Q, Teney D, Wang P et al (2017) Visual question answering: a survey of methods and datasets. Comput Vis Image Underst 163:21\u201340","journal-title":"Comput Vis Image Underst"},{"key":"283_CR37","doi-asserted-by":"crossref","unstructured":"Xie S, Girshick R, Doll\u00e1r P, et\u00a0al. (2017) Aggregated residual transformations for deep neural networks. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 1492\u20131500","DOI":"10.1109\/CVPR.2017.634"},{"key":"283_CR38","doi-asserted-by":"crossref","unstructured":"Yang X, Gao C, Zhang H, et\u00a0al. (2021) Auto-parsing network for image captioning and visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 2197\u20132207","DOI":"10.1109\/ICCV48922.2021.00220"},{"key":"283_CR39","doi-asserted-by":"crossref","unstructured":"Yang Z, He X, Gao J, et\u00a0al. (2016) Stacked attention networks for image question answering. In: Proceedings of the IEEE conference on computer vision and pattern recognition, pp 21\u201329","DOI":"10.1109\/CVPR.2016.10"},{"issue":"12","key":"283_CR40","doi-asserted-by":"publisher","first-page":"4467","DOI":"10.1109\/TCSVT.2019.2947482","volume":"30","author":"J Yu","year":"2020","unstructured":"Yu J, Li J, Yu Z et al (2020) Multimodal transformer with multi-view visual representation for image captioning. IEEE Trans Circuits Syst Video Technol 30(12):4467\u20134480","journal-title":"IEEE Trans Circuits Syst Video Technol"},{"key":"283_CR41","doi-asserted-by":"crossref","unstructured":"Yu Z, Yu J, Cui Y, et\u00a0al. (2019) Deep modular co-attention networks for visual question answering. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 6281\u20136290","DOI":"10.1109\/CVPR.2019.00644"},{"key":"283_CR42","doi-asserted-by":"crossref","unstructured":"Yu Z, Cui Y, Yu J, et\u00a0al. (2020b) Deep multimodal neural architecture search. In: Proceedings of the 28th ACM International Conference on Multimedia, pp 3743\u20133752","DOI":"10.1145\/3394171.3413977"},{"key":"283_CR43","unstructured":"Zeng Y, Zhang X, Li H (2022) Multi-grained vision language pre-training: aligning texts with visual concepts. In: International Conference on Machine Learning, PMLR, pp 25,994\u201326,009"},{"key":"283_CR44","doi-asserted-by":"crossref","unstructured":"Zhang S, Chen M, Chen J et al (2021) Multimodal feature-wise co-attention method for visual question answering. Inf Fusion 73:1\u201310","DOI":"10.1016\/j.inffus.2021.02.022"},{"key":"283_CR45","doi-asserted-by":"crossref","unstructured":"Zhang X, Sun X, Luo Y, et\u00a0al. (2021b) Rstnet: Captioning with adaptive attention on visual and non-visual words. In: Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition, pp 15,465\u201315,474","DOI":"10.1109\/CVPR46437.2021.01521"},{"key":"283_CR46","doi-asserted-by":"crossref","unstructured":"Zhou Y, Ji R, Sun X, et\u00a0al. (2020) K-armed bandit based multi-modal network architecture search for visual question answering. In: Proceedings of the 28th ACM international conference on multimedia, pp 1245\u20131254","DOI":"10.1145\/3394171.3413998"},{"key":"283_CR47","doi-asserted-by":"crossref","unstructured":"Zhou Y, Ren T, Zhu C, et\u00a0al. (2021) Trar: routing the attention spans in transformer for visual question answering. In: Proceedings of the IEEE\/CVF international conference on computer vision, pp 2074\u20132084","DOI":"10.1109\/ICCV48922.2021.00208"}],"container-title":["International Journal of Multimedia Information Retrieval"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s13735-023-00283-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s13735-023-00283-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s13735-023-00283-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,12,18]],"date-time":"2023-12-18T12:40:00Z","timestamp":1702903200000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s13735-023-00283-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,8,4]]},"references-count":47,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2023,12]]}},"alternative-id":["283"],"URL":"https:\/\/doi.org\/10.1007\/s13735-023-00283-8","relation":{},"ISSN":["2192-6611","2192-662X"],"issn-type":[{"value":"2192-6611","type":"print"},{"value":"2192-662X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,8,4]]},"assertion":[{"value":"7 October 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 May 2023","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 June 2023","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"4 August 2023","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"This manuscript is approved by all authors for publication. And there is no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"20"}}