{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,25]],"date-time":"2026-04-25T11:11:32Z","timestamp":1777115492589,"version":"3.51.4"},"reference-count":74,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2025,1,1]],"date-time":"2025-01-01T00:00:00Z","timestamp":1735689600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2025]]},"DOI":"10.1109\/access.2025.3609656","type":"journal-article","created":{"date-parts":[[2025,9,12]],"date-time":"2025-09-12T17:31:22Z","timestamp":1757698282000},"page":"160411-160437","source":"Crossref","is-referenced-by-count":4,"title":["(GRAVITY) Graph-Based Reasoning With Attention and Visual Information Using Transformers for Yielding Answers"],"prefix":"10.1109","volume":"13","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2307-0920","authenticated-orcid":false,"given":"Hassan Nazeer","family":"Chaudhry","sequence":"first","affiliation":[{"name":"Department of Electronics, Information and Bioengineering, Politecnico di Milano, Milan, Italy"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0382-5724","authenticated-orcid":false,"given":"Farzana","family":"Kulsoom","sequence":"additional","affiliation":[{"name":"Department of Telecommunication, University of Engineering and Technology, Taxila, Pakistan"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-4038-9477","authenticated-orcid":false,"given":"Zahid","family":"Ullah Khan","sequence":"additional","affiliation":[{"name":"College of Information and Communication Engineering, Harbin Engineering University, Harbin, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46478-7_28"},{"key":"ref3","first-page":"1","article-title":"Design and development of visual question answering model for the visually impaired","volume-title":"Proc. Int. Conf. Recent Adv. Sci. Eng. Technol. (ICRASET)","author":"Shruthi"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v38i5.28253"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1007\/s00521-022-07665-9"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1002\/spe.2846"},{"issue":"1","key":"ref7","article-title":"Visual question answering: A survey","volume":"8","author":"Assem","year":"2023","journal-title":"Future Comput. Informat. J."},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.9"},{"key":"ref9","first-page":"361","article-title":"Multimodal residual learning for visual QA","volume-title":"Proc. 30th Int. Conf. Neural Inf. Process. Syst. (NIPS)","author":"Kim"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-4012"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2577031"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.499"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240513"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.10"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.344"},{"key":"ref17","first-page":"8334","article-title":"Learning conditioned graph structures for interpretable visual question answering","volume-title":"Proc. Adv. Neural Inf. Process. Syst. (NeurIPS)","author":"Norcliffe-Brown"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICNLP55136.2022.00078"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00049"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.3390\/rs13071404"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00178"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/IJCNN.2005.1555942"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TNN.2008.2005605"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3476969"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1016\/j.inffus.2021.02.006"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/153"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01041"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1007\/s11063-021-10689-2"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3132034"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-024-02066-y"},{"key":"ref31","article-title":"Graph attention networks","author":"Veli\u010dkovi\u0107","year":"2017","journal-title":"arXiv:1710.10903"},{"key":"ref32","article-title":"Attention is all you need","author":"Vaswani","year":"2017","journal-title":"arXiv:1706.03762"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00444"},{"key":"ref34","article-title":"Bilinear attention networks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Kim"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00680"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00644"},{"key":"ref37","article-title":"ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Lu"},{"key":"ref38","article-title":"Multimodal unified attention networks for vision-and-language interactions","author":"Yu","year":"2019","journal-title":"arXiv:1908.04107"},{"key":"ref39","first-page":"3070","article-title":"Multimodal graph networks for compositional generalization in visual question answering","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"33","author":"Saqur"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413977"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01028"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"ref43","article-title":"UNIMO: Towards unified-modal understanding and generation via cross-modal contrastive learning","author":"Li","year":"2020","journal-title":"arXiv:2012.15409"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.maiworkshop-1.12"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1145\/3459637.3482218"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3104937"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-88361-4_7"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00208"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/ICME52920.2022.9859591"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.108883"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-acl.188"},{"key":"ref52","article-title":"MGA-VQA: Multi-granularity alignment for visual question answering","author":"Xiong","year":"2022","journal-title":"arXiv:2201.10656"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2022.108980"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1007\/s10489-022-04355-w"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1016\/j.knosys.2023.110706"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.110084"},{"key":"ref57","article-title":"VQA-GNN: Reasoning with multimodal knowledge via graph neural networks for visual question answering","author":"Wang","year":"2022","journal-title":"arXiv:2205.11501"},{"key":"ref58","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref59","first-page":"9694","article-title":"Align before fuse: Vision and language representation learning with momentum distillation","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Li"},{"key":"ref60","first-page":"23716","article-title":"Flamingo: A visual language model for few-shot learning","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","author":"Alayrac"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2023.3238524"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00686"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.215"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00331"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2754246"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00851"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00439"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01001"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01605"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00864"},{"key":"ref72","article-title":"Compositional attention networks for machine reasoning","author":"Hudson","year":"2018","journal-title":"arXiv:1803.03067"},{"key":"ref73","first-page":"5901","article-title":"Learning by abstraction: The neural state machine","volume-title":"Proc. Adv. Neural Inf. Process. Syst.","volume":"32","author":"Hudson"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr.2019.00857"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/6287639\/10820123\/11162515.pdf?arnumber=11162515","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,30]],"date-time":"2025-09-30T12:24:56Z","timestamp":1759235096000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/11162515\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025]]},"references-count":74,"URL":"https:\/\/doi.org\/10.1109\/access.2025.3609656","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025]]}}}