{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,18]],"date-time":"2026-07-18T22:19:53Z","timestamp":1784413193833,"version":"3.55.0"},"reference-count":198,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"8","license":[{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2024,8,1]],"date-time":"2024-08-01T00:00:00Z","timestamp":1722470400000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"National Key Research and Development Program of China","award":["2021YFB1715600"],"award-info":[{"award-number":["2021YFB1715600"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62137002"],"award-info":[{"award-number":["62137002"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U22B2019"],"award-info":[{"award-number":["U22B2019"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62306229"],"award-info":[{"award-number":["62306229"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62272372"],"award-info":[{"award-number":["62272372"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62293553"],"award-info":[{"award-number":["62293553"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62250066"],"award-info":[{"award-number":["62250066"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62202369"],"award-info":[{"award-number":["62202369"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Natural Science Basic Research Program of Shaanxi","award":["2023-JC-YB-593"],"award-info":[{"award-number":["2023-JC-YB-593"]}]},{"name":"Youth Innovation Team of Shaanxi Universities"},{"name":"Shaanxi Undergraduate and Higher Education Teaching Reform Research Program","award":["23BY195"],"award-info":[{"award-number":["23BY195"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Pattern Anal. Mach. Intell."],"published-print":{"date-parts":[[2024,8]]},"DOI":"10.1109\/tpami.2024.3366154","type":"journal-article","created":{"date-parts":[[2024,2,15]],"date-time":"2024-02-15T18:54:10Z","timestamp":1708023250000},"page":"5575-5594","source":"Crossref","is-referenced-by-count":45,"title":["Robust Visual Question Answering: Datasets, Methods, and Future Challenges"],"prefix":"10.1109","volume":"46","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7432-3238","authenticated-orcid":false,"given":"Jie","family":"Ma","sequence":"first","affiliation":[{"name":"Ministry of Education of Key Laboratory for Intelligent Networks and Network Security, School of Cyber Science and Engineering, Xi&#x2019;an Jiaotong University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5779-6108","authenticated-orcid":false,"given":"Pinghui","family":"Wang","sequence":"additional","affiliation":[{"name":"Ministry of Education of Key Laboratory for Intelligent Networks and Network Security, School of Cyber Science and Engineering, Xi&#x2019;an Jiaotong University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5273-8689","authenticated-orcid":false,"given":"Dechen","family":"Kong","sequence":"additional","affiliation":[{"name":"Ministry of Education of Key Laboratory for Intelligent Networks and Network Security, School of Automation Science and Engineering, Xi&#x2019;an Jiaotong University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9369-4109","authenticated-orcid":false,"given":"Zewei","family":"Wang","sequence":"additional","affiliation":[{"name":"Ministry of Education of Key Laboratory for Intelligent Networks and Network Security, School of Automation Science and Engineering, Xi&#x2019;an Jiaotong University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6004-0675","authenticated-orcid":false,"given":"Jun","family":"Liu","sequence":"additional","affiliation":[{"name":"Shannxi Provincial Key Laboratory of Big Data Knowledge Engineering, School of Computer Science and Technology, Xi&#x2019;an Jiaotong University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7157-9959","authenticated-orcid":false,"given":"Hongbin","family":"Pei","sequence":"additional","affiliation":[{"name":"Ministry of Education of Key Laboratory for Intelligent Networks and Network Security, School of Cyber Science and Engineering, Xi&#x2019;an Jiaotong University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3476-8248","authenticated-orcid":false,"given":"Junzhou","family":"Zhao","sequence":"additional","affiliation":[{"name":"Ministry of Education of Key Laboratory for Intelligent Networks and Network Security, School of Cyber Science and Engineering, Xi&#x2019;an Jiaotong University, Xi&#x2019;an, Shaanxi, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.279"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2017.06.005"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1080\/10447318.2022.2074667"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1145\/3556536"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/TIV.2022.3223131"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.215"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46478-7_41"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-023-01954-z"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01527"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW53098.2021.00181"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/tnnls.2021.3135655"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.670"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2754246"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00331"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00686"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/d16-1044"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v30i1.10442"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.10"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00209"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v36i3.20174"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00503"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00121"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-76298-0_52"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1145\/1376616.1376746"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2012.06.001"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2798607"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01046"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01438"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00501"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00522"},{"key":"ref32","first-page":"16292","article-title":"Introspective distillation for robust question answering","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Niu"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW59228.2023.00257"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/tpami.2023.3269429"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2023.3272224"},{"key":"ref36","first-page":"841","article-title":"RUBi: Reducing unimodal biases for visual question answering","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Cadene"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00502"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00280"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-emnlp.271"},{"key":"ref40","article-title":"Visual question answering: A survey on techniques and common trends in recent literature","author":"de Faria","year":"2023"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.3389\/frai.2019.00028"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1111\/lnc3.12417"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.217"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2708709"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3097180"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-demos.6"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-short.34"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6282"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.247"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3046683"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3094987"},{"key":"ref52","article-title":"VisualBERT: A simple and performant baseline for vision and language","author":"Li","year":"2019"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_7"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6795"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00160"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00380"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.15625\/1813-9663\/18157"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-emnlp.176"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-acl.196"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_26"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/tmm.2023.3234436"},{"key":"ref62","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2019.2909864"},{"key":"ref63","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01009"},{"key":"ref64","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00090"},{"key":"ref65","doi-asserted-by":"publisher","DOI":"10.1109\/WACV56688.2023.00044"},{"key":"ref66","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33018076"},{"key":"ref67","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2928634"},{"key":"ref68","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01028"},{"key":"ref69","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.01041"},{"key":"ref70","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2021.3105284"},{"key":"ref71","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW56347.2022.00502"},{"key":"ref72","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3139234"},{"key":"ref73","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-short.10"},{"key":"ref74","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.542"},{"key":"ref75","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2017.10.001"},{"key":"ref76","first-page":"1682","article-title":"A multi-world approach to question answering about real-world scenes based on uncertain input","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Malinowski"},{"key":"ref77","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"ref78","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.774"},{"key":"ref79","doi-asserted-by":"publisher","DOI":"10.1145\/2812802"},{"key":"ref80","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"ref81","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3210780"},{"key":"ref82","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475492"},{"key":"ref83","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3462981"},{"key":"ref84","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01124"},{"key":"ref85","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01123"},{"key":"ref86","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00681"},{"key":"ref87","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00205"},{"key":"ref88","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00971"},{"key":"ref89","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58589-1_23"},{"key":"ref90","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1514"},{"key":"ref91","first-page":"2296","article-title":"Are you talking to a machine? Dataset and methods for multilingual image question answering","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Gao"},{"key":"ref92","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.540"},{"key":"ref93","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1238"},{"key":"ref94","first-page":"6149","article-title":"Fakeddit: A new multimodal benchmark dataset for fine-grained fake news detection","volume-title":"Proc. Lang. Resour. Eval. Conf.","author":"Kai"},{"key":"ref95","first-page":"20346","article-title":"Human-adversarial visual question answering","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Sheng"},{"key":"ref96","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.naacl-main.324"},{"key":"ref97","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.265"},{"key":"ref98","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01081"},{"key":"ref99","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9746493"},{"key":"ref100","doi-asserted-by":"publisher","DOI":"10.1002\/0471667196.ess0238.pub2"},{"key":"ref101","first-page":"1571","article-title":"Bilinear attention networks","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Kim"},{"key":"ref102","doi-asserted-by":"publisher","DOI":"10.1145\/3474085.3475350"},{"key":"ref103","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01945"},{"key":"ref104","doi-asserted-by":"publisher","DOI":"10.1162\/089976602760128018"},{"key":"ref105","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W17-3529"},{"key":"ref106","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.emnlp-main.512"},{"key":"ref107","first-page":"1548","article-title":"Overcoming language priors in visual question answering with adversarial regularization","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Ramakrishnan"},{"key":"ref108","first-page":"8601","article-title":"Self-critical reasoning for robust visual question answering","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wu"},{"key":"ref109","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00268"},{"key":"ref110","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1418"},{"key":"ref111","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00204"},{"key":"ref112","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.6776"},{"key":"ref113","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01006"},{"key":"ref114","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58607-2_34"},{"key":"ref115","doi-asserted-by":"publisher","DOI":"10.1109\/ICME46284.2020.9102814"},{"key":"ref116","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.727"},{"key":"ref117","first-page":"3197","article-title":"Removing bias in multi-modal classifiers: Regularization by maximizing functional entropies","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Gat"},{"key":"ref118","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58601-0_2"},{"key":"ref119","first-page":"407","article-title":"On the value of out-of-distribution testing: An example of Goodharts law","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Teney"},{"key":"ref120","first-page":"6616","article-title":"Large-scale adversarial training for vision-and-language representation learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Gan"},{"key":"ref121","article-title":"A closer look at the robustness of vision-and-language pre-trained models","author":"Li","year":"2020"},{"key":"ref122","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.emnlp-main.63"},{"key":"ref123","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.findings-emnlp.272"},{"key":"ref124","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2021\/98"},{"key":"ref125","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00145"},{"key":"ref126","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01251"},{"key":"ref127","doi-asserted-by":"publisher","DOI":"10.1145\/3444685.3446256"},{"key":"ref128","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV48922.2021.00161"},{"key":"ref129","doi-asserted-by":"publisher","DOI":"10.1109\/ICME51207.2021.9428098"},{"key":"ref130","doi-asserted-by":"publisher","DOI":"10.1109\/ICME51207.2021.9428165"},{"key":"ref131","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2020\/151"},{"key":"ref132","first-page":"3784","article-title":"Debiased visual question answering from feature and sample perspectives","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Wen"},{"key":"ref133","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.317"},{"key":"ref134","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2021.3128322"},{"key":"ref135","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00263"},{"key":"ref136","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.findings-emnlp.495"},{"key":"ref137","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_6"},{"key":"ref138","doi-asserted-by":"publisher","DOI":"10.1145\/3498340"},{"key":"ref139","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3240337"},{"key":"ref140","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01124"},{"key":"ref141","doi-asserted-by":"publisher","DOI":"10.1016\/j.ipm.2023.103296"},{"key":"ref142","first-page":"13","article-title":"ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Lu"},{"key":"ref143","first-page":"20673","article-title":"Learning from failure: De-biasing classifier from biased classifier","volume":"33","author":"Nam","year":"2020","journal-title":"Adv. Neural Inf. Process. Syst."},{"key":"ref144","first-page":"5583","article-title":"ViLT: Vision-and-language transformer without convolution or region supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Kim"},{"key":"ref145","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"ref146","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/n19-1423"},{"key":"ref147","article-title":"Supervised multimodal bitransformers for classifying images and text","author":"Kiela","year":"2019"},{"key":"ref148","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00644"},{"key":"ref149","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.285"},{"key":"ref150","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3055564"},{"key":"ref151","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3160328"},{"key":"ref152","doi-asserted-by":"publisher","DOI":"10.1145\/1553374.1553380"},{"key":"ref153","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.00341"},{"key":"ref154","doi-asserted-by":"publisher","DOI":"10.5555\/3524938.3525087"},{"key":"ref155","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.02139"},{"key":"ref156","first-page":"7717","article-title":"Adversarial scene editing: Automatic object removal from weak supervision","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Shetty"},{"key":"ref157","first-page":"1126","article-title":"Model-agnostic meta-learning for fast adaptation of deep networks","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Finn"},{"key":"ref158","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/N18-2115"},{"key":"ref159","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01267-0_14"},{"key":"ref160","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2022.3203630"},{"key":"ref161","first-page":"8765","article-title":"Debiased contrastive learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Chuang"},{"key":"ref162","first-page":"18661","article-title":"Supervised contrastive learning","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Khosla"},{"key":"ref163","doi-asserted-by":"publisher","DOI":"10.1145\/3560815"},{"key":"ref164","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"ref165","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2023.3275156"},{"key":"ref166","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2889922"},{"key":"ref167","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2855406"},{"key":"ref168","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.3028651"},{"key":"ref169","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.421"},{"key":"ref170","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3222118"},{"key":"ref171","article-title":"VL-BERT: Pre-training of generic visual-linguistic representations","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Su"},{"key":"ref172","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"ref173","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Radford"},{"key":"ref174","first-page":"9694","article-title":"Align before fuse: Vision and language representation learning with momentum distillation","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Li"},{"key":"ref175","first-page":"32897","article-title":"VLMo: Unified vision-language pre-training with mixture-of-modality-experts","volume-title":"Proc. Int. Conf. Neural Inf. Process. Syst.","author":"Bao"},{"key":"ref176","article-title":"SimVLM: Simple visual language model pretraining with weak supervision","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Wang"},{"key":"ref177","article-title":"CoCa: Contrastive captioners are image-text foundation models","volume":"2022","author":"Yu","year":"2022","journal-title":"Trans. Mach. Learn. Res."},{"key":"ref178","first-page":"12888","article-title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Li"},{"key":"ref179","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01838"},{"key":"ref180","article-title":"PaLI: A jointly-scaled multilingual language-image model","author":"Chen","year":"2022"},{"key":"ref181","article-title":"BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"ref182","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.findings-eacl.90"},{"key":"ref183","article-title":"How much can CLIP benefit vision-and-language tasks?","volume-title":"Proc. Int. Conf. Learn. Representations","author":"Shen"},{"key":"ref184","article-title":"PaLI-X: On scaling up a multilingual vision and language model","author":"Chen","year":"2023"},{"key":"ref185","first-page":"6216","article-title":"Data determines distributional robustness in contrastive language image pre-training (clip)","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Fang"},{"key":"ref186","doi-asserted-by":"publisher","DOI":"10.1109\/cvpr52688.2022.01599"},{"key":"ref187","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.findings-emnlp.257"},{"key":"ref188","volume-title":"Human-in-the-Loop Machine Learning: Active Learning and annotation for Human-centered AI","author":"Monarch","year":"2021"},{"key":"ref189","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.naacl-main.192"},{"key":"ref190","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-017-1038-2"},{"key":"ref191","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01625-5"},{"key":"ref192","first-page":"23318","article-title":"OFA: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework","volume-title":"Proc. Int. Conf. Mach. Learn.","author":"Wang"},{"key":"ref193","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.641"},{"key":"ref194","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.153"},{"key":"ref195","doi-asserted-by":"publisher","DOI":"10.1109\/WACV51458.2022.00257"},{"key":"ref196","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-20059-5_9"},{"key":"ref197","doi-asserted-by":"publisher","DOI":"10.1613\/jair.1.11688"},{"key":"ref198","article-title":"Task formulation matters when learning continually: A case study in visual question answering","author":"Nikandrou","year":"2022"}],"container-title":["IEEE Transactions on Pattern Analysis and Machine Intelligence"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/34\/10582780\/10438044.pdf?arnumber=10438044","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,3]],"date-time":"2024-07-03T06:14:05Z","timestamp":1719987245000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10438044\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,8]]},"references-count":198,"journal-issue":{"issue":"8"},"URL":"https:\/\/doi.org\/10.1109\/tpami.2024.3366154","relation":{},"ISSN":["0162-8828","2160-9292","1939-3539"],"issn-type":[{"value":"0162-8828","type":"print"},{"value":"2160-9292","type":"electronic"},{"value":"1939-3539","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,8]]}}}