{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,23]],"date-time":"2026-04-23T04:42:04Z","timestamp":1776919324017,"version":"3.51.2"},"reference-count":100,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2023,8,28]],"date-time":"2023-08-28T00:00:00Z","timestamp":1693180800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,8,28]],"date-time":"2023-08-28T00:00:00Z","timestamp":1693180800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62088102"],"award-info":[{"award-number":["62088102"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,1]]},"DOI":"10.1007\/s11263-023-01858-y","type":"journal-article","created":{"date-parts":[[2023,8,28]],"date-time":"2023-08-28T19:02:11Z","timestamp":1693249331000},"page":"185-207","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":16,"title":["Correlation Information Bottleneck: Towards Adapting Pretrained Multimodal Models for Robust Visual Question Answering"],"prefix":"10.1007","volume":"132","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8241-4877","authenticated-orcid":false,"given":"Jingjing","family":"Jiang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ziyi","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Nanning","family":"Zheng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,8,28]]},"reference":[{"key":"1858_CR1","doi-asserted-by":"crossref","unstructured":"Agarwal, V., Shetty, R., & Fritz, M. (2020). Towards causal vqa: Revealing and reducing spurious correlations by invariant and covariant semantic editing. In IEEE conference on computer vision and pattern recognition (pp. 9690\u20139698).","DOI":"10.1109\/CVPR42600.2020.00971"},{"key":"1858_CR2","doi-asserted-by":"crossref","unstructured":"Agrawal, A., Kaji\u0107, I., Bugliarello, E., Davoodi, E., Gergely, A., Blunsom, P., & Nematzadeh, A. (2022). Rethinking evaluation practices in visual question answering: A case study on out-of-distribution generalization. arXiv preprint arXiv:2205.12191.","DOI":"10.18653\/v1\/2023.findings-eacl.90"},{"key":"1858_CR3","unstructured":"Ahuja, K., Caballero, E., Zhang, D., Bengio, Y., Mitliagkas, I., & Rish, I. (2021). Invariance principle meets information bottleneck for out-of-distribution generalization. In Neural information processing systems (pp. 3438\u20133450)."},{"key":"1858_CR4","unstructured":"Alayrac, J. B., Donahue, J., Luc, P., Miech, A., Barr, I., Hasson, Y., Lenc, K., Mensch, A., Millican, K., & Reynolds, M., et\u00a0al. (2022). Flamingo: A visual language model for few-shot learning. In Neural information processing systems (pp. 23716\u201323736)."},{"key":"1858_CR5","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., & Zhang, L. (2018). Bottom-up and top-down attention for image captioning and visual question answering. In IEEE conference on computer vision and pattern recognition (pp. 6077\u20136086).","DOI":"10.1109\/CVPR.2018.00636"},{"key":"1858_CR6","doi-asserted-by":"crossref","unstructured":"Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C. L., & Parikh, D. (2015), Vqa: Visual question answering. In IEEE conference on computer vision and pattern recognition (pp. 2425\u20132433)","DOI":"10.1109\/ICCV.2015.279"},{"key":"1858_CR7","unstructured":"Ban, Y., & Dong, Y. (2022). Pre-trained adversarial perturbations. In Neural information processing systems (pp. 1196\u20131209)."},{"key":"1858_CR8","doi-asserted-by":"crossref","unstructured":"Bao, F. (2021). Disentangled variational information bottleneck for multiview representation learning. In International conference on artificial intelligence (pp. 91\u2013102).","DOI":"10.1007\/978-3-030-93049-3_8"},{"key":"1858_CR9","unstructured":"Barber, D., & Agakov, F. (2003). The im algorithm: A variational approach to information maximization. In Neural information processing systems (pp. 201\u2013208)."},{"key":"1858_CR10","first-page":"530","volume":"80","author":"MI Belghazi","year":"2018","unstructured":"Belghazi, M. I., Baratin, A., Rajeswar, S., Ozair, S., Bengio, Y., Courville, A., & Hjelm, R. D. (2018). Mutual information neural estimation. International Conference on Machine Learning, 80, 530\u2013539.","journal-title":"International Conference on Machine Learning"},{"issue":"22","key":"1858_CR11","doi-asserted-by":"publisher","first-page":"8520","DOI":"10.1016\/j.eswa.2015.07.007","volume":"42","author":"M Bennasar","year":"2015","unstructured":"Bennasar, M., Hicks, Y., & Setchi, R. (2015). Feature selection using joint mutual information maximisation. Expert Systems with Applications, 42(22), 8520\u20138532.","journal-title":"Expert Systems with Applications"},{"key":"1858_CR12","first-page":"8102","volume":"33","author":"H Ben-Younes","year":"2019","unstructured":"Ben-Younes, H., Cadene, R., Thome, N., & Cord, M. (2019). Block: Bilinear superdiagonal fusion for visual question answering and visual relationship detection. Association for the Advancement of Artificial Intelligence, 33, 8102\u20138109.","journal-title":"Association for the Advancement of Artificial Intelligence"},{"key":"1858_CR13","unstructured":"Cadene, R., Dancette, C., Cord, M., Parikh, D., et\u00a0al. (2019). RUBi: Reducing unimodal biases for visual question answering. In Neural information processing systems (pp. 841\u2013852)."},{"key":"1858_CR14","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Sharma, P., Ding, N., & Soricut, R. (2021). Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts. In IEEE conference on computer vision and pattern recognition (pp. 3558\u20133568).","DOI":"10.1109\/CVPR46437.2021.00356"},{"key":"1858_CR15","unstructured":"Chen, X., Fang, H., Lin, T. Y., Vedantam, R., Gupta, S., Doll\u00e1r, P., & Zitnick, C. L. (2015). Microsoft coco captions: Data collection and evaluation server. arXiv preprint arXiv:1504.00325."},{"key":"1858_CR16","doi-asserted-by":"crossref","unstructured":"Chen, Y. C., Li, L., Yu, L., El\u00a0Kholy, A., Ahmed, F., Gan, Z., Cheng, Y., & Liu, J. (2020). UNITER: Universal image-text representation learning. In European conference on computer vision (pp. 104\u2013120).","DOI":"10.1007\/978-3-030-58577-8_7"},{"key":"1858_CR17","doi-asserted-by":"crossref","unstructured":"Chen, L., Yan, X., Xiao, J., Zhang, H., Pu, S., & Zhuang, Y. (2020). Counterfactual samples synthesizing for robust visual question answering. In IEEE conference on computer vision and pattern recognition (pp. 10800\u201310809).","DOI":"10.1109\/CVPR42600.2020.01081"},{"key":"1858_CR18","first-page":"1779","volume":"119","author":"P Cheng","year":"2020","unstructured":"Cheng, P., Hao, W., Dai, S., Liu, J., Gan, Z., & Carin, L. (2020). CLUB: A contrastive log-ratio upper bound of mutual information. International Conference on Machine Learning, 119, 1779\u20131788.","journal-title":"International Conference on Machine Learning"},{"key":"1858_CR19","first-page":"1931","volume":"139","author":"J Cho","year":"2021","unstructured":"Cho, J., Lei, J., Tan, H., & Bansal, M. (2021). Unifying vision-and-language tasks via text generation. International Conference on Machine Learning, 139, 1931\u20131942.","journal-title":"International Conference on Machine Learning"},{"key":"1858_CR20","doi-asserted-by":"crossref","unstructured":"Clark, C., Yatskar, M., & Zettlemoyer, L. (2019). Don\u2019t take the easy way out: Ensemble based methods for avoiding known dataset biases. In Conference on empirical methods in natural language processing (pp. 4067\u20134080).","DOI":"10.18653\/v1\/D19-1418"},{"key":"1858_CR21","doi-asserted-by":"crossref","unstructured":"Dancette, C., Cadene, R., Teney, D., & Cord, M. (2021). Beyond question-based biases: Assessing multimodal shortcut learning in visual question answering. In IEEE international conference on computer vision (pp. 1574\u20131583).","DOI":"10.1109\/ICCV48922.2021.00160"},{"key":"1858_CR22","unstructured":"Dong, X., Luu, A. T., Lin, M., Yan, S., & Zhang, H. (2021). How should pre-trained language models be fine-tuned towards adversarial robustness? In Neural information processing systems (pp. 4356\u20134369)."},{"key":"1858_CR23","doi-asserted-by":"crossref","unstructured":"Dou, Z. Y., Xu, Y., Gan, Z., Wang, J., Wang, S., Wang, L., Zhu, C., Zhang, P., Yuan, L., & Peng, N., et\u00a0al. (2022). An empirical study of training end-to-end vision-and-language transformers. In IEEE conference on computer vision and pattern recognition (pp. 18166\u201318176).","DOI":"10.1109\/CVPR52688.2022.01763"},{"key":"1858_CR24","doi-asserted-by":"crossref","unstructured":"Du, Y., Xu, J., Xiong, H., Qiu, Q., Zhen, X., Snoek, C. G., & Shao, L. (2020). Learning to learn with variational information bottleneck for domain generalization. In European conference on computer vision (pp. 200\u2013216).","DOI":"10.1007\/978-3-030-58607-2_12"},{"key":"1858_CR25","unstructured":"Dubois, Y., Kiela, D., Schwab, D. J., & Vedantam, R. (2020). Learning optimal representations with the decodable information bottleneck. In Neural information processing systems (pp. 18674\u201318690)."},{"key":"1858_CR26","unstructured":"Federici, M., Dutta, A., Forr\u00e9, P., Kushman, N., & Akata, Z. (2020). Learning robust representations via multi-view information bottleneck. In International conference on learning representations."},{"key":"1858_CR27","unstructured":"Gan, Z., Chen, Y.C., Li, L., Zhu, C., Cheng, Y., & Liu, J. (2020). Large-scale adversarial training for vision-and-language representation learning. In Neural information processing systems (pp. 6616\u20136628)."},{"key":"1858_CR28","unstructured":"Gat, I., Schwartz, I., Schwing, A., & Hazan, T. (2020). Removing bias in multi-modal classifiers: Regularization by maximizing functional entropies. In Neural information processing systems (pp. 3197\u20133208)."},{"key":"1858_CR29","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., & Parikh, D. (2017). Making the v in vqa matter: Elevating the role of image understanding in visual question answering. In IEEE conference on computer vision and pattern recognition (pp. 6904\u20136913).","DOI":"10.1109\/CVPR.2017.670"},{"key":"1858_CR30","doi-asserted-by":"crossref","unstructured":"Hu, R., Andreas, J., Darrell, T., & Saenko, K. (2018). Explainable neural computation via stack neural module networks. In European conference on computer vision (pp. 53\u201369).","DOI":"10.1007\/978-3-030-01234-2_4"},{"key":"1858_CR31","doi-asserted-by":"crossref","unstructured":"Hu, R., Singh, A., Darrell, T., & Rohrbach, M. (2020). Iterative answer prediction with pointer-augmented multimodal transformers for textvqa. In IEEE conference on computer vision and pattern recognition (pp. 9992\u201310002).","DOI":"10.1109\/CVPR42600.2020.01001"},{"key":"1858_CR32","doi-asserted-by":"crossref","unstructured":"Huang, Z., Zeng, Z., Huang, Y., Liu, B., Fu, D., & Fu, J. (2021). Seeing out of the box: End-to-end pre-training for vision-language representation learning. In IEEE conference on computer vision and pattern recognition (pp. 12976\u201312985).","DOI":"10.1109\/CVPR46437.2021.01278"},{"key":"1858_CR33","unstructured":"Huang, Z., Zeng, Z., Liu, B., Fu, D., & Fu, J. (2020). Pixel-BERT: Aligning image pixels with text by deep multi-modal transformers. arXiv preprint arXiv:2004.00849."},{"key":"1858_CR34","doi-asserted-by":"crossref","unstructured":"Hudson, D. A., & Manning, C. D. (2019). Gqa: A new dataset for real-world visual reasoning and compositional question answering. In IEEE conference on computer vision and pattern recognition (pp. 6700\u20136709).","DOI":"10.1109\/CVPR.2019.00686"},{"key":"1858_CR35","first-page":"7926","volume":"35","author":"I Jeon","year":"2021","unstructured":"Jeon, I., Lee, W., Pyeon, M., & Kim, G. (2021). Ib-gan: Disengangled representation learning with information bottleneck generative adversarial networks. Association for the Advancement of Artificial Intelligence, 35, 7926\u20137934.","journal-title":"Association for the Advancement of Artificial Intelligence"},{"key":"1858_CR36","doi-asserted-by":"crossref","unstructured":"Jiang, J., Liu, Z., Liu, Y., Nan, Z., & Zheng, N. (2021). X-ggm: Graph generative modeling for out-of-distribution generalization in visual question answering. In ACM international conference on multimedia (pp. 199\u2013208).","DOI":"10.1145\/3474085.3475350"},{"key":"1858_CR37","unstructured":"Jiang, Y., Natarajan, V., Chen, X., Rohrbach, M., Batra, D., & Parikh, D. (2018). Pythia v0. 1: The winning entry to the vqa challenge 2018. arXiv preprint arXiv:1807.09956."},{"key":"1858_CR38","doi-asserted-by":"crossref","unstructured":"Kant, Y., Moudgil, A., Batra, D., Parikh, D. & Agrawal, H. (2021). Contrast and classify: Training robust vqa models. In IEEE international conference on computer vision (pp. 1604\u20131613).","DOI":"10.1109\/ICCV48922.2021.00163"},{"key":"1858_CR39","unstructured":"Kazemi, V., & Elqursh, A. (2017). Show, ask, attend, and answer: A strong baseline for visual question answering. arXiv preprint arXiv:1704.03162."},{"key":"1858_CR40","doi-asserted-by":"crossref","unstructured":"Kervadec, C., Antipov, G., Baccouche, M., & Wolf, C. (2021). Roses are red, violets are blue...but should vqa expect them to? In IEEE conference on computer vision and pattern recognition (pp. 2776\u20132785).","DOI":"10.1109\/CVPR46437.2021.00280"},{"key":"1858_CR41","unstructured":"Kim, J. H., Jun, J., & Zhang, B. T. (2018). Bilinear attention networks. In Neural information processing systems (pp. 1564\u20131574)."},{"key":"1858_CR42","first-page":"5583","volume":"139","author":"W Kim","year":"2021","unstructured":"Kim, W., Son, B., & Kim, I. (2021). Vilt: Vision-and-language transformer without convolution or region supervision. International Conference on Machine Learning, 139, 5583\u20135594.","journal-title":"International Conference on Machine Learning"},{"issue":"1","key":"1858_CR43","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna, R., Zhu, Y., Groth, O., Johnson, J., Hata, K., Kravitz, J., Chen, S., Kalantidis, Y., Li, L. J., Shamma, D. A., et al. (2017). Visual Genome: Connecting language and vision using crowdsourced dense image annotations. International Journal of Computer Vision, 123(1), 32\u201373.","journal-title":"International Journal of Computer Vision"},{"key":"1858_CR44","unstructured":"Li, L., Gan, Z., & Liu, J. (2020). A closer look at the robustness of vision-and-language pre-trained models. arXiv preprint arXiv:2012.08673."},{"key":"1858_CR45","doi-asserted-by":"crossref","unstructured":"Li, L., Lei, J., Gan, Z., & Liu, J. (2021). Adversarial vqa: A new benchmark for evaluating the robustness of vqa models. In IEEE conference on computer vision and pattern recognition (pp. 2042\u20132051).","DOI":"10.1109\/ICCV48922.2021.00205"},{"key":"1858_CR46","unstructured":"Li, J., Selvaraju, R. R., Gotmare, A., Joty, S. R., Xiong, C., & Hoi, S. C. (2021). Align before fuse: Vision and language representation learning with momentum distillation. In Neural information processing systems (pp. 9694\u20139705)."},{"key":"1858_CR47","doi-asserted-by":"crossref","unstructured":"Li, C., Xu, H., Tian, J., Wang, W., Yan, M., Bi, B., Ye, J., Chen, H., Xu, G., Cao, Z., et\u00a0al. (2022). mplug: Effective and efficient vision-language learning by cross-modal skip-connections. In Conference on empirical methods in natural language processing (pp. 7241\u20137259).","DOI":"10.18653\/v1\/2022.emnlp-main.488"},{"key":"1858_CR48","unstructured":"Li, C., Yan, M., Xu, H., Luo, F., Wang, W., Bi, B., & Huang, S. (2021). SemVLP: Vision-language pre-training by aligning semantics at multiple levels. arXiv preprint arXiv:2103.07829."},{"key":"1858_CR49","unstructured":"Li, L. H., Yatskar, M., Yin, D., Hsieh, C. J., & Chang, K. W. (2019). Visualbert: A simple and performant baseline for vision and language. arXiv preprint arXiv:1908.03557."},{"key":"1858_CR50","doi-asserted-by":"crossref","unstructured":"Li, X., Yin, X., Li, C., Zhang, P., Hu, X., Zhang, L., Wang, L., Hu, H., Dong, L., & Wei, F., et\u00a0al. (2020). Oscar: Object-semantics aligned pre-training for vision-language tasks. In European conference on computer vision (pp. 121\u2013137).","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"1858_CR51","first-page":"12888","volume":"162","author":"J Li","year":"2022","unstructured":"Li, J., Li, D., Xiong, C., & Hoi, S. (2022). Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. International Conference on Machine Learning, 162, 12888\u201312900.","journal-title":"International Conference on Machine Learning"},{"key":"1858_CR52","first-page":"8518","volume":"35","author":"Y Li","year":"2021","unstructured":"Li, Y., Pan, Y., Yao, T., Chen, J., & Mei, T. (2021). Scheduled sampling in vision-language pretraining with decoupled encoder-decoder network. Association for the Advancement of Artificial Intelligence, 35, 8518\u20138526.","journal-title":"Association for the Advancement of Artificial Intelligence"},{"key":"1858_CR53","first-page":"7399","volume":"36","author":"B Li","year":"2022","unstructured":"Li, B., Shen, Y., Wang, Y., Zhu, W., Li, D., Keutzer, K., & Zhao, H. (2022). Invariant information bottleneck for domain generalization. Association for the Advancement of Artificial Intelligence, 36, 7399\u20137407.","journal-title":"Association for the Advancement of Artificial Intelligence"},{"key":"1858_CR54","doi-asserted-by":"crossref","unstructured":"Liu, X., Li, L., Wang, S., Zha, Z. J., Meng, D., & Huang, Q. (2019). Adaptive reconstruction network for weakly supervised referring expression grounding. In IEEE international conference on computer vision (pp. 2611\u20132620).","DOI":"10.1109\/ICCV.2019.00270"},{"key":"1858_CR55","unstructured":"Lu, J., Batra, D., Parikh, D., & Lee, S. (2019). ViLBERT: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks. In Neural information processing systems (pp. 13\u201323)."},{"key":"1858_CR56","doi-asserted-by":"crossref","unstructured":"Lu, J., Goswami, V., Rohrbach, M., Parikh, D., & Lee, S. (2020). 12-in-1: Multi-task vision and language representation learning. In IEEE conference on computer vision and pattern recognition (pp. 10437\u201310446).","DOI":"10.1109\/CVPR42600.2020.01045"},{"key":"1858_CR57","unstructured":"Lu, J., Lin, X., Batra, D., & Parikh, D. (2015). Deeper lstm and normalized cnn visual question answering model. https:\/\/github.com\/VT-vision-lab\/VQA_LSTM_CNN."},{"key":"1858_CR58","unstructured":"Mahabadi, R. K., Belinkov, Y., & Henderson, J. (2021). Variational information bottleneck for effective low-resource fine-tuning. In International conference on learning representations."},{"key":"1858_CR59","unstructured":"Nam, J., Cha, H., Ahn, S. S., Lee, J., & Shin, J. (2020). Learning from failure: De-biasing classifier from biased classifier. In Neural information processing systems (pp. 20673\u201320684)."},{"issue":"11","key":"1858_CR60","doi-asserted-by":"publisher","first-page":"5847","DOI":"10.1109\/TIT.2010.2068870","volume":"56","author":"X Nguyen","year":"2010","unstructured":"Nguyen, X., Wainwright, M. J., & Jordan, M. I. (2010). Estimating divergence functionals and the likelihood ratio by convex risk minimization. IEEE Transactions on Information Theory, 56(11), 5847\u20135861.","journal-title":"IEEE Transactions on Information Theory"},{"key":"1858_CR61","unstructured":"Oord, Avd, Li, Y., & Vinyals, O. (2018). Representation learning with contrastive predictive coding. arXiv preprint arXiv:1807.03748."},{"key":"1858_CR62","unstructured":"Ordonez, V., Kulkarni, G., & Berg, T. (2011). Im2text: Describing images using 1 million captioned photographs. In Neural information processing systems (pp. 1143\u20131151)."},{"issue":"3","key":"1858_CR63","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3487042","volume":"18","author":"Y Pan","year":"2022","unstructured":"Pan, Y., Li, Z., Zhang, L., & Tang, J. (2022). Causal inference with knowledge distilling and curriculum learning for unbiased vqa. ACM Transactions on Multimedia Computing, Communications, and Applications, 18(3), 1\u201323.","journal-title":"ACM Transactions on Multimedia Computing, Communications, and Applications"},{"key":"1858_CR64","first-page":"9285","volume":"35","author":"Z Pan","year":"2021","unstructured":"Pan, Z., Niu, L., Zhang, J., & Zhang, L. (2021). Disentangled information bottleneck. Association for the Advancement of Artificial Intelligence, 35, 9285\u20139293.","journal-title":"Association for the Advancement of Artificial Intelligence"},{"key":"1858_CR65","first-page":"5171","volume":"97","author":"B Poole","year":"2019","unstructured":"Poole, B., Ozair, S., Van Den Oord, A., Alemi, A., & Tucker, G. (2019). On variational bounds of mutual information. International Conference on Machine Learning, 97, 5171\u20135180.","journal-title":"International Conference on Machine Learning"},{"key":"1858_CR66","doi-asserted-by":"crossref","unstructured":"Shah, M., Chen, X., Rohrbach, M., & Parikh, D. (2019). Cycle-consistency for robust visual question answering. In IEEE conference on computer vision and pattern recognition (pp. 6649\u20136658).","DOI":"10.1109\/CVPR.2019.00681"},{"key":"1858_CR67","doi-asserted-by":"crossref","unstructured":"Sharma, P., Ding, N., Goodman, S., & Soricut, R. (2018). Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning. In Annual meeting of the association for computational linguistics (pp. 2556\u20132565).","DOI":"10.18653\/v1\/P18-1238"},{"key":"1858_CR68","unstructured":"Sheng, S., Singh, A., Goswami, V., Magana, J. A. L., Galuba, W., Parikh, D., & Kiela, D. (2021). Human-adversarial visual question answering. In Neural information processing systems (pp. 20346\u201320359)."},{"key":"1858_CR69","doi-asserted-by":"crossref","unstructured":"Shi, L., Shuang, K., Geng, S., Su, P., Jiang, Z., Gao, P., Fu, Z., de\u00a0Melo, G., & Su, S. (2020.) Contrastive visual-linguistic pretraining. arXiv preprint arXiv:2007.13135.","DOI":"10.1145\/3474085.3475637"},{"key":"1858_CR70","doi-asserted-by":"crossref","unstructured":"Shi, J., Zhang, H., & Li, J. (2019). Explainable and explicit visual reasoning over scene graphs. In IEEE conference on computer vision and pattern recognition (pp. 8376\u20138384).","DOI":"10.1109\/CVPR.2019.00857"},{"key":"1858_CR71","doi-asserted-by":"crossref","unstructured":"Shrestha, R., Kafle, K., & Kanan, C. (2020). A negative case analysis of visual grounding methods for vqa. In Annual meeting of the association for computational linguistics (pp. 8172\u20138181).","DOI":"10.18653\/v1\/2020.acl-main.727"},{"key":"1858_CR72","unstructured":"Shwartz-Ziv, R., & Tishby, N. (2017). Opening the black box of deep neural networks via information. arXiv preprint arXiv:1703.00810."},{"key":"1858_CR73","unstructured":"Su, W., Zhu, X., Cao, Y., Li, B., Lu, L., Wei. F., & Dai, J. (2020). VL-BERT: Pre-training of generic visual-linguistic representations. In International conference on learning representations."},{"key":"1858_CR74","doi-asserted-by":"crossref","unstructured":"Sun, S., Chen, Y. C., Li, L., Wang, S., Fang, Y., & Liu, J. (2021). Lightningdot: Pre-training visual-semantic embeddings for real-time image-text retrieval. In Annual meeting of the association for computational linguistics (pp. 982\u2013997).","DOI":"10.18653\/v1\/2021.naacl-main.77"},{"key":"1858_CR75","doi-asserted-by":"crossref","unstructured":"Tan, H., & Bansal, M. (2019). LXMERT: Learning cross-modality encoder representations from transformers. In Conference on empirical methods in natural language processing (pp. 5099\u20135110).","DOI":"10.18653\/v1\/D19-1514"},{"key":"1858_CR76","unstructured":"Teney, D., Kafle, K., Shrestha, R., Abbasnejad, E., Kanan, C., & Hengel, A. V. D. (2020). On the value of out-of-distribution testing: An example of goodhart\u2019s law. In Neural information processing systems (pp. 407\u2013417)."},{"key":"1858_CR77","doi-asserted-by":"crossref","unstructured":"Tishby, N., & Zaslavsky, N. (2015). Deep learning and the information bottleneck principle. In IEEE information theory workshop (pp. 1\u20135).","DOI":"10.1109\/ITW.2015.7133169"},{"key":"1858_CR78","unstructured":"Tishby, N., Pereira, F. C., & Bialek, W. (2000). The information bottleneck method. arXiv preprint physics\/0004057."},{"key":"1858_CR79","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, \u0141., & Polosukhin, I. (2017). Attention is all you need. In Neural information processing systems (pp. 5998\u20136008)."},{"key":"1858_CR80","unstructured":"Wang, W., Bao, H., Dong, L., & Wei, F. (2021). Vlmo: Unified vision-language pre-training with mixture-of-modality-experts. arXiv preprint arXiv:2111.02358"},{"key":"1858_CR81","doi-asserted-by":"crossref","unstructured":"Wang, W., Bao, H., Dong, L., Bjorck, J., Peng, Z., Liu, Q., Aggarwal, K., Mohammed, O. K., Singhal, S., Som, S. et\u00a0al. (2023). Image as a foreign language: Beit pretraining for all vision and vision-language tasks. In IEEE conference on computer vision and pattern recognition (pp. 19175\u201319186)","DOI":"10.1109\/CVPR52729.2023.01838"},{"key":"1858_CR82","doi-asserted-by":"crossref","unstructured":"Wang, H., Guo, X., Deng, ZH., & Lu, Y. (2022). Rethinking minimal sufficient representation in contrastive learning. In IEEE conference on computer vision and pattern recognition (pp. 16041\u201316050).","DOI":"10.1109\/CVPR52688.2022.01557"},{"key":"1858_CR83","unstructured":"Wang, B., Wang, S., Cheng, Y., Gan, Z., Jia, R., Li, B., & Liu, J. (2021). InfoBERT: Improving robustness of language models from an information theoretic perspective. In International conference on learning representations."},{"key":"1858_CR84","unstructured":"Wang, Z., Yu, J., Yu, A. W., Dai, Z., Tsvetkov, Y., & Cao, Y. (2022). Simvlm: Simple visual language model pretraining with weak supervision. In International conference on learning representations"},{"key":"1858_CR85","first-page":"23318","volume":"162","author":"P Wang","year":"2022","unstructured":"Wang, P., Yang, A., Men, R., Lin, J., Bai, S., Li, Z., Ma, J., Zhou, C., Zhou, J., & Yang, H. (2022). OFA: Unifying architectures, tasks, and modalities through a simple sequence-to-sequence learning framework. International Conference on Machine Learning, 162, 23318\u201323340.","journal-title":"International Conference on Machine Learning"},{"key":"1858_CR86","unstructured":"Whitehead, S., Wu, H., Fung, Y.R., Ji, H., Feris, R., & Saenko, K. (2020). Learning from lexical perturbations for consistent visual question answering. arXiv preprint arXiv:2011.13406."},{"key":"1858_CR87","unstructured":"Xu, H., Ye, Q., Yan, M., Shi, Y., Ye, J., Xu, Y., Li, C., Bi, B., Qian, Q., & Wang, W., et\u00a0al. (2023). mplug-2: A modularized multi-modal foundation model across text, image and video. arXiv preprint arXiv:2302.00402."},{"key":"1858_CR88","doi-asserted-by":"crossref","unstructured":"Yang, Z., He, X., Gao, J., Deng, L., & Smola, A. (2016). Stacked attention networks for image question answering. In IEEE conference on computer vision and pattern recognition (pp. 21\u201329).","DOI":"10.1109\/CVPR.2016.10"},{"key":"1858_CR89","doi-asserted-by":"crossref","unstructured":"Yu, L., Poirson, P., Yang, S., Berg, A. C., & Berg, T. L. (2016). Modeling context in referring expressions. In European conference on computer vision (pp. 69\u201385).","DOI":"10.1007\/978-3-319-46475-6_5"},{"key":"1858_CR90","unstructured":"Yu, J., Wang, Z., Vasudevan, V., Yeung, L., Seyedhosseini, M., & Wu, Y. (2022). Coca: Contrastive captioners are image-text foundation models. arXiv preprint arXiv:2205.01917"},{"key":"1858_CR91","unstructured":"Yuan, L., Chen, D., Chen, Y. L., Codella, N., Dai, X., Gao, J., Hu, H., Huang, X., Li, B., Li, C., et\u00a0al. (2021). Florence: A new foundation model for computer vision. arXiv preprint arXiv:2111.11432"},{"key":"1858_CR92","first-page":"3208","volume":"35","author":"F Yu","year":"2021","unstructured":"Yu, F., Tang, J., Yin, W., Sun, Y., Tian, H., Wu, H., & Wang, H. (2021). Ernie-vil: Knowledge enhanced vision-language representations through scene graphs. Association for the Advancement of Artificial Intelligence, 35, 3208\u20133216.","journal-title":"Association for the Advancement of Artificial Intelligence"},{"key":"1858_CR93","unstructured":"Zeng, Y., Zhang, X., Li, H., Wang, J., Zhang, J., & Zhou, W. (2022). X$$^{2}$$-VLM: All-in-one pre-trained model for vision-language tasks. arXiv preprint arXiv:2211.12402"},{"key":"1858_CR94","first-page":"25994","volume":"162","author":"Y Zeng","year":"2022","unstructured":"Zeng, Y., Zhang, X., & Li, H. (2022). Multi-grained vision language pre-training: Aligning texts with visual concepts. International Conference on Machine Learning, 162, 25994\u201326009.","journal-title":"International Conference on Machine Learning"},{"key":"1858_CR95","doi-asserted-by":"crossref","unstructured":"Zhang, P., Li, X., Hu, X., Yang, J., Zhang, L., Wang, L., Choi, Y., & Gao, J. (2021). Vinvl: Revisiting visual representations in vision-language models. In IEEE conference on computer vision and pattern recognition (pp. 5579\u20135588).","DOI":"10.1109\/CVPR46437.2021.00553"},{"key":"1858_CR96","unstructured":"Zhang, Z., Zhao, Z., Lin, Z., He, X., et\u00a0al. (2020). Counterfactual contrastive learning for weakly-supervised vision-language grounding. In Neural information processing systems (pp. 18123\u201318134)."},{"key":"1858_CR97","doi-asserted-by":"crossref","unstructured":"Zhong, Y., Yang, J., Zhang, P., Li, C., Codella, N., Li, L. H., Zhou, L., Dai, X., Yuan, L., & Li, Y., et\u00a0al. (2022). Regionclip: Region-based language-image pretraining. In IEEE conference on computer vision and pattern recognition (pp. 16793\u201316803).","DOI":"10.1109\/CVPR52688.2022.01629"},{"key":"1858_CR98","first-page":"13041","volume":"34","author":"L Zhou","year":"2020","unstructured":"Zhou, L., Palangi, H., Zhang, L., Hu, H., Corso, J., & Gao, J. (2020). Unified vision-language pre-training for image captioning and vqa. Association for the Advancement of Artificial Intelligence, 34, 13041\u201313049.","journal-title":"Association for the Advancement of Artificial Intelligence"},{"key":"1858_CR99","first-page":"27378","volume":"162","author":"D Zhou","year":"2022","unstructured":"Zhou, D., Yu, Z., Xie, E., Xiao, C., Anandkumar, A., Feng, J., & Alvarez, J. M. (2022). Understanding the robustness in vision transformers. International Conference on Machine Learning, 162, 27378\u201327394.","journal-title":"International Conference on Machine Learning"},{"key":"1858_CR100","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Groth, O., Bernstein, M., & Fei-Fei, L. (2016). Visual7w: Grounded question answering in images. In IEEE conference on computer vision and pattern recognition (pp. 4995\u20135004).","DOI":"10.1109\/CVPR.2016.540"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01858-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01858-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01858-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,1,22]],"date-time":"2024-01-22T03:12:35Z","timestamp":1705893155000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01858-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,8,28]]},"references-count":100,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2024,1]]}},"alternative-id":["1858"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01858-y","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,8,28]]},"assertion":[{"value":"3 January 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 July 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"28 August 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}