{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,3,27]],"date-time":"2025-03-27T11:01:39Z","timestamp":1743073299388,"version":"3.40.3"},"publisher-location":"Cham","reference-count":80,"publisher":"Springer Nature Switzerland","isbn-type":[{"type":"print","value":"9783031732461"},{"type":"electronic","value":"9783031732478"}],"license":[{"start":{"date-parts":[[2024,11,1]],"date-time":"2024-11-01T00:00:00Z","timestamp":1730419200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,11,1]],"date-time":"2024-11-01T00:00:00Z","timestamp":1730419200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025]]},"DOI":"10.1007\/978-3-031-73247-8_23","type":"book-chapter","created":{"date-parts":[[2024,10,31]],"date-time":"2024-10-31T12:02:20Z","timestamp":1730376140000},"page":"393-411","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Grounding Language Models for\u00a0Visual Entity Recognition"],"prefix":"10.1007","author":[{"given":"Zilin","family":"Xiao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ming","family":"Gong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Paola","family":"Cascante-Bonilla","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xingyao","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jie","family":"Wu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Vicente","family":"Ordonez","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,11,1]]},"reference":[{"key":"23_CR1","doi-asserted-by":"crossref","unstructured":"Agrawal, A., et al.: VQA: visual question answering. Int. J. Comput. Vision (2015)","DOI":"10.1007\/s11263-016-0966-6"},{"key":"23_CR2","first-page":"23716","volume":"35","author":"JB Alayrac","year":"2022","unstructured":"Alayrac, J.B., et al.: Flamingo: a visual language model for few-shot learning. Adv. Neural. Inf. Process. Syst. 35, 23716\u201323736 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"23_CR3","doi-asserted-by":"crossref","unstructured":"Aubret, A., Teuli\u00e8re, C., Triesch, J.: Self-supervised visual learning from interactions with objects. arXiv preprint arXiv:2407.06704 (2024)","DOI":"10.1007\/978-3-031-73226-3_4"},{"key":"23_CR4","unstructured":"Awadalla, A., et al.: OpenFlamingo: an open-source framework for training large autoregressive vision-language models. arXiv preprint arXiv: 2308.01390 (2023)"},{"key":"23_CR5","first-page":"25005","volume":"35","author":"A Bar","year":"2022","unstructured":"Bar, A., Gandelsman, Y., Darrell, T., Globerson, A., Efros, A.: Visual prompting via image inpainting. Adv. Neural. Inf. Process. Syst. 35, 25005\u201325017 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"23_CR6","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"446","DOI":"10.1007\/978-3-319-10599-4_29","volume-title":"Computer Vision \u2013 ECCV 2014","author":"L Bossard","year":"2014","unstructured":"Bossard, L., Guillaumin, M., Van Gool, L.: Food-101 \u2013 mining discriminative components with random forests. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8694, pp. 446\u2013461. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10599-4_29"},{"key":"23_CR7","unstructured":"Cao, N.D., Izacard, G., Riedel, S., Petroni, F.: Autoregressive entity retrieval. In: 9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, 3\u20137 May 2021 (2021)"},{"key":"23_CR8","doi-asserted-by":"crossref","unstructured":"Caron, M., Iscen, A., Fathi, A., Schmid, C.: A generative approach for Wikipedia-scale visual entity recognition. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (2024)","DOI":"10.1109\/CVPR52733.2024.01639"},{"key":"23_CR9","doi-asserted-by":"crossref","unstructured":"Changpinyo, S., Sharma, P., Ding, N., Soricut, R.: Conceptual 12M: pushing web-scale image-text pre-training to recognize long-tail visual concepts. In: Computer Vision and Pattern Recognition (2021)","DOI":"10.1109\/CVPR46437.2021.00356"},{"key":"23_CR10","unstructured":"Chen, L., et al.: Large language models are visual reasoning coordinators. arXiv preprint arXiv: 2310.15166 (2023)"},{"key":"23_CR11","unstructured":"Chen, T., Kornblith, S., Norouzi, M., Hinton, G.: A simple framework for contrastive learning of visual representations. In: International Conference on Machine Learning, pp. 1597\u20131607. PMLR (2020)"},{"key":"23_CR12","unstructured":"Chen, X., et al.: PaLI: a jointly-scaled multilingual language-image model. In: International Conference on Learning Representations (2022)"},{"key":"23_CR13","doi-asserted-by":"crossref","unstructured":"Chopra, S., Hadsell, R., LeCun, Y.: Learning a similarity metric discriminatively, with application to face verification. In: 2005 IEEE Computer Society Conference on Computer Vision and Pattern Recognition (CVPR 2005), vol.\u00a01, pp. 539\u2013546 (2005)","DOI":"10.1109\/CVPR.2005.202"},{"key":"23_CR14","unstructured":"Dai, W., et al.: InstructBLIP: towards general-purpose vision-language models with instruction tuning. In: Proceedings of the 37th International Conference on Neural Information Processing Systems, NIPS 2023. Curran Associates Inc., Red Hook (2024)"},{"key":"23_CR15","unstructured":"Dosovitskiy, A., et al.: An image is worth 16$$\\times $$16 words: transformers for image recognition at scale. In: 9th International Conference on Learning Representations, ICLR 2021, Virtual Event, Austria, 3\u20137 May 2021 (2021)"},{"key":"23_CR16","doi-asserted-by":"crossref","unstructured":"Fan, R., Poggi, M., Mattoccia, S.: Contrastive learning for depth prediction. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 3226\u20133237 (2023)","DOI":"10.1109\/CVPRW59228.2023.00325"},{"key":"23_CR17","doi-asserted-by":"crossref","unstructured":"F\u00e9vry, T., Baldini\u00a0Soares, L., FitzGerald, N., Choi, E., Kwiatkowski, T.: Entities as experts: sparse memory access with entity supervision. In: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP), pp. 4937\u20134951. Association for Computational Linguistics, Online (2020)","DOI":"10.18653\/v1\/2020.emnlp-main.400"},{"key":"23_CR18","doi-asserted-by":"crossref","unstructured":"Gao, F., Ping, Q., Thattai, G., Reganti, A., Wu, Y.N., Natarajan, P.: Transform-retrieve-generate: natural language-centric outside-knowledge visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5067\u20135077 (2022)","DOI":"10.1109\/CVPR52688.2022.00501"},{"key":"23_CR19","unstructured":"Gerry: Sports100: 100 Sports Image Classification (2021). https:\/\/www.kaggle.com\/datasets\/gpiosenka\/sports-classification\/metadata"},{"issue":"2","key":"23_CR20","first-page":"337","volume":"41","author":"WR Gilks","year":"1992","unstructured":"Gilks, W.R., Wild, P.: Adaptive rejection sampling for Gibbs sampling. J. Roy. Stat. Soc.: Ser. C (Appl. Stat.) 41(2), 337\u2013348 (1992)","journal-title":"J. Roy. Stat. Soc.: Ser. C (Appl. Stat.)"},{"key":"23_CR21","doi-asserted-by":"crossref","unstructured":"Goyal, Y., Khot, T., Summers-Stay, D., Batra, D., Parikh, D.: Making the V in VQA matter: elevating the role of image understanding in visual question answering. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2017)","DOI":"10.1109\/CVPR.2017.670"},{"key":"23_CR22","doi-asserted-by":"crossref","unstructured":"Gu, Y., Deng, X., Su, Y.: Don\u2019t generate, discriminate: a proposal for grounding language models to real-world environments. In: Annual Meeting of the Association for Computational Linguistics (2022)","DOI":"10.18653\/v1\/2023.acl-long.270"},{"key":"23_CR23","unstructured":"Guu, K., Lee, K., Tung, Z., Pasupat, P., Chang, M.W.: REALM: retrieval-augmented language model pre-training. In: International Conference on Machine Learning (ICML) (2020)"},{"key":"23_CR24","unstructured":"Guu, K., Lee, K., Tung, Z., Pasupat, P., Chang, M.: Retrieval augmented language model pre-training. In: III, H.D., Singh, A. (eds.) Proceedings of the 37th International Conference on Machine Learning. Proceedings of Machine Learning Research, vol.\u00a0119, pp. 3929\u20133938. PMLR (2020)"},{"key":"23_CR25","doi-asserted-by":"crossref","unstructured":"Hernandez, J., Villegas, R., Ordonez, V.: ViC-MAE: self-supervised representation learning from images and video with contrastive masked autoencoders. arXiv preprint arXiv:2303.12001 (2023)","DOI":"10.1007\/978-3-031-73235-5_25"},{"key":"23_CR26","unstructured":"Hernandez, J., Villegas, R., Ordonez, V.: Generative visual instruction tuning (2024). https:\/\/arxiv.org\/abs\/2406.11262"},{"key":"23_CR27","unstructured":"Hu, E.J., et al.: LoRA: low-rank adaptation of large language models. In: The Tenth International Conference on Learning Representations, ICLR 2022, Virtual Event, 25\u201329 April 2022 (2022)"},{"key":"23_CR28","doi-asserted-by":"crossref","unstructured":"Hu, H., et al.: Open-domain visual entity recognition: Towards recognizing millions of Wikipedia entities. In: ICCV (2023)","DOI":"10.1109\/ICCV51070.2023.01108"},{"key":"23_CR29","doi-asserted-by":"crossref","unstructured":"van Hulst, J.M., Hasibi, F., Dercksen, K., Balog, K., de\u00a0Vries, A.P.: REL: an entity linker standing on the shoulders of giants. In: Huang, J.X., et al. (eds.) Proceedings of the 43rd International ACM SIGIR conference on research and development in Information Retrieval, SIGIR 2020, Virtual Event, China, 25\u201330 July 2020, pp. 2197\u20132200. ACM (2020)","DOI":"10.1145\/3397271.3401416"},{"key":"23_CR30","unstructured":"Iscen, A., Caron, M., Fathi, A., Schmid, C.: Retrieval-enhanced contrastive vision-text models. In: The Twelfth International Conference on Learning Representations (2024)"},{"key":"23_CR31","unstructured":"Jia, C., et al.: Scaling up visual and vision-language representation learning with noisy text supervision. International Conference on Machine Learning (2021)"},{"key":"23_CR32","doi-asserted-by":"crossref","unstructured":"Kirillov, A., et al.: Segment Anything. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), pp. 4015\u20134026 (2023)","DOI":"10.1109\/ICCV51070.2023.00371"},{"key":"23_CR33","unstructured":"Koh, J.Y., Fried, D., Salakhutdinov, R.: Generating images with multimodal language models. arXiv preprint arXiv: 2305.17216 (2023)"},{"key":"23_CR34","unstructured":"Koh, J.Y., Salakhutdinov, R., Fried, D.: Grounding language models to images for multimodal inputs and outputs. In: International Conference on Machine Learning (2023)"},{"key":"23_CR35","doi-asserted-by":"crossref","unstructured":"Krause, J., Stark, M., Deng, J., Fei-Fei, L.: 3D object representations for fine-grained categorization. In: 3dRR-13 (2013)","DOI":"10.1109\/ICCVW.2013.77"},{"issue":"1","key":"23_CR36","doi-asserted-by":"publisher","first-page":"32","DOI":"10.1007\/s11263-016-0981-7","volume":"123","author":"R Krishna","year":"2017","unstructured":"Krishna, R., et al.: Visual genome: connecting language and vision using crowdsourced dense image annotations. Int. J. Comput. Vision 123(1), 32\u201373 (2017)","journal-title":"Int. J. Comput. Vision"},{"key":"23_CR37","unstructured":"Lai, X., et al.: LISA: reasoning segmentation via large language model. arXiv preprint arXiv: 2308.00692 (2023)"},{"key":"23_CR38","doi-asserted-by":"crossref","unstructured":"Lester, B., Al-Rfou, R., Constant, N.: The power of scale for parameter-efficient prompt tuning. In: Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing, pp. 3045\u20133059. Association for Computational Linguistics, Online and Punta Cana, Dominican Republic (2021)","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"23_CR39","unstructured":"Lewis, P., et al.: Retrieval-augmented generation for knowledge-intensive NLP tasks. In: Larochelle, H., Ranzato, M., Hadsell, R., Balcan, M., Lin, H. (eds.) Advances in Neural Information Processing Systems, vol.\u00a033, pp. 9459\u20139474. Curran Associates, Inc. (2020)"},{"key":"23_CR40","unstructured":"Li, J., Li, D., Savarese, S., Hoi, S.C.H.: BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models. In: Krause, A., Brunskill, E., Cho, K., Engelhardt, B., Sabato, S., Scarlett, J. (eds.) International Conference on Machine Learning, ICML 2023, 23-29 July 2023, Honolulu, Hawaii, USA. Proceedings of Machine Learning Research, vol.\u00a0202, pp. 19730\u201319742. PMLR (2023)"},{"key":"23_CR41","doi-asserted-by":"crossref","unstructured":"Lin, W., Chen, J., Mei, J., Coca, A., Byrne, B.: Fine-grained late-interaction multi-modal retrieval for retrieval augmented visual question answering. In: Larochelle, H., Ranzato, M., Hadsell, R., Balcan, M.F., Lin, H. (eds.) Advances in Neural Information Processing Systems. Curran Associates, Inc. (2023)","DOI":"10.18653\/v1\/2022.emnlp-main.772"},{"key":"23_CR42","doi-asserted-by":"crossref","unstructured":"Liu, H., Li, C., Li, Y., Lee, Y.J.: Improved baselines with visual instruction tuning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 26296\u201326306 (2024)","DOI":"10.1109\/CVPR52733.2024.02484"},{"key":"23_CR43","unstructured":"Liu, H., Li, C., Wu, Q., Lee, Y.J.: Visual instruction tuning. In: Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M., Levine, S. (eds.) Advances in Neural Information Processing Systems, vol.\u00a036, pp. 34892\u201334916. Curran Associates, Inc. (2023)"},{"key":"23_CR44","unstructured":"Maji, S., Rahtu, E., Kannala, J., Blaschko, M., Vedaldi, A.: Fine-grained visual classification of aircraft (2013). https:\/\/arxiv.org\/abs\/1306.5151"},{"key":"23_CR45","unstructured":"Malinowski, M., Fritz, M.: A multi-world approach to question answering about real-world scenes based on uncertain input. In: Advances in Neural Information Processing Systems, vol. 27 (2014)"},{"key":"23_CR46","doi-asserted-by":"crossref","unstructured":"Marino, K., Rastegari, M., Farhadi, A., Mottaghi, R.: OK-VQA: a visual question answering benchmark requiring external knowledge. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 3195\u20133204 (2019),","DOI":"10.1109\/CVPR.2019.00331"},{"key":"23_CR47","doi-asserted-by":"crossref","unstructured":"Mrini, K., Nie, S., Gu, J., Wang, S., Sanjabi, M., Firooz, H.: Detection, disambiguation, re-ranking: autoregressive entity linking as a multi-task problem. In: Findings of the Association for Computational Linguistics: ACL 2022, pp. 1972\u20131983. Association for Computational Linguistics, Dublin (2022)","DOI":"10.18653\/v1\/2022.findings-acl.156"},{"key":"23_CR48","unstructured":"Naveed, H., et al.: A comprehensive overview of large language models. arXiv preprint arXiv: 2307.06435 (2023)"},{"key":"23_CR49","doi-asserted-by":"crossref","unstructured":"Nilsback, M.E., Zisserman, A.: Automated flower classification over a large number of classes. In: 2008 Sixth Indian Conference on Computer Vision, Graphics & Image Processing. IEEE (2008)","DOI":"10.1109\/ICVGIP.2008.47"},{"key":"23_CR50","unstructured":"van\u00a0den Oord, A., Li, Y., Vinyals, O.: Representation learning with contrastive predictive coding. arXiv preprint arXiv: 1807.03748 (2018)"},{"key":"23_CR51","unstructured":"OpenAI: GPT-4V(ision) System Card (2023). https:\/\/cdn.openai.com\/papers\/GPTV_System_Card.pdf"},{"key":"23_CR52","unstructured":"Ordonez, V., Kulkarni, G., Berg, T.L.: IM2Text: describing images using 1 million captioned photographs. In: Neural Information Processing Systems (NIPS) (2011)"},{"key":"23_CR53","doi-asserted-by":"crossref","unstructured":"Ouyang, S., Huang, J., Pillai, P., Zhang, Y., Zhang, Y., Han, J.: Ontology enrichment for effective fine-grained entity typing. arXiv preprint arXiv:2310.07795 (2023)","DOI":"10.1145\/3637528.3671857"},{"key":"23_CR54","first-page":"22895","volume":"35","author":"X Pan","year":"2022","unstructured":"Pan, X., Ye, T., Han, D., Song, S., Huang, G.: Contrastive language-image pre-training with knowledge graphs. Adv. Neural. Inf. Process. Syst. 35, 22895\u201322910 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"23_CR55","unstructured":"Peng, Z., et al.: Kosmos-2: grounding multimodal large language models to the world. arXiv preprint arXiv: 2306.14824 (2023)"},{"key":"23_CR56","unstructured":"Radford, A., et al.: Learning transferable visual models from natural language supervision. In: Meila, M., Zhang, T. (eds.) Proceedings of the 38th International Conference on Machine Learning, ICML 2021, 18\u201324 July 2021, Virtual Event. Proceedings of Machine Learning Research, vol.\u00a0139, pp. 8748\u20138763. PMLR (2021)"},{"key":"23_CR57","doi-asserted-by":"crossref","unstructured":"Ram, O., et al.: In-context retrieval-augmented language models. Trans. Assoc. Comput. Linguist. (2023)","DOI":"10.1162\/tacl_a_00605"},{"key":"23_CR58","unstructured":"Ramakrishnan, S., Agrawal, A., Lee, S.: Overcoming language priors in visual question answering with adversarial regularization. In: Bengio, S., Wallach, H., Larochelle, H., Grauman, K., Cesa-Bianchi, N., Garnett, R. (eds.) Advances in Neural Information Processing Systems, vol.\u00a031. Curran Associates, Inc. (2018)"},{"key":"23_CR59","unstructured":"Ren, M., Kiros, R., Zemel, R.: Exploring models and data for image question answering. Adv. Neural Inf. Process. Syst. 28 (2015)"},{"key":"23_CR60","unstructured":"Ridnik, T., Ben-Baruch, E., Noy, A., Zelnik-Manor, L.: ImageNet-21k pretraining for the masses. In: NeurIPS (2021)"},{"issue":"4","key":"23_CR61","doi-asserted-by":"publisher","first-page":"333","DOI":"10.1561\/1500000019","volume":"3","author":"S Robertson","year":"2009","unstructured":"Robertson, S., Zaragoza, H., et al.: The probabilistic relevance framework: BM25 and beyond. Found. Trends Inf. Retr. 3(4), 333\u2013389 (2009)","journal-title":"Found. Trends Inf. Retr."},{"key":"23_CR62","doi-asserted-by":"crossref","unstructured":"Russakovsky, O., et\u00a0al.: ImageNet large scale visual recognition challenge. Int. J. Comput. Vision (IJCV) (2015)","DOI":"10.1007\/s11263-015-0816-y"},{"key":"23_CR63","first-page":"25278","volume":"35","author":"C Schuhmann","year":"2022","unstructured":"Schuhmann, C., et al.: LAION-5B: an open large-scale dataset for training next generation image-text models. Adv. Neural. Inf. Process. Syst. 35, 25278\u201325294 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"23_CR64","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"146","DOI":"10.1007\/978-3-031-20074-8_9","volume-title":"Computer Vision \u2013 ECCV 2022","author":"D Schwenk","year":"2022","unstructured":"Schwenk, D., Khandelwal, A., Clark, C., Marino, K., Mottaghi, R.: A-OKVQA: a benchmark for visual question answering using world knowledge. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13668, pp. 146\u2013162. Springer, Cham (2022)"},{"key":"23_CR65","doi-asserted-by":"crossref","unstructured":"Shao, Z., Yu, Z., Wang, M., Yu, J.: Prompting large language models with answer heuristics for knowledge-based visual question answering. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 14974\u201314983 (2023)","DOI":"10.1109\/CVPR52729.2023.01438"},{"key":"23_CR66","unstructured":"Shrivastava, A., Selvaraju, R.R., Naik, N., Ordonez, V.: CLIP-lite: Information efficient visual representation learning with language supervision. In: International Conference on Artificial Intelligence and Statistics, pp. 8433\u20138447. PMLR (2023)"},{"key":"23_CR67","doi-asserted-by":"crossref","unstructured":"Singh, A., et al.: Towards VQA models that can read. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2019)","DOI":"10.1109\/CVPR.2019.00851"},{"key":"23_CR68","unstructured":"Touvron, H., et al.: LLaMA: open and efficient foundation language models. arxiv (2023)"},{"key":"23_CR69","first-page":"200","volume":"34","author":"M Tsimpoukelli","year":"2021","unstructured":"Tsimpoukelli, M., Menick, J.L., Cabi, S., Eslami, S., Vinyals, O., Hill, F.: Multimodal few-shot learning with frozen language models. Adv. Neural. Inf. Process. Syst. 34, 200\u2013212 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"23_CR70","doi-asserted-by":"crossref","unstructured":"Van\u00a0Horn, G., et al.: The inaturalist species classification and detection dataset. In: IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00914"},{"key":"23_CR71","unstructured":"Wang, J., et al.: GIT: a generative image-to-text transformer for vision and language. Trans. Mach. Learn. Res. 2022 (2022)"},{"key":"23_CR72","doi-asserted-by":"crossref","unstructured":"Wang, W., et\u00a0al.: Image as a foreign language: BEiT pretraining for vision and vision-language tasks. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 19175\u201319186 (2023)","DOI":"10.1109\/CVPR52729.2023.01838"},{"key":"23_CR73","doi-asserted-by":"crossref","unstructured":"Wang, X., Wang, W., Cao, Y., Shen, C., Huang, T.: Images speak in images: a generalist painter for in-context visual learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pp. 6830\u20136839 (2023)","DOI":"10.1109\/CVPR52729.2023.00660"},{"key":"23_CR74","unstructured":"Wang, Z., et al.: Interactive natural language processing (2023). https:\/\/arxiv.org\/abs\/2305.13246"},{"key":"23_CR75","unstructured":"Wang, Z., Araki, J., Jiang, Z., Parvez, M.R., Neubig, G.: Learning to filter context for retrieval-augmented generation. arXiv preprint arXiv: 2311.08377 (2023)"},{"key":"23_CR76","doi-asserted-by":"crossref","unstructured":"Weyand, T., Araujo, A., Cao, B., Sim, J.: Google landmarks dataset v2-a large-scale benchmark for instance-level recognition and retrieval. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2020)","DOI":"10.1109\/CVPR42600.2020.00265"},{"key":"23_CR77","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K.A., Oliva, A., Torralba, A.: Sun database: large-scale scene recognition from abbey to zoo. In: Conference on Computer Vision and Pattern Recognition (CVPR) (2010)","DOI":"10.1109\/CVPR.2010.5539970"},{"key":"23_CR78","doi-asserted-by":"crossref","unstructured":"Xiao, Z., et al.: Instructed language models with retrievers are powerful entity linkers. arXiv preprint arXiv: 2311.03250 (2023)","DOI":"10.18653\/v1\/2023.emnlp-main.139"},{"key":"23_CR79","unstructured":"Zhang, W., Hua, W., Stratos, K.: EntQA: entity linking as question answering. In: The Tenth International Conference on Learning Representations, ICLR 2022, Virtual Event, 25\u201329 April 2022 (2022)"},{"key":"23_CR80","doi-asserted-by":"crossref","unstructured":"Zhu, Y., Groth, O., Bernstein, M., Fei-Fei, L.: Visual7w: grounded question answering in images. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2016)","DOI":"10.1109\/CVPR.2016.540"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2024"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-73247-8_23","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,30]],"date-time":"2024-11-30T15:38:20Z","timestamp":1732981100000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-73247-8_23"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,11,1]]},"ISBN":["9783031732461","9783031732478"],"references-count":80,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-73247-8_23","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"type":"print","value":"0302-9743"},{"type":"electronic","value":"1611-3349"}],"subject":[],"published":{"date-parts":[[2024,11,1]]},"assertion":[{"value":"1 November 2024","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Milan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Italy","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2024","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29 September 2024","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"4 October 2024","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2024","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2024.ecva.net\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}