{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T01:40:48Z","timestamp":1755826848498,"version":"3.44.0"},"publisher-location":"New York, NY, USA","reference-count":40,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,5,30]],"date-time":"2024-05-30T00:00:00Z","timestamp":1717027200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Key R&D Program Project of Nanjng Jiangbei New Area","award":["ZDYF20200130"],"award-info":[{"award-number":["ZDYF20200130"]}]},{"DOI":"10.13039\/501100006374","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1811461"],"award-info":[{"award-number":["U1811461"]}],"id":[{"id":"10.13039\/501100006374","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Jiangsu Province Science & Technology Research Grant","award":["BE2021729"],"award-info":[{"award-number":["BE2021729"]}]},{"name":"National Natural Science Foundation of China","award":["61572250"],"award-info":[{"award-number":["61572250"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,5,30]]},"DOI":"10.1145\/3652583.3658016","type":"proceedings-article","created":{"date-parts":[[2024,6,7]],"date-time":"2024-06-07T06:30:40Z","timestamp":1717741840000},"page":"842-850","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["ML\n            <sup>2<\/sup>\n            MG-VLCR: A Multimodal LLM Guided Zero-shot Method for Visio-linguistic Compositional Reasoning with Autoregressive Generative Language Model"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0008-0525-3089","authenticated-orcid":false,"given":"Ziyu","family":"Gong","sequence":"first","affiliation":[{"name":"State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6185-8858","authenticated-orcid":false,"given":"Chengcheng","family":"Mai","sequence":"additional","affiliation":[{"name":"School of Computer Science and Electronic Information\/School of Artifical Intelligence, Nanjing Normal University, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1806-0936","authenticated-orcid":false,"given":"Yihua","family":"Huang","sequence":"additional","affiliation":[{"name":"State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,6,7]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2308.12966"},{"key":"e_1_3_2_1_2_1","volume-title":"METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. In ACL. 65--72.","author":"Banerjee Satanjeev","year":"2005","unstructured":"Satanjeev Banerjee and Alon Lavie. 2005. METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. In ACL. 65--72."},{"key":"e_1_3_2_1_3_1","volume-title":"IMRAM: Iterative Matching With Recurrent Attention Memory for Cross-Modal Image-Text Retrieval. In CVPR. 12652--12660.","author":"Chen Hui","year":"2020","unstructured":"Hui Chen, Guiguang Ding, Xudong Liu, Zijia Lin, Ji Liu, and Jungong Han. 2020. IMRAM: Iterative Matching With Recurrent Attention Memory for Cross-Modal Image-Text Retrieval. In CVPR. 12652--12660."},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2306.15195"},{"key":"e_1_3_2_1_5_1","unstructured":"Xi Chen Xiao Wang Soravit Changpinyo A. J. Piergiovanni Piotr Padlewski Daniel Salz Sebastian Goodman Adam Grycner Basil Mustafa Lucas Beyer Alexander Kolesnikov Joan Puigcerver Nan Ding Keran Rong Hassan Akbari Gaurav Mishra Linting Xue Ashish V. Thapliyal James Bradbury and Weicheng Kuo. 2023 a. PaLI: A Jointly-Scaled Multilingual Language-Image Model. In ICLR."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Mengjun Cheng Yipeng Sun Longchao Wang Xiongwei Zhu Kun Yao Jie Chen Guoli Song Junyu Han Jingtuo Liu Errui Ding and Jingdong Wang. 2022. ViSTA: Vision and Scene Text Aggregation for Cross-Modal Retrieval. In CVPR. 5174--5183.","DOI":"10.1109\/CVPR52688.2022.00512"},{"key":"e_1_3_2_1_7_1","first-page":"1931","article-title":"Unifying Vision-and-Language Tasks via Text Generation","volume":"139","author":"Cho Jaemin","year":"2021","unstructured":"Jaemin Cho, Jie Lei, Hao Tan, and Mohit Bansal. 2021. Unifying Vision-and-Language Tasks via Text Generation. In ICML, Vol. 139. 1931--1942.","journal-title":"ICML"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2305.06500"},{"key":"e_1_3_2_1_9_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. 4171--4186.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. 4171--4186."},{"key":"e_1_3_2_1_10_1","first-page":"4904","article-title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","volume":"139","author":"Jia Chao","year":"2021","unstructured":"Chao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen, Zarana Parekh, Hieu Pham, Quoc V. Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig. 2021. Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. In ICML, Vol. 139. 4904--4916.","journal-title":"ICML"},{"key":"e_1_3_2_1_11_1","volume-title":"Adversarial Evaluation of Dialogue Models. CoRR","author":"Kannan Anjuli","year":"2017","unstructured":"Anjuli Kannan and Oriol Vinyals. 2017. Adversarial Evaluation of Dialogue Models. CoRR, Vol. abs\/1701.08198 (2017). http:\/\/arxiv.org\/abs\/1701.08198"},{"key":"e_1_3_2_1_12_1","first-page":"5583","article-title":"ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision","volume":"139","author":"Kim Wonjae","year":"2021","unstructured":"Wonjae Kim, Bokyung Son, and Ildoo Kim. 2021. ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision. In ICML, Vol. 139. 5583--5594.","journal-title":"ICML"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2305.03726"},{"key":"e_1_3_2_1_14_1","first-page":"12888","article-title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","volume":"162","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven C. H. Hoi. 2022. BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation. In ICML, Vol. 162. 12888--12900.","journal-title":"ICML"},{"key":"e_1_3_2_1_15_1","unstructured":"Junnan Li Ramprasaath R. Selvaraju Akhilesh Gotmare Shafiq R. Joty Caiming Xiong and Steven Chu-Hong Hoi. 2021. Align before Fuse: Vision and Language Representation Learning with Momentum Distillation. In NeurIPS. 9694--9705."},{"key":"e_1_3_2_1_16_1","volume-title":"Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74--81.","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin. 2004. Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74--81."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2304.08485"},{"key":"e_1_3_2_1_18_1","volume-title":"Nicolas Angelard-Gontier, Yoshua Bengio, and Joelle Pineau.","author":"Lowe Ryan","year":"2017","unstructured":"Ryan Lowe, Michael D. Noseworthy, Iulian Vlad Serban, Nicolas Angelard-Gontier, Yoshua Bengio, and Joelle Pineau. 2017. Towards an Automatic Turing Test: Learning to Evaluate Dialogue Responses. In ACL. 1116--1126."},{"key":"e_1_3_2_1_19_1","unstructured":"Tom\u00e1s Mikolov Kai Chen Greg Corrado and Jeffrey Dean. 2013. Efficient Estimation of Word Representations in Vector Space. In ICLR."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"crossref","unstructured":"Kishore Papineni Salim Roukos Todd Ward and Wei-Jing Zhu. 2002. Bleu: a Method for Automatic Evaluation of Machine Translation. In ACL. 311--318.","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2306.14824"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"crossref","unstructured":"Matthew E. Peters Mark Neumann Mohit Iyyer Matt Gardner Christopher Clark Kenton Lee and Luke Zettlemoyer. 2018. Deep Contextualized Word Representations. In NAACL-HLT. 2227--2237.","DOI":"10.18653\/v1\/N18-1202"},{"key":"e_1_3_2_1_23_1","first-page":"8748","article-title":"Learning Transferable Visual Models From Natural Language Supervision","volume":"139","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In ICML, Vol. 139. 8748--8763.","journal-title":"ICML"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"crossref","unstructured":"Robin Rombach Andreas Blattmann Dominik Lorenz Patrick Esser and Bj\u00f6rn Ommer. 2022. High-Resolution Image Synthesis with Latent Diffusion Models. In CVPR. 10674--10685.","DOI":"10.1109\/CVPR52688.2022.01042"},{"key":"e_1_3_2_1_25_1","volume-title":"FLAVA: A Foundational Language And Vision Alignment Model. In CVPR. 15617--15629.","author":"Singh Amanpreet","year":"2022","unstructured":"Amanpreet Singh, Ronghang Hu, Vedanuj Goswami, Guillaume Couairon, Wojciech Galuba, Marcus Rohrbach, and Douwe Kiela. 2022. FLAVA: A Foundational Language And Vision Alignment Model. In CVPR. 15617--15629."},{"key":"e_1_3_2_1_26_1","volume-title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers. In EMNLP-IJCNLP. 5099--5110.","author":"Tan Hao","year":"2019","unstructured":"Hao Tan and Mohit Bansal. 2019. LXMERT: Learning Cross-Modality Encoder Representations from Transformers. In EMNLP-IJCNLP. 5099--5110."},{"key":"e_1_3_2_1_27_1","volume-title":"Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality. In CVPR. 5228--5238.","author":"Thrush Tristan","year":"2022","unstructured":"Tristan Thrush, Ryan Jiang, Max Bartolo, Amanpreet Singh, Adina Williams, Douwe Kiela, and Candace Ross. 2022. Winoground: Probing Vision and Language Models for Visio-Linguistic Compositionality. In CVPR. 5228--5238."},{"key":"e_1_3_2_1_28_1","unstructured":"Junke Wang Dongdong Chen Zuxuan Wu Chong Luo Luowei Zhou Yucheng Zhao Yujia Xie Ce Liu Yu-Gang Jiang and Lu Yuan. 2022b. OmniVL: One Foundation Model for Image-Language and Video-Language Tasks. In NeurIPS."},{"key":"e_1_3_2_1_29_1","volume-title":"Saksham Singhal, Subhojit Som, and Furu Wei.","author":"Wang Wenhui","year":"2022","unstructured":"Wenhui Wang, Hangbo Bao, Li Dong, Johan Bjorck, Zhiliang Peng, Qiang Liu, Kriti Aggarwal, Owais Khan Mohammed, Saksham Singhal, Subhojit Som, and Furu Wei. 2022a. Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks. CoRR, Vol. abs\/2208.10442 (2022)."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2311.03079"},{"key":"e_1_3_2_1_31_1","volume-title":"Zihang Dai, Yulia Tsvetkov, and Yuan Cao.","author":"Wang Zirui","year":"2022","unstructured":"Zirui Wang, Jiahui Yu, Adams Wei Yu, Zihang Dai, Yulia Tsvetkov, and Yuan Cao. 2022c. SimVLM: Simple Visual Language Model Pretraining with Weak Supervision. In ICLR."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2304.14178"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2306.06687"},{"key":"e_1_3_2_1_34_1","unstructured":"Weizhe Yuan Graham Neubig and Pengfei Liu. 2021. BARTScore: Evaluating Generated Text as Text Generation. In NeurIPS. 27263--27277."},{"key":"e_1_3_2_1_35_1","unstructured":"Mert Y\u00fcksekg\u00f6n\u00fcl Federico Bianchi Pratyusha Kalluri Dan Jurafsky and James Zou. 2023. When and Why Vision-Language Models Behave like Bags-Of-Words and What to Do About It?. In ICLR."},{"key":"e_1_3_2_1_36_1","first-page":"25994","article-title":"Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts","volume":"162","author":"Zeng Yan","year":"2022","unstructured":"Yan Zeng, Xinsong Zhang, and Hang Li. 2022. Multi-Grained Vision Language Pre-Training: Aligning Texts with Visual Concepts. In ICML, Vol. 162. 25994--26009.","journal-title":"ICML"},{"key":"e_1_3_2_1_37_1","volume-title":"X 2-vlm: All-in-one pre-trained model for vision-language tasks","author":"Zeng Yan","year":"2023","unstructured":"Yan Zeng, Xinsong Zhang, Hang Li, Jiawei Wang, Jipeng Zhang, and Wangchunshu Zhou. 2023. X 2-vlm: All-in-one pre-trained model for vision-language tasks. IEEE Transactions on Pattern Analysis and Machine Intelligence (2023)."},{"key":"e_1_3_2_1_38_1","unstructured":"Tianyi Zhang Varsha Kishore Felix Wu Kilian Q. Weinberger and Yoav Artzi. 2020. BERTScore: Evaluating Text Generation with BERT. In ICLR."},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"crossref","unstructured":"Wei Zhao Maxime Peyrard Fei Liu Yang Gao Christian M. Meyer and Steffen Eger. 2019. MoverScore: Text Generation Evaluating with Contextualized Embeddings and Earth Mover Distance. In EMNLP-IJCNLP. 563--578.","DOI":"10.18653\/v1\/D19-1053"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.48550\/arXiv.2304.10592"}],"event":{"name":"ICMR '24: International Conference on Multimedia Retrieval","sponsor":["SIGMM ACM Special Interest Group on Multimedia","SIGSOFT ACM Special Interest Group on Software Engineering"],"location":"Phuket Thailand","acronym":"ICMR '24"},"container-title":["Proceedings of the 2024 International Conference on Multimedia Retrieval"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3652583.3658016","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3652583.3658016","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,21]],"date-time":"2025-08-21T08:44:57Z","timestamp":1755765897000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3652583.3658016"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,5,30]]},"references-count":40,"alternative-id":["10.1145\/3652583.3658016","10.1145\/3652583"],"URL":"https:\/\/doi.org\/10.1145\/3652583.3658016","relation":{},"subject":[],"published":{"date-parts":[[2024,5,30]]},"assertion":[{"value":"2024-06-07","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}