{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,7]],"date-time":"2026-05-07T16:43:25Z","timestamp":1778172205961,"version":"3.51.4"},"publisher-location":"New York, NY, USA","reference-count":49,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Kuaishou"},{"name":"National Key Research and Development Program of China","award":["2018AAA0102200"],"award-info":[{"award-number":["2018AAA0102200"]}]},{"name":"National Natural Science Foundation of China","award":["61772116"],"award-info":[{"award-number":["61772116"]}]},{"name":"National Natural Science Foundation of China","award":["61872064"],"award-info":[{"award-number":["61872064"]}]},{"name":"National Natural Science Foundation of China","award":["62020106008"],"award-info":[{"award-number":["62020106008"]}]},{"name":"Sichuan Science and Technology Program","award":["2019JDTD0005"],"award-info":[{"award-number":["2019JDTD0005"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3475380","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T11:31:01Z","timestamp":1634556661000},"page":"2205-2213","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":35,"title":["Conceptual and Syntactical Cross-modal Alignment with Cross-level Consistency for Image-Text Matching"],"prefix":"10.1145","author":[{"given":"Pengpeng","family":"Zeng","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[{"name":"University of Electronic Science and\u00a0Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xinyu","family":"Lyu","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuaiqi","family":"Jing","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Emily Alsentzer Samuel G. Finlayson Michelle M. Li and Marinka Zitnik. 2020. Subgraph Neural Networks. In NeurIPS. Emily Alsentzer Samuel G. Finlayson Michelle M. Li and Marinka Zitnik. 2020. Subgraph Neural Networks. In NeurIPS."},{"key":"e_1_3_2_1_2_1","first-page":"382","article-title":"SPICE: Semantic Propositional Image Caption Evaluation","volume":"9909","author":"Anderson Peter","year":"2016","journal-title":"ECCV"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Hui Chen Guiguang Ding Xudong Liu Zijia Lin Ji Liu and Jungong Han. 2020 a. IMRAM: Iterative Matching With Recurrent Attention Memory for Cross-Modal Image-Text Retrieval. In CVPR. 12652--12660. Hui Chen Guiguang Ding Xudong Liu Zijia Lin Ji Liu and Jungong Han. 2020 a. IMRAM: Iterative Matching With Recurrent Attention Memory for Cross-Modal Image-Text Retrieval. In CVPR. 12652--12660.","DOI":"10.1109\/CVPR42600.2020.01267"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Shizhe Chen Qin Jin Peng Wang and Qi Wu. 2020 b. Say As You Wish: Fine-Grained Control of Image Caption Generation With Abstract Scene Graphs. In CVPR. 9959--9968. Shizhe Chen Qin Jin Peng Wang and Qi Wu. 2020 b. Say As You Wish: Fine-Grained Control of Image Caption Generation With Abstract Scene Graphs. In CVPR. 9959--9968.","DOI":"10.1109\/CVPR42600.2020.00998"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Chaorui Deng Qi Wu Qingyao Wu Fuyuan Hu Fan Lyu and Mingkui Tan. 2018. Visual Grounding via Accumulated Attention. In CVPR. 7746--7755. Chaorui Deng Qi Wu Qingyao Wu Fuyuan Hu Fan Lyu and Mingkui Tan. 2018. Visual Grounding via Accumulated Attention. In CVPR. 7746--7755.","DOI":"10.1109\/CVPR.2018.00808"},{"key":"e_1_3_2_1_6_1","volume-title":"Jamie Ryan Kiros, and Sanja Fidler","author":"Faghri Fartash","year":"2018"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"crossref","unstructured":"Yifan Feng Haoxuan You Zizhao Zhang Rongrong Ji and Yue Gao. 2019. Hypergraph Neural Networks. In AAAI. 3558--3565. Yifan Feng Haoxuan You Zizhao Zhang Rongrong Ji and Yue Gao. 2019. Hypergraph Neural Networks. In AAAI. 3558--3565.","DOI":"10.1609\/aaai.v33i01.33013558"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v33i01.33016391"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240687"},{"key":"e_1_3_2_1_10_1","unstructured":"Longteng Guo Jing Liu Xinxin Zhu Peng Yao Shichen Lu and Hanqing Lu. 2020 a. Normalized and Geometry-Aware Self-Attention Network for Image Captioning. In CVPR. 10324--10333. Longteng Guo Jing Liu Xinxin Zhu Peng Yao Shichen Lu and Hanqing Lu. 2020 a. Normalized and Geometry-Aware Self-Attention Network for Image Captioning. In CVPR. 10324--10333."},{"key":"e_1_3_2_1_11_1","volume-title":"Heng Tao Shen, and Xuelong Li","author":"Guo Yuyu","year":"2021"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3414025"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Yan Huang Wei Wang and Liang Wang. 2017. Instance-Aware Image and Sentence Matching with Selective Multimodal LSTM. In CVPR. 7254--7262. Yan Huang Wei Wang and Liang Wang. 2017. Instance-Aware Image and Sentence Matching with Selective Multimodal LSTM. In CVPR. 7254--7262.","DOI":"10.1109\/CVPR.2017.767"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Huaizu Jiang Ishan Misra Marcus Rohrbach Erik G. Learned-Miller and Xinlei Chen. 2020. In Defense of Grid Features for Visual Question Answering. In CVPR. 10264--10273. Huaizu Jiang Ishan Misra Marcus Rohrbach Erik G. Learned-Miller and Xinlei Chen. 2020. In Defense of Grid Features for Visual Question Answering. In CVPR. 10264--10273.","DOI":"10.1109\/CVPR42600.2020.01028"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Andrej Karpathy and Fei-Fei Li. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR. 3128--3137. Andrej Karpathy and Fei-Fei Li. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR. 3128--3137.","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"e_1_3_2_1_16_1","unstructured":"Eun-Sol Kim Woo-Young Kang Kyoung-Woon On Yu-Jung Heo and Byoung-Tak Zhang. 2020. Hypergraph Attention Networks for Multimodal Learning. In CVPR. 14569--14578. Eun-Sol Kim Woo-Young Kang Kyoung-Woon On Yu-Jung Heo and Byoung-Tak Zhang. 2020. Hypergraph Attention Networks for Multimodal Learning. In CVPR. 14569--14578."},{"key":"e_1_3_2_1_17_1","volume-title":"Kingma and Jimmy Ba","author":"Diederik","year":"2015"},{"key":"e_1_3_2_1_18_1","volume-title":"Zemel","author":"Kiros Ryan","year":"2014"},{"key":"e_1_3_2_1_19_1","first-page":"212","article-title":"Stacked Cross Attention for Image-Text Matching","volume":"11208","author":"Lee Kuang-Huei","year":"2018","journal-title":"ECCV"},{"key":"e_1_3_2_1_20_1","unstructured":"Kunpeng Li Yulun Zhang Kai Li Yuanyuan Li and Yun Fu. 2019 c. Visual Semantic Reasoning for Image-Text Matching. In ICCV. 4653--4661. Kunpeng Li Yulun Zhang Kai Li Yuanyuan Li and Yun Fu. 2019 c. Visual Semantic Reasoning for Image-Text Matching. In ICCV. 4653--4661."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Linjie Li Zhe Gan Yu Cheng and Jingjing Liu. 2019 a. Relation-Aware Graph Attention Network for Visual Question Answering. In ICCV. 10312--10321. Linjie Li Zhe Gan Yu Cheng and Jingjing Liu. 2019 a. Relation-Aware Graph Attention Network for Visual Question Answering. In ICCV. 10312--10321.","DOI":"10.1109\/ICCV.2019.01041"},{"key":"e_1_3_2_1_22_1","unstructured":"Shuang Li Tong Xiao Hongsheng Li Wei Yang and Xiaogang Wang. 2017. Identity-Aware Textual-Visual Matching with Latent Co-attention. In ICCV. 1908--1917. Shuang Li Tong Xiao Hongsheng Li Wei Yang and Xiaogang Wang. 2017. Identity-Aware Textual-Visual Matching with Latent Co-attention. In ICCV. 1908--1917."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350971"},{"key":"e_1_3_2_1_24_1","volume-title":"Piotr Doll\u00e1 r, and C. Lawrence Zitnick","author":"Lin Tsung-Yi","year":"2014"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350869"},{"key":"e_1_3_2_1_26_1","unstructured":"Chunxiao Liu Zhendong Mao Tianzhu Zhang Hongtao Xie Bin Wang and Yongdong Zhang. 2020. Graph Structured Network for Image-Text Matching. In CVPR. 10918--10927. Chunxiao Liu Zhendong Mao Tianzhu Zhang Hongtao Xie Bin Wang and Yongdong Zhang. 2020. Graph Structured Network for Image-Text Matching. In CVPR. 10918--10927."},{"key":"e_1_3_2_1_27_1","volume-title":"Lew","author":"Liu Yu","year":"2017"},{"key":"e_1_3_2_1_28_1","volume-title":"Steven Bethard, and David McClosky.","author":"Manning Christopher D.","year":"2014"},{"key":"e_1_3_2_1_29_1","unstructured":"Hyeonseob Nam Jung-Woo Ha and Jeonghee Kim. 2017. Dual Attention Networks for Multimodal Reasoning and Matching. In CVPR. 2156--2164. Hyeonseob Nam Jung-Woo Ha and Jeonghee Kim. 2017. Dual Attention Networks for Multimodal Reasoning and Matching. In CVPR. 2156--2164."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Zhenxing Niu Mo Zhou Le Wang Xinbo Gao and Gang Hua. 2017. Hierarchical Multimodal LS\u2122 for Dense Visual-Semantic Embedding. In ICCV. 1899--1907. Zhenxing Niu Mo Zhou Le Wang Xinbo Gao and Gang Hua. 2017. Hierarchical Multimodal LS\u2122 for Dense Visual-Semantic Embedding. In ICCV. 1899--1907.","DOI":"10.1109\/ICCV.2017.208"},{"key":"e_1_3_2_1_31_1","volume-title":"Manning","author":"Pennington Jeffrey","year":"2014"},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413961"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2612883"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.5555\/3304415.3304544"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2018.2814344"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.5555\/3295222.3295349"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3413753"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2797921"},{"key":"e_1_3_2_1_39_1","volume-title":"2019 c","author":"Wang Peng","year":"1960"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.5555\/3367471.3367568"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"crossref","unstructured":"Zihao Wang Xihui Liu Hongsheng Li Lu Sheng Junjie Yan Xiaogang Wang and Jing Shao. 2019 b. CAMP: Cross-Modal Adaptive Message Passing for Text-Image Retrieval. In ICCV. 5763--5772. Zihao Wang Xihui Liu Hongsheng Li Lu Sheng Junjie Yan Xiaogang Wang and Jing Shao. 2019 b. CAMP: Cross-Modal Adaptive Message Passing for Text-Image Retrieval. In ICCV. 5763--5772.","DOI":"10.1109\/ICCV.2019.00586"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"crossref","unstructured":"Xi Wei Tianzhu Zhang Yan Li Yongdong Zhang and Feng Wu. 2020. Multi-Modality Cross Attention Network for Image and Sentence Matching. In CVPR. 10938--10947. Xi Wei Tianzhu Zhang Yan Li Yongdong Zhang and Feng Wu. 2020. Multi-Modality Cross Attention Network for Image and Sentence Matching. In CVPR. 10938--10947.","DOI":"10.1109\/CVPR42600.2020.01095"},{"key":"e_1_3_2_1_43_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394171.3414046"},{"key":"e_1_3_2_1_44_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCYB.2019.2928180"},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"crossref","unstructured":"Xu Yang Kaihua Tang Hanwang Zhang and Jianfei Cai. 2019. Auto-Encoding Scene Graphs for Image Captioning. In CVPR. 10685--10694. Xu Yang Kaihua Tang Hanwang Zhang and Jianfei Cai. 2019. Auto-Encoding Scene Graphs for Image Captioning. In CVPR. 10685--10694.","DOI":"10.1109\/CVPR.2019.01094"},{"key":"e_1_3_2_1_46_1","first-page":"711","article-title":"Exploring Visual Relationship for Image Captioning","volume":"11218","author":"Yao Ting","year":"2018","journal-title":"ECCV"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00166"},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"crossref","unstructured":"Rowan Zellers Mark Yatskar Sam Thomson and Yejin Choi. 2018. Neural motifs: Scene graph parsing with global context. In CVPR. 5831--5840. Rowan Zellers Mark Yatskar Sam Thomson and Yejin Choi. 2018. Neural motifs: Scene graph parsing with global context. In CVPR. 5831--5840.","DOI":"10.1109\/CVPR.2018.00611"},{"key":"e_1_3_2_1_49_1","volume-title":"Li","author":"Zhang Qi","year":"2020"}],"event":{"name":"MM '21: ACM Multimedia Conference","location":"Virtual Event China","acronym":"MM '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475380","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3475380","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:48:32Z","timestamp":1750193312000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475380"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":49,"alternative-id":["10.1145\/3474085.3475380","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3475380","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}