{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T15:46:57Z","timestamp":1776786417443,"version":"3.51.2"},"reference-count":58,"publisher":"Association for Computing Machinery (ACM)","issue":"5","funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"crossref","award":["62502243 and 52306082"],"award-info":[{"award-number":["62502243 and 52306082"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"crossref"}]},{"DOI":"10.13039\/501100017630","name":"Humanities and Social Sciences Youth Foundation, Ministry of Education of the People\u2019s Republic of China","doi-asserted-by":"crossref","award":["24YJCZH135"],"award-info":[{"award-number":["24YJCZH135"]}],"id":[{"id":"10.13039\/501100017630","id-type":"DOI","asserted-by":"crossref"}]},{"name":"Postgraduate Education Reform and Quality Improvement Project of Henan Province","award":["YJS2026YBGZZ46"],"award-info":[{"award-number":["YJS2026YBGZZ46"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":["ACM Trans. Multimedia Comput. Commun. Appl."],"published-print":{"date-parts":[[2026,5,31]]},"abstract":"<jats:p>\n                    With the rapid growth of Internet multimedia data, cross-modal retrieval techniques have garnered significant attention. Given the inherent complexity and non-intuitive nature of cross-modal relationships, tuning pre-trained Large Multimodal Models (LMMs) with cross-modal data has become a mainstream approach. However, cross-modal data commonly exhibit inter-modal information asymmetry and intra-modal distribution diversity. Faced with these challenges, existing paradigms tend to learn ambiguous and asymmetric cross-modal associations, which introduce semantic noise. In addition, their limited adaptability to the high diversity of real-world content further hinders optimal retrieval performance. To address these challenges, this article proposes the\n                    <jats:italic toggle=\"yes\">A<\/jats:italic>\n                    daptive\n                    <jats:italic toggle=\"yes\">C<\/jats:italic>\n                    o-operative\n                    <jats:italic toggle=\"yes\">K<\/jats:italic>\n                    nowledge\n                    <jats:italic toggle=\"yes\">E<\/jats:italic>\n                    nhancement (ACKE) method, which comprises the Uncertainty-Aware Inspire Potential (UAIP) and Adaptive Co-Operative Prompt (ACP) strategies. UAIP utilizes generative LMMs to generate multi-perspective descriptions that enrich semantic information, while employing Dempster-Shafer Theory (DST) to quantify their semantic uncertainty and adjust contribution weights, reducing inaccurate relational mappings and balancing information asymmetry. ACP constructs a prompt pool where instance-specific visual prompts are dynamically selected and projected into text prompts, which collaborate to guide modal encoders toward deep semantic consensus, thus mitigating alignment bias from intra-modal distribution diversity and improving accuracy. Extensive experiments are conducted on two widely used datasets, Flickr30K and MS-COCO, demonstrating the effectiveness of our proposed method. The code is available at\n                    <jats:ext-link xmlns:xlink=\"http:\/\/www.w3.org\/1999\/xlink\" ext-link-type=\"uri\" xlink:href=\"https:\/\/github.com\/nynu-BDAI\/ACKE\">https:\/\/github.com\/nynu-BDAI\/ACKE<\/jats:ext-link>\n                    .\n                  <\/jats:p>","DOI":"10.1145\/3797043","type":"journal-article","created":{"date-parts":[[2026,2,11]],"date-time":"2026-02-11T17:28:09Z","timestamp":1770830889000},"page":"1-26","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Adaptive Co-Operative Prompting and Uncertainty-Aware Implicit Knowledge Enhancement for Cross-Modal Retrieval"],"prefix":"10.1145","volume":"22","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-3201-4978","authenticated-orcid":false,"given":"Xin","family":"Huang","sequence":"first","affiliation":[{"name":"School of Artificial Intelligence, Nanyang Normal University, Nanyang, China and Henan Digital Image Big Data Development Innovation Laboratory, Nanyang, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-7340-6334","authenticated-orcid":false,"given":"Shilong","family":"Wang","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Nanyang Normal University, Nanyang, China and Henan Digital Image Big Data Development Innovation Laboratory, Nanyang, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5946-9829","authenticated-orcid":false,"given":"Tong","family":"Jia","sequence":"additional","affiliation":[{"name":"Institute for Artificial Intelligence, Peking University, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4587-8370","authenticated-orcid":false,"given":"Zhimin","family":"Yuan","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Nanyang Normal University, Nanyang, China and Henan Digital Image Big Data Development Innovation Laboratory, Nanyang, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0008-0943-9008","authenticated-orcid":false,"given":"Runsheng","family":"Zhang","sequence":"additional","affiliation":[{"name":"School of Energy, Power and Mechanical Engineering, North China Electric Power University, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-0714-3356","authenticated-orcid":false,"given":"Jingjing","family":"Li","sequence":"additional","affiliation":[{"name":"School of Artificial Intelligence, Nanyang Normal University, Nanyang, China and Henan Digital Image Big Data Development Innovation Laboratory, Nanyang, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2026,4,21]]},"reference":[{"key":"e_1_3_1_2_2","first-page":"1247","volume-title":"International Conference on Machine Learning","author":"Andrew Galen","year":"2013","unstructured":"Galen Andrew, Raman Arora, Jeff A. Bilmes, and Karen Livescu. 2013. Deep canonical correlation analysis. In International Conference on Machine Learning, 1247\u20131255."},{"key":"e_1_3_1_3_2","first-page":"3041","volume-title":"ACM International Conference on Multimedia","author":"Bin Yi","year":"2023","unstructured":"Yi Bin, Haoxuan Li, Yahui Xu, Xing Xu, Yang Yang, and Heng Tao Shen. 2023. Unifying two-stream encoders with transformers for cross-modal retrieval. In ACM International Conference on Multimedia, 3041\u20133050."},{"key":"e_1_3_1_4_2","first-page":"12652","volume-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Chen Hui","year":"2020","unstructured":"Hui Chen, Guiguang Ding, Xudong Liu, Zijia Lin, Ji Liu, and Jungong Han. 2020. IMRAM: Iterative matching with recurrent attention memory for cross-modal image-text retrieval. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 12652\u201312660."},{"key":"e_1_3_1_5_2","first-page":"15789","volume-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Chen Jiacheng","year":"2021","unstructured":"Jiacheng Chen, Hexiang Hu, Hao Wu, Yuning Jiang, and Changhu Wang. 2021. Learning the best pooling strategy for visual semantic embedding. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 15789\u201315798."},{"key":"e_1_3_1_6_2","doi-asserted-by":"publisher","DOI":"10.1145\/3499027"},{"key":"e_1_3_1_7_2","doi-asserted-by":"crossref","first-page":"1218","DOI":"10.1609\/aaai.v35i2.16209","article-title":"Similarity reasoning and filtration for image-text matching","author":"Diao Haiwen","year":"2021","unstructured":"Haiwen Diao, Ying Zhang, Lin Ma, and Huchuan Lu. 2021. Similarity reasoning and filtration for image-text matching. In AAAI Conference on Artificial Intelligence, 1218\u20131226.","journal-title":"AAAI Conference on Artificial Intelligence"},{"key":"e_1_3_1_8_2","first-page":"18145","volume-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Dou Zi-Yi","year":"2022","unstructured":"Zi-Yi Dou, Yichong Xu, Zhe Gan, Jianfeng Wang, Shuohang Wang, Lijuan Wang, Chenguang Zhu, Pengchuan Zhang, Lu Yuan, Nanyun Peng, et al. 2022. An empirical study of training end-to-end vision-and-language transformers. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 18145\u201318155."},{"key":"e_1_3_1_9_2","doi-asserted-by":"publisher","DOI":"10.1145\/3580501"},{"key":"e_1_3_1_10_2","first-page":"5185","volume-title":"ACM International Conference on Multimedia","author":"Ge Xuri","year":"2021","unstructured":"Xuri Ge, Fuhai Chen, Joemon M. Jose, Zhilong Ji, Zhongqin Wu, and Xiao Liu. 2021. Structured multi-modal feature embedding and alignment for image-sentence retrieval. In ACM International Conference on Multimedia, 5185\u20135193."},{"key":"e_1_3_1_11_2","doi-asserted-by":"crossref","first-page":"162","DOI":"10.1007\/978-1-4612-4380-9_14","article-title":"Relations between two sets of variates","author":"Hotelling Harold","year":"1992","unstructured":"Harold Hotelling. 1992. Relations between two sets of variates. Breakthroughs in Statistics: Methodology and Distribution, 162\u2013190.","journal-title":"Breakthroughs in Statistics: Methodology and Distribution"},{"key":"e_1_3_1_12_2","doi-asserted-by":"crossref","first-page":"18298","DOI":"10.1609\/aaai.v38i16.29789","article-title":"Cross-modal and uni-modal soft-label alignment for image-text retrieval","author":"Huang Hailang","year":"2024","unstructured":"Hailang Huang, Zhijie Nie, Ziqiao Wang, and Ziyu Shang. 2024. Cross-modal and uni-modal soft-label alignment for image-text retrieval. In AAAI Conference on Artificial Intelligence, 18298\u201318306.","journal-title":"AAAI Conference on Artificial Intelligence"},{"key":"e_1_3_1_13_2","first-page":"5435","volume-title":"International Joint Conference on Artificial Intelligence","author":"Huang Xin","year":"2025","unstructured":"Xin Huang, Ruibin Li, Tong Jia, Wei Zheng, and Ya Wang. 2025. Visual perturbation and adaptive hard negative contrastive learning for compositional reasoning in vision-language models. In International Joint Conference on Artificial Intelligence, 5435\u20135443."},{"key":"e_1_3_1_14_2","first-page":"1893","volume-title":"International Joint Conference on Artificial Intelligence","author":"Huang Xin","year":"2017","unstructured":"Xin Huang, Yuxin Peng, and Mingkuan Yuan. 2017. Cross-modal common representation learning by hybrid transfer network. In International Joint Conference on Artificial Intelligence, 1893\u20131900."},{"key":"e_1_3_1_15_2","first-page":"17485","volume-title":"AAAI Conference on Artificial Intelligence","author":"Huang Xin","year":"2025","unstructured":"Xin Huang, Shilong Wang, Tong Jia, Zhihang Gou, and Jingjing Li. 2025. Adaptive prompt-based semantic embedding with inspire potential of implicit knowledge for cross-modal retrieval. In AAAI Conference on Artificial Intelligence, 17485\u201317493."},{"key":"e_1_3_1_16_2","first-page":"765","volume-title":"International Joint Conference on Artificial Intelligence","author":"Ji Zhong","year":"2021","unstructured":"Zhong Ji, Kexin Chen, and Haoran Wang. 2021. Step-wise hierarchical alignment network for image-text matching. In International Joint Conference on Artificial Intelligence, 765\u2013771."},{"key":"e_1_3_1_17_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19827-4_41"},{"key":"e_1_3_1_18_2","first-page":"2787","volume-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Jiang Ding","year":"2023","unstructured":"Ding Jiang and Mang Ye. 2023. Cross-Modal implicit relation reasoning and aligning for text-to-image person retrieval. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 2787\u20132797."},{"key":"e_1_3_1_19_2","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-319-42337-1","volume-title":"Subjective Logic","author":"Audun J\u00f8sang","year":"2016","unstructured":"J\u00f8sang Audun. 2016. Subjective Logic, Vol. 3, Springer."},{"key":"e_1_3_1_20_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01225-0_13"},{"key":"e_1_3_1_21_2","unstructured":"Haoxuan Li Yi Bin Yunshan Ma Guoyin Wang Yang Yang See-Kiong Ng and Tat-Seng Chua. 2025. SemCORE: A semantic-enhanced generative cross-modal retrieval framework with MLLMs. arXiv:2504.13172. Retrieved from https:\/\/arxiv.org\/abs\/2504.13172"},{"key":"e_1_3_1_22_2","first-page":"24564","article-title":"Prototype-based aleatoric uncertainty quantification for cross-modal retrieval","author":"Li Hao","year":"2023","unstructured":"Hao Li, Jingkuan Song, Lianli Gao, Xiaosu Zhu, and Hengtao Shen. 2023. Prototype-based aleatoric uncertainty quantification for cross-modal retrieval. In Advances in Neural Information Processing Systems, 24564\u201324585.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_23_2","first-page":"19730","volume-title":"International Conference on Machine Learning","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven C. H. Hoi. 2023. BLIP-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. In International Conference on Machine Learning, 19730\u201319742."},{"key":"e_1_3_1_24_2","first-page":"12888","volume-title":"International Conference on Machine Learning","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven C. H. Hoi. 2022. BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In International Conference on Machine Learning, 12888\u201312900."},{"key":"e_1_3_1_25_2","first-page":"9694","article-title":"Align before fuse: Vision and language representation learning with momentum distillation","author":"Li Junnan","year":"2021","unstructured":"Junnan Li, Ramprasaath R. Selvaraju, Akhilesh Gotmare, Shafiq R. Joty, Caiming Xiong, and Steven Chu-Hong Hoi. 2021. Align before fuse: Vision and language representation learning with momentum distillation. In Advances in Neural Information Processing Systems, 9694\u20139705.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"e_1_3_1_26_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"e_1_3_1_27_2","first-page":"3","volume-title":"ACM International Conference on Multimedia","author":"Liu Chunxiao","year":"2019","unstructured":"Chunxiao Liu, Zhendong Mao, An-An Liu, Tianzhu Zhang, Bin Wang, and Yongdong Zhang. 2019. Focus your attention: A bidirectional focal attention network for image-text matching. In ACM International Conference on Multimedia, 3\u201311."},{"key":"e_1_3_1_28_2","first-page":"10918","volume-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Liu Chunxiao","year":"2020","unstructured":"Chunxiao Liu, Zhendong Mao, Tianzhu Zhang, Hongtao Xie, Bin Wang, and Yongdong Zhang. 2020. Graph structured network for image-text matching. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 10918\u201310927."},{"key":"e_1_3_1_29_2","first-page":"7957","article-title":"Deeply coupled cross-modal prompt learning","author":"Liu Xuejing","year":"2023","unstructured":"Xuejing Liu, Wei Tang, Jinghui Lu, Rui Zhao, Zhaojun Guo, and Fei Tan. 2023. Deeply coupled cross-modal prompt learning. In Findings of the Association for Computational Linguistics, 7957\u20137970.","journal-title":"Findings of the Association for Computational Linguistics"},{"key":"e_1_3_1_30_2","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2022.3152086"},{"key":"e_1_3_1_31_2","unstructured":"Ilya Loshchilov and Frank Hutter. 2017. Decoupled weight decay regularization. arXiv:1711.05101. Retrieved from https:\/\/arxiv.org\/abs\/1711.05101"},{"key":"e_1_3_1_32_2","doi-asserted-by":"crossref","first-page":"293","DOI":"10.1016\/j.neucom.2022.07.028","article-title":"CLIP4Clip: An empirical study of CLIP for end-to-end video clip retrieval and captioning","volume":"508","author":"Luo Huaishao","year":"2022","unstructured":"Huaishao Luo, Lei Ji, Ming Zhong, Yang Chen, Wen Lei, Nan Duan, and Tianrui Li. 2022. CLIP4Clip: An empirical study of CLIP for end-to-end video clip retrieval and captioning. Neurocomputing 508 (2022), 293\u2013304.","journal-title":"Neurocomputing"},{"key":"e_1_3_1_33_2","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547910"},{"key":"e_1_3_1_34_2","doi-asserted-by":"publisher","DOI":"10.1145\/3451390"},{"key":"e_1_3_1_35_2","first-page":"689","volume-title":"International Conference on Machine Learning","author":"Ngiam Jiquan","year":"2011","unstructured":"Jiquan Ngiam, Aditya Khosla, Mingyu Kim, Juhan Nam, Honglak Lee, and Andrew Y. Ng. 2011. Multimodal deep learning. In International Conference on Machine Learning, 689\u2013696."},{"key":"e_1_3_1_36_2","doi-asserted-by":"crossref","first-page":"4912","DOI":"10.1109\/TMM.2023.3327645","article-title":"Joint intra and inter-grained reasoning: A new look into semantic consistency of image-text retrieval","volume":"26","author":"Pan Renjie","year":"2024","unstructured":"Renjie Pan, Hua Yang, Cunyan Li, and Jinhai Yang. 2024. Joint intra and inter-grained reasoning: A new look into semantic consistency of image-text retrieval. IEEE Transactions on Multimedia 26 (2024), 4912\u20134925.","journal-title":"IEEE Transactions on Multimedia"},{"key":"e_1_3_1_37_2","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2017.2705068"},{"key":"e_1_3_1_38_2","first-page":"1104","volume-title":"International ACM SIGIR Conference on Research and Development in Information Retrieval","author":"Qu Leigang","year":"2021","unstructured":"Leigang Qu, Meng Liu, Jianlong Wu, Zan Gao, and Liqiang Nie. 2021. Dynamic modality interaction modeling for image-text retrieval. In International ACM SIGIR Conference on Research and Development in Information Retrieval, 1104\u20131113."},{"key":"e_1_3_1_39_2","first-page":"8748","volume-title":"International Conference on Machine Learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In International Conference on Machine Learning, 8748\u20138763."},{"key":"e_1_3_1_40_2","first-page":"3183","volume-title":"Advances in Neural Information Processing Systems","author":"Sensoy Murat","year":"2018","unstructured":"Murat Sensoy, Lance M. Kaplan, and Melih Kandemir. 2018. Evidential deep learning to quantify classification uncertainty. In Advances in Neural Information Processing Systems, 3183\u20133193."},{"key":"e_1_3_1_41_2","doi-asserted-by":"publisher","DOI":"10.1515\/9780691214696"},{"key":"e_1_3_1_42_2","doi-asserted-by":"publisher","DOI":"10.1145\/3637442"},{"key":"e_1_3_1_43_2","first-page":"1979","volume-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Song Yale","year":"2019","unstructured":"Yale Song and Mohammad Soleymani. 2019. Polysemous visual-semantic embedding for cross-modal retrieval. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 1979\u20131988."},{"key":"e_1_3_1_44_2","first-page":"1497","volume-title":"IEEE Winter Conference on Applications of Computer Vision","author":"Wang Sijin","year":"2020","unstructured":"Sijin Wang, Ruiping Wang, Ziwei Yao, Shiguang Shan, and Xilin Chen. 2020. Cross-modal scene graph matching for relationship-aware image-text retrieval. In IEEE Winter Conference on Applications of Computer Vision, 1497\u20131506."},{"key":"e_1_3_1_45_2","doi-asserted-by":"publisher","DOI":"10.1109\/TNNLS.2024.3381347"},{"key":"e_1_3_1_46_2","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-031-19809-0_36"},{"key":"e_1_3_1_47_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.00024"},{"issue":"2","key":"e_1_3_1_48_2","first-page":"449","article-title":"Cross-modal retrieval with CNN visual features: A new baseline","volume":"47","author":"Wei Yunchao","year":"2017","unstructured":"Yunchao Wei, Yao Zhao, Canyi Lu, Shikui Wei, Luoqi Liu, Zhenfeng Zhu, and Shuicheng Yan. 2017. Cross-modal retrieval with CNN visual features: A new baseline. IEEE Transactions on Cybernetics 47, 2 (2017), 449\u2013460.","journal-title":"IEEE Transactions on Cybernetics"},{"key":"e_1_3_1_49_2","doi-asserted-by":"crossref","first-page":"1551","DOI":"10.1109\/TMM.2024.3521736","article-title":"Dual stream relation learning network for image-text retrieval","volume":"27","author":"Wu Dongqing","year":"2025","unstructured":"Dongqing Wu, Huihui Li, Cang Gu, Lei Guo, and Hang Liu. 2025. Dual stream relation learning network for image-text retrieval. IEEE Transactions on Multimedia 27 (2025), 1551\u20131565.","journal-title":"IEEE Transactions on Multimedia"},{"key":"e_1_3_1_50_2","unstructured":"Zhiyu Wu Xiaokang Chen Zizheng Pan Xingchao Liu Wen Liu Damai Dai Huazuo Gao Yiyang Ma Chengyue Wu Bingxuan Wang et al. 2024. DeepSeek-VL2: Mixture-of-experts vision-language models for advanced multimodal understanding. arXiv:2412.10302. Retrieved from https:\/\/arxiv.org\/abs\/2412.10302"},{"key":"e_1_3_1_51_2","doi-asserted-by":"crossref","first-page":"2056","DOI":"10.1109\/TMM.2023.3291588","article-title":"Dual modality prompt tuning for vision-language pre-trained model","volume":"26","author":"Xing Yinghui","year":"2024","unstructured":"Yinghui Xing, Qirui Wu, De Cheng, Shizhou Zhang, Guoqiang Liang, Peng Wang, and Yanning Zhang. 2024. Dual modality prompt tuning for vision-language pre-trained model. IEEE Transactions on Multimedia 26 (2024), 2056\u20132068.","journal-title":"IEEE Transactions on Multimedia"},{"key":"e_1_3_1_52_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.00653"},{"key":"e_1_3_1_53_2","doi-asserted-by":"crossref","first-page":"67","DOI":"10.1162\/tacl_a_00166","article-title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions","volume":"2","author":"Young Peter","year":"2014","unstructured":"Peter Young, Alice Lai, Micah Hodosh, and Julia Hockenmaier. 2014. From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions. Transactions of the Association for Computational Linguistics 2 (2014), 67\u201378.","journal-title":"Transactions of the Association for Computational Linguistics"},{"key":"e_1_3_1_54_2","unstructured":"Yuhang Zang Wei Li Kaiyang Zhou Chen Huang and Chen Change Loy. 2022. Unified vision and language prompt learning. arXiv:2210.07225. Retrieved from https:\/\/arxiv.org\/abs\/2210.07225"},{"key":"e_1_3_1_55_2","first-page":"15640","volume-title":"IEEE\/CVF Conference on Computer Vision and Pattern Recognition","author":"Zhang Kun","year":"2022","unstructured":"Kun Zhang, Zhendong Mao, Quan Wang, and Yongdong Zhang. 2022. Negative-aware attention framework for image-text matching. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition, 15640\u201315649."},{"key":"e_1_3_1_56_2","doi-asserted-by":"crossref","first-page":"1551","DOI":"10.1109\/TMM.2023.3282894","article-title":"Weighted graph-structured semantics constraint network for cross-modal retrieval","volume":"26","author":"Zhang Lei","year":"2024","unstructured":"Lei Zhang, Leiting Chen, Chuan Zhou, Xin Li, Fan Yang, and Zhang Yi. 2024. Weighted graph-structured semantics constraint network for cross-modal retrieval. IEEE Transactions on Multimedia 26 (2024), 1551\u20131564.","journal-title":"IEEE Transactions on Multimedia"},{"key":"e_1_3_1_57_2","doi-asserted-by":"publisher","DOI":"10.1109\/tnn.2005.860849"},{"key":"e_1_3_1_58_2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52688.2022.01631"},{"key":"e_1_3_1_59_2","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-022-01653-1"}],"container-title":["ACM Transactions on Multimedia Computing, Communications, and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3797043","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T14:58:11Z","timestamp":1776783491000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3797043"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,4,21]]},"references-count":58,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2026,5,31]]}},"alternative-id":["10.1145\/3797043"],"URL":"https:\/\/doi.org\/10.1145\/3797043","relation":{},"ISSN":["1551-6857","1551-6865"],"issn-type":[{"value":"1551-6857","type":"print"},{"value":"1551-6865","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,4,21]]},"assertion":[{"value":"2025-08-31","order":0,"name":"received","label":"Received","group":{"name":"publication_history","label":"Publication History"}},{"value":"2026-01-30","order":2,"name":"accepted","label":"Accepted","group":{"name":"publication_history","label":"Publication History"}},{"value":"2026-04-21","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}