{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,17]],"date-time":"2026-04-17T12:58:05Z","timestamp":1776430685626,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":52,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T00:00:00Z","timestamp":1665360000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["No. 62020106008, No. 62122018, No. 61772116, No. 61872064"],"award-info":[{"award-number":["No. 62020106008, No. 62122018, No. 61772116, No. 61872064"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,10,10]]},"DOI":"10.1145\/3503161.3548024","type":"proceedings-article","created":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T15:42:46Z","timestamp":1665416566000},"page":"5210-5218","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":32,"title":["Progressive Tree-Structured Prototype Network for End-to-End Image Captioning"],"prefix":"10.1145","author":[{"given":"Pengpeng","family":"Zeng","sequence":"first","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinkuan","family":"Zhu","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jingkuan","family":"Song","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China &amp; Peng Cheng Laboratory, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lianli","family":"Gao","sequence":"additional","affiliation":[{"name":"University of Electronic Science and Technology of China, Chengdu, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2022,10,10]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Spice: Semantic propositional image caption evaluation. In ECCV. 382--398.","author":"Anderson Peter","year":"2016","unstructured":"Peter Anderson , Basura Fernando , Mark Johnson , and Stephen Gould . 2016 . Spice: Semantic propositional image caption evaluation. In ECCV. 382--398. Peter Anderson, Basura Fernando, Mark Johnson, and Stephen Gould. 2016. Spice: Semantic propositional image caption evaluation. In ECCV. 382--398."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering. In CVPR. 6077--6086. Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering. In CVPR. 6077--6086.","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_1_3_1","first-page":"52","article-title":"Entity slot filling for visual captioning","volume":"32","author":"Bin Yi","year":"2021","unstructured":"Yi Bin , Yujuan Ding , Bo Peng , Liang Peng , Yang Yang , and Tat-Seng Chua . 2021 . Entity slot filling for visual captioning . TCSVT , Vol. 32 (2021), 52 -- 62 . Yi Bin, Yujuan Ding, Bo Peng, Liang Peng, Yang Yang, and Tat-Seng Chua. 2021. Entity slot filling for visual captioning. TCSVT , Vol. 32 (2021), 52--62.","journal-title":"TCSVT"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Hui Chen Guiguang Ding Zijia Lin Sicheng Zhao and Jungong Han. 2018. Show Observe and Tell: Attribute-driven Attention Model for Image Captioning. In IJCAI. 606--612. Hui Chen Guiguang Ding Zijia Lin Sicheng Zhao and Jungong Han. 2018. Show Observe and Tell: Attribute-driven Attention Model for Image Captioning. In IJCAI. 606--612.","DOI":"10.24963\/ijcai.2018\/84"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Marcella Cornia Matteo Stefanini Lorenzo Baraldi and Rita Cucchiara. 2020. Meshed-Memory Transformer for Image Captioning. In CVPR. 10575--10584. Marcella Cornia Matteo Stefanini Lorenzo Baraldi and Rita Cucchiara. 2020. Meshed-Memory Transformer for Image Captioning. In CVPR. 10575--10584.","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2940693"},{"key":"e_1_3_2_1_7_1","volume-title":"Devi Parikh, and Dhruv Batra.","author":"Das Abhishek","year":"2017","unstructured":"Abhishek Das , Satwik Kottur , Khushi Gupta , Avi Singh , Deshraj Yadav , Jos\u00e9 MF Moura , Devi Parikh, and Dhruv Batra. 2017 . Visual dialog. In CVPR. 326--335. Abhishek Das, Satwik Kottur, Khushi Gupta, Avi Singh, Deshraj Yadav, Jos\u00e9 MF Moura, Devi Parikh, and Dhruv Batra. 2017. Visual dialog. In CVPR. 326--335."},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-3348"},{"key":"e_1_3_2_1_9_1","volume-title":"Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805.","author":"Devlin Jacob","year":"2018","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2018 . Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2018. Bert: Pre-training of deep bidirectional transformers for language understanding. arXiv preprint arXiv:1810.04805."},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Xinzhi Dong Chengjiang Long Wenju Xu and Chunxia Xiao. 2021. Dual Graph Convolutional Networks with Transformer and Curriculum Learning for Image Captioning. In ACM MM. 2615--2624. Xinzhi Dong Chengjiang Long Wenju Xu and Chunxia Xiao. 2021. Dual Graph Convolutional Networks with Transformer and Curriculum Learning for Image Captioning. In ACM MM. 2615--2624.","DOI":"10.1145\/3474085.3475439"},{"key":"e_1_3_2_1_11_1","unstructured":"Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly Jakob Uszkoreit and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In ICLR. Alexey Dosovitskiy Lucas Beyer Alexander Kolesnikov Dirk Weissenborn Xiaohua Zhai Thomas Unterthiner Mostafa Dehghani Matthias Minderer Georg Heigold Sylvain Gelly Jakob Uszkoreit and Neil Houlsby. 2021. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale. In ICLR."},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Zhiyuan Fang Jianfeng Wang Xiaowei Hu Lin Liang Zhe Gan Lijuan Wang Yezhou Yang and Zicheng Liu. 2022. Injecting Semantic Concepts into End-to-End Image Captioning. In CVPR. 18009--18019. Zhiyuan Fang Jianfeng Wang Xiaowei Hu Lin Liang Zhe Gan Lijuan Wang Yezhou Yang and Zicheng Liu. 2022. Injecting Semantic Concepts into End-to-End Image Captioning. In CVPR. 18009--18019.","DOI":"10.1109\/CVPR52688.2022.01748"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Lianli Gao Pengpeng Zeng Jingkuan Song Xianglong Liu and Heng Tao Shen. 2018. Examine before you answer: Multi-task learning with adaptive-attentions for multiple-choice VQA. In ACM MM. 1742--1750. Lianli Gao Pengpeng Zeng Jingkuan Song Xianglong Liu and Heng Tao Shen. 2018. Examine before you answer: Multi-task learning with adaptive-attentions for multiple-choice VQA. In ACM MM. 1742--1750.","DOI":"10.1145\/3240508.3240687"},{"key":"e_1_3_2_1_14_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770--778. Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR. 770--778."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Lun Huang Wenmin Wang Jie Chen and Xiao-Yong Wei. 2019. Attention on attention for image captioning. In CVPR. 4634--4643. Lun Huang Wenmin Wang Jie Chen and Xiao-Yong Wei. 2019. Attention on attention for image captioning. In CVPR. 4634--4643.","DOI":"10.1109\/ICCV.2019.00473"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"crossref","unstructured":"Unnat Jain Svetlana Lazebnik and Alexander G Schwing. 2018. Two can play this game: Visual dialog with discriminative question generation and answering. In CVPR. 5754--5763. Unnat Jain Svetlana Lazebnik and Alexander G Schwing. 2018. Two can play this game: Visual dialog with discriminative question generation and answering. In CVPR. 5754--5763.","DOI":"10.1109\/CVPR.2018.00603"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"crossref","unstructured":"Jiayi Ji Yunpeng Luo Xiaoshuai Sun Fuhai Chen Gen Luo Yongjian Wu Yue Gao and Rongrong Ji. 2021. Improving Image Captioning by Leveraging Intra- and Inter-layer Global Representation in Transformer Network. In AAAI. 1655--1663. Jiayi Ji Yunpeng Luo Xiaoshuai Sun Fuhai Chen Gen Luo Yongjian Wu Yue Gao and Rongrong Ji. 2021. Improving Image Captioning by Leveraging Intra- and Inter-layer Global Representation in Transformer Network. In AAAI. 1655--1663.","DOI":"10.1609\/aaai.v35i2.16258"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"crossref","unstructured":"Andrej Karpathy and Li Fei-Fei. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR. 3128--3137. Andrej Karpathy and Li Fei-Fei. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR. 3128--3137.","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_1_20_1","volume-title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In ECCV. 121--137.","author":"Li Xiujun","year":"2020","unstructured":"Xiujun Li , Xi Yin , Chunyuan Li , Pengchuan Zhang , Xiaowei Hu , Lei Zhang , Lijuan Wang , Houdong Hu , Li Dong , Furu Wei , Yejin Choi , and Jianfeng Gao . 2020 . Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In ECCV. 121--137. Xiujun Li, Xi Yin, Chunyuan Li, Pengchuan Zhang, Xiaowei Hu, Lei Zhang, Lijuan Wang, Houdong Hu, Li Dong, Furu Wei, Yejin Choi, and Jianfeng Gao. 2020. Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In ECCV. 121--137."},{"key":"e_1_3_2_1_21_1","volume-title":"Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74--81.","author":"Lin Chin-Yew","year":"2004","unstructured":"Chin-Yew Lin . 2004 . Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74--81. Chin-Yew Lin. 2004. Rouge: A package for automatic evaluation of summaries. In Text summarization branches out. 74--81."},{"key":"e_1_3_2_1_22_1","volume-title":"Piotr Doll\u00e1 r, and C. Lawrence Zitnick","author":"Lin Tsung-Yi","year":"2014","unstructured":"Tsung-Yi Lin , Michael Maire , Serge J. Belongie , James Hays , Pietro Perona , Deva Ramanan , Piotr Doll\u00e1 r, and C. Lawrence Zitnick . 2014 . Microsoft COCO: Common Objects in Context. In ECCV. 740--755. Tsung-Yi Lin, Michael Maire, Serge J. Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll\u00e1 r, and C. Lawrence Zitnick. 2014. Microsoft COCO: Common Objects in Context. In ECCV. 740--755."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Ze Liu Yutong Lin Yue Cao Han Hu Yixuan Wei Zheng Zhang Stephen Lin and Baining Guo. 2021. Swin transformer: Hierarchical vision transformer using shifted windows. In ICCV. 10012--10022. Ze Liu Yutong Lin Yue Cao Han Hu Yixuan Wei Zheng Zhang Stephen Lin and Baining Guo. 2021. Swin transformer: Hierarchical vision transformer using shifted windows. In ICCV. 10012--10022.","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIT.1982.1056489"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Yunpeng Luo Jiayi Ji Xiaoshuai Sun Liujuan Cao Yongjian Wu Feiyue Huang Chia-Wen Lin and Rongrong Ji. 2021. Dual-level Collaborative Transformer for Image Captioning. In AAAI. 2286--2293. Yunpeng Luo Jiayi Ji Xiaoshuai Sun Liujuan Cao Yongjian Wu Feiyue Huang Chia-Wen Lin and Rongrong Ji. 2021. Dual-level Collaborative Transformer for Image Captioning. In AAAI. 2286--2293.","DOI":"10.1609\/aaai.v35i3.16328"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"crossref","unstructured":"Weizhi Nie Jiesi Li Ning Xu An-An Liu Xuanya Li and Yongdong Zhang. 2021. Triangle-Reward Reinforcement Learning: A Visual-Linguistic Semantic Alignment for Image Captioning. In ACM MM. 4510--4518. Weizhi Nie Jiesi Li Ning Xu An-An Liu Xuanya Li and Yongdong Zhang. 2021. Triangle-Reward Reinforcement Learning: A Visual-Linguistic Semantic Alignment for Image Captioning. In ACM MM. 4510--4518.","DOI":"10.1145\/3474085.3475604"},{"key":"e_1_3_2_1_27_1","unstructured":"Yingwei Pan Ting Yao Yehao Li and Tao Mei. 2020. X-Linear Attention Networks for Image Captioning. In CVPR. 10968--10977. Yingwei Pan Ting Yao Yehao Li and Tao Mei. 2020. X-Linear Attention Networks for Image Captioning. In CVPR. 10968--10977."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Kishore Papineni Salim Roukos Todd Ward and Wei-Jing Zhu. 2002. Bleu: a method for automatic evaluation of machine translation. In ACL. 311--318. Kishore Papineni Salim Roukos Todd Ward and Wei-Jing Zhu. 2002. Bleu: a method for automatic evaluation of machine translation. In ACL. 311--318.","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_2_1_29_1","volume-title":"Glove: Global vectors for word representation. In EMNLP. 1532--1543.","author":"Pennington Jeffrey","year":"2014","unstructured":"Jeffrey Pennington , Richard Socher , and Christopher D Manning . 2014 . Glove: Global vectors for word representation. In EMNLP. 1532--1543. Jeffrey Pennington, Richard Socher, and Christopher D Manning. 2014. Glove: Global vectors for word representation. In EMNLP. 1532--1543."},{"key":"e_1_3_2_1_30_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford , Jong Wook Kim , Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021 . Learning transferable visual models from natural language supervision. In ICML. 8748--8763. Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, et al. 2021. Learning transferable visual models from natural language supervision. In ICML. 8748--8763."},{"key":"e_1_3_2_1_31_1","unstructured":"Shaoqing Ren Kaiming He Ross B. Girshick and Jian Sun. 2015. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks. In NeurIPS. 91--99. Shaoqing Ren Kaiming He Ross B. Girshick and Jian Sun. 2015. Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks. In NeurIPS. 91--99."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Steven J. Rennie Etienne Marcheret Youssef Mroueh Jerret Ross and Vaibhava Goel. 2017. Self-Critical Sequence Training for Image Captioning. In CVPR. 1179--1195. Steven J. Rennie Etienne Marcheret Youssef Mroueh Jerret Ross and Vaibhava Goel. 2017. Self-Critical Sequence Training for Image Captioning. In CVPR. 1179--1195.","DOI":"10.1109\/CVPR.2017.131"},{"key":"e_1_3_2_1_33_1","volume-title":"Gaussian mixture models. Encyclopedia of biometrics","author":"Reynolds Douglas A","year":"2009","unstructured":"Douglas A Reynolds . 2009. Gaussian mixture models. Encyclopedia of biometrics , Vol. 741 , 659--663 ( 2009 ). Douglas A Reynolds. 2009. Gaussian mixture models. Encyclopedia of biometrics , Vol. 741, 659--663 (2009)."},{"key":"e_1_3_2_1_34_1","unstructured":"Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR. Karen Simonyan and Andrew Zisserman. 2015. Very Deep Convolutional Networks for Large-Scale Image Recognition. In ICLR."},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"crossref","unstructured":"Zeliang Song Xiaofei Zhou Linhua Dong Jianlong Tan and Li Guo. 2021. Direction Relation Transformer for Image Captioning. In ACM MM. 5056--5064. Zeliang Song Xiaofei Zhou Linhua Dong Jianlong Tan and Li Guo. 2021. Direction Relation Transformer for Image Captioning. In ACM MM. 5056--5064.","DOI":"10.1145\/3474085.3475607"},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2021.3121987"},{"key":"e_1_3_2_1_37_1","volume-title":"NeurIPS","volume":"30","author":"Vaswani Ashish","year":"2017","unstructured":"Ashish Vaswani , Noam Shazeer , Niki Parmar , Jakob Uszkoreit , Llion Jones , Aidan N Gomez , \u0141ukasz Kaiser , and Illia Polosukhin . 2017 . Attention is all you need . NeurIPS , Vol. 30 (2017). Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N Gomez, \u0141ukasz Kaiser, and Illia Polosukhin. 2017. Attention is all you need. NeurIPS , Vol. 30 (2017)."},{"key":"e_1_3_2_1_38_1","volume-title":"Cider: Consensus-based image description evaluation. In CVPR. 4566--4575.","author":"Vedantam Ramakrishna","year":"2015","unstructured":"Ramakrishna Vedantam , C Lawrence Zitnick , and Devi Parikh . 2015 . Cider: Consensus-based image description evaluation. In CVPR. 4566--4575. Ramakrishna Vedantam, C Lawrence Zitnick, and Devi Parikh. 2015. Cider: Consensus-based image description evaluation. In CVPR. 4566--4575."},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2587640"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"crossref","unstructured":"Cheng Wang Haojin Yang Christian Bartz and Christoph Meinel. 2016. Image Captioning with Deep Bidirectional LSTMs. In ACM MM. 988--997. Cheng Wang Haojin Yang Christian Bartz and Christoph Meinel. 2016. Image Captioning with Deep Bidirectional LSTMs. In ACM MM. 988--997.","DOI":"10.1145\/2964284.2964299"},{"key":"e_1_3_2_1_41_1","volume-title":"Chan","author":"Wang Jiuniu","year":"2021","unstructured":"Jiuniu Wang , Wenjia Xu , Qingzhong Wang , and Antoni B . Chan . 2021 a. Group-based Distinctive Image Captioning with Memory Attention. In ACM MM. 5020--5028. Jiuniu Wang, Wenjia Xu, Qingzhong Wang, and Antoni B. Chan. 2021a. Group-based Distinctive Image Captioning with Memory Attention. In ACM MM. 5020--5028."},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"crossref","unstructured":"Yiyu Wang Jungang Xu and Yingfei Sun. 2022. End-to-End Transformer Based Model for Image Captioning. In AAAI. 2585--2594. Yiyu Wang Jungang Xu and Yingfei Sun. 2022. End-to-End Transformer Based Model for Image Captioning. In AAAI. 2585--2594.","DOI":"10.1609\/aaai.v36i3.20160"},{"key":"e_1_3_2_1_43_1","volume-title":"Zihang Dai, Yulia Tsvetkov, and Yuan Cao.","author":"Wang Zirui","year":"2021","unstructured":"Zirui Wang , Jiahui Yu , Adams Wei Yu , Zihang Dai, Yulia Tsvetkov, and Yuan Cao. 2021 b. Simvlm : Simple visual language model pretraining with weak supervision. arXiv preprint arXiv:2108.10904 (2021). Zirui Wang, Jiahui Yu, Adams Wei Yu, Zihang Dai, Yulia Tsvetkov, and Yuan Cao. 2021b. Simvlm: Simple visual language model pretraining with weak supervision. arXiv preprint arXiv:2108.10904 (2021)."},{"key":"e_1_3_2_1_44_1","unstructured":"Shaomei Wu Jeffrey Wieland Omid Farivar and Julie Schiller. 2017. Automatic alt-text: Computer-generated image descriptions for blind users on a social network service. In ACM CSCW. 1180--1192. Shaomei Wu Jeffrey Wieland Omid Farivar and Julie Schiller. 2017. Automatic alt-text: Computer-generated image descriptions for blind users on a social network service. In ACM CSCW. 1180--1192."},{"key":"e_1_3_2_1_45_1","unstructured":"Kelvin Xu Jimmy Ba Ryan Kiros Kyunghyun Cho Aaron C. Courville Ruslan Salakhutdinov Richard S. Zemel and Yoshua Bengio. 2015. Show Attend and Tell: Neural Image Caption Generation with Visual Attention. In ICML. 2048--2057. Kelvin Xu Jimmy Ba Ryan Kiros Kyunghyun Cho Aaron C. Courville Ruslan Salakhutdinov Richard S. Zemel and Yoshua Bengio. 2015. Show Attend and Tell: Neural Image Caption Generation with Visual Attention. In ICML. 2048--2057."},{"key":"e_1_3_2_1_46_1","unstructured":"Quanzeng You Hailin Jin Zhaowen Wang Chen Fang and Jiebo Luo. 2016. Image Captioning with Semantic Attention. In CVPR. 4651--4659. Quanzeng You Hailin Jin Zhaowen Wang Chen Fang and Jiebo Luo. 2016. Image Captioning with Semantic Attention. In CVPR. 4651--4659."},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"crossref","unstructured":"Pengpeng Zeng Lianli Gao Xinyu Lyu Shuaiqi Jing and Jingkuan Song. 2021. Conceptual and syntactical cross-modal alignment with cross-level consistency for image-text matching. In ACM MM. 2205--2213. Pengpeng Zeng Lianli Gao Xinyu Lyu Shuaiqi Jing and Jingkuan Song. 2021. Conceptual and syntactical cross-modal alignment with cross-level consistency for image-text matching. In ACM MM. 2205--2213.","DOI":"10.1145\/3474085.3475380"},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"crossref","unstructured":"Pengpeng Zeng Haonan Zhang Jingkuan Song and Lianli Gao. 2022. S2 Transformer for Image Captioning. In IJCAI. Pengpeng Zeng Haonan Zhang Jingkuan Song and Lianli Gao. 2022. S2 Transformer for Image Captioning. In IJCAI.","DOI":"10.24963\/ijcai.2022\/224"},{"key":"e_1_3_2_1_49_1","volume-title":"Progressive Meta-learning with Curriculum. TCSVT","author":"Zhang Ji","year":"2022","unstructured":"Ji Zhang , Jingkuan Song , Lianli Gao , Ye Liu , and Heng Tao Shen . 2022. Progressive Meta-learning with Curriculum. TCSVT ( 2022 ). Ji Zhang, Jingkuan Song, Lianli Gao, Ye Liu, and Heng Tao Shen. 2022. Progressive Meta-learning with Curriculum. TCSVT (2022)."},{"key":"e_1_3_2_1_50_1","first-page":"4362","article-title":"Rich visual knowledge-based augmentation network for visual question answering","volume":"32","author":"Zhang Liyang","year":"2020","unstructured":"Liyang Zhang , Shuaicheng Liu , Donghao Liu , Pengpeng Zeng , Xiangpeng Li , Jingkuan Song , and Lianli Gao . 2020 . Rich visual knowledge-based augmentation network for visual question answering . TNNLS , Vol. 32 , 10 (2020), 4362 -- 4373 . Liyang Zhang, Shuaicheng Liu, Donghao Liu, Pengpeng Zeng, Xiangpeng Li, Jingkuan Song, and Lianli Gao. 2020. Rich visual knowledge-based augmentation network for visual question answering. TNNLS, Vol. 32, 10 (2020), 4362--4373.","journal-title":"TNNLS"},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Pengchuan Zhang Xiyang Dai Jianwei Yang Bin Xiao Lu Yuan Lei Zhang and Jianfeng Gao. 2021a. Multi-scale vision longformer: A new vision transformer for high-resolution image encoding. In CVPR. 2998--3008. Pengchuan Zhang Xiyang Dai Jianwei Yang Bin Xiao Lu Yuan Lei Zhang and Jianfeng Gao. 2021a. Multi-scale vision longformer: A new vision transformer for high-resolution image encoding. In CVPR. 2998--3008.","DOI":"10.1109\/ICCV48922.2021.00299"},{"key":"e_1_3_2_1_52_1","doi-asserted-by":"crossref","unstructured":"Xuying Zhang Xiaoshuai Sun Yunpeng Luo Jiayi Ji Yiyi Zhou Yongjian Wu Feiyue Huang and Rongrong Ji. 2021b. RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual Words. In CVPR. 15465--15474.io Xuying Zhang Xiaoshuai Sun Yunpeng Luo Jiayi Ji Yiyi Zhou Yongjian Wu Feiyue Huang and Rongrong Ji. 2021b. RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual Words. In CVPR. 15465--15474.io","DOI":"10.1109\/CVPR46437.2021.01521"}],"event":{"name":"MM '22: The 30th ACM International Conference on Multimedia","location":"Lisboa Portugal","acronym":"MM '22","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 30th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548024","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3503161.3548024","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T19:02:29Z","timestamp":1750186949000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548024"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,10]]},"references-count":52,"alternative-id":["10.1145\/3503161.3548024","10.1145\/3503161"],"URL":"https:\/\/doi.org\/10.1145\/3503161.3548024","relation":{},"subject":[],"published":{"date-parts":[[2022,10,10]]},"assertion":[{"value":"2022-10-10","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}