{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,7]],"date-time":"2025-11-07T19:18:33Z","timestamp":1762543113608,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":34,"publisher":"ACM","license":[{"start":{"date-parts":[[2019,10,15]],"date-time":"2019-10-15T00:00:00Z","timestamp":1571097600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Beijing Natural Science Foundation","award":["4192028"],"award-info":[{"award-number":["4192028"]}]},{"name":"National Natural Science Foundation of China","award":["61772535"],"award-info":[{"award-number":["61772535"]}]},{"name":"National Key Research and Development Plan","award":["2016YFB1001202"],"award-info":[{"award-number":["2016YFB1001202"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2019,10,15]]},"DOI":"10.1145\/3343031.3350996","type":"proceedings-article","created":{"date-parts":[[2019,10,21]],"date-time":"2019-10-21T16:32:26Z","timestamp":1571675546000},"page":"784-792","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":31,"title":["Unpaired Cross-lingual Image Caption Generation with Self-Supervised Rewards"],"prefix":"10.1145","author":[{"given":"Yuqing","family":"Song","sequence":"first","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shizhe","family":"Chen","sequence":"additional","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yida","family":"Zhao","sequence":"additional","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qin","family":"Jin","sequence":"additional","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2019,10,15]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"crossref","unstructured":"Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering. In CVPR .  Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-Up and Top-Down Attention for Image Captioning and Visual Question Answering. In CVPR .","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_1_2_1","unstructured":"Samy Bengio Oriol Vinyals Navdeep Jaitly and Noam Shazeer. 2015. Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks. In NIPS .  Samy Bengio Oriol Vinyals Navdeep Jaitly and Noam Shazeer. 2015. Scheduled Sampling for Sequence Prediction with Recurrent Neural Networks. In NIPS ."},{"volume-title":"Marc cal Rusi nol, and Dimosthenis Karatzas","year":"2019","author":"Biten Ali Furkan","key":"e_1_3_2_1_3_1"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"crossref","unstructured":"Shizhe Chen Qin Jin and Jianlong Fu. 2019 a. From Words to Sentences: A Progressive Learning Approach for Zero-resource Machine Translation with Visual Pivots. In IJCAI .  Shizhe Chen Qin Jin and Jianlong Fu. 2019 a. From Words to Sentences: A Progressive Learning Approach for Zero-resource Machine Translation with Visual Pivots. In IJCAI .","DOI":"10.24963\/ijcai.2019\/685"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"crossref","unstructured":"Shizhe Chen Qin Jin and Alexander Hauptmann. 2019 b. Unsupervised Bilingual Lexicon Induction from Mono-lingual Multimodal Data. In AAAI .  Shizhe Chen Qin Jin and Alexander Hauptmann. 2019 b. Unsupervised Bilingual Lexicon Induction from Mono-lingual Multimodal Data. In AAAI .","DOI":"10.1609\/aaai.v33i01.33018207"},{"key":"e_1_3_2_1_6_1","unstructured":"Kyunghyun Cho Bart van Merrienboer Caglar Gulcehre Dzmitry Bahdanau Fethi Bougares Holger Schwenk and Yoshua Bengio. 2014. Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation. In EMNLP .  Kyunghyun Cho Bart van Merrienboer Caglar Gulcehre Dzmitry Bahdanau Fethi Bougares Holger Schwenk and Yoshua Bengio. 2014. Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation. In EMNLP ."},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-3348"},{"volume-title":"Jamie Ryan Kiros, and Sanja Fidler","year":"2018","author":"Faghri Fartash","key":"e_1_3_2_1_8_1"},{"key":"e_1_3_2_1_9_1","unstructured":": Improving Visual-Semantic Embeddings with Hard Negatives. In spotlight presentation at British Machine Vision Conference (BMVC) . https:\/\/arxiv.org\/abs\/1707.05612?context=cs.CV  : Improving Visual-Semantic Embeddings with Hard Negatives. In spotlight presentation at British Machine Vision Conference (BMVC) . https:\/\/arxiv.org\/abs\/1707.05612?context=cs.CV"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Hao Fang Saurabh Gupta Forrest Iandola Rupesh Srivastava Li Deng Piotr Doll\u00e1r Jianfeng Gao Xiaodong He Margaret Mitchell John C. Platt C. Lawrence Zitnick and Geoffrey Zweig. 2015. From Captions to Visual Concepts and Back. In CVPR .  Hao Fang Saurabh Gupta Forrest Iandola Rupesh Srivastava Li Deng Piotr Doll\u00e1r Jianfeng Gao Xiaodong He Margaret Mitchell John C. Platt C. Lawrence Zitnick and Geoffrey Zweig. 2015. From Captions to Visual Concepts and Back. In CVPR .","DOI":"10.1109\/CVPR.2015.7298754"},{"key":"e_1_3_2_1_11_1","unstructured":"Yang Feng Lin Ma Wei Liu and Jiebo Luo. 2018. Unsupervised Image Captioning. https:\/\/arxiv.org\/abs\/1811.10787  Yang Feng Lin Ma Wei Liu and Jiebo Luo. 2018. Unsupervised Image Captioning. https:\/\/arxiv.org\/abs\/1811.10787"},{"volume-title":"Computer Vision -- ECCV 2018","author":"Gu Jiuxiang","key":"e_1_3_2_1_12_1"},{"key":"e_1_3_2_1_13_1","unstructured":"Jiuxiang Gu Gang Wang Jianfei Cai and Tsuhan Chen. 2017. An Empirical Study of Language CNN for Image Captioning. In ICCV. 10.  Jiuxiang Gu Gang Wang Jianfei Cai and Tsuhan Chen. 2017. An Empirical Study of Language CNN for Image Captioning. In ICCV. 10."},{"key":"e_1_3_2_1_14_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR .  Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep Residual Learning for Image Recognition. In CVPR ."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Julian Hitschler Shigehiko Schamoni and Stefan Riezler. 2016. Multimodal Pivots for Image Caption Translation. In ACL .  Julian Hitschler Shigehiko Schamoni and Stefan Riezler. 2016. Multimodal Pivots for Image Caption Translation. In ACL .","DOI":"10.18653\/v1\/P16-1227"},{"volume-title":"Long Short-term Memory. Neural computation","year":"1997","author":"Hochreiter Sepp","key":"e_1_3_2_1_16_1"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"crossref","unstructured":"Xu Jia Efstratios Gavves Basura Fernando and Tinne Tuytelaars. 2015. Guiding Long-Short Term Memory for Image Caption Generation. In ICCV .  Xu Jia Efstratios Gavves Basura Fernando and Tinne Tuytelaars. 2015. Guiding Long-Short Term Memory for Image Caption Generation. In ICCV .","DOI":"10.1109\/ICCV.2015.277"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"crossref","unstructured":"Yoon Kim. 2014. Convolutional Neural Networks for Sentence Classification. (2014). https:\/\/arxiv.org\/abs\/1408.5882  Yoon Kim. 2014. Convolutional Neural Networks for Sentence Classification. (2014). https:\/\/arxiv.org\/abs\/1408.5882","DOI":"10.3115\/v1\/D14-1181"},{"volume-title":"Adam: A Method for Stochastic Optimization. In ICLR .","year":"2015","author":"Kingma Diederik","key":"e_1_3_2_1_19_1"},{"volume-title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations. https:\/\/arxiv.org\/abs\/1602.07332","year":"2016","author":"Krishna Ranjay","key":"e_1_3_2_1_20_1"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Weiyu Lan Xirong Li and Jianfeng Dong. 2017. Fluency-Guided Cross-Lingual Image Captioning. In ACM Multimedia. ACM 9. https:\/\/doi.org\/10.1145\/3123266.3123366  Weiyu Lan Xirong Li and Jianfeng Dong. 2017. Fluency-Guided Cross-Lingual Image Captioning. In ACM Multimedia. ACM 9. https:\/\/doi.org\/10.1145\/3123266.3123366","DOI":"10.1145\/3123266.3123366"},{"key":"e_1_3_2_1_22_1","unstructured":"Tsung-Yi Lin Michael Maire Serge Belongie Lubomir Bourdev Ross Girshick James Hays Pietro Perona Deva Ramanan C. Lawrence Zitnick and Piotr Doll\u00e1r. 2014. Microsoft COCO: Common Objects in Context. In ECCV .  Tsung-Yi Lin Michael Maire Serge Belongie Lubomir Bourdev Ross Girshick James Hays Pietro Perona Deva Ramanan C. Lawrence Zitnick and Piotr Doll\u00e1r. 2014. Microsoft COCO: Common Objects in Context. In ECCV ."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Daqing Liu Zheng-Jun Zha Hanwang Zhang Yongdong Zhang and Feng Wu. 2018. Context-Aware Visual Policy Network for Sequence-Level Image Captioning. In ACM Multimedia. ACM 9. https:\/\/doi.org\/10.1145\/3240508.3240632  Daqing Liu Zheng-Jun Zha Hanwang Zhang Yongdong Zhang and Feng Wu. 2018. Context-Aware Visual Policy Network for Sequence-Level Image Captioning. In ACM Multimedia. ACM 9. https:\/\/doi.org\/10.1145\/3240508.3240632","DOI":"10.1145\/3240508.3240632"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00728"},{"volume-title":"Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics (ACL) .","year":"2002","author":"Papineni Kishore","key":"e_1_3_2_1_25_1"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"crossref","unstructured":"Steven J. Rennie Etienne Marcheret and Youssef Mroueh et al. 2017. Self-Critical Sequence Training for Image Captioning. In CVPR .  Steven J. Rennie Etienne Marcheret and Youssef Mroueh et al. 2017. Self-Critical Sequence Training for Image Captioning. In CVPR .","DOI":"10.1109\/CVPR.2017.131"},{"key":"e_1_3_2_1_27_1","unstructured":"Satoshi Tsutsui and David Crandall. 2017. Using Artificial Tokens to Control Languages for Multilingual Image Caption Generation. (2017).  Satoshi Tsutsui and David Crandall. 2017. Using Artificial Tokens to Control Languages for Multilingual Image Caption Generation. (2017)."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"crossref","unstructured":"Ramakrishna Vedantam C. Lawrence Zitnick and Devi Parikh. 2015. CIDEr: Consensus-based Image Description Evaluation. In CVPR .  Ramakrishna Vedantam C. Lawrence Zitnick and Devi Parikh. 2015. CIDEr: Consensus-based Image Description Evaluation. In CVPR .","DOI":"10.1109\/CVPR.2015.7299087"},{"volume-title":"Show and Tell: A Neural Image Caption Generator","year":"2015","author":"Vinyals Oriol","key":"e_1_3_2_1_29_1"},{"volume-title":"A Large-scale Dataset for Going Deeper in Image Understanding. CoRR","year":"2017","author":"Wu Jiahong","key":"e_1_3_2_1_30_1"},{"key":"e_1_3_2_1_31_1","unstructured":"Jing Shao Dapeng Chen Xiaogang Wang Xihui Liu Hongsheng Li. 2018. Show Tell and Discriminate: Image Captioning by Self-retrieval with Partially Labeled Data. In ECCV .  Jing Shao Dapeng Chen Xiaogang Wang Xihui Liu Hongsheng Li. 2018. Show Tell and Discriminate: Image Captioning by Self-retrieval with Partially Labeled Data. In ECCV ."},{"volume-title":"Attend and Tell: Neural Image Caption Generation with Visual Attention","year":"2015","author":"Xu Kelvin","key":"e_1_3_2_1_32_1"},{"key":"e_1_3_2_1_33_1","unstructured":"Quanzeng You Hailin Jin Zhaowen Wang Chen Fang and Jiebo Luo. 2016. Image Captioning with Semantic Attention. In CVPR .  Quanzeng You Hailin Jin Zhaowen Wang Chen Fang and Jiebo Luo. 2016. Image Captioning with Semantic Attention. In CVPR ."},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"crossref","unstructured":"Wendong Zhang Bingbing Ni Yichao Yan Jingwei Xu and Xiaokang Yang. 2017. Depth Structure Preserving Scene Image Generation. In ACM Multimedia. ACM.  Wendong Zhang Bingbing Ni Yichao Yan Jingwei Xu and Xiaokang Yang. 2017. Depth Structure Preserving Scene Image Generation. In ACM Multimedia. ACM.","DOI":"10.1145\/3240508.3240584"}],"event":{"name":"MM '19: The 27th ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Nice France","acronym":"MM '19"},"container-title":["Proceedings of the 27th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3343031.3350996","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3343031.3350996","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T23:13:18Z","timestamp":1750201998000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3343031.3350996"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,10,15]]},"references-count":34,"alternative-id":["10.1145\/3343031.3350996","10.1145\/3343031"],"URL":"https:\/\/doi.org\/10.1145\/3343031.3350996","relation":{},"subject":[],"published":{"date-parts":[[2019,10,15]]},"assertion":[{"value":"2019-10-15","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}