{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,4]],"date-time":"2026-06-04T19:42:42Z","timestamp":1780602162788,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":36,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,12,1]],"date-time":"2021-12-01T00:00:00Z","timestamp":1638316800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,12]]},"DOI":"10.1145\/3469877.3490585","type":"proceedings-article","created":{"date-parts":[[2022,1,10]],"date-time":"2022-01-10T18:27:21Z","timestamp":1641839241000},"page":"1-7","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":9,"title":["S2TD: A Tree-Structured Decoder for Image Paragraph Captioning"],"prefix":"10.1145","author":[{"given":"Yihui","family":"Shi","sequence":"first","affiliation":[{"name":"Beijing University of Posts and Telecommunications, CN"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yun","family":"Liu","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, CN"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fangxiang","family":"Feng","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, CN"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ruifan","family":"Li","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, CN"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhanyu","family":"Ma","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, CN"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaojie","family":"Wang","sequence":"additional","affiliation":[{"name":"Beijing University of Posts and Telecommunications, CN"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2022,1,10]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01216-8_45"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240695"},{"key":"e_1_3_2_1_4_1","unstructured":"Xinlei Chen Hao Fang Tsung-Yi Lin Ramakrishna Vedantam Saurabh Gupta Piotr Doll\u00e1r and C\u00a0Lawrence Zitnick. 2015. Microsoft coco captions: Data collection and evaluation server. (2015). http:\/\/de.arxiv.org\/pdf\/1504.00325  Xinlei Chen Hao Fang Tsung-Yi Lin Ramakrishna Vedantam Saurabh Gupta Piotr Doll\u00e1r and C\u00a0Lawrence Zitnick. 2015. Microsoft coco captions: Data collection and evaluation server. (2015). http:\/\/de.arxiv.org\/pdf\/1504.00325"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/W14-3348"},{"key":"e_1_3_2_1_7_1","unstructured":"Simao Herdade Armin Kappeler Kofi Boakye and Joao Soares. 2019. Image captioning: Transforming objects into words. In Advances in Neural Information Processing Systems (NeuIPS). 11137\u201311147.  Simao Herdade Armin Kappeler Kofi Boakye and Joao Soares. 2019. Image captioning: Transforming objects into words. In Advances in Neural Information Processing Systems (NeuIPS). 11137\u201311147."},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00473"},{"key":"e_1_3_2_1_10_1","volume-title":"Adam: A Method for Stochastic Optimization. In International Conference on Learning Representations (ICLR). https:\/\/arxiv.org\/abs\/1412","author":"P.","unstructured":"Diederik\u00a0 P. Kingma and Jimmy Ba. 2015 . Adam: A Method for Stochastic Optimization. In International Conference on Learning Representations (ICLR). https:\/\/arxiv.org\/abs\/1412 .6980v8 Diederik\u00a0P. Kingma and Jimmy Ba. 2015. Adam: A Method for Stochastic Optimization. In International Conference on Learning Representations (ICLR). https:\/\/arxiv.org\/abs\/1412.6980v8"},{"key":"e_1_3_2_1_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.356"},{"key":"e_1_3_2_1_12_1","volume-title":"Deep Learning Symposium, Advances in Neural Information Processing Systems (NIPS). https:\/\/openreview.net\/forum?id=BJLa_ZC9","author":"Lei\u00a0Ba Jimmy","year":"2016","unstructured":"Jimmy Lei\u00a0Ba , Jamie\u00a0Ryan Kiros , and Geoffrey\u00a0 E Hinton . 2016 . Layer normalization . In Deep Learning Symposium, Advances in Neural Information Processing Systems (NIPS). https:\/\/openreview.net\/forum?id=BJLa_ZC9 Jimmy Lei\u00a0Ba, Jamie\u00a0Ryan Kiros, and Geoffrey\u00a0E Hinton. 2016. Layer normalization. In Deep Learning Symposium, Advances in Neural Information Processing Systems (NIPS). https:\/\/openreview.net\/forum?id=BJLa_ZC9"},{"key":"e_1_3_2_1_13_1","volume-title":"Dual-CNN: A Convolutional language decoder for paragraph image captioning. Neurocomputing","author":"Li Ruifan","year":"2020","unstructured":"Ruifan Li , Haoyu Liang , Yihui Shi , Fangxiang Feng , and Xiaojie Wang . 2020. Dual-CNN: A Convolutional language decoder for paragraph image captioning. Neurocomputing ( 2020 ). Ruifan Li, Haoyu Liang, Yihui Shi, Fangxiang Feng, and Xiaojie Wang. 2020. Dual-CNN: A Convolutional language decoder for paragraph image captioning. Neurocomputing (2020)."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.364"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00754"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"publisher","DOI":"10.1145\/3343031.3350961"},{"key":"e_1_3_2_1_17_1","volume-title":"Image-to-Tree: A Tree-Structured Decoder for Image Captioning. In IEEE International Conference on Multimedia and Expo (ICME). 1294\u20131299","author":"Ma Zhiming","year":"2019","unstructured":"Zhiming Ma , Chun Yuan , Yangyang Cheng , and Xinrui Zhu . 2019 . Image-to-Tree: A Tree-Structured Decoder for Image Captioning. In IEEE International Conference on Multimedia and Expo (ICME). 1294\u20131299 . Zhiming Ma, Chun Yuan, Yangyang Cheng, and Xinrui Zhu. 2019. Image-to-Tree: A Tree-Structured Decoder for Image Captioning. In IEEE International Conference on Multimedia and Expo (ICME). 1294\u20131299."},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D18-1084"},{"key":"e_1_3_2_1_19_1","volume-title":"Annual Meeting of the Association for Computational Linguistics (ACL). 311\u2013318","author":"Papineni Kishore","year":"2002","unstructured":"Kishore Papineni , Salim Roukos , Todd Ward , and Wei-Jing Zhu . 2002 . BLEU: a method for automatic evaluation of machine translation . In Annual Meeting of the Association for Computational Linguistics (ACL). 311\u2013318 . Kishore Papineni, Salim Roukos, Todd Ward, and Wei-Jing Zhu. 2002. BLEU: a method for automatic evaluation of machine translation. In Annual Meeting of the Association for Computational Linguistics (ACL). 311\u2013318."},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D19-1410"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.131"},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.acl-main.664"},{"key":"e_1_3_2_1_23_1","first-page":"2377","article-title":"Training very deep networks","volume":"28","author":"Srivastava K","year":"2015","unstructured":"Rupesh\u00a0 K Srivastava , Klaus Greff , and J\u00fcrgen Schmidhuber . 2015 . Training very deep networks . Advances in Neural Information Processing Systems (NIPS) 28 (2015), 2377 \u2013 2385 . Rupesh\u00a0K Srivastava, Klaus Greff, and J\u00fcrgen Schmidhuber. 2015. Training very deep networks. Advances in Neural Information Processing Systems (NIPS) 28 (2015), 2377\u20132385.","journal-title":"Advances in Neural Information Processing Systems (NIPS)"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58583-9_22"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/132"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240583"},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1080\/01621459.1963.10500845"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.24963\/ijcai.2019\/137"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2020.coling-main.279"},{"key":"e_1_3_2_1_31_1","volume-title":"Object Relation Attention for Image Paragraph Captioning. In AAAI Conference on Artificial Intelligence (AAAI), Vol.\u00a035","author":"Yang Li-Chuan","year":"2021","unstructured":"Li-Chuan Yang , Chih-Yuan Yang , and Jane Yung-jen Hsu . 2021 . Object Relation Attention for Image Paragraph Captioning. In AAAI Conference on Artificial Intelligence (AAAI), Vol.\u00a035 . 3136\u20133144. Li-Chuan Yang, Chih-Yuan Yang, and Jane Yung-jen Hsu. 2021. Object Relation Attention for Image Paragraph Captioning. In AAAI Conference on Artificial Intelligence (AAAI), Vol.\u00a035. 3136\u20133144."},{"key":"e_1_3_2_1_32_1","volume-title":"Hierarchical Scene Graph Encoder-Decoder for Image Paragraph Captioning. In ACM Conference on Multimedia (MM). 4181\u20134189","author":"Yang Xu","year":"2020","unstructured":"Xu Yang , Chongyang Gao , Hanwang Zhang , and Jianfei Cai . 2020 . Hierarchical Scene Graph Encoder-Decoder for Image Paragraph Captioning. In ACM Conference on Multimedia (MM). 4181\u20134189 . Xu Yang, Chongyang Gao, Hanwang Zhang, and Jianfei Cai. 2020. Hierarchical Scene Graph Encoder-Decoder for Image Paragraph Captioning. In ACM Conference on Multimedia (MM). 4181\u20134189."},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00271"},{"key":"e_1_3_2_1_34_1","volume-title":"International Conference on Machine Learning (ICML). 11076\u201311085","author":"Zhang Jianshu","year":"2020","unstructured":"Jianshu Zhang , Jun Du , Yongxin Yang , Yi-Zhe Song , Si Wei , and Lirong Dai . 2020 . A Tree-Structured Decoder for Image-to-Markup Generation . In International Conference on Machine Learning (ICML). 11076\u201311085 . Jianshu Zhang, Jun Du, Yongxin Yang, Yi-Zhe Song, Si Wei, and Lirong Dai. 2020. A Tree-Structured Decoder for Image-to-Markup Generation. In International Conference on Machine Learning (ICML). 11076\u201311085."},{"key":"e_1_3_2_1_35_1","volume-title":"RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual Words. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 15465\u201315474","author":"Zhang Xuying","year":"2021","unstructured":"Xuying Zhang , Xiaoshuai Sun , Yunpeng Luo , Jiayi Ji , Yiyi Zhou , Yongjian Wu , Feiyue Huang , and Rongrong Ji . 2021 . RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual Words. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 15465\u201315474 . Xuying Zhang, Xiaoshuai Sun, Yunpeng Luo, Jiayi Ji, Yiyi Zhou, Yongjian Wu, Feiyue Huang, and Rongrong Ji. 2021. RSTNet: Captioning With Adaptive Attention on Visual and Non-Visual Words. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). 15465\u201315474."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i07.7005"}],"event":{"name":"MMAsia '21: ACM Multimedia Asia","location":"Gold Coast Australia","acronym":"MMAsia '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["ACM Multimedia Asia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3469877.3490585","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3469877.3490585","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T19:30:16Z","timestamp":1750188616000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3469877.3490585"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,12]]},"references-count":36,"alternative-id":["10.1145\/3469877.3490585","10.1145\/3469877"],"URL":"https:\/\/doi.org\/10.1145\/3469877.3490585","relation":{},"subject":[],"published":{"date-parts":[[2021,12]]},"assertion":[{"value":"2022-01-10","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}