{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,18]],"date-time":"2026-04-18T05:46:46Z","timestamp":1776491206333,"version":"3.51.2"},"publisher-location":"New York, NY, USA","reference-count":59,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,4,19]],"date-time":"2021-04-19T00:00:00Z","timestamp":1618790400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,4,19]]},"DOI":"10.1145\/3442381.3449923","type":"proceedings-article","created":{"date-parts":[[2021,6,3]],"date-time":"2021-06-03T19:03:16Z","timestamp":1622746996000},"page":"2792-2804","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":31,"title":["Generating Accurate Caption Units for Figure Captioning"],"prefix":"10.1145","author":[{"given":"Xin","family":"Qian","sequence":"first","affiliation":[{"name":"University of Maryland, College Park, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Eunyee","family":"Koh","sequence":"additional","affiliation":[{"name":"Adobe Research, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fan","family":"Du","sequence":"additional","affiliation":[{"name":"Adobe Research, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sungchul","family":"Kim","sequence":"additional","affiliation":[{"name":"Adobe Research, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Joel","family":"Chan","sequence":"additional","affiliation":[{"name":"University of Maryland, College Park, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ryan A.","family":"Rossi","sequence":"additional","affiliation":[{"name":"Adobe Research, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sana","family":"Malik","sequence":"additional","affiliation":[{"name":"Adobe Research, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tak Yeon","family":"Lee","sequence":"additional","affiliation":[{"name":"Department of Industrial Design, KAIST, Republic of Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2021,6,3]]},"reference":[{"key":"e_1_3_2_1_1_1","first-page":"4","article-title":"VQA: Visual Question Answering","volume":"1","author":"Agrawal Aishwarya","year":"2016","unstructured":"Aishwarya Agrawal , Jiasen Lu , Stanislaw Antol , Margaret Mitchell , C\u00a0Lawrence Zitnick , Devi Parikh , and Dhruv Batra . 2016 . VQA: Visual Question Answering . International Journal of Computer Vision 1 , 123 (2016), 4 \u2013 31 . Aishwarya Agrawal, Jiasen Lu, Stanislaw Antol, Margaret Mitchell, C\u00a0Lawrence Zitnick, Devi Parikh, and Dhruv Batra. 2016. VQA: Visual Question Answering. International Journal of Computer Vision 1, 123 (2016), 4\u201331.","journal-title":"International Journal of Computer Vision"},{"key":"e_1_3_2_1_2_1","volume-title":"Workshops at AAAI.","author":"Al-Zaidy A","year":"2016","unstructured":"Rabah\u00a0 A Al-Zaidy , Sagnik\u00a0Ray Choudhury , and C\u00a0Lee Giles . 2016 . Automatic summary generation for scientific data charts . In Workshops at AAAI. Rabah\u00a0A Al-Zaidy, Sagnik\u00a0Ray Choudhury, and C\u00a0Lee Giles. 2016. Automatic summary generation for scientific data charts. In Workshops at AAAI."},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR.  Peter Anderson Xiaodong He Chris Buehler Damien Teney Mark Johnson Stephen Gould and Lei Zhang. 2018. Bottom-up and top-down attention for image captioning and visual question answering. In CVPR.","DOI":"10.1109\/CVPR.2018.00636"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/FUZZ-IEEE.2016.7737741"},{"key":"e_1_3_2_1_5_1","unstructured":"Satanjeev Banerjee and Alon Lavie. 2005. METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. In ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and\/or Summarization.  Satanjeev Banerjee and Alon Lavie. 2005. METEOR: An Automatic Metric for MT Evaluation with Improved Correlation with Human Judgments. In ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and\/or Summarization."},{"key":"e_1_3_2_1_6_1","doi-asserted-by":"crossref","unstructured":"Jeffrey\u00a0P Bigham Erin\u00a0L Brady Cole Gleason Anhong Guo and David\u00a0A Shamma. 2016. An Uninteresting Tour Through Why Our Research Papers Aren\u2019t Accessible. In CHI-EA.  Jeffrey\u00a0P Bigham Erin\u00a0L Brady Cole Gleason Anhong Guo and David\u00a0A Shamma. 2016. An Uninteresting Tour Through Why Our Research Papers Aren\u2019t Accessible. In CHI-EA.","DOI":"10.1145\/2851581.2892588"},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"crossref","unstructured":"Ali\u00a0Furkan Biten Lluis Gomez Mar\u00e7al Rusinol and Dimosthenis Karatzas. 2019. Good News Everyone! Context driven entity-aware captioning for news images. In CVPR.  Ali\u00a0Furkan Biten Lluis Gomez Mar\u00e7al Rusinol and Dimosthenis Karatzas. 2019. Good News Everyone! Context driven entity-aware captioning for news images. In CVPR.","DOI":"10.1109\/CVPR.2019.01275"},{"key":"e_1_3_2_1_8_1","volume-title":"Cognitive domain.","author":"S Bloom","year":"1956","unstructured":"Benjamin\u00a0 S Bloom 1956. Taxonomy of educational objectives . Vol. 1 : Cognitive domain. New York : McKay ( 1956 ), 20\u201324. Benjamin\u00a0S Bloom 1956. Taxonomy of educational objectives. Vol. 1: Cognitive domain. New York: McKay (1956), 20\u201324."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1145\/2745555.2746665"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"crossref","unstructured":"Ritwick Chaudhry Sumit Shekhar Utkarsh Gupta Pranav Maneriker Prann Bansal and Ajay Joshi. 2019. LEAF-QA: Locate Encode & Attend for Figure Question Answering. arXiv preprint arXiv:1907.12861(2019).  Ritwick Chaudhry Sumit Shekhar Utkarsh Gupta Pranav Maneriker Prann Bansal and Ajay Joshi. 2019. LEAF-QA: Locate Encode & Attend for Figure Question Answering. arXiv preprint arXiv:1907.12861(2019).","DOI":"10.1109\/WACV45572.2020.9093269"},{"key":"e_1_3_2_1_11_1","volume-title":"Figure Captioning with Relation Maps for Reasoning. In IEEE Winter Conference on Applications of Computer Vision (WACV).","author":"Chen C.","unstructured":"C. Chen , R. Zhang , E. Koh , S. Kim , S. Cohen , and R. Rossi . 2020 . Figure Captioning with Relation Maps for Reasoning. In IEEE Winter Conference on Applications of Computer Vision (WACV). C. Chen, R. Zhang, E. Koh, S. Kim, S. Cohen, and R. Rossi. 2020. Figure Captioning with Relation Maps for Reasoning. In IEEE Winter Conference on Applications of Computer Vision (WACV)."},{"key":"e_1_3_2_1_12_1","unstructured":"Charles Chen Ruiyi Zhang Eunyee Koh Sungchul Kim Scott Cohen Tong Yu Ryan\u00a0A. Rossi and Razvan\u00a0C. Bunescu. 2019. Figure Captioning with Reasoning and Sequence-Level Training. arXiv preprint arXiv:1906.02850(2019).  Charles Chen Ruiyi Zhang Eunyee Koh Sungchul Kim Scott Cohen Tong Yu Ryan\u00a0A. Rossi and Razvan\u00a0C. Bunescu. 2019. Figure Captioning with Reasoning and Sequence-Level Training. arXiv preprint arXiv:1906.02850(2019)."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1007\/11425274_68"},{"key":"e_1_3_2_1_14_1","volume-title":"Proceedings of the 7th European Workshop on Natural Language Generation.","author":"Corio Marc","year":"1999","unstructured":"Marc Corio and Guy Lapalme . 1999 . Generation of texts for information graphics . In Proceedings of the 7th European Workshop on Natural Language Generation. Marc Corio and Guy Lapalme. 1999. Generation of texts for information graphics. In Proceedings of the 7th European Workshop on Natural Language Generation."},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"crossref","unstructured":"Marcella Cornia Lorenzo Baraldi and Rita Cucchiara. 2019. Show Control and Tell: A Framework for Generating Controllable and Grounded Captions. In CVPR.  Marcella Cornia Lorenzo Baraldi and Rita Cucchiara. 2019. Show Control and Tell: A Framework for Generating Controllable and Grounded Captions. In CVPR.","DOI":"10.1109\/CVPR.2019.00850"},{"key":"e_1_3_2_1_16_1","doi-asserted-by":"crossref","unstructured":"Seniz Demir Sandra Carberry and Kathleen\u00a0F. McCoy. 2008. Generating Textual Summaries of Bar Charts. In INLG.  Seniz Demir Sandra Carberry and Kathleen\u00a0F. McCoy. 2008. Generating Textual Summaries of Bar Charts. In INLG.","DOI":"10.3115\/1708322.1708327"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"crossref","unstructured":"Stephanie Elzer Sandra Carberry Daniel Chester Seniz Demir Nancy Green Ingrid Zukerman and Keith Trnka. 2005. Exploring and exploiting the limited utility of captions in recognizing intention in information graphics. In ACL.  Stephanie Elzer Sandra Carberry Daniel Chester Seniz Demir Nancy Green Ingrid Zukerman and Keith Trnka. 2005. Exploring and exploiting the limited utility of captions in recognizing intention in information graphics. In ACL.","DOI":"10.3115\/1219840.1219868"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.artint.2010.10.003"},{"key":"e_1_3_2_1_19_1","unstructured":"Massimo Fasciano and Guy Lapalme. 1996. Postgraphe: a system for the generation of statistical graphics and text. In INLG.  Massimo Fasciano and Guy Lapalme. 1996. Postgraphe: a system for the generation of statistical graphics and text. In INLG."},{"key":"e_1_3_2_1_20_1","volume-title":"Stylenet: Generating attractive visual captions with styles. In CVPR.","author":"Gan Chuang","year":"2017","unstructured":"Chuang Gan , Zhe Gan , Xiaodong He , Jianfeng Gao , and Li Deng . 2017 . Stylenet: Generating attractive visual captions with styles. In CVPR. Chuang Gan, Zhe Gan, Xiaodong He, Jianfeng Gao, and Li Deng. 2017. Stylenet: Generating attractive visual captions with styles. In CVPR."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"David Grangier and Michael Auli. 2018. QuickEdit: Editing Text & Translations by Crossing Words Out. In NAACL HLT.  David Grangier and Michael Auli. 2018. QuickEdit: Editing Text & Translations by Crossing Words Out. In NAACL HLT.","DOI":"10.18653\/v1\/N18-1025"},{"key":"e_1_3_2_1_22_1","unstructured":"Jiatao Gu Zhengdong Lu Hang Li and Victor\u00a0O.K. Li. 2016. Incorporating Copying Mechanism in Sequence-to-Sequence Learning. In ACL.  Jiatao Gu Zhengdong Lu Hang Li and Victor\u00a0O.K. Li. 2016. Incorporating Copying Mechanism in Sequence-to-Sequence Learning. In ACL."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"crossref","unstructured":"Braden Hancock Hongrae Lee and Cong Yu. 2019. Generating Titles for Web Tables. In WWW.  Braden Hancock Hongrae Lee and Cong Yu. 2019. Generating Titles for Web Tables. In WWW.","DOI":"10.1145\/3308558.3313399"},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"crossref","unstructured":"Matthew Honnibal and Mark Johnson. 2015. An Improved Non-monotonic Transition System for Dependency Parsing. In EMNLP.  Matthew Honnibal and Mark Johnson. 2015. An Improved Non-monotonic Transition System for Dependency Parsing. In EMNLP.","DOI":"10.18653\/v1\/D15-1162"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"crossref","unstructured":"Morten Jessen Falk B\u00f6schen and Ansgar Scherp. 2019. Text Localization in Scientific Figures using Fully Convolutional Neural Networks on Limited Training Data. In DocEng.  Morten Jessen Falk B\u00f6schen and Ansgar Scherp. 2019. Text Localization in Scientific Figures using Fully Convolutional Neural Networks on Limited Training Data. In DocEng.","DOI":"10.1145\/3342558.3345396"},{"key":"e_1_3_2_1_26_1","volume-title":"Li Fei-Fei, C Lawrence\u00a0Zitnick, and Ross Girshick.","author":"Johnson Justin","year":"2017","unstructured":"Justin Johnson , Bharath Hariharan , Laurens van\u00a0der Maaten , Li Fei-Fei, C Lawrence\u00a0Zitnick, and Ross Girshick. 2017 . Clevr : A diagnostic dataset for compositional language and elementary visual reasoning. In CVPR. Justin Johnson, Bharath Hariharan, Laurens van\u00a0der Maaten, Li Fei-Fei, C Lawrence\u00a0Zitnick, and Ross Girshick. 2017. Clevr: A diagnostic dataset for compositional language and elementary visual reasoning. In CVPR."},{"key":"e_1_3_2_1_27_1","volume-title":"Densecap: Fully convolutional localization networks for dense captioning. In CVPR.","author":"Johnson Justin","year":"2016","unstructured":"Justin Johnson , Andrej Karpathy , and Li Fei-Fei . 2016 . Densecap: Fully convolutional localization networks for dense captioning. In CVPR. Justin Johnson, Andrej Karpathy, and Li Fei-Fei. 2016. Densecap: Fully convolutional localization networks for dense captioning. In CVPR."},{"key":"e_1_3_2_1_28_1","volume-title":"DVQA: Understanding data visualizations via question answering. In CVPR.","author":"Kafle Kushal","year":"2018","unstructured":"Kushal Kafle , Brian Price , Scott Cohen , and Christopher Kanan . 2018 . DVQA: Understanding data visualizations via question answering. In CVPR. Kushal Kafle, Brian Price, Scott Cohen, and Christopher Kanan. 2018. DVQA: Understanding data visualizations via question answering. In CVPR."},{"key":"e_1_3_2_1_29_1","volume-title":"Figureqa: An annotated figure dataset for visual reasoning. arXiv preprint arXiv:1710.07300(2017).","author":"Kahou Samira\u00a0Ebrahimi","year":"2017","unstructured":"Samira\u00a0Ebrahimi Kahou , Vincent Michalski , Adam Atkinson , \u00c1kos K\u00e1d\u00e1r , Adam Trischler , and Yoshua Bengio . 2017 . Figureqa: An annotated figure dataset for visual reasoning. arXiv preprint arXiv:1710.07300(2017). Samira\u00a0Ebrahimi Kahou, Vincent Michalski, Adam Atkinson, \u00c1kos K\u00e1d\u00e1r, Adam Trischler, and Yoshua Bengio. 2017. Figureqa: An annotated figure dataset for visual reasoning. arXiv preprint arXiv:1710.07300(2017)."},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"crossref","unstructured":"Andrej Karpathy and Li Fei-Fei. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR.  Andrej Karpathy and Li Fei-Fei. 2015. Deep visual-semantic alignments for generating image descriptions. In CVPR.","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"e_1_3_2_1_31_1","unstructured":"Dong-Jin Kim Jinsoo Choi Tae-Hyun Oh and In\u00a0So Kweon. 2019. Dense relational captioning: Triple-stream networks for relationship-based captioning. In CVPR.  Dong-Jin Kim Jinsoo Choi Tae-Hyun Oh and In\u00a0So Kweon. 2019. Dense relational captioning: Triple-stream networks for relationship-based captioning. In CVPR."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Jonathan Krause Justin Johnson Ranjay Krishna and Li Fei-Fei. 2017. A hierarchical approach for generating descriptive image paragraphs. In CVPR.  Jonathan Krause Justin Johnson Ranjay Krishna and Li Fei-Fei. 2017. A hierarchical approach for generating descriptive image paragraphs. In CVPR.","DOI":"10.1109\/CVPR.2017.356"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0981-7"},{"key":"e_1_3_2_1_34_1","volume-title":"Sequicity: Simplifying Task-oriented Dialogue Systems with Single Sequence-to-Sequence Architectures. In ACL.","author":"Lei Wenqiang","year":"2018","unstructured":"Wenqiang Lei , Xisen Jin , Min-Yen Kan , Zhaochun Ren , Xiangnan He , and Dawei Yin . 2018 . Sequicity: Simplifying Task-oriented Dialogue Systems with Single Sequence-to-Sequence Architectures. In ACL. Wenqiang Lei, Xisen Jin, Min-Yen Kan, Zhaochun Ren, Xiangnan He, and Dawei Yin. 2018. Sequicity: Simplifying Task-oriented Dialogue Systems with Single Sequence-to-Sequence Architectures. In ACL."},{"key":"e_1_3_2_1_35_1","unstructured":"Mateusz Malinowski and Mario Fritz. 2014. A multi-world approach to question answering about real-world scenes based on uncertain input. In NIPS.  Mateusz Malinowski and Mario Fritz. 2014. A multi-world approach to question answering about real-world scenes based on uncertain input. In NIPS."},{"key":"e_1_3_2_1_36_1","unstructured":"James\u00a0H Martin and Daniel Jurafsky. 2009. Speech and language processing: An introduction to natural language processing computational linguistics and speech recognition. Pearson\/Prentice Hall Upper Saddle River.  James\u00a0H Martin and Daniel Jurafsky. 2009. Speech and language processing: An introduction to natural language processing computational linguistics and speech recognition. Pearson\/Prentice Hall Upper Saddle River."},{"key":"e_1_3_2_1_37_1","volume-title":"Senticap: Generating image descriptions with sentiments. In AAAI.","author":"Mathews Alexander\u00a0Patrick","year":"2016","unstructured":"Alexander\u00a0Patrick Mathews , Lexing Xie , and Xuming He . 2016 . Senticap: Generating image descriptions with sentiments. In AAAI. Alexander\u00a0Patrick Mathews, Lexing Xie, and Xuming He. 2016. Senticap: Generating image descriptions with sentiments. In AAAI."},{"key":"e_1_3_2_1_38_1","unstructured":"Kathleen\u00a0F McCoy Sandra Carberry Tom Roper and Nancy Green. 2001. Towards generating textual summaries of graphs.  Kathleen\u00a0F McCoy Sandra Carberry Tom Roper and Nancy Green. 2001. Towards generating textual summaries of graphs."},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.5555\/972749.972754"},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"crossref","unstructured":"Priscilla Moraes Gabriel Sina Kathy McCoy and Sandra Carberry. 2014. Generating summaries of line graphs. In INLG.  Priscilla Moraes Gabriel Sina Kathy McCoy and Sandra Carberry. 2014. Generating summaries of line graphs. In INLG.","DOI":"10.3115\/v1\/W14-4413"},{"key":"e_1_3_2_1_41_1","doi-asserted-by":"publisher","DOI":"10.21437\/Interspeech.2017-1525"},{"key":"e_1_3_2_1_42_1","doi-asserted-by":"crossref","unstructured":"Kishore Papineni Salim Roukos Todd Ward and Wei-Jing Zhu. 2002. Bleu: a Method for Automatic Evaluation of Machine Translation. In ACL.  Kishore Papineni Salim Roukos Todd Ward and Wei-Jing Zhu. 2002. Bleu: a Method for Automatic Evaluation of Machine Translation. In ACL.","DOI":"10.3115\/1073083.1073135"},{"key":"e_1_3_2_1_43_1","volume-title":"Human-Centered Machine Learning Perspectives Workshop, CHI.","author":"Piazentin\u00a0Ono Jorge","year":"2019","unstructured":"Jorge Piazentin\u00a0Ono , Ray\u00a0(Sungsoo) Hong, Claudio T.\u00a0 Silva , and Juliana Freire . 2019 . Why should we teach machines to read charts made for humans? . In Human-Centered Machine Learning Perspectives Workshop, CHI. Jorge Piazentin\u00a0Ono, Ray\u00a0(Sungsoo) Hong, Claudio T.\u00a0Silva, and Juliana Freire. 2019. Why should we teach machines to read charts made for humans?. In Human-Centered Machine Learning Perspectives Workshop, CHI."},{"key":"e_1_3_2_1_44_1","volume-title":"Reverse-Engineering Visualizations: Recovering Visual Encodings from Chart Images. EuroVis","author":"Poco Jorge","year":"2017","unstructured":"Jorge Poco and Jeffrey Heer . 2017. Reverse-Engineering Visualizations: Recovering Visual Encodings from Chart Images. EuroVis ( 2017 ). Jorge Poco and Jeffrey Heer. 2017. Reverse-Engineering Visualizations: Recovering Visual Encodings from Chart Images. EuroVis (2017)."},{"key":"e_1_3_2_1_45_1","doi-asserted-by":"crossref","unstructured":"Xin Qian Eunyee Koh Fan Du Sungchul Kim and Joel Chan. 2020. A Formative Study on Designing Accurate and Natural Figure Captioning Systems. In CHI-EA.  Xin Qian Eunyee Koh Fan Du Sungchul Kim and Joel Chan. 2020. A Formative Study on Designing Accurate and Natural Figure Captioning Systems. In CHI-EA.","DOI":"10.1145\/3334480.3382946"},{"key":"e_1_3_2_1_46_1","unstructured":"Steven\u00a0F. Roth John Kolojejchick Joe Mattis and Jade Goldstein. 1994. Interactive Graphic Design Using Automatic Presentation Knowledge. In CHI.  Steven\u00a0F. Roth John Kolojejchick Joe Mattis and Jade Goldstein. 1994. Interactive Graphic Design Using Automatic Presentation Knowledge. In CHI."},{"key":"e_1_3_2_1_47_1","unstructured":"Adam Santoro David Raposo David\u00a0G Barrett Mateusz Malinowski Razvan Pascanu Peter Battaglia and Timothy Lillicrap. 2017. A simple neural network module for relational reasoning. In NIPS.  Adam Santoro David Raposo David\u00a0G Barrett Mateusz Malinowski Razvan Pascanu Peter Battaglia and Timothy Lillicrap. 2017. A simple neural network module for relational reasoning. In NIPS."},{"key":"e_1_3_2_1_48_1","unstructured":"Abigail See Peter\u00a0J. Liu and Christopher\u00a0D. Manning. 2017. Get To The Point: Summarization with Pointer-Generator Networks. In ACL.  Abigail See Peter\u00a0J. Liu and Christopher\u00a0D. Manning. 2017. Get To The Point: Summarization with Pointer-Generator Networks. In ACL."},{"key":"e_1_3_2_1_49_1","doi-asserted-by":"crossref","unstructured":"Noah Siegel Zachary Horvitz Roie Levin Santosh Divvala and Ali Farhadi. 2016. FigureSeer: Parsing result-figures in research papers. In ECCV.  Noah Siegel Zachary Horvitz Roie Levin Santosh Divvala and Ali Farhadi. 2016. FigureSeer: Parsing result-figures in research papers. In ECCV.","DOI":"10.1007\/978-3-319-46478-7_41"},{"key":"e_1_3_2_1_50_1","unstructured":"Michel Simard Cyril Goutte and Pierre Isabelle. 2007. Statistical Phrase-Based Post-Editing. In NAACL.  Michel Simard Cyril Goutte and Pierre Isabelle. 2007. Statistical Phrase-Based Post-Editing. In NAACL."},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Oriol Vinyals Alexander Toshev Samy Bengio and Dumitru Erhan. 2014. Show and Tell: A Neural Image Caption Generator. arXiv preprint arXiv:1411.4555(2014).  Oriol Vinyals Alexander Toshev Samy Bengio and Dumitru Erhan. 2014. Show and Tell: A Neural Image Caption Generator. arXiv preprint arXiv:1411.4555(2014).","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"e_1_3_2_1_52_1","unstructured":"W3C 2019. A First Review of Web Accessibility. https:\/\/www.w3.org\/WAI\/test-evaluate\/preliminary\/images  W3C 2019. A First Review of Web Accessibility. https:\/\/www.w3.org\/WAI\/test-evaluate\/preliminary\/images"},{"key":"e_1_3_2_1_53_1","unstructured":"Tsung-Hsien Wen Milica Gasic Nikola Mrk\u0161i\u0107 Pei-Hao Su David Vandyke and Steve Young. 2015. Semantically Conditioned LSTM-based Natural Language Generation for Spoken Dialogue Systems. In EMNLP.  Tsung-Hsien Wen Milica Gasic Nikola Mrk\u0161i\u0107 Pei-Hao Su David Vandyke and Steve Young. 2015. Semantically Conditioned LSTM-based Natural Language Generation for Spoken Dialogue Systems. In EMNLP."},{"key":"e_1_3_2_1_54_1","unstructured":"Kelvin Xu Jimmy Ba Ryan Kiros Kyunghyun Cho Aaron Courville Ruslan Salakhudinov Rich Zemel and Yoshua Bengio. 2015. Show attend and tell: Neural image caption generation with visual attention. In ICML.  Kelvin Xu Jimmy Ba Ryan Kiros Kyunghyun Cho Aaron Courville Ruslan Salakhudinov Rich Zemel and Yoshua Bengio. 2015. Show attend and tell: Neural image caption generation with visual attention. In ICML."},{"key":"e_1_3_2_1_55_1","doi-asserted-by":"crossref","unstructured":"Qian Yang Aaron Steinfeld Carolyn Ros\u00e9 and John Zimmerman. 2020. Re-examining whether why and how human-ai interaction is uniquely difficult to design. In CHI.  Qian Yang Aaron Steinfeld Carolyn Ros\u00e9 and John Zimmerman. 2020. Re-examining whether why and how human-ai interaction is uniquely difficult to design. In CHI.","DOI":"10.1145\/3313831.3376301"},{"key":"e_1_3_2_1_56_1","doi-asserted-by":"crossref","unstructured":"Zichao Yang Xiaodong He Jianfeng Gao Li Deng and Alex Smola. 2016. Stacked attention networks for image question answering. In CVPR.  Zichao Yang Xiaodong He Jianfeng Gao Li Deng and Alex Smola. 2016. Stacked attention networks for image question answering. In CVPR.","DOI":"10.1109\/CVPR.2016.10"},{"key":"e_1_3_2_1_57_1","doi-asserted-by":"crossref","unstructured":"Ting Yao Yingwei Pan Yehao Li Zhaofan Qiu and Tao Mei. 2017. Boosting image captioning with attributes. In CVPR.  Ting Yao Yingwei Pan Yehao Li Zhaofan Qiu and Tao Mei. 2017. Boosting image captioning with attributes. In CVPR.","DOI":"10.1109\/ICCV.2017.524"},{"key":"e_1_3_2_1_58_1","unstructured":"Kexin Yi Jiajun Wu Chuang Gan Antonio Torralba Pushmeet Kohli and Josh Tenenbaum. 2018. Neural-symbolic vqa: Disentangling reasoning from vision and language understanding. In NIPS.  Kexin Yi Jiajun Wu Chuang Gan Antonio Torralba Pushmeet Kohli and Josh Tenenbaum. 2018. Neural-symbolic vqa: Disentangling reasoning from vision and language understanding. In NIPS."},{"key":"e_1_3_2_1_59_1","doi-asserted-by":"crossref","unstructured":"Yue Zheng Yali Li and Shengjin Wang. 2019. Intention Oriented Image Captions with Guiding Objects. In CVPR.  Yue Zheng Yali Li and Shengjin Wang. 2019. Intention Oriented Image Captions with Guiding Objects. In CVPR.","DOI":"10.1109\/CVPR.2019.00859"}],"event":{"name":"WWW '21: The Web Conference 2021","location":"Ljubljana Slovenia","acronym":"WWW '21","sponsor":["SIGWEB ACM Special Interest Group on Hypertext, Hypermedia, and Web"]},"container-title":["Proceedings of the Web Conference 2021"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3442381.3449923","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3442381.3449923","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:24:32Z","timestamp":1750195472000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3442381.3449923"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,4,19]]},"references-count":59,"alternative-id":["10.1145\/3442381.3449923","10.1145\/3442381"],"URL":"https:\/\/doi.org\/10.1145\/3442381.3449923","relation":{},"subject":[],"published":{"date-parts":[[2021,4,19]]},"assertion":[{"value":"2021-06-03","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}