{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,27]],"date-time":"2026-06-27T16:23:40Z","timestamp":1782577420510,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":37,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T00:00:00Z","timestamp":1665360000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,10,10]]},"DOI":"10.1145\/3503161.3548547","type":"proceedings-article","created":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T15:43:12Z","timestamp":1665416592000},"page":"7355-7358","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":6,"title":["DavarOCR: A Toolbox for OCR and Multi-Modal Document Understanding"],"prefix":"10.1145","author":[{"given":"Liang","family":"Qiao","sequence":"first","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hui","family":"Jiang","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ying","family":"Chen","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Can","family":"Li","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pengfei","family":"Li","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zaisheng","family":"Li","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Baorui","family":"Zou","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Dashan","family":"Guo","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yingda","family":"Xu","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yunlu","family":"Xu","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhanzhan","family":"Cheng","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yi","family":"Niu","sequence":"additional","affiliation":[{"name":"Hikvision Research Institute, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2022,10,10]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"crossref","unstructured":"Youngmin Baek Bado Lee Dongyoon Han Sangdoo Yun and Hwalsuk Lee. 2019. Character region awareness for text detection. In CVPR. 9365--9374.  Youngmin Baek Bado Lee Dongyoon Han Sangdoo Yun and Hwalsuk Lee. 2019. Character region awareness for text detection. In CVPR. 9365--9374.","DOI":"10.1109\/CVPR.2019.00959"},{"key":"e_1_3_2_2_2_1","volume-title":"Rosetta: Large Scale System for Text Detection and Recognition in Images. In KDD. 71--79.","author":"Borisyuk Fedor","year":"2018","unstructured":"Fedor Borisyuk , Albert Gordo , and Viswanath Sivakumar . 2018 . Rosetta: Large Scale System for Text Detection and Recognition in Images. In KDD. 71--79. Fedor Borisyuk, Albert Gordo, and Viswanath Sivakumar. 2018. Rosetta: Large Scale System for Text Detection and Recognition in Images. In KDD. 71--79."},{"key":"e_1_3_2_2_3_1","volume-title":"Chen Change Loy, and Dahua Lin","author":"Chen Kai","year":"2019","unstructured":"Kai Chen , Jiaqi Wang , Jiangmiao Pang , Yuhang Cao , Yu Xiong , Xiaoxiao Li , Shuyang Sun , Wansen Feng , Ziwei Liu , Jiarui Xu , Zheng Zhang , Dazhi Cheng , Chenchen Zhu , Tianheng Cheng , Qijie Zhao , Buyu Li , Xin Lu , Rui Zhu , Yue Wu , Jifeng Dai , Jingdong Wang , Jianping Shi , Wanli Ouyang , Chen Change Loy, and Dahua Lin . 2019 . MMDetection: Open MMLab Detection Toolbox and Benchmark. CoRR , Vol. abs\/ 1906 .07155 (2019). Kai Chen, Jiaqi Wang, Jiangmiao Pang, Yuhang Cao, Yu Xiong, Xiaoxiao Li, Shuyang Sun, Wansen Feng, Ziwei Liu, Jiarui Xu, Zheng Zhang, Dazhi Cheng, Chenchen Zhu, Tianheng Cheng, Qijie Zhao, Buyu Li, Xin Lu, Rui Zhu, Yue Wu, Jifeng Dai, Jingdong Wang, Jianping Shi, Wanli Ouyang, Chen Change Loy, and Dahua Lin. 2019. MMDetection: Open MMLab Detection Toolbox and Benchmark. CoRR, Vol. abs\/1906.07155 (2019)."},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"crossref","unstructured":"Zhanzhan Cheng Jing Lu Yi Niu Shiliang Pu Fei Wu and Shuigeng Zhou. 2019. You Only Recognize Once: Towards Fast Video Text Spotting. In ACM MM. ACM 855--863.  Zhanzhan Cheng Jing Lu Yi Niu Shiliang Pu Fei Wu and Shuigeng Zhou. 2019. You Only Recognize Once: Towards Fast Video Text Spotting. In ACM MM. ACM 855--863.","DOI":"10.1145\/3343031.3351093"},{"key":"e_1_3_2_2_5_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. 4171--4186.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. 4171--4186. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. 4171--4186."},{"key":"e_1_3_2_2_6_1","unstructured":"Shancheng Fang Hongtao Xie Yuxin Wang Zhendong Mao and Yongdong Zhang. 2021. Read Like Humans: Autonomous Bidirectional and Iterative Language Modeling for Scene Text Recognition. In CVPR. 7098--7107.  Shancheng Fang Hongtao Xie Yuxin Wang Zhendong Mao and Yongdong Zhang. 2021. Read Like Humans: Autonomous Bidirectional and Iterative Language Modeling for Scene Text Recognition. In CVPR. 7098--7107."},{"key":"e_1_3_2_2_7_1","unstructured":"Jiafeng Guo Gu Xu Xueqi Cheng and Hang Li. 2009. Named entity recognition in query. In SIGIR. 267--274.  Jiafeng Guo Gu Xu Xueqi Cheng and Hang Li. 2009. Named entity recognition in query. In SIGIR. 267--274."},{"key":"e_1_3_2_2_8_1","volume-title":"Piotr Dollar, and Ross Girshick","author":"He Kaiming","year":"2017","unstructured":"Kaiming He , Georgia Gkioxari , Piotr Dollar, and Ross Girshick . 2017 . Mask R-CNN. In ICCV. 2980--2988. Kaiming He, Georgia Gkioxari, Piotr Dollar, and Ross Girshick. 2017. Mask R-CNN. In ICCV. 2980--2988."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"e_1_3_2_2_10_1","volume-title":"Bidirectional LSTM-CRF Models for Sequence Tagging. CoRR","author":"Huang Zhiheng","year":"2015","unstructured":"Zhiheng Huang , Wei Xu , and Kai Yu. 2015. Bidirectional LSTM-CRF Models for Sequence Tagging. CoRR ( 2015 ). Zhiheng Huang, Wei Xu, and Kai Yu. 2015. Bidirectional LSTM-CRF Models for Sequence Tagging. CoRR (2015)."},{"key":"e_1_3_2_2_11_1","unstructured":"Max Jaderberg Karen Simonyan Andrew Zisserman and Koray Kavukcuoglu. 2015. Spatial Transformer Networks. In NeurIPS. 2017--2025.  Max Jaderberg Karen Simonyan Andrew Zisserman and Koray Kavukcuoglu. 2015. Spatial Transformer Networks. In NeurIPS. 2017--2025."},{"key":"e_1_3_2_2_12_1","volume-title":"Hovy","author":"Jauhar Sujay Kumar","year":"2016","unstructured":"Sujay Kumar Jauhar , Peter D. Turney , and Eduard H . Hovy . 2016 . Tables as Semi-structured Knowledge for Question Answering. In ACL . Sujay Kumar Jauhar, Peter D. Turney, and Eduard H. Hovy. 2016. Tables as Semi-structured Knowledge for Question Answering. In ACL ."},{"key":"e_1_3_2_2_13_1","volume-title":"Johannes H\u00f6 hne, and Jean Baptiste Faddoul","author":"Katti Anoop R.","year":"2018","unstructured":"Anoop R. Katti , Christian Reisswig , Cordula Guder , Sebastian Brarda , Steffen Bickel , Johannes H\u00f6 hne, and Jean Baptiste Faddoul . 2018 . Chargrid : Towards Understanding 2D Documents. In EMNLP. 4459--4469. Anoop R. Katti, Christian Reisswig, Cordula Guder, Sebastian Brarda, Steffen Bickel, Johannes H\u00f6 hne, and Jean Baptiste Faddoul. 2018. Chargrid: Towards Understanding 2D Documents. In EMNLP. 4459--4469."},{"key":"e_1_3_2_2_14_1","volume-title":"Muhammad Ali Shahzad, and Faisal Shafait.","author":"Khan Saqib Ali","year":"2019","unstructured":"Saqib Ali Khan , Syed Muhammad Daniyal Khalid , Muhammad Ali Shahzad, and Faisal Shafait. 2019 . Table Structure Extraction with Bi-Directional Gated Recurrent Unit Networks. In ICDAR. 1366--1371. Saqib Ali Khan, Syed Muhammad Daniyal Khalid, Muhammad Ali Shahzad, and Faisal Shafait. 2019. Table Structure Extraction with Bi-Directional Gated Recurrent Unit Networks. In ICDAR. 1366--1371."},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"crossref","unstructured":"Hui Li Peng Wang and Chunhua Shen. 2017. Towards End-to-end Text Spotting with Convolutional Recurrent Neural Networks. In ICCV. 5248--5256.  Hui Li Peng Wang and Chunhua Shen. 2017. Towards End-to-end Text Spotting with Convolutional Recurrent Neural Networks. In ICCV. 5248--5256.","DOI":"10.1109\/ICCV.2017.560"},{"key":"e_1_3_2_2_16_1","first-page":"85","article-title":"An End-to-End OCR Text Re-organization Sequence Learning for Rich-Text Detail Image Comprehension","volume":"12370","author":"Li Liangcheng","year":"2020","unstructured":"Liangcheng Li , Feiyu Gao , Jiajun Bu , Yongpan Wang , Zhi Yu , and Qi Zheng . 2020 . An End-to-End OCR Text Re-organization Sequence Learning for Rich-Text Detail Image Comprehension . In ECCV , Vol. 12370. 85 -- 100 . Liangcheng Li, Feiyu Gao, Jiajun Bu, Yongpan Wang, Zhi Yu, and Qi Zheng. 2020. An End-to-End OCR Text Re-organization Sequence Learning for Rich-Text Detail Image Comprehension. In ECCV, Vol. 12370. 85--100.","journal-title":"ECCV"},{"key":"e_1_3_2_2_17_1","volume-title":"IEEE TPAMI","volume":"1","author":"Liao Minghui","year":"2019","unstructured":"Minghui Liao , Pengyuan Lyu , Minghang He , Cong Yao , Wenhao Wu , and Xiang Bai . 2019 . Mask textspotter: An end-to-end trainable neural network for spotting text with arbitrary shapes . IEEE TPAMI , Vol. 1 , 1 (2019). Minghui Liao, Pengyuan Lyu, Minghang He, Cong Yao, Wenhao Wu, and Xiang Bai. 2019. Mask textspotter: An end-to-end trainable neural network for spotting text with arbitrary shapes. IEEE TPAMI, Vol. 1, 1 (2019)."},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"crossref","unstructured":"Minghui Liao Zhaoyi Wan Cong Yao Kai Chen and Xiang Bai. 2020. Real-Time Scene Text Detection with Differentiable Binarization. In AAAI. 11474--11481.  Minghui Liao Zhaoyi Wan Cong Yao Kai Chen and Xiang Bai. 2020. Real-Time Scene Text Detection with Differentiable Binarization. In AAAI. 11474--11481.","DOI":"10.1609\/aaai.v34i07.6812"},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"crossref","unstructured":"Minesh Mathew Dimosthenis Karatzas and C. V. Jawahar. 2021. DocVQA: A Dataset for VQA on Document Images. In WACV. 2199--2208.  Minesh Mathew Dimosthenis Karatzas and C. V. Jawahar. 2021. DocVQA: A Dataset for VQA on Document Images. In WACV. 2199--2208.","DOI":"10.1109\/WACV48630.2021.00225"},{"key":"e_1_3_2_2_20_1","volume-title":"MANGO: A Mask Attention Guided One-Stage Scene Text Spotter. In AAAI. 2467--2476.","author":"Qiao Liang","year":"2021","unstructured":"Liang Qiao , Ying Chen , Zhanzhan Cheng , Yunlu Xu , Yi Niu , Shiliang Pu , and Fei Wu . 2021 a. MANGO: A Mask Attention Guided One-Stage Scene Text Spotter. In AAAI. 2467--2476. Liang Qiao, Ying Chen, Zhanzhan Cheng, Yunlu Xu, Yi Niu, Shiliang Pu, and Fei Wu. 2021a. MANGO: A Mask Attention Guided One-Stage Scene Text Spotter. In AAAI. 2467--2476."},{"key":"e_1_3_2_2_21_1","first-page":"99","article-title":"LGPMA: Complicated Table Structure Recognition with Local and Global Pyramid Mask Alignment","volume":"12821","author":"Qiao Liang","year":"2021","unstructured":"Liang Qiao , Zaisheng Li , Zhanzhan Cheng , Peng Zhang , Shiliang Pu , Yi Niu , Wenqi Ren , Wenming Tan , and Fei Wu . 2021 b. LGPMA: Complicated Table Structure Recognition with Local and Global Pyramid Mask Alignment . In ICDAR , Vol. 12821. 99 -- 114 . Liang Qiao, Zaisheng Li, Zhanzhan Cheng, Peng Zhang, Shiliang Pu, Yi Niu, Wenqi Ren, Wenming Tan, and Fei Wu. 2021b. LGPMA: Complicated Table Structure Recognition with Local and Global Pyramid Mask Alignment. In ICDAR, Vol. 12821. 99--114.","journal-title":"ICDAR"},{"key":"e_1_3_2_2_22_1","volume-title":"Text Perceptron: Towards End-to-End Arbitrary-Shaped Text Spotting. In AAAI. 11899--11907.","author":"Qiao Liang","year":"2020","unstructured":"Liang Qiao , Sanli Tang , Zhanzhan Cheng , Yunlu Xu , Yi Niu , Shiliang Pu , and Fei Wu . 2020 . Text Perceptron: Towards End-to-End Arbitrary-Shaped Text Spotting. In AAAI. 11899--11907. Liang Qiao, Sanli Tang, Zhanzhan Cheng, Yunlu Xu, Yi Niu, Shiliang Pu, and Fei Wu. 2020. Text Perceptron: Towards End-to-End Arbitrary-Shaped Text Spotting. In AAAI. 11899--11907."},{"key":"e_1_3_2_2_23_1","volume-title":"Faster, Stronger","author":"Redmon Joseph","unstructured":"Joseph Redmon and Ali Farhadi . 2017. YOLO9000 : Better , Faster, Stronger . In CVPR. IEEE Computer Society , 6517--6525. Joseph Redmon and Ali Farhadi. 2017. YOLO9000: Better, Faster, Stronger. In CVPR. IEEE Computer Society, 6517--6525."},{"key":"e_1_3_2_2_24_1","volume-title":"Tjong Kim Sang and Fien De Meulder","author":"Erik","year":"2003","unstructured":"Erik F. Tjong Kim Sang and Fien De Meulder . 2003 . Introduction to the CoNLL-2003 Shared Task : Language-Independent Named Entity Recognition. In CoNLL\/HLT-NAACL. 142--147. Erik F. Tjong Kim Sang and Fien De Meulder. 2003. Introduction to the CoNLL-2003 Shared Task: Language-Independent Named Entity Recognition. In CoNLL\/HLT-NAACL. 142--147."},{"key":"e_1_3_2_2_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2646371"},{"key":"e_1_3_2_2_26_1","unstructured":"Baoguang Shi Xinggang Wang Pengyuan Lyu Cong Yao and Xiang Bai. 2016. Robust Scene Text Recognition with Automatic Rectification. In CVPR. 4168--4176.  Baoguang Shi Xinggang Wang Pengyuan Lyu Cong Yao and Xiang Bai. 2016. Robust Scene Text Recognition with Automatic Rectification. In CVPR. 4168--4176."},{"key":"e_1_3_2_2_27_1","volume-title":"Spatial Dual-Modality Graph Reasoning for Key Information Extraction. CoRR","author":"Sun Hongbin","year":"2021","unstructured":"Hongbin Sun , Zhanghui Kuang , Xiaoyu Yue , Chenhao Lin , and Wayne Zhang . 2021. Spatial Dual-Modality Graph Reasoning for Key Information Extraction. CoRR , Vol. abs\/ 2103 .14470 ( 2021 ). Hongbin Sun, Zhanghui Kuang, Xiaoyu Yue, Chenhao Lin, and Wayne Zhang. 2021. Spatial Dual-Modality Graph Reasoning for Key Information Extraction. CoRR, Vol. abs\/2103.14470 (2021)."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"crossref","unstructured":"Pengfei Wang Chengquan Zhang Fei Qi Shanshan Liu Xiaoqiang Zhang Pengyuan Lyu Junyu Han Jingtuo Liu Errui Ding and Guangming Shi. 2021b. PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network. In AAAI. 2782--2790.  Pengfei Wang Chengquan Zhang Fei Qi Shanshan Liu Xiaoqiang Zhang Pengyuan Lyu Junyu Han Jingtuo Liu Errui Ding and Guangming Shi. 2021b. PGNet: Real-time Arbitrarily-Shaped Text Spotting with Point Gathering Network. In AAAI. 2782--2790.","DOI":"10.1609\/aaai.v35i4.16383"},{"key":"e_1_3_2_2_29_1","volume-title":"Structure-aware Pre-training for Table Understanding with Tree-based Transformers. CoRR","author":"Wang Zhiruo","year":"2020","unstructured":"Zhiruo Wang , Haoyu Dong , Ran Jia , Jia Li , Zhiyi Fu , Shi Han , and Dongmei Zhang . 2020. Structure-aware Pre-training for Table Understanding with Tree-based Transformers. CoRR , Vol. abs\/ 2010 .12537 ( 2020 ). Zhiruo Wang, Haoyu Dong, Ran Jia, Jia Li, Zhiyi Fu, Shi Han, and Dongmei Zhang. 2020. Structure-aware Pre-training for Table Understanding with Tree-based Transformers. CoRR, Vol. abs\/2010.12537 (2020)."},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"crossref","unstructured":"Zilong Wang Yiheng Xu Lei Cui Jingbo Shang and Furu Wei. 2021a. LayoutReader: Pre-training of Text and Layout for Reading Order Detection. In EMNLP. 4735--4744.  Zilong Wang Yiheng Xu Lei Cui Jingbo Shang and Furu Wei. 2021a. LayoutReader: Pre-training of Text and Layout for Reading Order Detection. In EMNLP. 4735--4744.","DOI":"10.18653\/v1\/2021.emnlp-main.389"},{"key":"e_1_3_2_2_31_1","unstructured":"Hang Yan Tao Gui Junqi Dai Qipeng Guo Zheng Zhang and Xipeng Qiu. 2021. A Unified Generative Framework for Various NER Subtasks. In ACL. 5808--5822.  Hang Yan Tao Gui Junqi Dai Qipeng Guo Zheng Zhang and Xipeng Qiu. 2021. A Unified Generative Framework for Various NER Subtasks. In ACL. 5808--5822."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"crossref","unstructured":"Xiao Yang Ersin Yumer Paul Asente Mike Kraley Daniel Kifer and C. Lee Giles. 2017. Learning to Extract Semantic Structure from Documents Using Multimodal Fully Convolutional Neural Networks. In CVPR. 4342--4351.  Xiao Yang Ersin Yumer Paul Asente Mike Kraley Daniel Kifer and C. Lee Giles. 2017. Learning to Extract Semantic Structure from Documents Using Multimodal Fully Convolutional Neural Networks. In CVPR. 4342--4351.","DOI":"10.1109\/CVPR.2017.462"},{"key":"e_1_3_2_2_33_1","volume-title":"SPIN: Structure-Preserving Inner Offset Network for Scene Text Recognition","author":"Zhang Chengwei","year":"2021","unstructured":"Chengwei Zhang , Yunlu Xu , Zhanzhan Cheng , Shiliang Pu , Yi Niu , Fei Wu , and Futai Zou . 2021 b. SPIN: Structure-Preserving Inner Offset Network for Scene Text Recognition . In AAAI. AAAI Press , 3305--3314. Chengwei Zhang, Yunlu Xu, Zhanzhan Cheng, Shiliang Pu, Yi Niu, Fei Wu, and Futai Zou. 2021b. SPIN: Structure-Preserving Inner Offset Network for Scene Text Recognition. In AAAI. AAAI Press, 3305--3314."},{"key":"e_1_3_2_2_34_1","first-page":"115","article-title":"VSR: A Unified Framework for Document Layout Analysis Combining Vision, Semantics and Relations","volume":"12821","author":"Zhang Peng","year":"2021","unstructured":"Peng Zhang , Can Li , Liang Qiao , Zhanzhan Cheng , Shiliang Pu , Yi Niu , and Fei Wu . 2021 a. VSR: A Unified Framework for Document Layout Analysis Combining Vision, Semantics and Relations . In ICDAR , Vol. 12821. 115 -- 130 . Peng Zhang, Can Li, Liang Qiao, Zhanzhan Cheng, Shiliang Pu, Yi Niu, and Fei Wu. 2021a. VSR: A Unified Framework for Document Layout Analysis Combining Vision, Semantics and Relations. In ICDAR, Vol. 12821. 115--130.","journal-title":"ICDAR"},{"key":"e_1_3_2_2_35_1","volume-title":"TRIE: End-to-End Text Reading and Information Extraction for Document Understanding. In ACM MM. ACM, 1413--1422.","author":"Zhang Peng","year":"2020","unstructured":"Peng Zhang , Yunlu Xu , Zhanzhan Cheng , Shiliang Pu , Jing Lu , Liang Qiao , Yi Niu , and Fei Wu . 2020 . TRIE: End-to-End Text Reading and Information Extraction for Document Understanding. In ACM MM. ACM, 1413--1422. Peng Zhang, Yunlu Xu, Zhanzhan Cheng, Shiliang Pu, Jing Lu, Liang Qiao, Yi Niu, and Fei Wu. 2020. TRIE: End-to-End Text Reading and Information Extraction for Document Understanding. In ACM MM. ACM, 1413--1422."},{"key":"e_1_3_2_2_36_1","volume-title":"PubLayNet: Largest Dataset Ever for Document Layout Analysis","author":"Zhong Xu","unstructured":"Xu Zhong , Jianbin Tang , and Antonio Jimeno-Yepes . 2019. PubLayNet: Largest Dataset Ever for Document Layout Analysis . In ICDAR. IEEE , 1015--1022. Xu Zhong, Jianbin Tang, and Antonio Jimeno-Yepes. 2019. PubLayNet: Largest Dataset Ever for Document Layout Analysis. In ICDAR. IEEE, 1015--1022."},{"key":"e_1_3_2_2_37_1","volume-title":"EAST: An Efficient and Accurate Scene Text Detector. In CVPR. 2642--2651.","author":"Zhou Xinyu","year":"2017","unstructured":"Xinyu Zhou , Cong Yao , He Wen , Yuzhi Wang , Shuchang Zhou , Weiran He , and Jiajun Liang . 2017 . EAST: An Efficient and Accurate Scene Text Detector. In CVPR. 2642--2651. Xinyu Zhou, Cong Yao, He Wen, Yuzhi Wang, Shuchang Zhou, Weiran He, and Jiajun Liang. 2017. EAST: An Efficient and Accurate Scene Text Detector. In CVPR. 2642--2651."}],"event":{"name":"MM '22: The 30th ACM International Conference on Multimedia","location":"Lisboa Portugal","acronym":"MM '22","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 30th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548547","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3503161.3548547","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T17:49:17Z","timestamp":1750182557000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3548547"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,10]]},"references-count":37,"alternative-id":["10.1145\/3503161.3548547","10.1145\/3503161"],"URL":"https:\/\/doi.org\/10.1145\/3503161.3548547","relation":{},"subject":[],"published":{"date-parts":[[2022,10,10]]},"assertion":[{"value":"2022-10-10","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}