{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,20]],"date-time":"2026-01-20T04:30:59Z","timestamp":1768883459433,"version":"3.49.0"},"reference-count":84,"publisher":"Springer Science and Business Media LLC","license":[{"start":{"date-parts":[[2024,7,29]],"date-time":"2024-07-29T00:00:00Z","timestamp":1722211200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,7,29]],"date-time":"2024-07-29T00:00:00Z","timestamp":1722211200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["IJDAR"],"DOI":"10.1007\/s10032-024-00493-8","type":"journal-article","created":{"date-parts":[[2024,7,29]],"date-time":"2024-07-29T12:57:37Z","timestamp":1722257857000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":4,"title":["Deep learning approaches for information extraction from visually rich documents: datasets, challenges and methods"],"prefix":"10.1007","author":[{"given":"Hamza","family":"Gbada","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Karim","family":"Kalti","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mohamed Ali","family":"Mahjoub","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2024,7,29]]},"reference":[{"key":"493_CR1","unstructured":"Park, S., Shin, S., Lee, B., Lee, J., Surh, J., Seo, M., Lee, H.: CORD: a consolidated receipt dataset for post-OCR parsing. In: Workshop on Document Intelligence at NeurIPS 2019 (2019)"},{"key":"493_CR2","doi-asserted-by":"crossref","unstructured":"Jaume, G., Ekenel, H.K., Thiran, J.-P.: FUNSD: a dataset for form understanding in noisy scanned documents. In: 2019 International Conference on Document Analysis and Recognition Workshops (ICDARW), vol. 2, pp. 1\u20136. IEEE (2019)","DOI":"10.1109\/ICDARW.2019.10029"},{"key":"493_CR3","doi-asserted-by":"crossref","unstructured":"Huang, Z., Chen, K., He, J., Bai, X., Karatzas, D., Lu, S., Jawahar, C.: Icdar2019 competition on scanned receipt OCR and information extraction. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 1516\u20131520. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00244"},{"key":"493_CR4","unstructured":"Sun, H., Kuang, Z., Yue, X., Lin, C., Zhang, W.: Spatial dual-modality graph reasoning for key information extraction. arXiv preprint arXiv:2103.14470 (2021)"},{"key":"493_CR5","doi-asserted-by":"publisher","unstructured":"Li, M., Xu, Y., Cui, L., Huang, S., Wei, F., Li, Z., Zhou, M.: DocBank: a benchmark dataset for document layout analysis. In: Proceedings of the 28th International Conference on Computational Linguistics, pp. 949\u2013960. International Committee on Computational Linguistics, Barcelona (Online) (2020). https:\/\/doi.org\/10.18653\/v1\/2020.coling-main.82. https:\/\/aclanthology.org\/2020.coling-main.82","DOI":"10.18653\/v1\/2020.coling-main.82"},{"key":"493_CR6","doi-asserted-by":"crossref","unstructured":"Zhong, X., Tang, J., Yepes, A.J.: PubLayNet: largest dataset ever for document layout analysis. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 1015\u20131022. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00166"},{"key":"493_CR7","doi-asserted-by":"publisher","unstructured":"Devlin, J., Chang, M.-W., Lee, K., Toutanova, K.: BERT: Pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), pp. 4171\u20134186. Association for Computational Linguistics, Minneapolis, Minnesota (2019). https:\/\/doi.org\/10.18653\/v1\/N19-1423. https:\/\/aclanthology.org\/N19-1423","DOI":"10.18653\/v1\/N19-1423"},{"key":"493_CR8","doi-asserted-by":"publisher","unstructured":"Liu, X., Gao, F., Zhang, Q., Zhao, H.: Graph convolution for multimodal information extraction from visually rich documents, pp. 32\u201339 (2019). https:\/\/doi.org\/10.18653\/v1\/N19-2005","DOI":"10.18653\/v1\/N19-2005"},{"key":"493_CR9","doi-asserted-by":"crossref","unstructured":"Appalaraju, S., Jasani, B., Kota, B.U., Xie, Y., Manmatha, R.: DocFormer: end-to-end transformer for document understanding. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 993\u20131003 (2021)","DOI":"10.1109\/ICCV48922.2021.00103"},{"key":"493_CR10","unstructured":"Subramani, N., Matton, A., Greaves, M., Lam, A.: A survey of deep learning approaches for OCR and document understanding. arxiv 2020. arXiv preprint arXiv:2011.13534"},{"issue":"19","key":"493_CR11","doi-asserted-by":"publisher","first-page":"9691","DOI":"10.3390\/app12199691","volume":"12","author":"Y Yang","year":"2022","unstructured":"Yang, Y., Wu, Z., Yang, Y., Lian, S., Guo, F., Wang, Z.: A survey of information extraction based on deep learning. Appl. Sci. 12(19), 9691 (2022)","journal-title":"Appl. Sci."},{"key":"493_CR12","unstructured":"Antonio, J., Putra, A.R., Abdurrohman, H., Tsalasa, M.S.: A survey on scanned receipts ocr and information extraction. In: Proceedings of the International Conference on Document Analysis and Recognit, Jerusalem, Israel, pp. 29\u201330 (2022)"},{"key":"493_CR13","doi-asserted-by":"crossref","unstructured":"Skalick\u1ef3, M., \u0160imsa, \u0160., U\u0159i\u010d\u00e1\u0159, M., \u0160ulc, M.: Business document information extraction: towards practical benchmarks. In: International Conference of the Cross-Language Evaluation Forum for European Languages, pp. 105\u2013117. Springer (2022)","DOI":"10.1007\/978-3-031-13643-6_8"},{"key":"493_CR14","doi-asserted-by":"crossref","unstructured":"NIGAM, S., Verma, S., Nagabhushan, P.: Document analysis and recognition: a survey. Authorea Preprints (2023)","DOI":"10.36227\/techrxiv.22336435.v1"},{"issue":"6","key":"493_CR15","doi-asserted-by":"publisher","first-page":"102361","DOI":"10.1016\/j.ipm.2020.102361","volume":"57","author":"B Oral","year":"2020","unstructured":"Oral, B., Emekligil, E., Arslan, S., Eryi\u01e7it, G.: Information extraction from text intensive and visually rich banking documents. Inf. Process. Manag. 57(6), 102361 (2020)","journal-title":"Inf. Process. Manag."},{"key":"493_CR16","doi-asserted-by":"crossref","unstructured":"Xu, Y., Lv, T., Cui, L., Wang, G., Lu, Y., Florencio, D., Zhang, C., Wei, F.: XFUND: a benchmark dataset for multilingual visually rich form understanding. In: Findings of the Association for Computational Linguistics: ACL 2022, pp. 3214\u20133224 (2022)","DOI":"10.18653\/v1\/2022.findings-acl.253"},{"key":"493_CR17","doi-asserted-by":"crossref","unstructured":"Harley, A.W., Ufkes, A., Derpanis, K.G.: Evaluation of deep convolutional nets for document image classification and retrieval. In: 2015 13th International Conference on Document Analysis and Recognition (ICDAR), pp. 991\u2013995. IEEE (2015)","DOI":"10.1109\/ICDAR.2015.7333910"},{"key":"493_CR18","doi-asserted-by":"crossref","unstructured":"\u0160imsa, \u0160., \u0160ulc, M., U\u0159i\u010d\u00e1\u0159, M., Patel, Y., Hamdi, A., Koci\u00e1n, M., Skalick\u1ef3, M., Matas, J., Doucet, A., Coustaty, M., et al.: Docile benchmark for document information localization and extraction. arXiv preprint arXiv:2302.05658 (2023)","DOI":"10.1007\/978-3-031-41679-8_9"},{"key":"493_CR19","unstructured":"Liu, Y., Ott, M., Goyal, N., Du, J., Joshi, M., Chen, D., Levy, O., Lewis, M., Zettlemoyer, L., Stoyanov, V.: Roberta: a robustly optimized BERT pretraining approach. CoRR arXiv:1907.11692 (2019)"},{"issue":"7","key":"493_CR20","doi-asserted-by":"publisher","first-page":"78","DOI":"10.3390\/data6070078","volume":"6","author":"D Baviskar","year":"2021","unstructured":"Baviskar, D., Ahirrao, S., Kotecha, K.: Multi-layout invoice document dataset (MIDD): a dataset for named entity recognition. Data 6(7), 78 (2021)","journal-title":"Data"},{"key":"493_CR21","doi-asserted-by":"crossref","unstructured":"Stanis\u0142awek, T., Grali\u0144ski, F., Wr\u00f3blewska, A., Lipi\u0144ski, D., Kaliska, A., Rosalska, P., Topolski, B., Biecek, P.: Kleister: key information extraction datasets involving long documents with complex layouts. In: International Conference on Document Analysis and Recognition, pp. 564\u2013579. Springer (2021)","DOI":"10.1007\/978-3-030-86549-8_36"},{"key":"493_CR22","doi-asserted-by":"publisher","first-page":"381","DOI":"10.1073\/pnas.98.2.381","volume":"98","author":"RJ Roberts","year":"2001","unstructured":"Roberts, R.J.: PubMed Central: the GenBank of the published literature. Proc Natl Acad Sci 98, 381\u2013382 (2001)","journal-title":"Proc Natl Acad Sci"},{"key":"493_CR23","doi-asserted-by":"crossref","unstructured":"Desai, H., Kayal, P., Singh, M.: Tablex: a benchmark dataset for structure and content information extraction from scientific tables. In: Document Analysis and Recognition\u2013ICDAR 2021: 16th International Conference, Lausanne, Switzerland, September 5\u201310, 2021, Proceedings, Part II 16, pp. 554\u2013569. Springer (2021)","DOI":"10.1007\/978-3-030-86331-9_36"},{"key":"493_CR24","doi-asserted-by":"crossref","unstructured":"Guo, H., Qin, X., Liu, J., Han, J., Liu, J., Ding, E.: Eaten: entity-aware attention for single shot visual text extraction. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 254\u2013259. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00049"},{"key":"493_CR25","doi-asserted-by":"crossref","unstructured":"Mathew, M., Karatzas, D., Jawahar, C.: DocVQA: a dataset for VQA on document images. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 2200\u20132209 (2021)","DOI":"10.1109\/WACV48630.2021.00225"},{"key":"493_CR26","doi-asserted-by":"publisher","first-page":"119","DOI":"10.1016\/j.patrec.2013.10.030","volume":"43","author":"J Kumar","year":"2014","unstructured":"Kumar, J., Ye, P., Doermann, D.: Structural similarity for document image classification and retrieval. Pattern Recognit. Lett. 43, 119\u2013126 (2014). https:\/\/doi.org\/10.1016\/j.patrec.2013.10.030","journal-title":"Pattern Recognit. Lett."},{"key":"493_CR27","unstructured":"Dimmick, D., Garris, M., Wilson, C.: NIST structured forms reference set of binary images (SFRS). NIST Special Database 2 (1991)"},{"key":"493_CR28","doi-asserted-by":"crossref","unstructured":"Lewis, D., Agam, G., Argamon, S., Frieder, O., Grossman, D., Heard, J.: Building a test collection for complex document information processing. In: Proceedings of the 29th Annual International ACM SIGIR Conference on Research and Development in Information Retrieval, pp. 665\u2013666 (2006)","DOI":"10.1145\/1148170.1148307"},{"key":"493_CR29","doi-asserted-by":"crossref","unstructured":"Van\u00a0Strien, D., Beelen, K., Ardanuy, M.C., Hosseini, K., McGillivray, B., Colavizza, G.: Assessing the impact of OCR quality on downstream NLP tasks (2020)","DOI":"10.5220\/0009169004840496"},{"key":"493_CR30","doi-asserted-by":"crossref","unstructured":"Bazzo, G.T., Lorentz, G.A., Suarez\u00a0Vargas, D., Moreira, V.P.: Assessing the impact of OCR errors in information retrieval. In: Advances in Information Retrieval: 42nd European Conference on IR Research, ECIR 2020, Lisbon, Portugal, April 14\u201317, 2020, Proceedings, Part II 42, pp. 102\u2013109. Springer (2020)","DOI":"10.1007\/978-3-030-45442-5_13"},{"issue":"1","key":"493_CR31","doi-asserted-by":"publisher","first-page":"45","DOI":"10.1007\/s00799-023-00345-6","volume":"24","author":"LL de Oliveira","year":"2023","unstructured":"de Oliveira, L.L., Vargas, D.S., Alexandre, A.M.A., Cordeiro, F.C., Gomes, D.S.M., Rodrigues, M.C., Romeu, R.K., Moreira, V.P.: Evaluating and mitigating the impact of OCR errors on information retrieval. Int. J. Digit. Libr. 24(1), 45\u201362 (2023)","journal-title":"Int. J. Digit. Libr."},{"key":"493_CR32","doi-asserted-by":"crossref","unstructured":"Taghva, K., Beckley, R., Coombs, J.: The effects of OCR error on the extraction of private information. In: Document Analysis Systems VII: 7th International Workshop, DAS 2006, Nelson, New Zealand, February 13\u201315, 2006. Proceedings 7, pp. 348\u2013357. Springer (2006)","DOI":"10.1007\/11669487_31"},{"key":"493_CR33","doi-asserted-by":"crossref","unstructured":"Lopresti, D.: Optical character recognition errors and their effects on natural language processing. In: Proceedings of the Second Workshop on Analytics for Noisy Unstructured Text Data, pp. 9\u201316 (2008)","DOI":"10.1145\/1390749.1390753"},{"key":"493_CR34","doi-asserted-by":"crossref","unstructured":"Garncarek, \u0141., Powalski, R., Stanis\u0142awek, T., Topolski, B., Halama, P., Turski, M., Grali\u0144ski, F.: Lambert: layout-aware language modeling for information extraction. In: International Conference on Document Analysis and Recognition (ICDAR), pp. 532\u2013547. Springer (2021)","DOI":"10.1007\/978-3-030-86549-8_34"},{"key":"493_CR35","doi-asserted-by":"crossref","unstructured":"Majumder, B.P., Potti, N., Tata, S., Wendt, J.B., Zhao, Q., Najork, M.: Representation learning for information extraction from form-like documents. In: Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pp. 6495\u20136504 (2020)","DOI":"10.18653\/v1\/2020.acl-main.580"},{"key":"493_CR36","doi-asserted-by":"crossref","unstructured":"Zhang, P., Xu, Y., Cheng, Z., Pu, S., Lu, J., Qiao, L., Niu, Y., Wu, F.: TRIE: end-to-end text reading and information extraction for document understanding. In: Proceedings of the 28th ACM International Conference on Multimedia, pp. 1413\u20131422 (2020)","DOI":"10.1145\/3394171.3413900"},{"key":"493_CR37","doi-asserted-by":"publisher","unstructured":"Xu, Y., Xu, Y., Lv, T., Cui, L., Wei, F., Wang, G., Lu, Y., Florencio, D., Zhang, C., Che, W., Zhang, M., Zhou, L.: LayoutLMv2: multi-modal pre-training for visually-rich document understanding. In: Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 2579\u20132591. Association for Computational Linguistics, Online (2021). https:\/\/doi.org\/10.18653\/v1\/2021.acl-long.201. https:\/\/aclanthology.org\/2021.acl-long.201","DOI":"10.18653\/v1\/2021.acl-long.201"},{"key":"493_CR38","doi-asserted-by":"crossref","unstructured":"Yu, W., Lu, N., Qi, X., Gong, P., Xiao, R.: Pick: processing key information extraction from documents using improved graph learning-convolutional networks. In: 2020 25th International Conference on Pattern Recognition (ICPR), pp. 4363\u20134370. IEEE (2021)","DOI":"10.1109\/ICPR48806.2021.9412927"},{"key":"493_CR39","doi-asserted-by":"crossref","unstructured":"Krieger, F., Drews, P., Funk, B., Wobbe, T.: Information extraction from invoices: a graph neural network approach for datasets with high layout variety. In: International Conference on Wirtschaftsinformatik, pp. 5\u201320. Springer (2021)","DOI":"10.1007\/978-3-030-86797-3_1"},{"key":"493_CR40","doi-asserted-by":"crossref","unstructured":"Wang, J., Krumdick, M., Tong, B., Halim, H., Sokolov, M., Barda, V., Vendryes, D., Tanner, C.: A graphical approach to document layout analysis. In: International Conference on Document Analysis and Recognition, pp. 53\u201369. Springer (2023)","DOI":"10.1007\/978-3-031-41734-4_4"},{"key":"493_CR41","doi-asserted-by":"crossref","unstructured":"Deng, J., Zhang, Y., Zhang, X., Tang, Z., Gao, L.: An iterative graph learning convolution network for key information extraction based on the document inductive bias. In: International Conference on Document Analysis and Recognition, pp. 84\u201397. Springer (2023)","DOI":"10.1007\/978-3-031-41682-8_6"},{"key":"493_CR42","doi-asserted-by":"crossref","unstructured":"Lee, C.-Y., Li, C.-L., Dozat, T., Perot, V., Su, G., Hua, N., Ainslie, J., Wang, R., Fujii, Y., Pfister, T.: FormNet: structural encoding beyond sequential modeling in form document information extraction. arXiv preprint arXiv:2203.08411 (2022)","DOI":"10.18653\/v1\/2022.acl-long.260"},{"key":"493_CR43","doi-asserted-by":"crossref","unstructured":"Xu, Y., Li, M., Cui, L., Huang, S., Wei, F., Zhou, M.: LayoutLM: pre-training of text and layout for document image understanding. In: Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp. 1192\u20131200 (2020)","DOI":"10.1145\/3394486.3403172"},{"key":"493_CR44","unstructured":"Patel, S., Bhatt, D.: Abstractive information extraction from scanned invoices (AIESI) using end-to-end sequential approach. arXiv preprint arXiv:2009.05728 (2020)"},{"key":"493_CR45","doi-asserted-by":"publisher","unstructured":"Katti, A.R., Reisswig, C., Guder, C., Brarda, S., Bickel, S., H\u00f6hne, J., Faddoul, J.B.: Chargrid: towards understanding 2D documents. In: Proceedings of the 2018 Conference on Empirical Methods in Natural Language Processing, pp. 4459\u20134469. Association for Computational Linguistics, Brussels, Belgium (2018). https:\/\/doi.org\/10.18653\/v1\/D18-1476. https:\/\/aclanthology.org\/D18-1476","DOI":"10.18653\/v1\/D18-1476"},{"key":"493_CR46","unstructured":"Zhao, X., Niu, E., Wu, Z., Wang, X.: CUTIE: learning to understand documents with convolutional universal text information extractor. arXiv preprint arXiv:1903.12363 (2019)"},{"key":"493_CR47","doi-asserted-by":"crossref","unstructured":"Lin, W., Gao, Q., Sun, L., Zhong, Z., Hu, K., Ren, Q., Huo, Q.: ViBERTgrid: a jointly trained multi-modal 2D document representation for key information extraction from documents. In: Document Analysis and Recognition\u2013ICDAR 2021: 16th International Conference, Lausanne, Switzerland, September 5\u201310, 2021, Proceedings, Part I 16, pp. 548\u2013563. Springer (2021)","DOI":"10.1007\/978-3-030-86549-8_35"},{"key":"493_CR48","doi-asserted-by":"publisher","first-page":"109419","DOI":"10.1016\/j.patcog.2023.109419","volume":"139","author":"S Bakkali","year":"2023","unstructured":"Bakkali, S., Ming, Z., Coustaty, M., Rusi\u00f1ol, M., Terrades, O.R.: VLCDoC: vision-language contrastive pre-training model for cross-modal document classification. Pattern Recognit. 139, 109419 (2023)","journal-title":"Pattern Recognit."},{"key":"493_CR49","unstructured":"Gu, J., Kuen, J., Morariu, V.I., Zhao, H., Barmpalios, N., Jain, R., Nenkova, A., Sun, T.: Unified Pretraining Framework for Document Understanding (2022)"},{"key":"493_CR50","doi-asserted-by":"crossref","unstructured":"Powalski, R., Borchmann, \u0141., Jurkiewicz, D., Dwojak, T., Pietruszka, M., Pa\u0142ka, G.: Going full-tilt boogie on document understanding with text-image-layout transformer. In: International Conference on Document Analysis and Recognition (ICDAR), pp. 732\u2013747. Springer (2021)","DOI":"10.1007\/978-3-030-86331-9_47"},{"key":"493_CR51","doi-asserted-by":"crossref","unstructured":"Hong, T., Kim, D., Ji, M., Hwang, W., Nam, D., Park, S.: Bros: a pre-trained language model focusing on text and layout for better key information extraction from documents. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 36, pp. 10767\u201310775 (2022)","DOI":"10.1609\/aaai.v36i10.21322"},{"key":"493_CR52","doi-asserted-by":"publisher","unstructured":"Qian, Y., Santus, E., Jin, Z., Guo, J., Barzilay, R.: GraphIE: a graph-based framework for information extraction. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), pp. 751\u2013761. Association for Computational Linguistics, Minneapolis, Minnesota (2019). https:\/\/doi.org\/10.18653\/v1\/N19-1082. https:\/\/aclanthology.org\/N19-1082","DOI":"10.18653\/v1\/N19-1082"},{"key":"493_CR53","doi-asserted-by":"publisher","unstructured":"Hwang, W., Yim, J., Park, S., Yang, S., Seo, M.: Spatial dependency parsing for semi-structured document information extraction. In: Findings of the Association for Computational Linguistics: ACL-IJCNLP 2021, pp. 330\u2013343. Association for Computational Linguistics, Online (2021). https:\/\/doi.org\/10.18653\/v1\/2021.findings-acl.28. https:\/\/aclanthology.org\/2021.findings-acl.28","DOI":"10.18653\/v1\/2021.findings-acl.28"},{"key":"493_CR54","doi-asserted-by":"crossref","unstructured":"Lohani, D., Bela\u00efd, A., Bela\u00efd, Y.: An invoice reading system using a graph convolutional network. In: Asian Conference on Computer Vision, pp. 144\u2013158. Springer (2018)","DOI":"10.1007\/978-3-030-21074-8_12"},{"key":"493_CR55","doi-asserted-by":"crossref","unstructured":"Shi, D., Liu, S., Du, J., Zhu, H.: LAYOUTGCN: a lightweight architecture for visually rich document understanding. In: International Conference on Document Analysis and Recognition, pp. 149\u2013165. Springer (2023)","DOI":"10.1007\/978-3-031-41682-8_10"},{"key":"493_CR56","doi-asserted-by":"crossref","unstructured":"Belhadj, D., Bela\u00efd, Y., Bela\u00efd, A.: Consideration of the word\u2019s neighborhood in gats for information extraction in semi-structured documents. In: International Conference on Document Analysis and Recognition (ICDAR), pp. 854\u2013869 (2021). Springer","DOI":"10.1007\/978-3-030-86331-9_55"},{"key":"493_CR57","doi-asserted-by":"crossref","unstructured":"Belhadj, D., Bela\u00efd, A., Bela\u00efd, Y.: Improving information extraction from semi-structured documents using attention based semi-variational graph auto-encoder. In: International Conference on Document Analysis and Recognition, pp. 113\u2013129. Springer (2023)","DOI":"10.1007\/978-3-031-41679-8_7"},{"key":"493_CR58","doi-asserted-by":"publisher","first-page":"96","DOI":"10.1007\/978-3-031-06555-2_7","volume-title":"Document Analysis Systems","author":"G Nagendar","year":"2022","unstructured":"Nagendar, G., Sitaram, R.: Contrastive graph learning with graph convolutional networks. In: Uchida, S., Barney, E., Eglin, V. (eds.) Document Analysis Systems, pp. 96\u2013110. Springer, Cham (2022)"},{"key":"493_CR59","doi-asserted-by":"crossref","unstructured":"Chen, Y.-M., Hou, X.-T., Lou, D.-F., Liao, Z.-L., Liu, C.-L.: DAMGCN: entity linking in visually rich documents with dependency-aware multimodal graph convolutional network. In: International Conference on Document Analysis and Recognition, pp. 33\u201347. Springer (2023)","DOI":"10.1007\/978-3-031-41682-8_3"},{"key":"493_CR60","doi-asserted-by":"crossref","unstructured":"Lee, C.-Y., Li, C.-L., Wang, C., Wang, R., Fujii, Y., Qin, S., Popat, A., Pfister, T.: Rope: reading order equivariant positional encoding for graph-based document information extraction. arXiv preprint arXiv:2106.10786 (2021)","DOI":"10.18653\/v1\/2021.acl-short.41"},{"key":"493_CR61","doi-asserted-by":"publisher","first-page":"127223","DOI":"10.1016\/j.neucom.2023.127223","volume":"573","author":"H Gbada","year":"2024","unstructured":"Gbada, H., Kalti, K., Mahjoub, M.A.: Multimodal weighted graph representation for information extraction from visually rich documents. Neurocomputing 573, 127223 (2024). https:\/\/doi.org\/10.1016\/j.neucom.2023.127223","journal-title":"Neurocomputing"},{"issue":"2","key":"493_CR62","doi-asserted-by":"publisher","first-page":"425","DOI":"10.1017\/S1351324922000110","volume":"29","author":"A Hamdi","year":"2023","unstructured":"Hamdi, A., Pontes, E.L., Sidere, N., Coustaty, M., Doucet, A.: In-depth analysis of the impact of OCR errors on named entity recognition and linking. Nat. Lang. Eng. 29(2), 425\u2013448 (2023)","journal-title":"Nat. Lang. Eng."},{"key":"493_CR63","doi-asserted-by":"crossref","unstructured":"Hamdi, A., Jean-Caurant, A., Sid\u00e8re, N., Coustaty, M., Doucet, A.: Assessing and minimizing the impact of OCR quality on named entity recognition. In: Digital Libraries for Open Knowledge: 24th International Conference on Theory and Practice of Digital Libraries, TPDL 2020, Lyon, France, August 25\u201327, 2020, Proceedings 24, pp. 87\u2013101. Springer (2020)","DOI":"10.1007\/978-3-030-54956-5_7"},{"key":"493_CR64","doi-asserted-by":"crossref","unstructured":"Linhares\u00a0Pontes, E., Hamdi, A., Sidere, N., Doucet, A.: Impact of OCR quality on named entity linking. In: Digital Libraries at the Crossroads of Digital Information for the Future: 21st International Conference on Asia-Pacific Digital Libraries, ICADL 2019, Kuala Lumpur, Malaysia, November 4\u20137, 2019, Proceedings 21, pp. 102\u2013115. Springer (2019)","DOI":"10.1007\/978-3-030-34058-2_11"},{"key":"493_CR65","unstructured":"Welling, M., Kipf, T.N.: Semi-supervised classification with graph convolutional networks. In: J. International Conference on Learning Representations (ICLR 2017) (2016)"},{"key":"493_CR66","unstructured":"Veli\u010dkovi\u0107, P., Cucurull, G., Casanova, A., Romero, A., Li\u00f2, P., Bengio, Y.: Graph attention networks. In: International Conference on Learning Representations (2018). https:\/\/openreview.net\/forum?id=rJXMpikCZ"},{"issue":"3","key":"493_CR67","doi-asserted-by":"publisher","first-page":"149","DOI":"10.1007\/s10032-021-00375-3","volume":"24","author":"M Hole\u010dek","year":"2021","unstructured":"Hole\u010dek, M.: Learning from similarity and information extraction from structured documents. Int. J. Doc. Anal. Recognit. (IJDAR) 24(3), 149\u2013165 (2021)","journal-title":"Int. J. Doc. Anal. Recognit. (IJDAR)"},{"key":"493_CR68","unstructured":"Ultralytics: YOLOv5: SOTA Realtime Instance Segmentation. https:\/\/github.com\/ultralytics\/yolov5 (2022)"},{"key":"493_CR69","doi-asserted-by":"crossref","unstructured":"Zhong, Z., Wang, J., Sun, H., Hu, K., Zhang, E., Sun, L., Huo, Q.: A hybrid approach to document layout analysis for heterogeneous document images. In: International Conference on Document Analysis and Recognition, pp. 189\u2013206. Springer (2023)","DOI":"10.1007\/978-3-031-41734-4_12"},{"key":"493_CR70","doi-asserted-by":"publisher","unstructured":"Huang, Y., Lv, T., Cui, L., Lu, Y., Wei, F.: LayoutLMv3: pre-training for document AI with unified text and image masking. In: Proceedings of the 30th ACM International Conference on Multimedia. MM \u201922, pp. 4083\u20134091. Association for Computing Machinery, New York (2022). https:\/\/doi.org\/10.1145\/3503161.3548112","DOI":"10.1145\/3503161.3548112"},{"key":"493_CR71","doi-asserted-by":"crossref","unstructured":"Palm, R.B., Laws, F., Winther, O.: Attend, copy, parse end-to-end information extraction from documents. In: 2019 International Conference on Document Analysis and Recognition (ICDAR), pp. 329\u2013336. IEEE (2019)","DOI":"10.1109\/ICDAR.2019.00060"},{"key":"493_CR72","doi-asserted-by":"crossref","unstructured":"Gbada, H., Kalti, K., Mahjoub, M.A.: VisuaLIE: receipt-based information extraction with a novel visual and textual approach. In: 2023 International Conference on Cyberworlds (CW), pp. 165\u2013170. IEEE (2023)","DOI":"10.1109\/CW58918.2023.00032"},{"key":"493_CR73","doi-asserted-by":"crossref","unstructured":"Li, P., Gu, J., Kuen, J., Morariu, V.I., Zhao, H., Jain, R., Manjunatha, V., Liu, H.: SelfDoc: self-supervised document representation learning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 5652\u20135660 (2021)","DOI":"10.1109\/CVPR46437.2021.00560"},{"key":"493_CR74","unstructured":"Cheng, Z., Zhang, P., Li, C., Liang, Q., Xu, Y., Li, P., Pu, S., Niu, Y., Wu, F.: Trie++: towards end-to-end information extraction from visually rich documents. arXiv preprint arXiv:2207.06744 (2022)"},{"key":"493_CR75","doi-asserted-by":"crossref","unstructured":"Dhouib, M., Bettaieb, G., Shabou, A.: DocParser: End-to-end OCR-free information extraction from visually rich documents. arXiv preprint arXiv:2304.12484 (2023)","DOI":"10.1007\/978-3-031-41734-4_10"},{"key":"493_CR76","doi-asserted-by":"crossref","unstructured":"Tjong Kim\u00a0Sang, E.F., De\u00a0Meulder, F.: Introduction to the CoNLL-2003 shared task: language-independent named entity recognition. In: Proceedings of the Seventh Conference on Natural Language Learning at HLT-NAACL 2003, pp. 142\u2013147 (2003). https:\/\/aclanthology.org\/W03-0419","DOI":"10.3115\/1119176.1119195"},{"issue":"1","key":"493_CR77","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/1758-2946-7-S1-S1","volume":"7","author":"M Krallinger","year":"2015","unstructured":"Krallinger, M., Rabal, O., Leitner, F., Vazquez, M., Salgado, D., Lu, Z., Leaman, R., Lu, Y., Ji, D., Lowe, D.M., et al.: The CHEMDNER corpus of chemicals and drugs and its annotation principles. J. Cheminformatics 7(1), 1\u201317 (2015)","journal-title":"J. Cheminformatics"},{"key":"493_CR78","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3025062","author":"Y Gao","year":"2020","unstructured":"Gao, Y., Kuang, Z., Li, G., Luo, P., Chen, Y., Lin, L., Zhang, W.: Fashion retrieval via graph reasoning networks on a similarity pyramid. IEEE Trans. Pattern Anal. Mach. Intell. (2020). https:\/\/doi.org\/10.1109\/TPAMI.2020.3025062","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"493_CR79","doi-asserted-by":"crossref","unstructured":"Ronneberger, O., Fischer, P., Brox, T.: U-Net: convolutional networks for biomedical image segmentation. In: International Conference on Medical Image Computing and Computer-assisted Intervention, pp. 234\u2013241. Springer (2015)","DOI":"10.1007\/978-3-319-24574-4_28"},{"key":"493_CR80","doi-asserted-by":"crossref","unstructured":"Kim, G., Hong, T., Yim, M., Nam, J., Park, J., Yim, J., Hwang, W., Yun, S., Han, D., Park, S.: OCR-free document understanding transformer. In: European Conference on Computer Vision, pp. 498\u2013517. Springer (2022)","DOI":"10.1007\/978-3-031-19815-1_29"},{"key":"493_CR81","doi-asserted-by":"crossref","unstructured":"Kim, G., Hong, T., Yim, M., Park, J., Yim, J., Hwang, W., Yun, S., Han, D., Park, S.: Donut: document understanding transformer without OCR, vol. 7, p. 15. arXiv preprint arXiv:2111.15664 (2021)","DOI":"10.1007\/978-3-031-19815-1_29"},{"key":"493_CR82","doi-asserted-by":"crossref","unstructured":"Ye, J., Hu, A., Xu, H., Ye, Q., Yan, M., Xu, G., Li, C., Tian, J., Qian, Q., Zhang, J., et al.: UReader: Universal OCR-free visually-situated language understanding with multimodal large language model. arXiv preprint arXiv:2310.05126 (2023)","DOI":"10.18653\/v1\/2023.findings-emnlp.187"},{"issue":"11","key":"493_CR83","doi-asserted-by":"publisher","first-page":"2298","DOI":"10.1109\/TPAMI.2016.2646371","volume":"39","author":"B Shi","year":"2016","unstructured":"Shi, B., Bai, X., Yao, C.: An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition. IEEE Trans. Pattern Anal. Mach. Intell. 39(11), 2298\u20132304 (2016)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"493_CR84","doi-asserted-by":"crossref","unstructured":"Xue, L., Gao, M., Chen, Z., Xiong, C., Xu, R.: Robustness evaluation of transformer-based form field extractors via form attacks. In: International Conference on Document Analysis and Recognition, pp. 167\u2013184. Springer (2023)","DOI":"10.1007\/978-3-031-41679-8_10"}],"container-title":["International Journal on Document Analysis and Recognition (IJDAR)"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-024-00493-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10032-024-00493-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-024-00493-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,29]],"date-time":"2024-07-29T13:09:12Z","timestamp":1722258552000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10032-024-00493-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,7,29]]},"references-count":84,"alternative-id":["493"],"URL":"https:\/\/doi.org\/10.1007\/s10032-024-00493-8","relation":{},"ISSN":["1433-2833","1433-2825"],"issn-type":[{"value":"1433-2833","type":"print"},{"value":"1433-2825","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,7,29]]},"assertion":[{"value":"12 November 2022","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"11 January 2024","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 July 2024","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 July 2024","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}]}}