{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,9,16]],"date-time":"2025-09-16T21:26:05Z","timestamp":1758057965092,"version":"3.44.0"},"publisher-location":"Cham","reference-count":41,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783032046291","type":"print"},{"value":"9783032046307","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,9,16]],"date-time":"2025-09-16T00:00:00Z","timestamp":1757980800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,9,16]],"date-time":"2025-09-16T00:00:00Z","timestamp":1757980800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-032-04630-7_29","type":"book-chapter","created":{"date-parts":[[2025,9,15]],"date-time":"2025-09-15T23:47:29Z","timestamp":1757980049000},"page":"505-522","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["ICDAR 2025 Competition on\u00a0End-to-End Document Image Machine Translation Towards Complex Layouts"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6892-905X","authenticated-orcid":false,"given":"Yaping","family":"Zhang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-6121-9054","authenticated-orcid":false,"given":"Yupu","family":"Liang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0004-4057-7098","authenticated-orcid":false,"given":"Zhiyang","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0001-6921-6251","authenticated-orcid":false,"given":"Zhiyuan","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7702-7274","authenticated-orcid":false,"given":"Lu","family":"Xiang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1028-3406","authenticated-orcid":false,"given":"Yang","family":"Zhao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4911-4717","authenticated-orcid":false,"given":"Yu","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-9864-3818","authenticated-orcid":false,"given":"Chengqing","family":"Zong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,9,16]]},"reference":[{"key":"29_CR1","first-page":"42566","volume":"37","author":"X Dong","year":"2024","unstructured":"Dong, X., et al.: Internlm-xcomposer2-4khd: a pioneering large vision-language model handling resolutions from 336 pixels to 4k HD. Adv. Neural. Inf. Process. Syst. 37, 42566\u201342592 (2024)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"29_CR2","unstructured":"Yao, Y., et\u00a0al.: MiniCPM-V: a GPT-4V level MLLM on your phone. arXiv preprint arXiv:2408.01800 (2024)"},{"key":"29_CR3","doi-asserted-by":"crossref","unstructured":"Yang, W., Wu, J., Wang, C., Zong, C., Zhang, J.: Implicit cross-lingual rewarding for efficient multilingual preference alignment. arXiv preprint arXiv:2503.04647 (2025)","DOI":"10.18653\/v1\/2025.findings-acl.1088"},{"key":"29_CR4","doi-asserted-by":"crossref","unstructured":"Qian, Z., et al.: AnyTrans: translate AnyText in the image with large scale models. In: Al-Onaizan, Y., Bansal, M., Chen, Y.-N. (eds.) Findings of the Association for Computational Linguistics: EMNLP 2024, Miami, Florida, USA, November 2024, pp. 2432\u20132444. Association for Computational Linguistics (2021)","DOI":"10.18653\/v1\/2024.findings-emnlp.137"},{"key":"29_CR5","doi-asserted-by":"crossref","unstructured":"Lan, Z., et al.. Exploring better text image translation with multimodal codebook. In: ACL (1) (2023)","DOI":"10.18653\/v1\/2023.acl-long.192"},{"issue":"5","key":"29_CR6","doi-asserted-by":"publisher","first-page":"3358","DOI":"10.1109\/TPAMI.2025.3530998","volume":"47","author":"Z Zhang","year":"2025","unstructured":"Zhang, Z., et al.: Understand layout and translate text: unified feature-conductive end-to-end document image translation. IEEE Trans. Pattern Anal. Mach. Intell. 47(5), 3358\u20133376 (2025)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"29_CR7","unstructured":"Liang, Y., et al.: Document image machine translation with dynamic multi-pre-trained models assembling. In: Proceedings of NAACL, pp. 7077\u20137088 (2024)"},{"key":"29_CR8","doi-asserted-by":"crossref","unstructured":"Zhang, Z., et al.: LayoutDIT: layout-aware end-to-end document image translation with multi-step conductive decoder. In: Proceedings of EMNLP Findings, pp. 10043\u201310053 (2023)","DOI":"10.18653\/v1\/2023.findings-emnlp.673"},{"key":"29_CR9","doi-asserted-by":"crossref","unstructured":"Liang, Z., et al.:. A survey of multimodel large language models. In: Proceedings of the 3rd International Conference on Computer, Artificial Intelligence and Control Engineering, pp. 405\u2013409 (2024)","DOI":"10.1145\/3672758.3672824"},{"issue":"12","key":"29_CR10","doi-asserted-by":"publisher","DOI":"10.1007\/s11432-024-4235-6","volume":"67","author":"Y Liu","year":"2024","unstructured":"Liu, Y., et al.: Ocrbench: on the hidden mystery of OCR in large multimodal models. SCIENCE CHINA Inf. Sci. 67(12), 220102 (2024)","journal-title":"SCIENCE CHINA Inf. Sci."},{"key":"29_CR11","series-title":"LNCS","doi-asserted-by":"publisher","first-page":"498","DOI":"10.1007\/978-3-031-19815-1_29","volume-title":"ECCV 2022","author":"G Kim","year":"2022","unstructured":"Kim, G., et al.: OCR-free document understanding transformer. In: Avidan, S., Brostow, G., Ciss\u00e9, M., Farinella, G.M., Hassner, T. (eds.) ECCV 2022. LNCS, vol. 13688, pp. 498\u2013517. Springer, Cham (2022). https:\/\/doi.org\/10.1007\/978-3-031-19815-1_29"},{"key":"29_CR12","unstructured":"Zhang, R., Zhou, Y., Chen, J., Gu, J., Chen, C., Sun, T.: Llava-read: enhancing reading ability of multimodal language models. arXiv preprint arXiv:2407.19185 (2024)"},{"key":"29_CR13","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.-J.: Bleu: a method for automatic evaluation of machine translation. In: Isabelle, P., Charniak, E., Lin, D. (eds.) Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, Philadelphia, Pennsylvania, USA, July 2002, pp. 311\u2013318. Association for Computational Linguistics (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"29_CR14","doi-asserted-by":"crossref","unstructured":"Xu, Y., Li, M., Cui, L., Huang, S., Wei, F., Zhou, M.: Layoutlm: pre-training of text and layout for document image understanding. In Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining, pp. 1192\u20131200 (2020)","DOI":"10.1145\/3394486.3403172"},{"key":"29_CR15","doi-asserted-by":"crossref","unstructured":"Xu, Y., et al.: Layoutlmv2: multi-modal pre-training for visually-rich document understanding. In: Proceedings of ACL, pp. 2579\u20132591 (2021)","DOI":"10.18653\/v1\/2021.acl-long.201"},{"key":"29_CR16","doi-asserted-by":"crossref","unstructured":"Wang, J., Jin, L., Ding, K.: LILT: a simple yet effective language-independent layout transformer for structured document understanding. In: Proceedings of ACL, pp. 7747\u20137757 (2022)","DOI":"10.18653\/v1\/2022.acl-long.534"},{"key":"29_CR17","doi-asserted-by":"crossref","unstructured":"Huang, Y., Lv, T., Cui, L., Lu, Y., Wei, F.: Layoutlmv3: pre-training for document AI with unified text and image masking. In: Proceedings of ACM MM, pp. 4083\u20134091 (2022)","DOI":"10.1145\/3503161.3548112"},{"key":"29_CR18","unstructured":"Blecher, L., Cucurull, G., Scialom, T., Stojnic, R.: Nougat: neural optical understanding for academic documents. In: The Twelfth International Conference on Learning Representations (2024)"},{"key":"29_CR19","unstructured":"Achiam, J., et\u00a0al.: Gpt-4 technical report. arXiv preprint arXiv:2303.08774 (2023)"},{"key":"29_CR20","unstructured":"Hurst, A., et\u00a0al.: Gpt-4o system card. arXiv preprint arXiv:2410.21276 (2024)"},{"key":"29_CR21","doi-asserted-by":"crossref","unstructured":"Mathew, D.K.M., Jawahar, C.V.: DocVQA: a dataset for VQA on document images. In: Proceedings of CVPR, pp. 2200\u20132209 (2021)","DOI":"10.1109\/WACV48630.2021.00225"},{"key":"29_CR22","doi-asserted-by":"crossref","unstructured":"Wang, R., et al.: A region-based document VQA. In: Proceedings of ACM MM, pp. 4909\u20134920 (2022)","DOI":"10.1145\/3503161.3548172"},{"key":"29_CR23","doi-asserted-by":"crossref","unstructured":"Li, K., Tian, J., Xiao, L., Du,Q., Wang, Q., Jin, Y.: Calm: commen-sense knowledge augmentation for document image understanding. In: Proceedings of ACM MM, pp. 3282\u20133290 (2022)","DOI":"10.1145\/3503161.3548321"},{"key":"29_CR24","doi-asserted-by":"crossref","unstructured":"Nishida, K., Tanaka, R., Yoshida, S.: VisualMRC: machine reading comprehension on document images. In: Proceedings of AAAI, pp. 13878\u201313888 (2021)","DOI":"10.1609\/aaai.v35i15.17635"},{"key":"29_CR25","unstructured":"Borchmann, \u0141., et al.: Document understanding dataset and evaluation (dude). In: Proceedings of ICCV, pp. 19528\u201319540 (2023)"},{"key":"29_CR26","unstructured":"Huang, J., Luo, S., Ding, Y., Ren, K., Han, S.C.: A dataset for multimodal information retrieval in pdf-based visual question answering. In: Proceedings of ICCV, pp. 19528\u201319540 (2023)"},{"key":"29_CR27","doi-asserted-by":"crossref","unstructured":"U\u0159i\u010d\u00e1\u0159, M., et al.: Docile benchmark for document information localization and extraction. In: Proceedings of ICDAR, pp. 147\u2013166 (2023)","DOI":"10.1007\/978-3-031-41679-8_9"},{"key":"29_CR28","unstructured":"Zhang, Z., et al.: From chaotic OCR words to coherent document: a fine-to-coarse zoom-out network for complex-layout document image translation. In: Proceedings of COLING, pp. 10877\u201310890 (2025)"},{"key":"29_CR29","unstructured":"Wang, p., et al.: Qwen2-vl: enhancing vision-language model\u2019s perception of the world at any resolution. arXiv preprint arXiv:2409.12191 (2024)"},{"key":"29_CR30","unstructured":"Chen, Z., et al.: Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling. arXiv preprint arXiv:2412.05271 (2024)"},{"key":"29_CR31","unstructured":"Yang, A., et\u00a0al.: Qwen2. 5 technical report. arXiv preprint arXiv:2412.15115 (2024)"},{"key":"29_CR32","unstructured":"Touvron, H., et al.: Llama: open and efficient foundation language models. arXiv preprint arXiv:2302.13971 (2023)"},{"key":"29_CR33","doi-asserted-by":"publisher","first-page":"713","DOI":"10.1007\/s10579-023-09704-w","volume":"58","author":"J Tiedemann","year":"2023","unstructured":"Tiedemann, J., et al.: Democratizing neural machine translation with OPUS-MT. Lang. Resour. Eval. 58, 713\u2013755 (2023)","journal-title":"Lang. Resour. Eval."},{"key":"29_CR34","doi-asserted-by":"crossref","unstructured":"Huang, Y., Lv, T., Cui, L., Lu, Y., Wei, F.: Layoutlmv3: pre-training for document AI with unified text and image masking. In: Proceedings of the 30th ACM International Conference on Multimedia, pp. 4083\u20134091 (2022)","DOI":"10.1145\/3503161.3548112"},{"key":"29_CR35","unstructured":"Devlin, J., Chang, M.-W., Lee, K., Toutanova, K.: Bert: pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (long and short papers), pp. 4171\u20134186 (2019)"},{"key":"29_CR36","unstructured":"Hu, E.J., et al.: Lora: low-rank adaptation of large language models. ICLR, 1(2), 3 (2022)"},{"key":"29_CR37","unstructured":"Bai, S., et\u00a0al.: Qwen2. 5-vl technical report. arXiv preprint arXiv:2502.13923 (2025)"},{"key":"29_CR38","unstructured":"Radford, A., et\u00a0al.: Learning transferable visual models from natural language supervision. In: International Conference on Machine Learning, pp. 8748\u20138763. PmLR (2021)"},{"key":"29_CR39","unstructured":"Dosovitskiy, A., et al.: An image is worth 16x16 words: transformers for image recognition at scale. arXiv preprint arXiv:2010.11929 (2020)"},{"key":"29_CR40","unstructured":"Vaswani, A., et al.: Attention is all you need. In: Advances in Neural Information Processing Systems, vol. 30 (2017)"},{"key":"29_CR41","unstructured":"Rafailov, R., Sharma, A., Mitchell, E., Manning, C.D., Ermon, S., Finn, C.: Direct preference optimization: Your language model is secretly a reward model. In: Advances in Neural Information Processing Systems, vol. 36, pp. 53728\u201353741 (2023)"}],"container-title":["Lecture Notes in Computer Science","Document Analysis and Recognition \u2013 ICDAR 2025"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-032-04630-7_29","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,15]],"date-time":"2025-09-15T23:47:47Z","timestamp":1757980067000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-032-04630-7_29"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,16]]},"ISBN":["9783032046291","9783032046307"],"references-count":41,"URL":"https:\/\/doi.org\/10.1007\/978-3-032-04630-7_29","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,9,16]]},"assertion":[{"value":"16 September 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICDAR","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Document Analysis and Recognition","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Wuhan","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16 September 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"21 September 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"18","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icdar2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/iapr.org\/icdar2025","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}