{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,6]],"date-time":"2026-05-06T02:18:36Z","timestamp":1778033916557,"version":"3.51.4"},"reference-count":45,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2022,7,12]],"date-time":"2022-07-12T00:00:00Z","timestamp":1657584000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2022,7,12]],"date-time":"2022-07-12T00:00:00Z","timestamp":1657584000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["IJDAR"],"published-print":{"date-parts":[[2023,3]]},"DOI":"10.1007\/s10032-022-00406-7","type":"journal-article","created":{"date-parts":[[2022,7,12]],"date-time":"2022-07-12T06:06:40Z","timestamp":1657606000000},"page":"33-49","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Sequence-aware multimodal page classification of Brazilian legal documents"],"prefix":"10.1007","volume":"26","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6114-832X","authenticated-orcid":false,"given":"Pedro H.","family":"Luz de Araujo","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8241-1388","authenticated-orcid":false,"given":"Ana Paula G. S.","family":"de Almeida","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6690-9741","authenticated-orcid":false,"given":"Fabricio","family":"Ataides Braz","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5817-5175","authenticated-orcid":false,"given":"Nilton","family":"Correia da Silva","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6317-218X","authenticated-orcid":false,"given":"Flavio","family":"de Barros Vidal","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6172-0229","authenticated-orcid":false,"given":"Teofilo E.","family":"de Campos","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2022,7,12]]},"reference":[{"key":"406_CR1","doi-asserted-by":"crossref","unstructured":"Agam, G., Argamon, S., Frieder, O., Grossman, D., Lewis, D.: The Complex Document Image Processing (CDIP) test collection project (2006). http:\/\/ir.iit.edu\/projects\/CDIP.html","DOI":"10.1145\/1148170.1148274"},{"key":"406_CR2","unstructured":"Audebert, N., Herold, C., Slimani, K., Vidal, C.: Multimodal deep networks for text and image-based document classification. CoRR abs\/1907.06370 (2019). http:\/\/arxiv.org\/abs\/1907.06370"},{"key":"406_CR3","doi-asserted-by":"crossref","unstructured":"Bakkali, S., Ming, Z., Coustaty, M., Rusinol, M.: Visual and textual deep feature fusion for document image classification. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops (2020)","DOI":"10.1109\/CVPRW50498.2020.00289"},{"key":"406_CR4","unstructured":"Beltagy, I., Peters, M.E., Cohan, A.: Longformer: The long-document transformer. CoRR abs\/2004.05150 (2020). https:\/\/arxiv.org\/abs\/2004.05150"},{"key":"406_CR5","unstructured":"Blei, D.M., Ng, A.Y., Jordan, M.I.: Latent Dirichlet Allocation. J. Mach. Learn. Res. 3, 993\u20131022 (2003). http:\/\/www.jmlr.org\/papers\/volume3\/blei03a\/blei03a.pdf"},{"key":"406_CR6","doi-asserted-by":"publisher","first-page":"135","DOI":"10.1162\/tacl_a_00051.","volume":"5","author":"P Bojanowski","year":"2017","unstructured":"Bojanowski, P., Grave, E., Joulin, A., Mikolov, T.: Enriching word vectors with subword information. Trans. Assoc. Comput. Linguistics 5, 135\u2013146 (2017). https:\/\/doi.org\/10.1162\/tacl_a_00051.","journal-title":"Trans. Assoc. Comput. Linguistics"},{"key":"406_CR7","doi-asserted-by":"publisher","DOI":"10.1016\/j.engappai.2021.104394.","volume":"105","author":"FA Braz","year":"2021","unstructured":"Braz, F.A., da Silva, N.C., Lima, J.A.S.: Leveraging effectiveness and efficiency in page stream deep segmentation. Eng. Appl. Artif. Intell. 105, 104394 (2021). https:\/\/doi.org\/10.1016\/j.engappai.2021.104394.","journal-title":"Eng. Appl. Artif. Intell."},{"key":"406_CR8","unstructured":"Buitinck, L., Louppe, G., Blondel, M., Pedregosa, F., Mueller, A., Grisel, O., Niculae, V., Prettenhofer, P., Gramfort, A., Grobler, J., Layton, R., VanderPlas, J., Joly, A., Holt, B., Varoquaux, G.: API design for machine learning software: experiences from the scikit-learn project. In: ECML PKDD Workshop: Languages for Data Mining and Machine Learning, pp. 108\u2013122 (2013)"},{"issue":"1","key":"406_CR9","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/s10032-006-0020-2","volume":"10","author":"N Chen","year":"2007","unstructured":"Chen, N., Blostein, D.: A survey of document image classification: problem statement, classifier architecture and performance evaluation. Int. J. Document Anal. Recogn. (IJDAR) 10(1), 1\u201316 (2007). https:\/\/doi.org\/10.1007\/s10032-006-0020-2","journal-title":"Int. J. Document Anal. Recogn. (IJDAR)"},{"key":"406_CR10","unstructured":"Chung, J., G\u00fcl\u00e7ehre, \u00c7., Cho, K., Bengio, Y.: Empirical evaluation of gated recurrent neural networks on sequence modeling. CoRR abs\/1412.3555 (2014). http:\/\/arxiv.org\/abs\/1412.3555"},{"key":"406_CR11","doi-asserted-by":"crossref","unstructured":"Conneau, A., Schwenk, H., Barrault, L., Lecun, Y.: Very deep convolutional networks for text classification. In: Proceedings of the 15th Conference of the European Chapter of the Association for Computational Linguistics: Volume 1, Long Papers, pp. 1107\u20131116. Association for Computational Linguistics, Valencia, Spain (2017). http:\/\/www.aclweb.org\/anthology\/E17-1104","DOI":"10.18653\/v1\/E17-1104"},{"issue":"6","key":"406_CR12","doi-asserted-by":"publisher","first-page":"391","DOI":"10.1002\/(SICI)1097-4571(199009)41:6<391::AID-ASI1>3.0.CO;2-9","volume":"41","author":"S Deerwester","year":"1990","unstructured":"Deerwester, S., Dumais, S.T., Furnas, G.W., Landauer, T.K., Harshman, R.: Indexing by latent semantic analysis. J. Am. Soc. Inform. Sci. 41(6), 391\u2013407 (1990)","journal-title":"J. Am. Soc. Inform. Sci."},{"key":"406_CR13","unstructured":"Devlin, J., Chang, M., Lee, K., Toutanova, K.: BERT: pre-training of deep bidirectional transformers for language understanding. CoRR abs\/1810.04805 (2018). http:\/\/arxiv.org\/abs\/1810.04805"},{"key":"406_CR14","doi-asserted-by":"publisher","unstructured":"Dimmick, D., Garris, M., Wilson, C., Flanagan, P.: Nist special database 2 - structured forms database users\u2019 guide (2017). https:\/\/doi.org\/10.6028\/NIST.NSRDS.2-2017","DOI":"10.6028\/NIST.NSRDS.2-2017"},{"key":"406_CR15","unstructured":"Engin, D., Emekligil, E., Oral, B., Arslan, S., Akp\u0131nar, M.: Multimodal deep neural networks for banking document classification. In: International Conference on Advances in Information Mining and Management, pp. 21\u201325 (2019)"},{"key":"406_CR16","unstructured":"Ford, G., Thoma, G.R.: Ground truth data for document image analysis. In: Symposium on document image understanding and technology (SDIUT), pp. 199\u2013205 (2003)"},{"key":"406_CR17","doi-asserted-by":"crossref","unstructured":"Harley, A.W., Ufkes, A., Derpanis, K.G.: Evaluation of deep convolutional nets for document image classification and retrieval. In: International Conference on Document Analysis and Recognition (ICDAR), pp. 991\u2013995. IEEE (2015)","DOI":"10.1109\/ICDAR.2015.7333910"},{"key":"406_CR18","doi-asserted-by":"publisher","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 770\u2013778 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.90","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"406_CR19","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"key":"406_CR20","doi-asserted-by":"publisher","unstructured":"Howard, J., Ruder, S.: Universal language model fine-tuning for text classification. In: Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 328\u2013339. Association for Computational Linguistics, Melbourne, Australia (2018). https:\/\/doi.org\/10.18653\/v1\/P18-1031","DOI":"10.18653\/v1\/P18-1031"},{"key":"406_CR21","unstructured":"Ioffe, S., Szegedy, C.: Batch normalization: Accelerating deep network training by reducing internal covariate shift. In: Proceedings of the 32nd International Conference on Machine Learning - Volume 37, pp. 448\u2013456. JMLR.org (2015). http:\/\/proceedings.mlr.press\/v37\/ioffe15.html"},{"key":"406_CR22","doi-asserted-by":"publisher","unstructured":"Jain, R., Wigington, C.: Multimodal document image classification. In: International Conference on Document Analysis and Recognition (ICDAR), pp. 71\u201377 (2019). https:\/\/doi.org\/10.1109\/ICDAR.2019.00021","DOI":"10.1109\/ICDAR.2019.00021"},{"key":"406_CR23","unstructured":"Kingma, D.P., Ba, J.: Adam: A method for stochastic optmisation. In: International Conference on Learning Representations (ICLR) (2015). Preprint available at https:\/\/arxiv.org\/abs\/1412.6980"},{"key":"406_CR24","doi-asserted-by":"publisher","first-page":"119","DOI":"10.1016\/j.patrec.2013.10.030","volume":"43","author":"J Kumar","year":"2014","unstructured":"Kumar, J., Ye, P., Doermann, D.: Structural similarity for document image classification and retrieval. Pattern Recogn. Lett. 43, 119\u2013126 (2014)","journal-title":"Pattern Recogn. Lett."},{"key":"406_CR25","unstructured":"Lafferty, J.D., Andrew, M., Pereira, F.C.N.: Conditional random fields: Probabilistic models for segmenting and labeling sequence data. In: Proceedings of the Eighteenth International Conference on Machine Learning, ICML, pp. 282\u2013289. Morgan Kaufmann Publishers Inc., San Francisco, CA, USA (2001)"},{"key":"406_CR26","doi-asserted-by":"publisher","unstructured":"Lewis, D., Agam, G., Argamon, S., Frieder, O., Grossman, D., Heard, J.: Building a test collection for complex document information processing. In: Proceedings of the 29th Annual International ACM SIGIR Conference on Research and Development in Information Retrieval, SIGIR \u201906, p. 665-666. Association for Computing Machinery, New York, NY, USA (2006). https:\/\/doi.org\/10.1145\/1148170.1148307","DOI":"10.1145\/1148170.1148307"},{"key":"406_CR27","unstructured":"Luz de Araujo, P.H., de\u00a0Campos, T.E., Ataides\u00a0Braz, F., Correia\u00a0da Silva, N.: VICTOR: a dataset for Brazilian legal documents classification. In: Proceedings of The 12th Language Resources and Evaluation Conference (LREC), pp. 1449\u20131458. European Language Resources Association, Marseille, France (2020). https:\/\/www.aclweb.org\/anthology\/2020.lrec-1.181"},{"key":"406_CR28","doi-asserted-by":"publisher","unstructured":"Mota, C., Lima, A., Nascimento, A., Miranda, P., de\u00a0Mello, R.: Classifica\u00e7\u00e3o de p\u00e1ginas de peti\u00e7\u00f5es iniciais utilizando redes neurais convolucionais multimodais. In: Anais do XVII Encontro Nacional de Intelig\u00eancia Artificial e Computacional, pp. 318\u2013329. SBC, Porto Alegre, RS, Brasil (2020). https:\/\/doi.org\/10.5753\/eniac.2020.12139","DOI":"10.5753\/eniac.2020.12139"},{"key":"406_CR29","unstructured":"Raffel, C., Shazeer, N., Roberts, A., Lee, K., Narang, S., Matena, M., Zhou, Y., Li, W., Liu, P.J.: Exploring the limits of transfer learning with a unified text-to-text transformer. J. Mach. Learn. Res. 21(140), 1\u201367 (2020). http:\/\/jmlr.org\/papers\/v21\/20-074.html"},{"key":"406_CR30","doi-asserted-by":"publisher","unstructured":"Ramshaw, L.A., Marcus, M.P.: Text chunking using transformation-based learning. In: Natural language processing using very large corpora, pp. 157\u2013176. Springer (1999). https:\/\/doi.org\/10.1007\/978-94-017-2390-9_10. Preprint available at http:\/\/arxiv.org\/abs\/cmp-lg\/9505040","DOI":"10.1007\/978-94-017-2390-9_10"},{"key":"406_CR31","unstructured":"Rosenstein, M.T., Marx, Z., Kaelbling, L.P., Dietterich, T.G.: To transfer or not to transfer. In: In NIPS\u201905 Workshop, Inductive Transfer: 10 Years Later (2005)"},{"issue":"4","key":"406_CR32","doi-asserted-by":"publisher","first-page":"331","DOI":"10.1007\/s10032-014-0225-8","volume":"17","author":"M Rusi\u00f1ol","year":"2014","unstructured":"Rusi\u00f1ol, M., Frinken, V., Karatzas, D., Bagdanov, A.D., Llad\u00f3s, J.: Multimodal page classification in administrative document image streams. Int. J. Document Anal. Recogn. (IJDAR) 17(4), 331\u2013341 (2014). https:\/\/doi.org\/10.1007\/s10032-014-0225-8","journal-title":"Int. J. Document Anal. Recogn. (IJDAR)"},{"issue":"3","key":"406_CR33","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., Huang, Z., Karpathy, A., Khosla, A., Bernstein, M., Berg, A.C., Fei-Fei, L.: ImageNet Large Scale Visual Recognition Challenge. Int. J. Comput. Visi. (IJCV) 115(3), 211\u2013252 (2015). https:\/\/doi.org\/10.1007\/s11263-015-0816-y","journal-title":"Int. J. Comput. Visi. (IJCV)"},{"key":"406_CR34","doi-asserted-by":"crossref","unstructured":"Sandler, M., Howard, A., Zhu, M., Zhmoginov, A., Chen, L.C.: Mobilenetv2: Inverted residuals and linear bottlenecks. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2018)","DOI":"10.1109\/CVPR.2018.00474"},{"key":"406_CR35","unstructured":"Secretaria de Comunica\u00e7\u00e3o Social do Conselho Nacional de Justi\u00e7a: Sum\u00e1rio executivo do relat\u00f3rio justi\u00e7a em n\u00fameros 2020 (2018). https:\/\/www.cnj.jus.br\/wp-content\/uploads\/2020\/08\/WEB_V2_SUMARIO_EXECUTIVO_CNJ_JN2020.pdf"},{"key":"406_CR36","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. In: International Conference on Learning Representations (2015)"},{"key":"406_CR37","doi-asserted-by":"publisher","unstructured":"Smith, L.N.: Cyclical learning rates for training neural networks. In: IEEE Winter Conference on Applications of Computer Vision (WACV), pp. 464\u2013472 (2017). https:\/\/doi.org\/10.1109\/WACV.2017.58","DOI":"10.1109\/WACV.2017.58"},{"key":"406_CR38","unstructured":"Smith, L.N., Topin, N.: Super-convergence: Very fast training of neural networks using large learning rates. CoRR abs\/1708.07120 (2017). http:\/\/arxiv.org\/abs\/1708.07120"},{"key":"406_CR39","doi-asserted-by":"crossref","unstructured":"Smith, R.: An overview of the Tesseract OCR engine. In: Ninth International Conference on Document Analysis and Recognition (ICDAR), vol.\u00a02, pp. 629\u2013633. IEEE (2007)","DOI":"10.1109\/ICDAR.2007.4376991"},{"key":"406_CR40","unstructured":"Supremo Tribunal Federal: Ministra C\u00e1rmen L\u00facia anuncia in\u00edcio de funcionamento do Projeto Victor, de intelig\u00eancia artificial (2018). http:\/\/www.stf.jus.br\/portal\/cms\/verNoticiaDetalhe.asp?idConteudo=388443"},{"key":"406_CR41","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, L.u., Polosukhin, I.: Attention is all you need. In: I.\u00a0Guyon, U.V. Luxburg, S.\u00a0Bengio, H.\u00a0Wallach, R.\u00a0Fergus, S.\u00a0Vishwanathan, R.\u00a0Garnett (eds.) Advances in Neural Information Processing Systems 30, pp. 5998\u20136008. Curran Associates, Inc. (2017). http:\/\/papers.nips.cc\/paper\/7181-attention-is-all-you-need.pdf"},{"key":"406_CR42","doi-asserted-by":"publisher","DOI":"10.1007\/s10579-019-09476-2","author":"G Wiedemann","year":"2019","unstructured":"Wiedemann, G., Heyer, G.: Multi-modal page stream segmentation with convolutional neural networks. Language Res. Evalu. (2019). https:\/\/doi.org\/10.1007\/s10579-019-09476-2","journal-title":"Language Res. Evalu."},{"key":"406_CR43","doi-asserted-by":"crossref","unstructured":"Xu, Y., Li, M., Cui, L., Huang, S., Wei, F., Zhou, M.: LayoutLM: Pre-Training of Text and Layout for Document Image Understanding, p. 1192\u20131200. Association for Computing Machinery, New York, NY, USA (2020). https:\/\/doi.org\/10.1145\/3394486.3403172","DOI":"10.1145\/3394486.3403172"},{"key":"406_CR44","doi-asserted-by":"crossref","unstructured":"Xu, Y., Lv, T., Cui, L., Wang, G., Lu, Y., Florencio, D., Zhang, C., Wei, F.: Layoutxlm: Multimodal pre-training for multilingual visually-rich document understanding (2021)","DOI":"10.18653\/v1\/2022.findings-acl.253"},{"key":"406_CR45","doi-asserted-by":"publisher","unstructured":"Xu, Y., Xu, Y., Lv, T., Cui, L., Wei, F., Wang, G., Lu, Y., Florencio, D., Zhang, C., Che, W., Zhang, M., Zhou, L.: LayoutLMv2: Multi-modal pre-training for visually-rich document understanding. In: Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 2579\u20132591. Association for Computational Linguistics, Online (2021). https:\/\/doi.org\/10.18653\/v1\/2021.acl-long.201","DOI":"10.18653\/v1\/2021.acl-long.201"}],"container-title":["International Journal on Document Analysis and Recognition (IJDAR)"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-022-00406-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s10032-022-00406-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s10032-022-00406-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,27]],"date-time":"2023-02-27T06:08:49Z","timestamp":1677478129000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s10032-022-00406-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,7,12]]},"references-count":45,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2023,3]]}},"alternative-id":["406"],"URL":"https:\/\/doi.org\/10.1007\/s10032-022-00406-7","relation":{},"ISSN":["1433-2833","1433-2825"],"issn-type":[{"value":"1433-2833","type":"print"},{"value":"1433-2825","type":"electronic"}],"subject":[],"published":{"date-parts":[[2022,7,12]]},"assertion":[{"value":"8 April 2021","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"31 December 2021","order":2,"name":"revised","label":"Revised","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 June 2022","order":3,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"12 July 2022","order":4,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}