{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,22]],"date-time":"2025-10-22T20:35:12Z","timestamp":1761165312339,"version":"build-2065373602"},"reference-count":15,"publisher":"Sociedade Brasileira de Computa\u00e7\u00e3o - SBC","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"abstract":"<jats:p>O desbalanceamento de classes \u00e9 um desafio relevante na classifica\u00e7\u00e3o autom\u00e1tica de textos, especialmente em contextos de dados anotados escassos e l\u00ednguas ainda sub-representadas, como \u00e9 caso do portugu\u00eas. Este estudo investiga a classifica\u00e7\u00e3o de um conjunto de dados escassos desbalanceado constitu\u00eddo por solicita\u00e7\u00f5es de suporte t\u00e9cnico registradas por profissionais de sa\u00fade relativas aos sistemas do e-SUS APS. Foram avaliadas seis estrat\u00e9gias de reamostragem \u2014 duas de subamostragem e quatro de sobreamostragem, incluindo gera\u00e7\u00e3o de par\u00e1frases com Large Language Models. A combina\u00e7\u00e3o de sobreamostragem via par\u00e1frases com rotula\u00e7\u00e3o seletiva elevou a Macro-F1 do BERTimbau em 18%, alcan\u00e7ando desempenho estatisticamente equivalente ao da Regress\u00e3o Log\u00edstica (RL) aplicada \u00e0 jun\u00e7\u00e3o de dados originais, random oversampling e rotula\u00e7\u00e3o seletiva, que atingiu 70% de melhorias em rela\u00e7\u00e3o ao m\u00e9todo original. A RL \u00e9 contudo cerca de 3690x mais eficiente que o BERTimbau considerando a vers\u00e3o mais efetiva de ambos os m\u00e9todos.<\/jats:p>","DOI":"10.5753\/sbbd.2025.247749","type":"proceedings-article","created":{"date-parts":[[2025,10,21]],"date-time":"2025-10-21T19:26:36Z","timestamp":1761074796000},"page":"837-843","source":"Crossref","is-referenced-by-count":0,"title":["Estudo do Impacto de Dados Sint\u00e9ticos e Par\u00e1frases na Mitiga\u00e7\u00e3o do Desbalanceamento em Tarefas de Classifica\u00e7\u00e3o de Textos em Portugu\u00eas com Baixa Amostragem"],"prefix":"10.5753","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-7366-2633","authenticated-orcid":false,"given":"Claudio M. V. de","family":"Andrade","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Gestefane Rabbi","family":"Magalh\u00e3es","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Raiane","family":"Asevedo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Julia","family":"Paes","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Isaias Jos\u00e9 Ramos","family":"Oliveira","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Adriana","family":"Pagano","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zilma","family":"Reis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Marcos A.","family":"Gon\u00e7alves","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"3742","published-online":{"date-parts":[[2025,9,29]]},"reference":[{"key":"1","doi-asserted-by":"crossref","unstructured":"Batista, G. E. A. P. A., Prati, R. C., & Monard, M. C. (2004). A study of the behavior of several methods for balancing machine learning training data. SIGKDD Explor. Newsl., 6(1):20\u201329.","DOI":"10.1145\/1007730.1007735"},{"key":"2","doi-asserted-by":"crossref","unstructured":"Chawla, N. V., Bowyer, K. W., Hall, L. O., & Kegelmeyer, W. P. (2002). Smote: synthetic minority oversampling technique. J. Artif. Int. Res., 16(1):321\u2013357.","DOI":"10.1613\/jair.953"},{"key":"3","doi-asserted-by":"crossref","unstructured":"Cunha, W., Fran\u00e7a, C., Fonseca, G., Rocha, L., & Gon\u00e7alves, M. A. (2023). An effective, efficient, and scalable confidence-based instance selection framework for transformer-based text classification. In Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Information Retrieval, SIGIR \u201923, page 665\u2013674, New York, NY, USA. Association for Computing Machinery.","DOI":"10.1145\/3539618.3591638"},{"key":"4","doi-asserted-by":"crossref","unstructured":"Cunha, W., Moreo Fern\u00e1ndez, A., Esuli, A., Sebastiani, F., Rocha, L., & Gon\u00e7alves, M. A. (2025). A noise-oriented and redundancy-aware instance selection framework. ACM Trans. Inf. Syst., 43(2).","DOI":"10.1145\/3705000"},{"key":"5","doi-asserted-by":"crossref","unstructured":"Han, H., Wang, W.-Y., & Mao, B.-H. (2005). Borderline-smote: A new over-sampling method in imbalanced data sets learning. In Huang, D.-S., Zhang, X.-P., & Huang, G.-B., editors, Advances in Intelligent Computing, pages 878\u2013887, Berlin, Heidelberg. Springer Berlin Heidelberg.","DOI":"10.1007\/11538059_91"},{"key":"6","doi-asserted-by":"crossref","unstructured":"He, H. & Garcia, E. A. (2009). Learning from imbalanced data. IEEE Transactions on Knowledge and Data Engineering, 21(9):1263\u20131284.","DOI":"10.1109\/TKDE.2008.239"},{"key":"7","unstructured":"Hu, J., Ruder, S., Siddhant, A., Neubig, G., Firat, O., & Johnson, M. (2020). XTREME: A massively multilingual multi-task benchmark for evaluating cross-lingual generalisation. In Proceedings of the 37th International Conference on Machine Learning, volume 119 of Proc. of Machine Learning Research, pages 4411\u20134421. PMLR."},{"key":"8","unstructured":"Last, F., Douzas, G., & Ba\u00e7\u00e3o, F. (2017). Oversampling for imbalanced learning based on k-means and SMOTE. CoRR, abs\/1711.00837."},{"key":"9","unstructured":"McClure, J., Shimmei, M., Matsuda, N., & Jiang, S. (2024). Leveraging prompts in llms to overcome imbalances in complex educational text data."},{"key":"10","doi-asserted-by":"crossref","unstructured":"Nguyen, H. M., Cooper, E. W., & Kamei, K. (2011). Borderline over-sampling for imbalanced data classification. Int. J. Knowl. Eng. Soft Data Paradigm., 3(1):4\u201321.","DOI":"10.1504\/IJKESDP.2011.039875"},{"key":"11","doi-asserted-by":"crossref","unstructured":"Souza, F., Nogueira, R., & Lotufo, R. (2020). BERTimbau: pretrained BERT models for Brazilian Portuguese. In 9th Brazilian Conference on Intelligent Systems, BRACIS, Rio Grande do Sul, Brazil, October 20-23 (to appear).","DOI":"10.1007\/978-3-030-61377-8_28"},{"key":"12","doi-asserted-by":"crossref","unstructured":"Tabar, V. R., Eskandari, F., Salimi, S., & Zareifard, H. (2018). Finding a set of candidate parents using dependency criterion for the k2 algorithm. Pattern Recognition Letters, 111:23\u201329.","DOI":"10.1016\/j.patrec.2018.04.019"},{"key":"13","doi-asserted-by":"crossref","unstructured":"Taskiran, S. F., Turkoglu, B., Kaya, E., & Asuroglu, T. (2025). A comprehensive evaluation of oversampling techniques for enhancing text classification performance. Scientific Reports, 15:21631.","DOI":"10.1038\/s41598-025-05791-7"},{"key":"14","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A. N., Kaiser, L. u., & Polosukhin, I. (2017). Attention is all you need. In Advances in Neural Information Processing Systems, volume 30."},{"key":"15","doi-asserted-by":"crossref","unstructured":"Yadav, V., Tang, Z., & Srinivasan, V. (2024). Pag-llm: Paraphrase and aggregate with large language models for minimizing intent classification errors. In Proc. of the International ACM SIGIR Conference, SIGIR \u201924, page 2569\u20132573.","DOI":"10.1145\/3626772.3657959"}],"event":{"name":"Simp\u00f3sio Brasileiro de Banco de Dados","number":"40","location":"Brasil","acronym":"SBBD 2025"},"container-title":["Anais do XL Simp\u00f3sio Brasileiro de Banco de Dados (SBBD 2025)"],"original-title":[],"link":[{"URL":"https:\/\/sol.sbc.org.br\/index.php\/sbbd\/article\/download\/37292\/37075","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/sol.sbc.org.br\/index.php\/sbbd\/article\/download\/37292\/37075","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,21]],"date-time":"2025-10-21T19:27:43Z","timestamp":1761074863000},"score":1,"resource":{"primary":{"URL":"https:\/\/sol.sbc.org.br\/index.php\/sbbd\/article\/view\/37292"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,29]]},"references-count":15,"URL":"https:\/\/doi.org\/10.5753\/sbbd.2025.247749","relation":{},"subject":[],"published":{"date-parts":[[2025,9,29]]}}}