{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,22]],"date-time":"2025-10-22T20:34:55Z","timestamp":1761165295130,"version":"build-2065373602"},"reference-count":13,"publisher":"Sociedade Brasileira de Computa\u00e7\u00e3o - SBC","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"abstract":"<jats:p>A manuten\u00e7\u00e3o de scrapers com seletores fixos \u00e9 onerosa, pois pequenas mudan\u00e7as nas p\u00e1ginas os invalidam. Este artigo prop\u00f5e um agente aut\u00f4nomo com Large Language Model (LLM) e prompts din\u00e2micos, capaz de extrair not\u00edcias sem conhecimento pr\u00e9vio do HTML. O agente opera em ciclos observar\u2013planejar\u2013agir, nos quais o GPT-4 decide a\u00e7\u00f5es (rolagem, clique, extra\u00e7\u00e3o). Em testes com 4.898URLs da Seade e 12 portais in\u00e9ditos, obteve-se 91% de recall e 95% de precision, igualando o desempenho do scraper legado. O sistema manteve qualidade superior a 90% em DOMs din\u00e2micos, viabilizando monitoramento de m\u00eddia em larga escala com m\u00ednima interven\u00e7\u00e3o humana.<\/jats:p>","DOI":"10.5753\/sbbd.2025.247075","type":"proceedings-article","created":{"date-parts":[[2025,10,21]],"date-time":"2025-10-21T19:26:36Z","timestamp":1761074796000},"page":"278-288","source":"Crossref","is-referenced-by-count":0,"title":["Agente Aut\u00f4nomo Guiado por LLM para Extra\u00e7\u00e3o de Not\u00edcias"],"prefix":"10.5753","author":[{"ORCID":"https:\/\/orcid.org\/0009-0006-7885-9992","authenticated-orcid":false,"given":"Jo\u00e3o V. C.","family":"Neres de Sousa","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lucas M.","family":"Mingardo","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Carlos E. T.","family":"Freire","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4929-7258","authenticated-orcid":false,"given":"Agma J. M.","family":"Traina","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6625-6047","authenticated-orcid":false,"given":"Caetano","family":"T. Junior","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"3742","published-online":{"date-parts":[[2025,9,29]]},"reference":[{"key":"1","unstructured":"Ahluwalia, A. and Wani, S. (2024). Leveraging large language models for web scraping. arXiv preprint arXiv:2406.08246. Acesso em: 15 jul. 2025."},{"key":"2","doi-asserted-by":"crossref","unstructured":"Aslany\u00fcrek, C. and Yerlikaya, T. (2024). Automatic regular expression generation for extracting relevant image data from web pages using genetic algorithms. IEEE Access, 12:90660\u201390669.","DOI":"10.1109\/ACCESS.2024.3420734"},{"key":"3","unstructured":"Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger, G., Henighan, T., Child, R., Ramesh, A., Ziegler, D. M., Wu, J., Winter, C., Hesse, C., Chen, M., Sigler, E., Litwin, M., Gray, S., Chess, B., Clark, J., Berner, C., McCandlish, S., Radford, A., Sutskever, I., and Amodei, D. (2020). Language models are few-shot learners. <a href=\"https:\/\/arxiv.org\/abs\/2005.14165\"target=\"_blank\">[link]<\/a>. arXiv preprint arXiv:2005.14165. Acesso em: 15 jul. 2025."},{"key":"4","unstructured":"Funda\u00e7\u00e3o Sistema Estadual de An\u00e1lise de Dados (SEADE) (2025). Pesquisa de investimentos do estado de s\u00e3o paulo (piesp). <a href=\"https:\/\/investimentos.seade.gov.br\"target=\"_blank\">[link]<\/a>. Acesso em: 28 abr. 2025."},{"key":"5","doi-asserted-by":"crossref","unstructured":"Huang, W., Gu, Z., Peng, C., Li, Z., Liang, J., Xiao, Y., Wen, L., and Chen, Z. (2024). Autoscraper: A progressive understanding web agent for web scraper generation. arXiv preprint arXiv:2404.12753. Acesso em: 15 jul. 2025.","DOI":"10.18653\/v1\/2024.emnlp-main.141"},{"key":"6","doi-asserted-by":"crossref","unstructured":"Khder, M. A. (2021). Web scraping or web crawling: State of the art, techniques, approaches and application. International Journal of Advances in Soft Computing and Its Applications, 13(3):145\u2013168.","DOI":"10.15849\/IJASCA.211128.11"},{"key":"7","unstructured":"Reynolds, L. and McDonell, K. (2021). Prompt programming for large language models: Beyond the few-shot paradigm. <a href=\"https:\/\/arxiv.org\/abs\/2102.07350\"target=\"_blank\">[link]<\/a>. arXiv preprint arXiv:2102.07350. Acesso em: 15 jul. 2025."},{"key":"8","unstructured":"Roig, A. P. (2023). Web data scraper. PhD thesis, Universitat Polit\u00e8cnica de Val\u00e8ncia, Val\u00e8ncia, ES. Tese de Doutorado. Acesso em: 15 jul. 2025."},{"key":"9","unstructured":"Shinn, N., Cassano, F., Berman, E., Gopinath, A., Narasimhan, K., and Yao, S. (2023). Reflexion: Language agents with verbal reinforcement learning. <a href=\"https:\/\/arxiv.org\/abs\/2303.11366\"target=\"_blank\">[link]<\/a>. arXiv preprint arXiv:2303.11366. Acesso em: 15 jul. 2025."},{"key":"10","unstructured":"Wei, J., Wang, X., Schuurmans, D., Bosma, M., Ichter, B., Xia, F., Chi, E., Le, Q., and Zhou, D. (2023). Chain-of-thought prompting elicits reasoning in large language models. <a href=\"https:\/\/arxiv.org\/abs\/2201.11903\"target=\"_blank\">[link]<\/a>. arXiv preprint arXiv:2201.11903. Acesso em: 15 jul. 2025."},{"key":"11","unstructured":"Yao, S., Yu, D., Zhao, J., Shafran, I., Griffiths, T. L., Cao, Y., and Narasimhan, K. (2023a). Tree of thoughts: Deliberate problem solving with large language models. <a href=\"https:\/\/arxiv.org\/abs\/2305.10601\"target=\"_blank\">[link]<\/a>. arXiv preprint arXiv:2305.10601. Acesso em: 15 jul. 2025."},{"key":"12","unstructured":"Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., and Cao, Y. (2023b). React: Synergizing reasoning and acting in language models. <a href=\"https:\/\/arxiv.org\/abs\/2210.03629\"target=\"_blank\">[link]<\/a>. arXiv preprint arXiv:2210.03629. Acesso em: 15 jul. 2025."},{"key":"13","doi-asserted-by":"crossref","unstructured":"You, J., Lee, K., and Kwon, H. (2024). Deepscraper: A complete and efficient tweet scraping method using authenticated multiprocessing. Data and Knowledge Engineering, 149:102260.","DOI":"10.1016\/j.datak.2023.102260"}],"event":{"name":"Simp\u00f3sio Brasileiro de Banco de Dados","number":"40","location":"Brasil","acronym":"SBBD 2025"},"container-title":["Anais do XL Simp\u00f3sio Brasileiro de Banco de Dados (SBBD 2025)"],"original-title":[],"link":[{"URL":"https:\/\/sol.sbc.org.br\/index.php\/sbbd\/article\/download\/37244\/37027","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/sol.sbc.org.br\/index.php\/sbbd\/article\/download\/37244\/37027","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,21]],"date-time":"2025-10-21T19:30:59Z","timestamp":1761075059000},"score":1,"resource":{"primary":{"URL":"https:\/\/sol.sbc.org.br\/index.php\/sbbd\/article\/view\/37244"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,9,29]]},"references-count":13,"URL":"https:\/\/doi.org\/10.5753\/sbbd.2025.247075","relation":{},"subject":[],"published":{"date-parts":[[2025,9,29]]}}}