{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T13:12:42Z","timestamp":1784121162555,"version":"3.55.0"},"reference-count":79,"publisher":"Oxford University Press (OUP)","license":[{"start":{"date-parts":[[2024,7,12]],"date-time":"2024-07-12T00:00:00Z","timestamp":1720742400000},"content-version":"vor","delay-in-days":193,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,7,11]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>Biomedical relation extraction is an ongoing challenge within the natural language processing community. Its application is important for understanding scientific biomedical literature, with many use cases, such as drug discovery, precision medicine, disease diagnosis, treatment optimization and biomedical knowledge graph construction. Therefore, the development of a tool capable of effectively addressing this task holds the potential to improve knowledge discovery by automating the extraction of relations from research manuscripts. The first track in the BioCreative VIII competition extended the scope of this challenge by introducing the detection of novel relations within the literature. This paper describes that our participation system initially focused on jointly extracting and classifying novel relations between biomedical entities. We then describe our subsequent advancement to an end-to-end model. Specifically, we enhanced our initial system by incorporating it into a cascading pipeline that includes a tagger and linker module. This integration enables the comprehensive extraction of relations and classification of their novelty directly from raw text. Our experiments yielded promising results, and our tagger module managed to attain state-of-the-art named entity recognition performance, with a micro F1-score of 90.24, while our end-to-end system achieved a competitive novelty F1-score of 24.59. The code to run our system is publicly available at https:\/\/github.com\/ieeta-pt\/BioNExt.<\/jats:p><jats:p>Database URL: https:\/\/github.com\/ieeta-pt\/BioNExt<\/jats:p>","DOI":"10.1093\/database\/baae057","type":"journal-article","created":{"date-parts":[[2024,7,12]],"date-time":"2024-07-12T10:05:35Z","timestamp":1720778735000},"source":"Crossref","is-referenced-by-count":6,"title":["Towards discovery: an end-to-end system for uncovering novel biomedical relations"],"prefix":"10.1093","volume":"2024","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-4258-3350","authenticated-orcid":false,"given":"Tiago","family":"Almeida","sequence":"first","affiliation":[{"name":"IEETA\/DETI, LASI, University of Aveiro , Campus Universit\u00e1rio de Santiago, Aveiro 3810-193, Portugal"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Richard A A","family":"Jonker","sequence":"additional","affiliation":[{"name":"IEETA\/DETI, LASI, University of Aveiro , Campus Universit\u00e1rio de Santiago, Aveiro 3810-193, Portugal"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3533-8872","authenticated-orcid":false,"given":"Rui","family":"Antunes","sequence":"additional","affiliation":[{"name":"IEETA\/DETI, LASI, University of Aveiro , Campus Universit\u00e1rio de Santiago, Aveiro 3810-193, Portugal"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jo\u00e3o R","family":"Almeida","sequence":"additional","affiliation":[{"name":"IEETA\/DETI, LASI, University of Aveiro , Campus Universit\u00e1rio de Santiago, Aveiro 3810-193, Portugal"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1941-3983","authenticated-orcid":false,"given":"S\u00e9rgio","family":"Matos","sequence":"additional","affiliation":[{"name":"IEETA\/DETI, LASI, University of Aveiro , Campus Universit\u00e1rio de Santiago, Aveiro 3810-193, Portugal"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2024,7,11]]},"reference":[{"key":"2024071210052083300_R1","first-page":"pp. 1723","article-title":"Global normalization of convolutional neural networks for joint entity and relation classification","author":"Adel","year":"2017"},{"key":"2024071210052083300_R2","doi-asserted-by":"publisher","DOI":"10.1093\/database\/baac047","article-title":"Chemical identification and indexing in PubMed full-text articles using deep learning and heuristics","volume":"2022","author":"Almeida","year":"2022","journal-title":"Database"},{"key":"2024071210052083300_R3","article-title":"BIT.UA at Biocreative VIII track 1: a joint model for relation classification and novelty detection","author":"Almeida","year":"2023"},{"key":"2024071210052083300_R4","first-page":"pp. 37","article-title":"BIT.UA at BioASQ 11B: two-stage IR with synthetic training and zero-shot answer generation","author":"Almeida","year":"2023"},{"key":"2024071210052083300_R5","doi-asserted-by":"publisher","first-page":"25","DOI":"10.7171\/jbt.18-2902-002","article-title":"The cellosaurus, a cell-line knowledge resource","volume":"29","author":"Bairoch","year":"2018","journal-title":"J. Biomol. Tech. JBT"},{"key":"2024071210052083300_R6","doi-asserted-by":"publisher","first-page":"34","DOI":"10.1016\/j.eswa.2018.07.032","article-title":"Joint entity recognition and relation extraction as a multi-head selection problem","volume":"114","author":"Bekoulis","year":"2018","journal-title":"Expert Syst. Appl."},{"key":"2024071210052083300_R7","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1186\/2041-1480-2-S5-S4","article-title":"Automatic extraction of semantic relations between medical entities: a rule based approach","volume":"2","author":"Ben Abacha","year":"2011","journal-title":"J. Biomed. Semant."},{"key":"2024071210052083300_R8","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.jbi.2016.09.009","article-title":"Stacked ensemble combined with fuzzy matching for biomedical named entity recognition of diseases","volume":"64","author":"Bhasuran","year":"2016","journal-title":"J. Biomed. Inf."},{"key":"2024071210052083300_R9","doi-asserted-by":"publisher","first-page":"267D","DOI":"10.1093\/nar\/gkh061","article-title":"The unified medical language system (UMLS): integrating biomedical terminology","volume":"32","author":"Bodenreider","year":"2004","journal-title":"Nucleic Acids Res."},{"key":"2024071210052083300_R10","doi-asserted-by":"publisher","first-page":"D36","DOI":"10.1093\/nar\/gku1055","article-title":"Gene: a gene-centered information resource at ncbi","volume":"43","author":"Brown","year":"2015","journal-title":"Nucleic Acids Res."},{"key":"2024071210052083300_R11","first-page":"pp. 7","article-title":"Bidirectional LSTM-CRF for clinical concept extraction","author":"Chalapathy","year":"2016"},{"key":"2024071210052083300_R12","first-page":"pp. 1002","article-title":"Domain adaptation of rule-based annotators for named-entity recognition tasks","author":"Chiticariu","year":"2010"},{"key":"2024071210052083300_R13","article-title":"BioRED track lasigeBioTM submission: relation extraction using domain ontologies with BioRED","author":"Concei\u00e7\u00e3o","year":"2023"},{"key":"2024071210052083300_R14","doi-asserted-by":"publisher","DOI":"10.1186\/1758-2946-7-S1-S14","article-title":"Enhancing of chemical compound and drug name recognition using representative tag scheme and fine-grained tokenization","volume":"7","author":"Dai","year":"2015","journal-title":"J. Cheminf."},{"key":"2024071210052083300_R15","first-page":"pp. 37","article-title":"Recognizing complex entity mentions: a review and future directions","author":"Dai","year":"2018"},{"key":"2024071210052083300_R16","doi-asserted-by":"publisher","first-page":"D786","DOI":"10.1093\/nar\/gkn580","article-title":"Comparative Toxicogenomics Database: a knowledgebase and discovery tool for chemical-gene-disease networks","volume":"37","author":"Davis","year":"2009","journal-title":"Nucleic Acids Res."},{"key":"2024071210052083300_R17","doi-asserted-by":"publisher","first-page":"D1257","DOI":"10.1093\/nar\/gkac833","article-title":"Comparative Toxicogenomics Database (CTD): update 2023","volume":"51","author":"Davis","year":"2023","journal-title":"Nucleic Acids Res."},{"key":"2024071210052083300_R18","first-page":"pp. 4171","article-title":"BERT: Pre-training of deep bidirectional transformers for language understanding","author":"Devlin","year":"2019"},{"key":"2024071210052083300_R19","doi-asserted-by":"publisher","first-page":"pp. 2006","DOI":"10.3233\/FAIA200321","article-title":"Span-based joint entity and relation extraction with transformer pre-training","author":"Eberts","year":"2019"},{"key":"2024071210052083300_R20","first-page":"pp. 303","article-title":"SemEval-2015 Task 14: analysis of clinical text","author":"Elhadad","year":"2015"},{"key":"2024071210052083300_R21","doi-asserted-by":"crossref","DOI":"10.1016\/j.jbi.2022.104252","article-title":"An overview of biomedical entity linking throughout the years","volume":"137","author":"French","year":"2023","journal-title":"J. Biomed. Inf."},{"key":"2024071210052083300_R22","first-page":"pp. 1","article-title":"PharmaCoNER: pharmacological substances, compounds and proteins named entity recognition track","author":"Gonzalez-Agirre","year":"2019"},{"key":"2024071210052083300_R23","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3458754","article-title":"Domain-specific language model pretraining for biomedical natural language processing","volume":"3","author":"Gu","year":"2021","journal-title":"ACM Trans. Comput. Healthcare"},{"key":"2024071210052083300_R24","doi-asserted-by":"publisher","first-page":"i37","DOI":"10.1093\/bioinformatics\/btx228","article-title":"Deep learning with word embeddings improves biomedical named entity recognition","volume":"33","author":"Habibi","year":"2017","journal-title":"Bioinformatics"},{"key":"2024071210052083300_R25","doi-asserted-by":"publisher","first-page":"1553","DOI":"10.1093\/bioinformatics\/18.12.1553","article-title":"Accomplishments and challenges in literature data mining for biology","volume":"18","author":"Hirschman","year":"2002","journal-title":"Bioinformatics"},{"key":"2024071210052083300_R26","doi-asserted-by":"publisher","DOI":"10.1186\/1471-2105-6-S1-S1","article-title":"Overview of BioCreAtIvE: critical assessment of information extraction for biology","volume":"6","author":"Hirschman","year":"2005","journal-title":"BMC Bioinf."},{"key":"2024071210052083300_R27","article-title":"The overview of the BioRED (Biomedical Relation Extraction Dataset) track at BioCreative VIII","author":"Islamaj","year":"2023"},{"key":"2024071210052083300_R28","doi-asserted-by":"publisher","DOI":"10.1038\/s41597-021-00875-1","article-title":"NLM-Chem, a new resource for chemical entity recognition in PubMed full text literature","volume":"8","author":"Islamaj","year":"2021","journal-title":"Sci. Data"},{"key":"2024071210052083300_R29","doi-asserted-by":"publisher","DOI":"10.1016\/j.nlp.2023.100017","article-title":"A survey on named entity recognition\u2014datasets, tools, and methodologies","volume":"3","author":"Jehangir","year":"2023","journal-title":"Nat. Lang. Process. J."},{"key":"2024071210052083300_R30","first-page":"pp. 1148","article-title":"Knowledge base population: successful approaches and challenges","volume-title":"49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies","author":"Ji","year":"2011"},{"key":"2024071210052083300_R31","doi-asserted-by":"publisher","DOI":"10.1186\/1471-2105-15-64","article-title":"Knowledge-based extraction of adverse drug events from biomedical text","volume":"15","author":"Kang","year":"2014","journal-title":"BMC Bioinf."},{"key":"2024071210052083300_R32","article-title":"A survey on recent advances in named entity recognition","author":"Keraghel","year":"2024"},{"key":"2024071210052083300_R33","doi-asserted-by":"publisher","DOI":"10.1186\/gb-2008-9-s2-s4","article-title":"Overview of the protein-protein interaction annotation extraction task of BioCreative II","volume":"9","author":"Krallinger","year":"2008","journal-title":"Genome Biol."},{"key":"2024071210052083300_R34","article-title":"Assessing the state of the art in biomedical relation extraction: evaluating ChatGPT, PubMedBERT and BioREx for the BioRED track at BioCreative VIII","author":"Lai","year":"2023"},{"key":"2024071210052083300_R35","doi-asserted-by":"publisher","first-page":"pp. 260","DOI":"10.18653\/v1\/N16-1030","article-title":"Neural architectures for named entity recognition","author":"Lample","year":"2016"},{"key":"2024071210052083300_R36","doi-asserted-by":"publisher","DOI":"10.1093\/database\/baad005","article-title":"Chemical identification and indexing in full-text articles: an overview of the NLM-Chem track at BioCreative VII","volume":"2023","author":"Leaman","year":"2023","journal-title":"Database"},{"key":"2024071210052083300_R37","doi-asserted-by":"publisher","first-page":"2839","DOI":"10.1093\/bioinformatics\/btw343","article-title":"TaggerOne: joint named entity recognition and normalization with semi-Markov models","volume":"32","author":"Leaman","year":"2016","journal-title":"Bioinformatics"},{"key":"2024071210052083300_R38","article-title":"BioRED task DUTIR-901 submission: enhancing biomedical document-level relation extraction through multi-task method","author":"Li","year":"2023"},{"key":"2024071210052083300_R39","article-title":"EMBRE: entity-aware masking for biomedical relation extraction","author":"Li","year":"2023"},{"key":"2024071210052083300_R40","first-page":"pp. 1","article-title":"Overview of MedProcNER task on medical procedure detection and entity linking at BioASQ 2023","author":"Lima-L\u00f3pez","year":"2023"},{"key":"2024071210052083300_R41","article-title":"Overview of SympTEMIST at BioCreative VIII: corpus, guidelines and evaluation of systems for the detection and normalization of symptoms, signs and findings from text","author":"Lima-L\u00f3pez","year":"2023"},{"key":"2024071210052083300_R42","first-page":"265","article-title":"Medical Subject Headings (MeSH)","volume":"88","author":"Lipscomb","year":"2000","journal-title":"Bull. Med. Libr. Assoc."},{"key":"2024071210052083300_R43","first-page":"pp. 4228","article-title":"Self-alignment pretraining for biomedical entity representations","author":"Liu","year":"2021"},{"key":"2024071210052083300_R44","doi-asserted-by":"publisher","DOI":"10.1093\/bib\/bbac282","article-title":"BioRED: a rich biomedical relation extraction dataset","volume":"23","author":"Luo","year":"2022","journal-title":"Briefings Bioinf."},{"key":"2024071210052083300_R45","doi-asserted-by":"publisher","DOI":"10.1093\/bioinformatics\/btad310","article-title":"AIONER: all-in-one scheme-based biomedical named entity recognition using deep learning","volume":"39","author":"Luo","year":"2023","journal-title":"Bioinformatics"},{"key":"2024071210052083300_R46","doi-asserted-by":"publisher","DOI":"10.1093\/bib\/bbac409","article-title":"BioGPT: generative pre-trained transformer for biomedical text generation and mining","volume":"23","author":"Luo","year":"2022","journal-title":"Briefings Bioinf."},{"key":"2024071210052083300_R47","doi-asserted-by":"publisher","first-page":"1529","DOI":"10.1093\/jamia\/ocaa106","article-title":"The 2019 n2c2\/UMass Lowell shared task on clinical concept normalization","volume":"27","author":"Luo","year":"2020","journal-title":"J. Am. Med. Inf. Assoc."},{"key":"2024071210052083300_R48","article-title":"TTI-COIN at BioCreative VIII Track 1","author":"Matsubara","year":"2023"},{"key":"2024071210052083300_R49","article-title":"BioRED task NCU-IISR submission: preprocessing-robust ensemble learning approach for biomedical relation extraction","author":"Meesawad","year":"2023"},{"key":"2024071210052083300_R50","first-page":"pp. 3111","article-title":"Distributed representations of words and phrases and their compositionality","author":"Mikolov","year":"2013"},{"key":"2024071210052083300_R51","first-page":"pp. 179","article-title":"Overview of DisTEMIST at BioASQ: automatic detection and normalization of diseases from clinical texts: results, methods, evaluation and multilingual resources","author":"Miranda-Escalada","year":"2022"},{"key":"2024071210052083300_R52","doi-asserted-by":"publisher","DOI":"10.1093\/database\/baad080","article-title":"Overview of DrugProt task at BioCreative VII: data and methods for large-scale text mining and knowledge graph generation of heterogenous chemical\u2013protein relations","volume":"2023","author":"Miranda-Escalada","year":"2023","journal-title":"Database"},{"key":"2024071210052083300_R53","article-title":"Biomedical information extraction for disease gene prioritization","author":"Parmar","year":"2020"},{"key":"2024071210052083300_R54","article-title":"Probability model with ensemble learning and data augmentation for named entity recognition (NER) and relation extraction (RE) tasks","author":"Phan","year":"2023"},{"key":"2024071210052083300_R55","first-page":"pp. 54","article-title":"SemEval-2014 Task 7: analysis of clinical text","author":"Pradhan","year":"2014"},{"key":"2024071210052083300_R56","article-title":"Task 1: ShARe\/CLEF eHealth evaluation lab 2013","author":"Pradhan","year":"2013"},{"key":"2024071210052083300_R57","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1214\/10-BA521","article-title":"Exploring the limits of transfer learning with a unified text-to-text transformer","volume":"21","author":"Raffel","year":"2020","journal-title":"J. Mach. Learn. Res."},{"key":"2024071210052083300_R58","first-page":"pp. 147","article-title":"Design challenges and misconceptions in named entity recognition","author":"Ratinov","year":"2009"},{"key":"2024071210052083300_R59","article-title":"An end-to-end approach for asserted named entity recognition and relationship extraction in biomedical text","author":"Salem","year":"2023"},{"key":"2024071210052083300_R60","doi-asserted-by":"crossref","DOI":"10.1093\/bioinformatics\/btae564","article-title":"HunFlair2 in a cross-corpus evaluation of biomedical named entity recognition and normalization tools","author":"S\u00e4nger","year":"2024"},{"key":"2024071210052083300_R61","first-page":"pp. 43","article-title":"Overview of the Second Social Media Mining for Health (SMM4H) shared tasks at AMIA 2017","author":"Sarker","year":"2017"},{"key":"2024071210052083300_R62","article-title":"UIUC-BioNLP @ BioCreative VIII BioRED Track","author":"Sarol","year":"2023"},{"key":"2024071210052083300_R63","doi-asserted-by":"publisher","DOI":"10.1093\/database\/baaa062","article-title":"Ncbi taxonomy: a comprehensive update on curation, resources and tools","volume":"2020","author":"Schoch","year":"2020","journal-title":"Database"},{"key":"2024071210052083300_R64","doi-asserted-by":"publisher","first-page":"352","DOI":"10.1093\/nar\/28.1.352","article-title":"dbsnp: a database of single nucleotide polymorphisms","volume":"28","author":"Smigielski","year":"2000","journal-title":"Nucleic Acids Res."},{"key":"2024071210052083300_R65","doi-asserted-by":"publisher","DOI":"10.1093\/bib\/bbab282","article-title":"Deep learning methods for biomedical named entity recognition: a survey and qualitative comparison","volume":"22","author":"Song","year":"2021","journal-title":"Briefings Bioinf."},{"key":"2024071210052083300_R66","doi-asserted-by":"publisher","first-page":"4837","DOI":"10.1093\/bioinformatics\/btac598","article-title":"BERN2: an advanced neural biomedical named entity recognition and normalization tool","volume":"38","author":"Sung","year":"2022","journal-title":"Bioinformatics"},{"key":"2024071210052083300_R67"},{"key":"2024071210052083300_R68","doi-asserted-by":"publisher","DOI":"10.1093\/nar\/gkae235","article-title":"PubTator 3.0: an AI-powered literature resource for unlocking biomedical knowledge","author":"Wei","year":"2024","journal-title":"Nucleic Acids Research"},{"key":"2024071210052083300_R69","doi-asserted-by":"publisher","first-page":"W587","DOI":"10.1093\/nar\/gkz389","article-title":"PubTator central: automated concept annotation for biomedical full text articles","volume":"47","author":"Wei","year":"2019","journal-title":"Nucleic Acids Res."},{"key":"2024071210052083300_R70","doi-asserted-by":"publisher","first-page":"4449","DOI":"10.1093\/bioinformatics\/btac537","article-title":"tmVar 3.0: an improved variant concept recognition and normalization tool","volume":"38","author":"Wei","year":"2022","journal-title":"Bioinformatics"},{"key":"2024071210052083300_R71","doi-asserted-by":"publisher","DOI":"10.1093\/database\/bas041","article-title":"Accelerating literature curation with text-mining tools: a case study of using PubTator to curate genes in PubMed abstracts","volume":"2012","author":"Wei","year":"2012","journal-title":"Database"},{"key":"2024071210052083300_R72","first-page":"pp. 145","article-title":"PubTator: a PubMed-like interactive curation system for document triage and literature curation","author":"Wei","year":"2012"},{"key":"2024071210052083300_R73","doi-asserted-by":"publisher","first-page":"W518","DOI":"10.1093\/nar\/gkt441","article-title":"PubTator: a web-based text mining tool for assisting biocuration","volume":"41","author":"Wei","year":"2013","journal-title":"Nucleic Acids Res."},{"key":"2024071210052083300_R74","doi-asserted-by":"publisher","DOI":"10.1093\/bioinformatics\/btad599","article-title":"GNorm2: an improved gene name recognition and normalization system","volume":"39","author":"Wei","year":"2023","journal-title":"Bioinformatics"},{"key":"2024071210052083300_R75","doi-asserted-by":"publisher","DOI":"10.1093\/database\/baw032","article-title":"Assessing the state of the art in biomedical relation extraction: overview of the BioCreative V chemical-disease relation (CDR) task","volume":"2016","author":"Wei","year":"2016","journal-title":"Database"},{"key":"2024071210052083300_R76","first-page":"pp. 2024","article-title":"Masked conditional random fields for sequence labeling","author":"Wei","year":"2021"},{"key":"2024071210052083300_R77","first-page":"pp. 38","article-title":"Transformers: State-of-the-art natural language processing","author":"Wolf","year":"2020"},{"key":"2024071210052083300_R78","article-title":"Clinical relation extraction using transformer-based models","author":"Yang","year":"2021"},{"key":"2024071210052083300_R79","doi-asserted-by":"publisher","first-page":"pp. 8003","DOI":"10.18653\/v1\/2022.acl-long.551","article-title":"Linkbert: Pretraining language models with document links.","author":"Yasunaga","year":"2022"}],"container-title":["Database"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/database\/article-pdf\/doi\/10.1093\/database\/baae057\/58519032\/baae057.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/database\/article-pdf\/doi\/10.1093\/database\/baae057\/58519032\/baae057.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,22]],"date-time":"2024-11-22T07:35:08Z","timestamp":1732260908000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/database\/article\/doi\/10.1093\/database\/baae057\/7712641"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024]]},"references-count":79,"URL":"https:\/\/doi.org\/10.1093\/database\/baae057","relation":{},"ISSN":["1758-0463"],"issn-type":[{"value":"1758-0463","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2024]]},"published":{"date-parts":[[2024]]},"article-number":"baae057"}}