{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,26]],"date-time":"2026-02-26T20:34:54Z","timestamp":1772138094134,"version":"3.50.1"},"reference-count":36,"publisher":"Oxford University Press (OUP)","issue":"5","license":[{"start":{"date-parts":[[2019,2,20]],"date-time":"2019-02-20T00:00:00Z","timestamp":1550620800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/academic.oup.com\/journals\/pages\/open_access\/funder_policies\/chorus\/standard_publication_model"}],"funder":[{"name":"Fonds de la Recherche Scientifique de Belgique","award":["2.5020.11"],"award-info":[{"award-number":["2.5020.11"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,3,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Motivation<\/jats:title>\n                    <jats:p>Short-read accuracy is important for downstream analyses such as genome assembly and hybrid long-read correction. Despite much work on short-read correction, present-day correctors either do not scale well on large datasets or consider reads as mere suites of k-mers, without taking into account their full-length sequence information.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>We propose a new method to correct short reads using de Bruijn graphs and implement it as a tool called Bcool. As a first step, Bcool constructs a compacted de Bruijn graph from the reads. This graph is filtered on the basis of k-mer abundance then of unitig abundance, thereby removing most sequencing errors. The cleaned graph is then used as a reference on which the reads are mapped to correct them. We show that this approach yields more accurate reads than k-mer-spectrum correctors while being scalable to human-size genomic datasets and beyond.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Availability and implementation<\/jats:title>\n                    <jats:p>The implementation is open source, available at http:\/\/github.com\/Malfoy\/BCOOL under the Affero GPL license and as a Bioconda package.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Supplementary information<\/jats:title>\n                    <jats:p>Supplementary data are available at Bioinformatics online.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btz102","type":"journal-article","created":{"date-parts":[[2019,2,18]],"date-time":"2019-02-18T15:10:09Z","timestamp":1550502609000},"page":"1374-1381","source":"Crossref","is-referenced-by-count":32,"title":["Toward perfect reads: self-correction of short reads via mapping on de Bruijn graphs"],"prefix":"10.1093","volume":"36","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0669-4141","authenticated-orcid":false,"given":"Antoine","family":"Limasset","sequence":"first","affiliation":[{"name":"Evolutionary Biology & Ecology, Universit\u00e9 Libre de Bruxelles (ULB) , Bruxelles, Belgium"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4091-7916","authenticated-orcid":false,"given":"Jean-Fran\u00e7ois","family":"Flot","sequence":"additional","affiliation":[{"name":"Evolutionary Biology & Ecology, Universit\u00e9 Libre de Bruxelles (ULB) , Bruxelles, Belgium"},{"name":"Interuniversity Institute of Bioinformatics in Brussels \u2013 (IB) 2, Brussels, Belgium"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0776-6407","authenticated-orcid":false,"given":"Pierre","family":"Peterlongo","sequence":"additional","affiliation":[{"name":"Inria, CNRS, University of Rennes , IRISA, Rennes, France"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2019,2,20]]},"reference":[{"key":"2023060910264426300_btz102-B1","doi-asserted-by":"crossref","first-page":"20.","DOI":"10.1186\/s40246-016-0068-0","article-title":"A comparative study of k-spectrum-based error correction methods for next-generation sequencing data analysis","volume":"10","author":"Akogwu","year":"2016","journal-title":"Hum. Genomics"},{"key":"2023060910264426300_btz102-B2","volume-title":"European Conference on Computational Biology (ECCB)","author":"Benoit","year":"2014"},{"key":"2023060910264426300_btz102-B3","first-page":"336","volume-title":"J. Comput. Biol","author":"Chikhi","year":"2015"},{"key":"2023060910264426300_btz102-B4","doi-asserted-by":"crossref","first-page":"i201","DOI":"10.1093\/bioinformatics\/btw279","article-title":"Compacting de Bruijn graphs from sequencing data quickly and in low memory","volume":"32","author":"Chikhi","year":"2016","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B5","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1093\/bioinformatics\/btt310","article-title":"Informed and automated k-mer size selection for genome assembly","volume":"30","author":"Chikhi","year":"2014","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B6","doi-asserted-by":"crossref","first-page":"22.","DOI":"10.1186\/1748-7188-8-22","article-title":"Space-efficient and exact de Bruijn graph representation based on a Bloom filter","volume":"8","author":"Chikhi","year":"2013","journal-title":"Algorithms Mol. Biol"},{"key":"2023060910264426300_btz102-B7","doi-asserted-by":"crossref","first-page":"1306","DOI":"10.1126\/science.1067799","article-title":"Capturing chromosome conformation","volume":"295","author":"Dekker","year":"2002","journal-title":"Science"},{"key":"2023060910264426300_btz102-B8","doi-asserted-by":"crossref","first-page":"491","DOI":"10.1038\/ng.806","article-title":"A framework for variation discovery and genotyping using next-generation DNA sequencing data","volume":"43","author":"DePristo","year":"2011","journal-title":"Nat. Genet"},{"key":"2023060910264426300_btz102-B9","doi-asserted-by":"crossref","first-page":"2966","DOI":"10.1016\/j.febslet.2015.04.034","article-title":"Contact genomics: scaffolding and phasing (meta)genomes using chromosome 3D physical signatures","volume":"589","author":"Flot","year":"2015","journal-title":"FEBS Lett"},{"key":"2023060910264426300_btz102-B10","doi-asserted-by":"crossref","first-page":"1072","DOI":"10.1093\/bioinformatics\/btt086","article-title":"QUAST: quality assessment tool for genome assemblies","volume":"29","author":"Gurevich","year":"2013","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B11","doi-asserted-by":"crossref","first-page":"239.","DOI":"10.1186\/s13059-016-1103-0","article-title":"The Oxford Nanopore MinION: delivery of nanopore sequencing to the genomics community","volume":"17","author":"Jain","year":"2016","journal-title":"Genome Biol"},{"key":"2023060910264426300_btz102-B12","doi-asserted-by":"crossref","first-page":"296","DOI":"10.1038\/nbt.3500","article-title":"Haplotypes drop by drop: short-read sequencing provides haplotype information when long DNA fragments are barcoded in microfluidic droplets","volume":"34","author":"Kitzman","year":"2016","journal-title":"Nat. Biotechnol"},{"key":"2023060910264426300_btz102-B13","doi-asserted-by":"crossref","first-page":"357","DOI":"10.1038\/nmeth.1923","article-title":"Fast gapped-read alignment with Bowtie 2","volume":"9","author":"Langmead","year":"2012","journal-title":"Nat. Methods"},{"key":"2023060910264426300_btz102-B14","doi-asserted-by":"crossref","first-page":"1838","DOI":"10.1093\/bioinformatics\/bts280","article-title":"Exploring single-sample SNP and INDEL calling with whole-genome de novo assembly","volume":"28","author":"Li","year":"2012","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B15","doi-asserted-by":"crossref","first-page":"2885","DOI":"10.1093\/bioinformatics\/btv290","article-title":"BFC: correcting Illumina sequencing errors","volume":"31","author":"Li","year":"2015","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B16","doi-asserted-by":"crossref","first-page":"1754","DOI":"10.1093\/bioinformatics\/btp324","article-title":"Fast and accurate short read alignment with Burrows\u2013Wheeler transform","volume":"25","author":"Li","year":"2009","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B17","doi-asserted-by":"crossref","first-page":"1124","DOI":"10.1101\/gr.088013.108","article-title":"SNP detection for massively parallel whole-genome resequencing","volume":"19","author":"Li","year":"2009","journal-title":"Genome Res"},{"key":"2023060910264426300_btz102-B18","doi-asserted-by":"crossref","first-page":"237.","DOI":"10.1186\/s12859-016-1103-9","article-title":"Read mapping on de Bruijn graphs","volume":"17","author":"Limasset","year":"2016","journal-title":"BMC Bioinform"},{"key":"2023060910264426300_btz102-B19","first-page":"25:1","article-title":"Fast and scalable minimal perfect hashing for massive key sets","volume-title":"Proceedings of the 16th International Symposium on Experimental Algorithms (SEA 2017), London, UK, June 21-23, 2017, Leibniz International Proceedings in Informatics Volume 75","author":"Limasset","year":"2017"},{"key":"2023060910264426300_btz102-B20","doi-asserted-by":"crossref","first-page":"308","DOI":"10.1093\/bioinformatics\/bts690","article-title":"Musket: a multistage k-mer spectrum-based error corrector for Illumina sequence data","volume":"29","author":"Liu","year":"2013","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B21","doi-asserted-by":"crossref","first-page":"733","DOI":"10.1038\/nmeth.3444","article-title":"A complete bacterial genome assembled de novo using only nanopore sequencing data","volume":"12","author":"Loman","year":"2015","journal-title":"Nat. Methods"},{"key":"2023060910264426300_btz102-B22","doi-asserted-by":"crossref","first-page":"5695","DOI":"10.1038\/ncomms6695","article-title":"High-quality genome (re)assembly using chromosomal contact data","volume":"5","author":"Marie-Nelly","year":"2014","journal-title":"Nat. Commun"},{"key":"2023060910264426300_btz102-B23","doi-asserted-by":"crossref","first-page":"1324","DOI":"10.1093\/bioinformatics\/btw832","article-title":"ntCard: a streaming algorithm for cardinality estimation in genomics data","volume":"33","author":"Mohamadi","year":"2017","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B24","doi-asserted-by":"crossref","first-page":"897","DOI":"10.1089\/cmb.2009.0005","article-title":"Parametric complexity of sequence assembly: theory and applications to next generation sequencing","volume":"16","author":"Nagarajan","year":"2009","journal-title":"J. Comput. Biol"},{"key":"2023060910264426300_btz102-B25","doi-asserted-by":"crossref","first-page":"119","DOI":"10.1093\/bioinformatics\/bts649","article-title":"PBSIM: PacBio reads simulator\u2014toward accurate genome assembly","volume":"29","author":"Ono","year":"2013","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B26","doi-asserted-by":"crossref","first-page":"9748","DOI":"10.1073\/pnas.171285098","article-title":"An Eulerian path approach to DNA fragment assembly","volume":"98","author":"Pevzner","year":"2001","journal-title":"Proc. Natl. Acad. Sci"},{"key":"2023060910264426300_btz102-B27","doi-asserted-by":"crossref","first-page":"3506","DOI":"10.1093\/bioinformatics\/btu538","article-title":"LoRDEC: accurate and efficient long read error correction","volume":"30","author":"Salmela","year":"2014","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B28","doi-asserted-by":"crossref","first-page":"1455","DOI":"10.1093\/bioinformatics\/btr170","article-title":"Correcting errors in short reads by multiple alignments","volume":"27","author":"Salmela","year":"2011","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B29","doi-asserted-by":"crossref","first-page":"799","DOI":"10.1093\/bioinformatics\/btw321","article-title":"Accurate self-correction of errors in long reads using de Bruijn graphs","volume":"33","author":"Salmela","year":"2017","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B30","doi-asserted-by":"crossref","first-page":"2157","DOI":"10.1093\/bioinformatics\/btp379","article-title":"SHREC: a short-read error correction method","volume":"25","author":"Schr\u00f6der","year":"2009","journal-title":"Bioinformatics"},{"key":"2023060910264426300_btz102-B31","doi-asserted-by":"crossref","first-page":"62.","DOI":"10.1186\/s12915-017-0399-x","article-title":"The house spider genome reveals an ancient whole-genome duplication during arachnid evolution","volume":"15","author":"Schwager","year":"2017","journal-title":"BMC Biol"},{"key":"2023060910264426300_btz102-B32","doi-asserted-by":"crossref","first-page":"48.","DOI":"10.1186\/s13742-015-0089-y","article-title":"Rcorrector: efficient and accurate error correction for Illumina RNA-seq reads","volume":"4","author":"Song","year":"2015","journal-title":"GigaScience"},{"key":"2023060910264426300_btz102-B33","doi-asserted-by":"crossref","first-page":"509.","DOI":"10.1186\/s13059-014-0509-9","article-title":"Lighter: fast and memory-efficient sequencing error correction without counting","volume":"15","author":"Song","year":"2014","journal-title":"Genome Biol"},{"key":"2023060910264426300_btz102-B34","doi-asserted-by":"crossref","first-page":"e1005595.","DOI":"10.1371\/journal.pcbi.1005595","article-title":"Unicycler: resolving bacterial genome assemblies from short and long sequencing reads","volume":"13","author":"Wick","year":"2017","journal-title":"PLoS Comput. Biol"},{"key":"2023060910264426300_btz102-B35","doi-asserted-by":"crossref","first-page":"56","DOI":"10.1093\/bib\/bbs015","article-title":"A survey of error-correction methods for next-generation sequencing","volume":"14","author":"Yang","year":"2013","journal-title":"Brief. Bioinform"},{"key":"2023060910264426300_btz102-B36","doi-asserted-by":"crossref","first-page":"725","DOI":"10.1093\/bioinformatics\/btx675","article-title":"ARCS: scaffolding genome drafts with linked reads","volume":"34","author":"Yeo","year":"2017","journal-title":"Bioinformatics"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/academic.oup.com\/bioinformatics\/advance-article-pdf\/doi\/10.1093\/bioinformatics\/btz102\/32091781\/btz102.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/36\/5\/1374\/50552810\/bioinformatics_36_5_1374.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/36\/5\/1374\/50552810\/bioinformatics_36_5_1374.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,6,9]],"date-time":"2023-06-09T06:27:21Z","timestamp":1686292041000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/36\/5\/1374\/5345559"}},"subtitle":[],"editor":[{"given":"Alfonso","family":"Valencia","sequence":"additional","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2019,2,20]]},"references-count":36,"journal-issue":{"issue":"5","published-print":{"date-parts":[[2020,3,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btz102","relation":{"has-preprint":[{"id-type":"doi","id":"10.1101\/558395","asserted-by":"object"}]},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2020,3]]},"published":{"date-parts":[[2019,2,20]]}}}