{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T22:26:19Z","timestamp":1778883979537,"version":"3.51.4"},"reference-count":26,"publisher":"Oxford University Press (OUP)","issue":"11","license":[{"start":{"date-parts":[[2025,11,9]],"date-time":"2025-11-09T00:00:00Z","timestamp":1762646400000},"content-version":"vor","delay-in-days":8,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,11,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Motivation<\/jats:title>\n                    <jats:p>DNA-based data storage offers a compelling solution for long-term, high-density archiving. In this framework, accurately reconstructing high-quality encoded sequences after sequencing is critical, as it directly impacts the design of error-correcting codes optimized for DNA storage. Furthermore, efficient and scalable processing is essential to manage the large volumes of data expected in such applications.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>We introduce a novel method based on de-Bruijn graph partitioning, enabling fast and accurate processing of sequencing data regardless of the underlying sequencing technology and without requiring prior knowledge of the information encoded in the oligonucleotides. Evaluated on both synthetic and real datasets, the method achieves excellent precision and recall. It is implemented in C++ within the software ConCluD and optimized for multi-core servers. Our experiments show that a dataset of 89 million reads, corresponding to a 10 GB fasta file, can be fully processed in less than a minute on a standard 32-cores server.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Availability and implementation<\/jats:title>\n                    <jats:p>The ConCluD software and the scripts to reproduce the experiments from this paper are available at https:\/\/gitlab.inria.fr\/pim\/org.pim.dnarxiv under the GNU AGPLv3 licence. An archival snapshot of the repository is also provided at https:\/\/doi.org\/10.5281\/zenodo.17160067.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btaf618","type":"journal-article","created":{"date-parts":[[2025,11,7]],"date-time":"2025-11-07T13:04:35Z","timestamp":1762520675000},"source":"Crossref","is-referenced-by-count":1,"title":["De-Bruijn graph partitioning for scalable and accurate DNA storage processing"],"prefix":"10.1093","volume":"41","author":[{"given":"Florestan","family":"De Moor","sequence":"first","affiliation":[{"name":"IRISA, CNRS , Rennes, 35042,","place":["France"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Olivier","family":"Boull\u00e9","sequence":"additional","affiliation":[{"name":"IRISA, CNRS , Rennes, 35042,","place":["France"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2557-680X","authenticated-orcid":false,"given":"Dominique","family":"Lavenier","sequence":"additional","affiliation":[{"name":"IRISA, CNRS , Rennes, 35042,","place":["France"]}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2025,11,9]]},"reference":[{"key":"2025111511270521600_btaf618-B1","author":"Appuswamy","year":"2019"},{"key":"2025111511270521600_btaf618-B2","doi-asserted-by":"crossref","first-page":"2502","DOI":"10.1093\/bioinformatics\/btr447","article-title":"Seed: efficient clustering of next-generation sequences","volume":"27","author":"Bao","year":"2011","journal-title":"Bioinformatics"},{"key":"2025111511270521600_btaf618-B3","doi-asserted-by":"crossref","first-page":"54348","DOI":"10.1109\/ACCESS.2022.3176954","article-title":"A deep embedded clustering algorithm for the binning of metagenomic sequences","volume":"10","author":"Bao","year":"2022","journal-title":"IEEE Access"},{"key":"2025111511270521600_btaf618-B4","doi-asserted-by":"crossref","first-page":"btae274","DOI":"10.1093\/bioinformatics\/btae274","article-title":"GradHC: highly reliable gradual hash-based clustering for DNA storage systems","volume":"40","author":"Ben Shabat","year":"2024","journal-title":"Bioinformatics"},{"key":"2025111511270521600_btaf618-B5","doi-asserted-by":"crossref","first-page":"456","DOI":"10.1038\/s41576-019-0125-3","article-title":"Molecular digital data storage using DNA","volume":"20","author":"Ceze","year":"2019","journal-title":"Nat Rev Genet"},{"key":"2025111511270521600_btaf618-B6","doi-asserted-by":"crossref","first-page":"108","DOI":"10.1186\/s12859-022-04643-9","article-title":"Clustering biological sequences with dynamic sequence similarity threshold","volume":"23","author":"Chiu","year":"2022","journal-title":"BMC Bioinformatics"},{"key":"2025111511270521600_btaf618-B7","doi-asserted-by":"crossref","first-page":"1628","DOI":"10.1126\/science.1226355","article-title":"Next-generation digital information storage in DNA","volume":"337","author":"Church","year":"2012","journal-title":"Science"},{"key":"2025111511270521600_btaf618-B8","author":"Curham","year":"2024"},{"key":"2025111511270521600_btaf618-B9","doi-asserted-by":"crossref","first-page":"2460","DOI":"10.1093\/bioinformatics\/btq461","article-title":"Search and clustering orders of magnitude faster than blast","volume":"26","author":"Edgar","year":"2010","journal-title":"Bioinformatics"},{"key":"2025111511270521600_btaf618-B10","doi-asserted-by":"crossref","first-page":"950","DOI":"10.1126\/science.aaj2038","article-title":"DNA fountain enables a robust and efficient storage architecture","volume":"355","author":"Erlich","year":"2017","journal-title":"Science"},{"key":"2025111511270521600_btaf618-B11","doi-asserted-by":"crossref","first-page":"3150","DOI":"10.1093\/bioinformatics\/bts565","article-title":"CD-HIT: accelerated for clustering the next-generation sequencing data","volume":"28","author":"Fu","year":"2012","journal-title":"Bioinformatics"},{"key":"2025111511270521600_btaf618-B12","doi-asserted-by":"crossref","first-page":"536","DOI":"10.1186\/s12859-018-2579-2","article-title":"NGmerge: merging paired-end reads via novel empirically-derived models of sequencing errors","volume":"19","author":"Gaspar","year":"2018","journal-title":"BMC Bioinformatics"},{"key":"2025111511270521600_btaf618-B13","doi-asserted-by":"crossref","first-page":"271","DOI":"10.1186\/1471-2105-12-271","article-title":"DNACLUST: accurate and efficient clustering of phylogenetic marker genes","volume":"12","author":"Ghodsi","year":"2011","journal-title":"BMC Bioinformatics"},{"key":"2025111511270521600_btaf618-B14","doi-asserted-by":"crossref","first-page":"77","DOI":"10.1038\/nature11875","article-title":"Towards practical, high-capacity, low-maintenance information storage in synthesized DNA","volume":"494","author":"Goldman","year":"2013","journal-title":"Nature"},{"key":"2025111511270521600_btaf618-B15","doi-asserted-by":"crossref","first-page":"593","DOI":"10.1093\/bioinformatics\/btr708","article-title":"Art: a next-generation sequencing read simulator","volume":"28","author":"Huang","year":"2012","journal-title":"Bioinformatics"},{"key":"2025111511270521600_btaf618-B16","doi-asserted-by":"crossref","first-page":"e83","DOI":"10.1093\/nar\/gky315","article-title":"MeShClust: an intelligent tool for clustering DNA sequences","volume":"46","author":"James","year":"2018","journal-title":"Nucleic Acids Res"},{"key":"2025111511270521600_btaf618-B17","first-page":"178","author":"Marinelli"},{"key":"2025111511270521600_btaf618-B18","doi-asserted-by":"crossref","first-page":"86","DOI":"10.1038\/s41596-019-0244-5","article-title":"Reading and writing digital data in DNA","volume":"15","author":"Meiser","year":"2020","journal-title":"Nat Protoc"},{"key":"2025111511270521600_btaf618-B19","doi-asserted-by":"crossref","first-page":"lqac092","DOI":"10.1093\/nargab\/lqac092","article-title":"PBSIM3: a simulator for all types of PacBio and ONT long reads","volume":"4","author":"Ono","year":"2022","journal-title":"NAR Genom Bioinform"},{"key":"2025111511270521600_btaf618-B20","doi-asserted-by":"crossref","DOI":"10.1093\/bioinformatics\/btaf335","article-title":"Sequence analysis and decoding with extra low-quality reads for DNA data storage","volume":"41","author":"Park","year":"2025","journal-title":"Bioinformatics"},{"key":"2025111511270521600_btaf618-B21","doi-asserted-by":"crossref","first-page":"9748","DOI":"10.1073\/pnas.171285098","article-title":"An Eulerian path approach to DNA fragment assembly","volume":"98","author":"Pevzner","year":"2001","journal-title":"Proc Natl Acad Sci USA"},{"key":"2025111511270521600_btaf618-B22","first-page":"3362","article-title":"Clustering billions of reads for DNA data storage","volume":"30","author":"Rashtchian","year":"2017","journal-title":"Adv Neural Inf Process Syst"},{"key":"2025111511270521600_btaf618-B23","doi-asserted-by":"crossref","first-page":"195","DOI":"10.1016\/0022-2836(81)90087-5","article-title":"Identification of common molecular subsequences","volume":"147","author":"Smith","year":"1981","journal-title":"J Mol Biol"},{"key":"2025111511270521600_btaf618-B24","doi-asserted-by":"crossref","first-page":"5361","DOI":"10.1038\/s41467-022-33046-w","article-title":"Robust data storage in DNA by de Bruijn graph-based de novo strand assembly","volume":"13","author":"Song","year":"2022","journal-title":"Nat Commun"},{"key":"2025111511270521600_btaf618-B25","doi-asserted-by":"crossref","first-page":"2542","DOI":"10.1038\/s41467-018-04964-5","article-title":"Clustering huge protein sequence sets in linear time","volume":"9","author":"Steinegger","year":"2018","journal-title":"Nat Commun"},{"key":"2025111511270521600_btaf618-B26","doi-asserted-by":"crossref","first-page":"821","DOI":"10.1101\/gr.074492.107","article-title":"Velvet: algorithms for de novo short read assembly using de Bruijn graphs","volume":"18","author":"Zerbino","year":"2008","journal-title":"Genome Res"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/advance-article-pdf\/doi\/10.1093\/bioinformatics\/btaf618\/65248497\/btaf618.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/41\/11\/btaf618\/65248497\/btaf618.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/41\/11\/btaf618\/65248497\/btaf618.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,11,15]],"date-time":"2025-11-15T16:27:15Z","timestamp":1763224035000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/doi\/10.1093\/bioinformatics\/btaf618\/8317434"}},"subtitle":[],"editor":[{"given":"Inanc","family":"Birol","sequence":"additional","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2025,11,1]]},"references-count":26,"journal-issue":{"issue":"11","published-print":{"date-parts":[[2025,11,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btaf618","relation":{},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2025,11]]},"published":{"date-parts":[[2025,11,1]]},"article-number":"btaf618"}}