{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,26]],"date-time":"2026-03-26T15:59:45Z","timestamp":1774540785942,"version":"3.50.1"},"reference-count":29,"publisher":"Oxford University Press (OUP)","issue":"9","license":[{"start":{"date-parts":[[2016,10,2]],"date-time":"2016-10-02T00:00:00Z","timestamp":1475366400000},"content-version":"vor","delay-in-days":989,"URL":"http:\/\/creativecommons.org\/licenses\/by\/3.0\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2014,5,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:p>Motivation: The de novo assembly of large, complex genomes is a significant challenge with currently available DNA sequencing technology. While many de novo assembly software packages are available, comparatively little attention has been paid to assisting the user with the assembly.<\/jats:p>\n               <jats:p>Results: This article addresses the practical aspects of de novo assembly by introducing new ways to perform quality assessment on a collection of sequence reads. The software implementation calculates per-base error rates, paired-end fragment-size distributions and coverage metrics in the absence of a reference genome. Additionally, the software will estimate characteristics of the sequenced genome, such as repeat content and heterozygosity that are key determinants of assembly difficulty.<\/jats:p>\n               <jats:p>Availability: The software described is freely available online (https:\/\/github.com\/jts\/sga) and open source under the GNU Public License.<\/jats:p>\n               <jats:p>Contact: \u00a0jared.simpson@oicr.on.ca<\/jats:p>\n               <jats:p>Supplementary Information: \u00a0Supplementary data are available at Bioinformatics online.<\/jats:p>","DOI":"10.1093\/bioinformatics\/btu023","type":"journal-article","created":{"date-parts":[[2014,1,19]],"date-time":"2014-01-19T01:24:37Z","timestamp":1390094677000},"page":"1228-1235","source":"Crossref","is-referenced-by-count":141,"title":["Exploring genome characteristics and sequence quality without a reference"],"prefix":"10.1093","volume":"30","author":[{"given":"Jared T.","family":"Simpson","sequence":"first","affiliation":[{"name":"Ontario Institute for Cancer Research, Toronto, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2014,1,17]]},"reference":[{"key":"2023012710502968700_btu023-B1","doi-asserted-by":"crossref","first-page":"10","DOI":"10.1186\/2047-217X-2-10","article-title":"Assemblathon 2: evaluating de novo methods of genome assembly in three vertebrate species","volume":"2","author":"Bradnam","year":"2013","journal-title":"GigaScience"},{"issue":"1","key":"2023012710502968700_btu023-B2","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1093\/bioinformatics\/btt310","article-title":"Informed and automated k-mer size selection for genome assembly","volume":"30","author":"Chikhi","year":"2014","journal-title":"Bioinformatics"},{"key":"2023012710502968700_btu023-B3","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1111\/j.2517-6161.1977.tb01600.x","article-title":"Maximum likelihood from incomplete data via the EM algorithm","volume":"39","author":"Dempster","year":"1977","journal-title":"Journal of the Royal Statistical Society. Series B (Methodological)"},{"key":"2023012710502968700_btu023-B4","doi-asserted-by":"crossref","first-page":"e105","DOI":"10.1093\/nar\/gkn425","article-title":"Substantial biases in ultra-short read data sets from high-throughput DNA sequencing","volume":"36","author":"Dohm","year":"2008","journal-title":"Nucleic Acids Res."},{"key":"2023012710502968700_btu023-B5","article-title":"Hapsembler: an assembler for highly polymorphic genomes","volume-title":"Proceedings of the 15th Annual International Conference on Research in Computational Molecular Biology","author":"Donmez","year":"2001"},{"key":"2023012710502968700_btu023-B6","doi-asserted-by":"crossref","first-page":"390","DOI":"10.1109\/SFCS.2000.892127","article-title":"Opportunistic data structures with applications","volume-title":"Proceedings 41st Annual Symposium on Foundations of Computer Science","author":"Ferragina","year":"2000"},{"key":"2023012710502968700_btu023-B7","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-540-30213-1_23","article-title":"An alphabet-friendly FM-index","volume-title":"String Processing and Information Retrieval","author":"Ferragina","year":"2004"},{"key":"2023012710502968700_btu023-B8","doi-asserted-by":"crossref","first-page":"659","DOI":"10.1093\/jhered\/esp086","article-title":"Genome 10K: A proposal to obtain Whole-Genome sequence for 10000 vertebrate species","volume":"100","author":"Genome 10K Community of Scientists","year":"2009","journal-title":"J. Heredity"},{"key":"2023012710502968700_btu023-B9","doi-asserted-by":"crossref","first-page":"546","DOI":"10.1126\/science.274.5287.546","article-title":"Life with 6000 genes","volume":"274","author":"Goffeau","year":"1996","journal-title":"Science (New York, N.Y.)"},{"key":"2023012710502968700_btu023-B10","doi-asserted-by":"crossref","first-page":"666","DOI":"10.1186\/1471-2164-13-666","article-title":"The effect of strand bias in illumina short-read sequencing data","volume":"13","author":"Guo","year":"2012","journal-title":"BMC Genomics"},{"key":"2023012710502968700_btu023-B11","doi-asserted-by":"crossref","first-page":"226","DOI":"10.1038\/ng.1028","article-title":"De novo assembly and genotyping of variants using colored de bruijn graphs","volume":"44","author":"Iqbal","year":"2012","journal-title":"Nat. Genet."},{"key":"2023012710502968700_btu023-B12","doi-asserted-by":"crossref","first-page":"e1002541","DOI":"10.1371\/journal.pcbi.1002541","article-title":"A platform-Independent method for detecting errors in metagenomic sequencing data: DRISEE","volume":"8","author":"Keegan","year":"2012","journal-title":"PLoS Comput. Biol."},{"issue":"11","key":"2023012710502968700_btu023-B13","doi-asserted-by":"crossref","first-page":"R116","DOI":"10.1186\/gb-2010-11-11-r116","article-title":"Quake: quality-aware detection and correction of sequencing errors","volume":"11","author":"Kelley","year":"2010","journal-title":"Genome Biol."},{"key":"2023012710502968700_btu023-B14","doi-asserted-by":"crossref","first-page":"21","DOI":"10.1186\/1471-2105-11-21","article-title":"Assembly complexity of prokaryotic genomes using short reads","volume":"11","author":"Kingsford","year":"2010","journal-title":"BMC Bioinform."},{"key":"2023012710502968700_btu023-B15","doi-asserted-by":"crossref","first-page":"291","DOI":"10.1038\/nmeth.1311","article-title":"Amplification-free illumina sequencing-library preparation facilitates improved mapping and assembly of (G+C)-biased genomes","volume":"6","author":"Kozarewa","year":"2009","journal-title":"Nat. Methods"},{"key":"2023012710502968700_btu023-B16","doi-asserted-by":"crossref","first-page":"231","DOI":"10.1016\/0888-7543(88)90007-9","article-title":"Genomic mapping by fingerprinting random clones: a mathematical analysis","volume":"2","author":"Lander","year":"1988","journal-title":"Genomics"},{"key":"2023012710502968700_btu023-B17","doi-asserted-by":"crossref","first-page":"311","DOI":"10.1038\/nature08696","article-title":"The sequence and de novo assembly of the giant panda genome","volume":"463","author":"Li","year":"2009","journal-title":"Nature"},{"key":"2023012710502968700_btu023-B18","doi-asserted-by":"crossref","first-page":"e90","DOI":"10.1093\/nar\/gkr344","article-title":"Sequence-specific error profile of illumina sequencers","volume":"39","author":"Nakamura","year":"2011","journal-title":"Nucleic Acids Res."},{"key":"2023012710502968700_btu023-B19","doi-asserted-by":"crossref","first-page":"13272","DOI":"10.1073\/pnas.1121464109","article-title":"Scaling metagenome sequence assembly with probabilistic de bruijn graphs","volume":"109","author":"Pell","year":"2012","journal-title":"Proc. Natl Acad. Sci. USA"},{"key":"2023012710502968700_btu023-B20","doi-asserted-by":"crossref","first-page":"9748","DOI":"10.1073\/pnas.171285098","article-title":"An eulerian path approach to DNA fragment assembly","volume":"98","author":"Pevzner","year":"2001","journal-title":"Proc. Natl Acad. Sci. USA"},{"key":"2023012710502968700_btu023-B21","doi-asserted-by":"crossref","first-page":"R51","DOI":"10.1186\/gb-2013-14-5-r51","article-title":"Characterizing and measuring bias in sequence data","volume":"14","author":"Ross","year":"2013","journal-title":"Genome Biol."},{"key":"2023012710502968700_btu023-B22","doi-asserted-by":"crossref","first-page":"e12681","DOI":"10.1371\/journal.pone.0012681","article-title":"Reference-Free validation of short read data","volume":"5","author":"Schr\u00f6der","year":"2010","journal-title":"PLoS ONE"},{"key":"2023012710502968700_btu023-B23","doi-asserted-by":"crossref","first-page":"549","DOI":"10.1101\/gr.126953.111","article-title":"Efficient de novo assembly of large genomes using compressed data structures","volume":"22","author":"Simpson","year":"2012","journal-title":"Genome Res."},{"key":"2023012710502968700_btu023-B24","doi-asserted-by":"crossref","first-page":"1117","DOI":"10.1101\/gr.089532.108","article-title":"ABySS: a parallel assembler for short read sequence data","volume":"19","author":"Simpson","year":"2009","journal-title":"Genome Res."},{"key":"2023012710502968700_btu023-B25","doi-asserted-by":"crossref","first-page":"189","DOI":"10.1038\/nature10158","article-title":"Genome sequence and analysis of the tuber crop potato","volume":"475","author":"The Potato Genome Sequencing Consortium","year":"2011","journal-title":"Nature"},{"key":"2023012710502968700_btu023-B26","doi-asserted-by":"crossref","first-page":"185","DOI":"10.1186\/1471-2105-13-185","article-title":"Estimation of sequencing error rates in short reads","volume":"13","author":"Wang","year":"2012","journal-title":"BMC Bioinform."},{"key":"2023012710502968700_btu023-B27","doi-asserted-by":"crossref","first-page":"401","DOI":"10.1101\/gr.7.5.401","article-title":"Human Whole-Genome shotgunsequencing","volume":"7","author":"Weber","year":"1997","journal-title":"Genome Res."},{"key":"2023012710502968700_btu023-B28","doi-asserted-by":"crossref","first-page":"821","DOI":"10.1101\/gr.074492.107","article-title":"Velvet: Algorithms for de novo short read assembly using de bruijn graphs","volume":"18","author":"Zerbino","year":"2008","journal-title":"Genome Res."},{"key":"2023012710502968700_btu023-B29","doi-asserted-by":"crossref","first-page":"49","DOI":"10.1038\/nature11413","article-title":"The oyster genome reveals stress adaptation and complexity of shell formation","volume":"490","author":"Zhang","year":"2012","journal-title":"Nature"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/30\/9\/1228\/48922583\/bioinformatics_30_9_1228.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/30\/9\/1228\/48922583\/bioinformatics_30_9_1228.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,27]],"date-time":"2023-01-27T11:28:53Z","timestamp":1674818933000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/30\/9\/1228\/237596"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014,1,17]]},"references-count":29,"journal-issue":{"issue":"9","published-print":{"date-parts":[[2014,5,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btu023","relation":{},"ISSN":["1367-4811","1367-4803"],"issn-type":[{"value":"1367-4811","type":"electronic"},{"value":"1367-4803","type":"print"}],"subject":[],"published-other":{"date-parts":[[2014,5,1]]},"published":{"date-parts":[[2014,1,17]]}}}