{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,26]],"date-time":"2026-02-26T20:34:42Z","timestamp":1772138082264,"version":"3.50.1"},"reference-count":40,"publisher":"Oxford University Press (OUP)","issue":"15","license":[{"start":{"date-parts":[[2017,3,15]],"date-time":"2017-03-15T00:00:00Z","timestamp":1489536000000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc\/4.0\/"}],"funder":[{"DOI":"10.13039\/100000002","name":"National Institutes of Health","doi-asserted-by":"publisher","award":["R01-GM101352"],"award-info":[{"award-number":["R01-GM101352"]}],"id":[{"id":"10.13039\/100000002","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000002","name":"National Institutes of Health","doi-asserted-by":"publisher","award":["R01-HG007178"],"award-info":[{"award-number":["R01-HG007178"]}],"id":[{"id":"10.13039\/100000002","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["DBI-1356548"],"award-info":[{"award-number":["DBI-1356548"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017,8,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Motivation<\/jats:title>\n                    <jats:p>Accurate identification of genotypes is an essential part of the analysis of genomic data, including in identification of sequence polymorphisms, linking mutations with disease and determining mutation rates. Biological and technical processes that adversely affect genotyping include copy-number-variation, paralogous sequences, library preparation, sequencing error and reference-mapping biases, among others.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>We modeled the read depth for all data as a mixture of Dirichlet-multinomial distributions, resulting in significant improvements over previously used models. In most cases the best model was comprised of two distributions. The major-component distribution is similar to a binomial distribution with low error and low reference bias. The minor-component distribution is overdispersed with higher error and reference bias. We also found that sites fitting the minor component are enriched for copy number variants and low complexity regions, which can produce erroneous genotype calls. By removing sites that do not fit the major component, we can improve the accuracy of genotype calls.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Availability and Implementation<\/jats:title>\n                    <jats:p>Methods and data files are available at https:\/\/github.com\/CartwrightLab\/WuEtAl2017\/ (doi:10.5281\/zenodo.256858).<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Supplementary information<\/jats:title>\n                    <jats:p>Supplementary data is available at Bioinformatics online.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btx133","type":"journal-article","created":{"date-parts":[[2017,3,7]],"date-time":"2017-03-07T15:11:30Z","timestamp":1488899490000},"page":"2322-2329","source":"Crossref","is-referenced-by-count":16,"title":["Estimating error models for whole genome sequencing using mixtures of Dirichlet-multinomial distributions"],"prefix":"10.1093","volume":"33","author":[{"given":"Steven H","family":"Wu","sequence":"first","affiliation":[{"name":"The Biodesign Institute, Arizona State University, Tempe, AZ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rachel S","family":"Schwartz","sequence":"additional","affiliation":[{"name":"The Biodesign Institute, Arizona State University, Tempe, AZ, USA"},{"name":"Department of Biological Sciences, The University of Rhode Island, Kingston, RI, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"David J","family":"Winter","sequence":"additional","affiliation":[{"name":"The Biodesign Institute, Arizona State University, Tempe, AZ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Donald F","family":"Conrad","sequence":"additional","affiliation":[{"name":"Department of Genetics, Department of Pathology and Immunology, Washington University School of Medicine, Saint Louis, MO, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Reed A","family":"Cartwright","sequence":"additional","affiliation":[{"name":"The Biodesign Institute, Arizona State University, Tempe, AZ, USA"},{"name":"School of Life Sciences, Arizona State University, Tempe, AZ, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2017,3,15]]},"reference":[{"key":"2023063012494483600_btx133-B1","doi-asserted-by":"crossref","first-page":"1061","DOI":"10.1038\/nature09534","article-title":"A map of human genome variation from population-scale sequencing","volume":"467","author":"1000 Genomes Project Consortium","year":"2010","journal-title":"Nature"},{"key":"2023063012494483600_btx133-B2","doi-asserted-by":"crossref","first-page":"68","DOI":"10.1038\/nature15393","article-title":"A global reference for human genetic variation","volume":"526","author":"1000 Genomes Project Consortium","year":"2015","journal-title":"Nature"},{"key":"2023063012494483600_btx133-B3","doi-asserted-by":"crossref","first-page":"316","DOI":"10.1016\/j.ajhg.2010.07.019","article-title":"Direct measure of the de novo mutation rate in autism and schizophrenia cohorts","volume":"87","author":"Awadalla","year":"2010","journal-title":"Am J Hum Genet"},{"key":"2023063012494483600_btx133-B4","doi-asserted-by":"crossref","first-page":"6","DOI":"10.2202\/1544-6115.1713","article-title":"A family-based probabilistic method for capturing de novo mutations from high-throughput short-read sequencing data","volume":"11","author":"Cartwright","year":"2012","journal-title":"Stat Appl Genet Mol Biol"},{"key":"2023063012494483600_btx133-B5","doi-asserted-by":"crossref","first-page":"3207","DOI":"10.1093\/bioinformatics\/btp579","article-title":"Effect of read-mapping biases on detecting allele-specific expression from RNA-sequencing data","volume":"25","author":"Degner","year":"2009","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B6","doi-asserted-by":"crossref","first-page":"491","DOI":"10.1038\/ng.806","article-title":"A framework for variation discovery and genotyping using next-generation DNA sequencing data","volume":"43","author":"DePristo","year":"2011","journal-title":"Nat Genet"},{"key":"2023063012494483600_btx133-B7","doi-asserted-by":"crossref","first-page":"1512","DOI":"10.1038\/srep01512","article-title":"Using false discovery rates to benchmark SNP-callers in next-generation sequencing projects","volume":"3","author":"Farrer","year":"2013","journal-title":"Sci Rep"},{"key":"2023063012494483600_btx133-B8","first-page":"1000106","article-title":"Accuracy of next generation sequencing platforms","volume":"1","author":"Fox","year":"2014","journal-title":"Next Gener Seq Appl"},{"key":"2023063012494483600_btx133-B9","doi-asserted-by":"crossref","first-page":"e28819.","DOI":"10.1371\/journal.pone.0028819","article-title":"Gentle masking of low-complexity sequences improves homology search","volume":"6","author":"Frith","year":"2011","journal-title":"PloS One"},{"key":"2023063012494483600_btx133-B10","doi-asserted-by":"crossref","first-page":"460","DOI":"10.1038\/nrg3455","article-title":"Sequencing studies in human genetics: design and interpretation","volume":"14","author":"Goldstein","year":"2013","journal-title":"Nat Rev Genet"},{"key":"2023063012494483600_btx133-B11","doi-asserted-by":"crossref","first-page":"730","DOI":"10.1093\/bioinformatics\/btq040","article-title":"SNVMix: predicting single nucleotide variants from next-generation sequencing of tumors","volume":"26","author":"Goya","year":"2010","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B12","doi-asserted-by":"crossref","first-page":"R32.","DOI":"10.1186\/gb-2009-10-3-r32","article-title":"Evaluation of next generation sequencing platforms for population targeted sequencing studies","volume":"10","author":"Harismendy","year":"2009","journal-title":"Genome Biol"},{"key":"2023063012494483600_btx133-B13","doi-asserted-by":"crossref","first-page":"2426","DOI":"10.1093\/nar\/gkr1073","article-title":"The allele distribution in next-generation sequencing data sets is accurately described as the result of a stochastic branching process","volume":"40","author":"Heinrich","year":"2012","journal-title":"Nucleic Acids Res"},{"key":"2023063012494483600_btx133-B14","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1371\/journal.pgen.1000862","article-title":"Population genomics of parallel adaptation in threespine stickleback using sequenced RAD tags","volume":"6","author":"Hohenlohe","year":"2010","journal-title":"PLOS Genetics"},{"key":"2023063012494483600_btx133-B15","doi-asserted-by":"crossref","first-page":"e61.","DOI":"10.1093\/nar\/gkv135","article-title":"multiSNV: a probabilistic approach for improving detection of somatic point mutations from multiple related tumour samples","volume":"43","author":"Josephidou","year":"2015","journal-title":"Nucleic Acids Res"},{"key":"2023063012494483600_btx133-B16","doi-asserted-by":"crossref","first-page":"D493","DOI":"10.1093\/nar\/gkh103","article-title":"The UCSC Table Browser data retrieval tool","volume":"32","author":"Karolchik","year":"2004","journal-title":"Nucleic Acids Res"},{"key":"2023063012494483600_btx133-B17","doi-asserted-by":"crossref","first-page":"27","DOI":"10.1016\/j.cell.2013.09.006","article-title":"The next-generation sequencing revolution and its impact on genomics","volume":"155","author":"Koboldt","year":"2013","journal-title":"Cell"},{"key":"2023063012494483600_btx133-B18","doi-asserted-by":"crossref","first-page":"722","DOI":"10.1093\/bioinformatics\/btq027","article-title":"Microindel detection in short-read sequence data","volume":"26","author":"Krawitz","year":"2010","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B19","doi-asserted-by":"crossref","first-page":"2987","DOI":"10.1093\/bioinformatics\/btr509","article-title":"A statistical framework for SNP calling, mutation discovery, association mapping and population genetical parameter estimation from sequencing data","volume":"27","author":"Li","year":"2011","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B20","doi-asserted-by":"crossref","first-page":"2843","DOI":"10.1093\/bioinformatics\/btu356","article-title":"Toward better understanding of artifacts in variant calling from high-coverage samples","volume":"30","author":"Li","year":"2014","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B21","doi-asserted-by":"crossref","first-page":"1851","DOI":"10.1101\/gr.078212.108","article-title":"Mapping short DNA sequencing reads and calling variants using mapping quality scores","volume":"18","author":"Li","year":"2008","journal-title":"Genome Res"},{"key":"2023063012494483600_btx133-B22","doi-asserted-by":"crossref","first-page":"2078","DOI":"10.1093\/bioinformatics\/btp352","article-title":"The sequence alignment\/map format and SAMtools","volume":"25","author":"Li","year":"2009","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B23","doi-asserted-by":"crossref","first-page":"713","DOI":"10.1093\/bioinformatics\/btn025","article-title":"SOAP: short oligonucleotide alignment program","volume":"24","author":"Li","year":"2008","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B24","doi-asserted-by":"crossref","first-page":"1124","DOI":"10.1101\/gr.088013.108","article-title":"SNP detection for massively parallel whole-genome resequencing","volume":"19","author":"Li","year":"2009","journal-title":"Genome Res"},{"key":"2023063012494483600_btx133-B25","first-page":"3629","article-title":"Low base-substitution mutation rate in the ciliate Tetrahymena thermophila","volume":"8","author":"Long","year":"2016","journal-title":"Genome Biol Evol"},{"key":"2023063012494483600_btx133-B26","doi-asserted-by":"crossref","first-page":"1","DOI":"10.18637\/jss.v061.i08","article-title":"OptimalCutpoints: an R package for selecting optimal cutpoints in diagnostic tests","volume":"61","author":"L\u00f3pez-Rat\u00f3n","year":"2014","journal-title":"Journal of Statistical Software"},{"key":"2023063012494483600_btx133-B27","doi-asserted-by":"crossref","first-page":"295","DOI":"10.1534\/genetics.109.100479","article-title":"Estimation of allele frequencies from high-coverage genome-sequencing projects","volume":"182","author":"Lynch","year":"2009","journal-title":"Genetics"},{"key":"2023063012494483600_btx133-B28","doi-asserted-by":"crossref","first-page":"1029","DOI":"10.1093\/bioinformatics\/btq092","article-title":"High quality SNP calling using Illumina data at shallow coverage","volume":"26","author":"Malhis","year":"2010","journal-title":"Bioinformatics"},{"key":"2023063012494483600_btx133-B29","doi-asserted-by":"crossref","first-page":"473","DOI":"10.1534\/genetics.115.179077","article-title":"Genotype-frequency estimation from high-throughput sequencing data","volume":"201","author":"Maruki","year":"2015","journal-title":"Genetics"},{"key":"2023063012494483600_btx133-B30","doi-asserted-by":"crossref","first-page":"1297","DOI":"10.1101\/gr.107524.110","article-title":"The Genome Analysis Toolkit: a MapReduce framework for analyzing next-generation DNA sequencing data","volume":"20","author":"McKenna","year":"2010","journal-title":"Genome Res"},{"key":"2023063012494483600_btx133-B31","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1038\/nature09708","article-title":"Mapping copy number variation by population-scale genome sequencing","volume":"470","author":"Mills","year":"2011","journal-title":"Nature"},{"key":"2023063012494483600_btx133-B32","doi-asserted-by":"crossref","first-page":"e5.","DOI":"10.1093\/nar\/gkr851","article-title":"A cross-sample statistical model for SNP detection in short-read sequencing data","volume":"40","author":"Muralidharan","year":"2012","journal-title":"Nucleic Acids Res"},{"key":"2023063012494483600_btx133-B33","doi-asserted-by":"crossref","first-page":"3985","DOI":"10.1073\/pnas.1222158110","article-title":"Rare variant detection using family-based sequencing analysis","volume":"110","author":"Peng","year":"2013","journal-title":"Proc Natl Acad Sci U S A"},{"key":"2023063012494483600_btx133-B34","doi-asserted-by":"crossref","first-page":"985","DOI":"10.1038\/nmeth.2611","article-title":"DeNovoGear: de novo indel and point mutation discovery and phasing","volume":"10","author":"Ramu","year":"2013","journal-title":"Nat Methods"},{"key":"2023063012494483600_btx133-B35","doi-asserted-by":"crossref","first-page":"1419","DOI":"10.2337\/db08-1792","article-title":"Extremes of clinical and enzymatic phenotypes in children with hyperinsulinism caused by glucokinase activating mutations","volume":"58","author":"Sayed","year":"2009","journal-title":"Diabetes"},{"key":"2023063012494483600_btx133-B36","doi-asserted-by":"crossref","first-page":"200","DOI":"10.1016\/j.tpb.2010.07.002","article-title":"Overdispersion in allelic counts and \u03b8-correction in forensic genetics","volume":"78","author":"Tvedebrink","year":"2010","journal-title":"Theor Popul Biol"},{"key":"2023063012494483600_btx133-B37","doi-asserted-by":"crossref","DOI":"10.1002\/0471250953.bi1110s43","article-title":"From FastQ data to high-confidence variant calls: the genome analysis toolkit best practices pipeline","volume":"43","author":"Van der Auwera","year":"2013","journal-title":"Current Protocols in Bioinformatics"},{"key":"2023063012494483600_btx133-B38","doi-asserted-by":"crossref","first-page":"1734","DOI":"10.1101\/gr.168393.113","article-title":"Estimating genotype error rates from high-coverage next-generation sequence data","volume":"24","author":"Wall","year":"2014","journal-title":"Genome Res"},{"key":"2023063012494483600_btx133-B39","doi-asserted-by":"crossref","first-page":"338.","DOI":"10.3389\/fgene.2015.00338","article-title":"Identification of low-confidence regions in the pig reference genome (Sscrofa10.2)","volume":"6","author":"Warr","year":"2015","journal-title":"Front Genet"},{"key":"2023063012494483600_btx133-B40","doi-asserted-by":"crossref","first-page":"554","DOI":"10.1016\/S0076-6879(96)66035-2","article-title":"Analysis of compositionally biased regions in sequence databases","volume":"266","author":"Wootton","year":"1996","journal-title":"Methods Enzymol"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/33\/15\/2322\/50756427\/bioinformatics_33_15_2322.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/33\/15\/2322\/50756427\/bioinformatics_33_15_2322.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,6,30]],"date-time":"2023-06-30T08:50:26Z","timestamp":1688115026000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/33\/15\/2322\/3071980"}},"subtitle":[],"editor":[{"given":"Oliver","family":"Stegle","sequence":"additional","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2017,3,15]]},"references-count":40,"journal-issue":{"issue":"15","published-print":{"date-parts":[[2017,8,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btx133","relation":{"has-preprint":[{"id-type":"doi","id":"10.1101\/031724","asserted-by":"object"}]},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2017,8,1]]},"published":{"date-parts":[[2017,3,15]]}}}