{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,21]],"date-time":"2026-04-21T22:41:53Z","timestamp":1776811313421,"version":"3.51.2"},"reference-count":54,"publisher":"Springer Science and Business Media LLC","issue":"1","funder":[{"DOI":"10.13039\/100004328","name":"Genentech","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100004328","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["BMC Bioinformatics"],"published-print":{"date-parts":[[2017,12]]},"DOI":"10.1186\/s12859-017-1756-z","type":"journal-article","created":{"date-parts":[[2017,7,24]],"date-time":"2017-07-24T13:27:26Z","timestamp":1500902846000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":55,"title":["Identifying and mitigating batch effects in whole genome sequencing data"],"prefix":"10.1186","volume":"18","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-3060-6751","authenticated-orcid":false,"given":"Jennifer A.","family":"Tom","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jens","family":"Reeder","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"William F.","family":"Forrest","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Robert R.","family":"Graham","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Julie","family":"Hunkapiller","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Timothy W.","family":"Behrens","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tushar R.","family":"Bhangale","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,7,24]]},"reference":[{"key":"1756_CR1","doi-asserted-by":"crossref","unstructured":"Hayden EC. Technology: the $1,000 genome. Nature. 2014;507:294-95.","DOI":"10.1038\/507294a"},{"issue":"5","key":"1756_CR2","doi-asserted-by":"crossref","first-page":"435","DOI":"10.1038\/ng.3247","volume":"47","author":"DF Gudbjartsson","year":"2015","unstructured":"Gudbjartsson DF, Helgason H, Gudjonsson SA, Zink F, Oddson A, Gylfason A, et al. Large-scale whole-genome sequencing of the Icelandic population. Nat Genet. 2015;47(5):435\u201344.","journal-title":"Nat Genet"},{"issue":"21","key":"1756_CR3","doi-asserted-by":"crossref","first-page":"e161","DOI":"10.1093\/nar\/gku864","volume":"42","author":"JT Leek","year":"2014","unstructured":"Leek JT. Svaseq: removing batch effects and other unwanted noise from sequencing data. Nucleic Acids Res. 2014;42(21):e161.","journal-title":"Nucleic Acids Res"},{"issue":"12","key":"1756_CR4","doi-asserted-by":"crossref","first-page":"87","DOI":"10.1186\/gm208","volume":"2","author":"M Taub","year":"2010","unstructured":"Taub M, Corrada Bravo H, Irizarry R. Overcoming bias and systematic errors in next generation sequencing data. Genome Medicine. 2010;2(12):87.","journal-title":"Genome Medicine"},{"issue":"Suppl 9","key":"1756_CR5","doi-asserted-by":"crossref","first-page":"S17","DOI":"10.1186\/1471-2105-9-S9-S17","volume":"9","author":"H Hong","year":"2008","unstructured":"Hong H, Su Z, Ge W, Shi L, Perkins R, Fang H, et al. Assessing batch effects of genotype calling algorithm BRLMM for the Affymetrix genechip human mapping 500 k array set using 270 HapMap samples. BMC Bioinformatics. 2008;9(Suppl 9):S17.","journal-title":"BMC Bioinformatics."},{"key":"1756_CR6","doi-asserted-by":"crossref","first-page":"336","DOI":"10.1038\/tpj.2010.36","volume":"10","author":"K Miclaus","year":"2010","unstructured":"Miclaus K, Wolfinger R, Vega S, Chierici M, Furlanello C, Lambert C, et al. Batch effects in the BRLMM genotype calling algorithm influence GWAS results for the Affymetrix 500K array. Pharmacogenomics J. 2010;10:336\u201346.","journal-title":"Pharmacogenomics J"},{"key":"1756_CR7","doi-asserted-by":"crossref","first-page":"324","DOI":"10.1038\/tpj.2010.46","volume":"10","author":"K Miclaus","year":"2010","unstructured":"Miclaus K, Chierici M, Lambert C, Zhang L, Vega S, Hong H, et al. Variability in GWAS analysis: the impact of genotype calling algorithm inconsistencies. Pharmacogenomics J. 2010;10:324\u201335.","journal-title":"Pharmacogenomics J"},{"issue":"6","key":"1756_CR8","doi-asserted-by":"crossref","first-page":"591","DOI":"10.1002\/gepi.20516","volume":"34","author":"CC Laurie","year":"2010","unstructured":"Laurie CC, Doheny KF, Mirel DB, Pugh EW, Bierut LJ, Bhangale T, et al. Quality control and quality assurance in genotypic data for genome-wide association studies. Genet Epidemiol. 2010;34(6):591\u2013602. http:\/\/doi.org\/10.1002\/gepi.20516","journal-title":"Genet Epidemiol"},{"key":"1756_CR9","doi-asserted-by":"crossref","unstructured":"Turner S, Armstrong LL, Bradford Y, Carlson CS, Crawford DC, Crenshaw AT, et al Quality control procedures for genome wide association studies. Curr Protoc Hum Genet \/ editorial board Edited by: Jonathan L Haines, 2011, Chapter 1:Unit11.19.","DOI":"10.1002\/0471142905.hg0119s68"},{"issue":"1","key":"1756_CR10","doi-asserted-by":"crossref","first-page":"125","DOI":"10.1186\/1471-2105-15-125","volume":"15","author":"A Carson","year":"2014","unstructured":"Carson A, Smith EN, Matsui H, Braekkan SK, Jepsen K, Hansen JB, et al. Effective filtering strategies to improve data quality from population-based whole exome sequencing studies. BMC Bioinformatics. 2014;15(1):125.","journal-title":"BMC Bioinformatics"},{"key":"1756_CR11","doi-asserted-by":"crossref","first-page":"1525","DOI":"10.1101\/gr.138115.112","volume":"22","author":"N Krumm","year":"2012","unstructured":"Krumm N, Sudmant PH, Ko A, O\u2019Roak BJ, Malig M, Coe BP, et al. Copy number variation detection and genotyping from exome sequence data. Genome Res. 2012;22:1525\u201332.","journal-title":"Genome Res"},{"issue":"18","key":"1756_CR12","doi-asserted-by":"crossref","first-page":"i370","DOI":"10.1093\/bioinformatics\/bts379","volume":"28","author":"LJ Coin","year":"2012","unstructured":"Coin LJ, Cao D, Ren J, Zuo X, Sun L, Yang S, et al. An exome sequencing pipeline for identifying and genotyping common CNVs associated with disease with application to psoriasis. Bioinformatics. 2012;28(18):i370\u20134.","journal-title":"Bioinformatics"},{"issue":"1","key":"1756_CR13","doi-asserted-by":"crossref","first-page":"133","DOI":"10.1093\/bioinformatics\/btv547","volume":"32","author":"JS Packer","year":"2016","unstructured":"Packer JS, Maxwell EK, O\u2019Dushlaine C, Lopez AE, Chernomorsky R, Baras A, et al. CLAMMS: a scalable algorithm for calling common and rare copy number variants from exome sequencing data. Bioinformatics. 2016;32(1):133\u20135.","journal-title":"Bioinformatics"},{"issue":"5","key":"1756_CR14","doi-asserted-by":"crossref","first-page":"491","DOI":"10.1038\/ng.806","volume":"43","author":"MA DePristo","year":"2011","unstructured":"DePristo MA, Banks E, Poplin R, Garimella KV, Maguire JR, Hartl C, et al. A framework for variation discovery and genotyping using next-generation DNA sequencing data. Nat Genet. 2011;43(5):491\u20138.","journal-title":"Nat Genet"},{"issue":"2","key":"1756_CR15","doi-asserted-by":"crossref","first-page":"195","DOI":"10.1093\/biostatistics\/kxr055","volume":"13","author":"CG Lambert","year":"2012","unstructured":"Lambert CG, Black LJ. Learning from our GWAS mistakes: from experimental design to scientific method. Biostatistics. 2012;13(2):195\u2013203.","journal-title":"Biostatistics"},{"key":"1756_CR16","doi-asserted-by":"crossref","unstructured":"Clayton D. Population association. In: Balding DJ, Bishop M, Cannings C, editors. Handbook of statistical genetics: Wiley; 2007. p. 1216\u201337.","DOI":"10.1002\/9780470061619.ch36"},{"issue":"1","key":"1756_CR17","doi-asserted-by":"crossref","first-page":"56","DOI":"10.1038\/nrg3655","volume":"15","author":"K Robasky","year":"2014","unstructured":"Robasky K, Lewis NE, Church GM. The role of replicates for error mitigation in next-generation sequencing. Nat Rev Genet. 2014;15(1):56\u201362.","journal-title":"Nat Rev Genet."},{"key":"1756_CR18","doi-asserted-by":"publisher","unstructured":"Mann DL, Newby K. Will the precision medicine initiative transform cardiovascular translational research. JACC: Basic Trans Sci. 2016;1(4) doi: 10.1016\/j.jacbts.2016.05.003 .","DOI":"10.1016\/j.jacbts.2016.05.003"},{"key":"1756_CR19","doi-asserted-by":"crossref","first-page":"41","DOI":"10.1038\/nature18642","volume":"536","author":"C Fuchsberger","year":"2016","unstructured":"Fuchsberger C, Flannick J, Teslovich TM, Mahajan A, Agarwala V, Gaulton KJ, et al. The genetic architecture of type 2 diabetes. Nature. 2016;536:41\u20137.","journal-title":"Nature"},{"key":"1756_CR20","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1038\/nature14962","volume":"526","author":"The UK10K Consortium","year":"2015","unstructured":"The UK10K Consortium. The UK10K project identifies rare variants in health and disease. Nature. 2015;526:82\u201390.","journal-title":"Nature"},{"issue":"5","key":"1756_CR21","volume":"12","author":"Y Hu","year":"2016","unstructured":"Hu Y, Liao P, Johnston R, Allen AS, Satten GA. Testing rare-variant association without calling genotypes allows for systematic differences in sequencing between cases and controls. PLoS Genet. 2016;12(5):e1006040.","journal-title":"PLoS Genet"},{"key":"1756_CR22","unstructured":"Smit AFA, Hubley R, Green P. RepeatMasker Open-4.0. 2013-2015 http:\/\/www.repeatmasker.org ."},{"key":"1756_CR23","doi-asserted-by":"publisher","unstructured":"Zook JM, Catoe D, McDaniel J, Vang L, Spies N, Sidow A, et al. Extensive sequencing of seven human genomes to characterize reference materials. Scientific Data. 2016;3 doi: 10.1038\/sdata.2016.25 .","DOI":"10.1038\/sdata.2016.25"},{"issue":"22","key":"1756_CR24","doi-asserted-by":"crossref","first-page":"2877","DOI":"10.1093\/bioinformatics\/btt480","volume":"29","author":"SE Reese","year":"2013","unstructured":"Reese SE, Archer KJ, Therneau TM, Atkinson EJ, Vachon CM, de Andrade M, et al. A new statistic for identifying batch effects in high-throughput genomic data that uses guided principal components analysis. Bioinformatics. 2013;29(22):2877\u201383.","journal-title":"Bioinformatics"},{"issue":"5\u20136","key":"1756_CR25","doi-asserted-by":"crossref","first-page":"323","DOI":"10.1016\/j.ygeno.2014.03.006","volume":"103","author":"Y Guo","year":"2014","unstructured":"Guo Y, Zhao S, Sheng Q, Ye F, Li J, Lehmann B, et al. Multi-perspective quality control of Illumina exome sequencing data using QC3. Genomics. 2014;103(5\u20136):323\u20138.","journal-title":"Genomics"},{"key":"1756_CR26","doi-asserted-by":"crossref","unstructured":"1000 Genomes Project Consortium. A global reference for human genetic variation. Nature. 2015;526:68\u201374.","DOI":"10.1038\/nature15393"},{"issue":"2","key":"1756_CR27","first-page":"111","volume":"7","author":"AG Clark","year":"1990","unstructured":"Clark AG. Inference of haplotypes from PCR-amplified samples of diploid populations. Mol Biol Evol. 1990;7(2):111\u201322.","journal-title":"Mol Biol Evol"},{"issue":"4","key":"1756_CR28","doi-asserted-by":"crossref","first-page":"978","DOI":"10.1086\/319501","volume":"68","author":"M Stephens","year":"2001","unstructured":"Stephens M, Smith NJ, Donnelly P. A new statistical method for haplotype reconstruction from population data. Am J Hum Genet. 2001;68(4):978\u201389.","journal-title":"Am J Hum Genet"},{"issue":"5","key":"1756_CR29","doi-asserted-by":"crossref","first-page":"1084","DOI":"10.1086\/521987","volume":"81","author":"SR Browning","year":"2007","unstructured":"Browning SR, Browning BL. Rapid and accurate haplotype phasing and missing-data inference for whole-genome association studies by use of localized haplotype clustering. Am J Hum Genet. 2007;81(5):1084\u201397.","journal-title":"Am J Hum Genet"},{"issue":"10","key":"1756_CR30","doi-asserted-by":"crossref","first-page":"703","DOI":"10.1038\/nrg3054","volume":"12","author":"SR Browning","year":"2011","unstructured":"Browning SR, Browning BL. Haplotype phasing: existing methods and new developments. Nat Rev Genet. 2011;12(10):703\u201314.","journal-title":"Nat Rev Genet"},{"issue":"6","key":"1756_CR31","doi-asserted-by":"crossref","first-page":"e1000529","DOI":"10.1371\/journal.pgen.1000529","volume":"5","author":"BN Howie","year":"2009","unstructured":"Howie BN, Donnelly P, Marchini J. A flexible and accurate genotype imputation method for the next generation of genome-wide association studies. PLoS Genet. 2009;5(6):e1000529.","journal-title":"PLoS Genet"},{"issue":"6","key":"1756_CR32","doi-asserted-by":"crossref","first-page":"631","DOI":"10.1038\/ng.2283","volume":"44","author":"B Pasaniuc","year":"2012","unstructured":"Pasaniuc B, Rohland N, McLaren PJ, Garimella K, Zaitlen N, Li H, et al. Extremely low-coverage sequencing and imputation increases power for genome-wide association studies. Nat Genet. 2012;44(6):631\u20135.","journal-title":"Nat Genet"},{"issue":"6","key":"1756_CR33","doi-asserted-by":"crossref","first-page":"847","DOI":"10.1016\/j.ajhg.2009.11.004","volume":"85","author":"BL Browning","year":"2009","unstructured":"Browning BL, Yu Z. Simultaneous genotype calling and haplotype phasing improves genotype accuracy and reduces false-positive associations for genome-wide association studies. Am J Hum Genet. 2009;85(6):847\u201361.","journal-title":"Am J Hum Genet"},{"key":"1756_CR34","unstructured":"Li H. Aligning sequence reads, clone sequences, and assembly contigs with BWA-MEM. 2013:1303.3997.arXiv."},{"key":"1756_CR35","unstructured":"GATK Best Practices. https:\/\/www.broadinstitute.org\/gatk\/guide\/best-practices.php . Accessed 17 Jan 2017."},{"key":"1756_CR36","volume-title":"Pan-cancer analysis reveals technical artifacts in the cancer genome atlas (TCGA) Germline variant calls","author":"A Buckley","year":"2016","unstructured":"Buckley A, Standish KA, Bhutani K, Ideker T, Carter, H, et al. Pan-cancer analysis reveals technical artifacts in the cancer genome atlas (TCGA) Germline variant calls. 2016; http:\/\/biorxiv.org\/content\/early\/2016\/12\/08\/092163 ."},{"issue":"Database issue","key":"1756_CR37","doi-asserted-by":"crossref","first-page":"D716","DOI":"10.1093\/nar\/gkl953","volume":"35","author":"DJ Thomas","year":"2007","unstructured":"Thomas DJ, Trumbower H, Kern AD, Rhead BL, Kuhn RM, Haussler D, et al. Variation resources at UC Santa Cruz. Nucleic Acids Res. 2007;35(Database issue):D716\u201320.","journal-title":"Nucleic Acids Res"},{"issue":"7414","key":"1756_CR38","doi-asserted-by":"crossref","first-page":"57","DOI":"10.1038\/nature11247","volume":"489","author":"ENCODE Project Consortium","year":"2012","unstructured":"ENCODE Project Consortium. An integrated encyclopedia of DNA elements in the human genome. Nature. 2012;489(7414):57\u201374.","journal-title":"Nature"},{"issue":"7130","key":"1756_CR39","doi-asserted-by":"crossref","first-page":"881","DOI":"10.1038\/nature05616","volume":"445","author":"R Sladek","year":"2007","unstructured":"Sladek R, Rocheleau G, Rung J, Dina C, Shen L, Serre D, et al. A genome-wide association study identifies novel risk loci for type 2 diabetes. Nature. 2007;445(7130):881\u20135.","journal-title":"Nature"},{"key":"1756_CR40","doi-asserted-by":"publisher","unstructured":"Cipriani V, Leung HT, Plagnol V, Bunce C, Khan JC, Shahid H, et al. Genome-wide association study of age-related macular degeneration identifies associated variants in the TNXB-FKBPL-NOTCH4 region of chromosome 6p21.3. Hum Mol Genet. 2012; doi: 10.1093\/hmg\/dds225 .","DOI":"10.1093\/hmg\/dds225"},{"key":"1756_CR41","doi-asserted-by":"crossref","first-page":"1001","DOI":"10.1038\/ng.938","volume":"43","author":"S Arakawa","year":"2011","unstructured":"Arakawa S, Takahashi A, Ashikawa K, Hosono N, Aoi T, Yasuda M, et al. Genome-wide association study identifies two susceptibility loci for exudative age-related macular degeneration in the Japanese population. Nat Genet. 2011;43:1001\u20134.","journal-title":"Nat Genet"},{"issue":"4","key":"1756_CR42","doi-asserted-by":"crossref","first-page":"629","DOI":"10.1086\/502802","volume":"78","author":"P Scheet","year":"2006","unstructured":"Scheet P, Stephens M. A fast and flexible statistical model for large-scale population genotype data: applications to inferring missing genotypes and haplotypic phase. Am J Hum Genet. 2006;78(4):629\u201344.","journal-title":"Am J Hum Genet"},{"key":"1756_CR43","doi-asserted-by":"crossref","first-page":"17875","DOI":"10.1038\/srep17875","volume":"5","author":"S Hwang","year":"2015","unstructured":"Hwang S, Kim E, Lee I, Marcotte E. Systematic comparison of variant calling pipelines using gold standard personal exome variants. Sci Rep. 2015;5:17875.","journal-title":"Sci Rep"},{"issue":"4","key":"1756_CR44","doi-asserted-by":"crossref","first-page":"433","DOI":"10.1038\/ng.2578","volume":"45","author":"The AMD Gene Consortium","year":"2013","unstructured":"The AMD Gene Consortium. Seven new loci associated with age-related macular degeneration. Nat Genet. 2013;45(4):433\u20139.","journal-title":"Nat Genet"},{"issue":"7562","key":"1756_CR45","doi-asserted-by":"crossref","first-page":"588","DOI":"10.1038\/nature14659","volume":"523","author":"CONVERGE Consortium","year":"2015","unstructured":"CONVERGE Consortium. Sparse whole-genome sequencing identifies two loci for major depressive disorder. Nature. 2015;523(7562):588\u201391.","journal-title":"Nature"},{"issue":"5","key":"1756_CR46","doi-asserted-by":"crossref","first-page":"e1000477","DOI":"10.1371\/journal.pgen.1000477","volume":"5","author":"CCA Spencer","year":"2009","unstructured":"Spencer CCA, Su Z, Donnelly P, Marchini J. Designing genome-wide association studies: sample size, power, imputation, and the choice of genotyping chip. PLoS Genet. 2009;5(5):e1000477.","journal-title":"PLoS Genet"},{"key":"1756_CR47","doi-asserted-by":"crossref","unstructured":"Gonzalez Silos R, Karadag O, Peil B, Fischer C, Kabisch M, et al. Using next-generation DNA sequence data for genetic association tests based on allele counts with and without consideration of zero inflation. BMC Proc. 2016:10(Suppl 7):41.","DOI":"10.1186\/s12919-016-0062-5"},{"key":"1756_CR48","unstructured":"Tom J. genotypeval: QA\/QC of a gVCF or VCF file. https:\/\/bioconductor.org\/packages\/release\/bioc\/html\/genotypeeval.html ."},{"key":"1756_CR49","unstructured":"http:\/\/hgdownload.soe.ucsc.edu\/goldenPath\/hg38\/vsSelf\/ . Accessed 17 Jan 2017."},{"key":"1756_CR50","unstructured":"http:\/\/genome.ucsc.edu\/cgi-bin\/hgTrackUi?db=hg38&g=genomicSuperDups . Accessed 17 Jan 2017."},{"issue":"14","key":"1756_CR51","doi-asserted-by":"crossref","first-page":"1841","DOI":"10.1093\/bioinformatics\/btp328","volume":"25","author":"M Lawrence","year":"2009","unstructured":"Lawrence M, Gentleman R, Carey V. Rtracklayer: an R package for interfacing with genome browsers. Bioinformatics. 2009;25(14):1841\u20132.","journal-title":"Bioinformatics"},{"key":"1756_CR52","doi-asserted-by":"crossref","first-page":"209","DOI":"10.1038\/ng1706","volume":"38","author":"AD Skol","year":"2006","unstructured":"Skol AD, Scott LJ, Abecasis GR, Boehnke M. Joint analysis is more efficient than replication-based analysis for two-stage genome-wide association studies. Nat Genet. 2006;38:209\u201313.","journal-title":"Nat Genet"},{"issue":"3","key":"1756_CR53","doi-asserted-by":"crossref","first-page":"559","DOI":"10.1086\/519795","volume":"81","author":"S Purcell","year":"2007","unstructured":"Purcell S, Neale B, Todd-Brown K, Thomas L, Ferreira MA, Bender D, et al. PLINK: a tool set for whole-genome association and population-based linkage analyses. Am J Hum Genet. 2007;81(3):559\u201375.","journal-title":"Am J Hum Genet"},{"key":"1756_CR54","doi-asserted-by":"crossref","first-page":"904","DOI":"10.1038\/ng1847","volume":"38","author":"AL Price","year":"2006","unstructured":"Price AL, Patterson NJ, Plenge RM, Weinblatt ME, Shadick NA, Reich D. Principal components analysis corrects for stratification in genome-wide association studies. Nat Genet. 2006;38:904\u20139.","journal-title":"Nat Genet"}],"container-title":["BMC Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/s12859-017-1756-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,24]],"date-time":"2023-08-24T17:38:47Z","timestamp":1692898727000},"score":1,"resource":{"primary":{"URL":"http:\/\/bmcbioinformatics.biomedcentral.com\/articles\/10.1186\/s12859-017-1756-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,7,24]]},"references-count":54,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2017,12]]}},"alternative-id":["1756"],"URL":"https:\/\/doi.org\/10.1186\/s12859-017-1756-z","relation":{},"ISSN":["1471-2105"],"issn-type":[{"value":"1471-2105","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017,7,24]]},"article-number":"351"}}