{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,19]],"date-time":"2026-07-19T05:10:44Z","timestamp":1784437844256,"version":"3.55.0"},"reference-count":17,"publisher":"Oxford University Press (OUP)","issue":"8","license":[{"start":{"date-parts":[[2024,7,30]],"date-time":"2024-07-30T00:00:00Z","timestamp":1722297600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100000002","name":"National Institutes of Health","doi-asserted-by":"publisher","award":["R01CA269919"],"award-info":[{"award-number":["R01CA269919"]}],"id":[{"id":"10.13039\/100000002","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,8,2]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:sec>\n                  <jats:title>Summary<\/jats:title>\n                  <jats:p>Harmonizing variant indexing and allele assignments across datasets is crucial for data integrity in cross-dataset studies such as multi-cohort genome-wide association studies, meta-analyses, and the development, validation, and application of polygenic risk scores. Ensuring this indexing and allele consistency is a laborious, time-consuming, and error-prone process requiring a certain degree of computational proficiency. Here, we introduce GRIEVOUS, a command-line tool for cross-dataset variant homogenization. By means of an internal database and a custom indexing methodology, GRIEVOUS identifies, formats, and aligns all biallelic single nucleotide polymorphisms (SNPs) across all summary statistic and genotype files of interest. Upon completion of dataset harmonization, GRIEVOUS can also be used to extract the maximal set of biallelic SNPs common to all datasets.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Availability and implementation<\/jats:title>\n                  <jats:p>GRIEVOUS and all supporting documentation and tutorials can be found at https:\/\/github.com\/jvtalwar\/GRIEVOUS. It is freely and publicly available under the MIT license and can be installed via pip.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btae489","type":"journal-article","created":{"date-parts":[[2024,7,30]],"date-time":"2024-07-30T19:52:43Z","timestamp":1722369163000},"source":"Crossref","is-referenced-by-count":1,"title":["GRIEVOUS: your command-line general for resolving cross-dataset genotype inconsistencies"],"prefix":"10.1093","volume":"40","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9520-1950","authenticated-orcid":false,"given":"James V","family":"Talwar","sequence":"first","affiliation":[{"name":"Division of Medical Genetics, Department of Medicine, University of California San Diego , La Jolla, CA 92093, United States"},{"name":"Bioinformatics and Systems Biology Program, University of California San Diego , La Jolla, CA 92093, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Adam","family":"Klie","sequence":"additional","affiliation":[{"name":"Division of Medical Genetics, Department of Medicine, University of California San Diego , La Jolla, CA 92093, United States"},{"name":"Bioinformatics and Systems Biology Program, University of California San Diego , La Jolla, CA 92093, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Meghana S","family":"Pagadala","sequence":"additional","affiliation":[{"name":"Biomedical Science Program, University of California San Diego , La Jolla, CA 92093, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1729-2463","authenticated-orcid":false,"given":"Hannah","family":"Carter","sequence":"additional","affiliation":[{"name":"Division of Medical Genetics, Department of Medicine, University of California San Diego , La Jolla, CA 92093, United States"},{"name":"Bioinformatics and Systems Biology Program, University of California San Diego , La Jolla, CA 92093, United States"},{"name":"Moores Cancer Center, University of California San Diego , La Jolla, CA 92093, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2024,7,30]]},"reference":[{"key":"2024081404511727000_btae489-B1","doi-asserted-by":"crossref","first-page":"126","DOI":"10.1158\/1055-9965.EPI-16-0106","article-title":"The OncoArray Consortium: a network for understanding the genetic architecture of common cancers","volume":"26","author":"Amos","year":"2017","journal-title":"Cancer Epidemiol Biomarkers Prev"},{"key":"2024081404511727000_btae489-B2","doi-asserted-by":"crossref","first-page":"1564","DOI":"10.1038\/nprot.2010.116","article-title":"Data quality control in genetic case-control association studies","volume":"5","author":"Anderson","year":"2010","journal-title":"Nat Protoc"},{"key":"2024081404511727000_btae489-B3","doi-asserted-by":"crossref","first-page":"203","DOI":"10.1038\/s41586-018-0579-z","article-title":"The UK Biobank resource with deep phenotyping and genomic data","volume":"562","author":"Bycroft","year":"2018","journal-title":"Nature"},{"key":"2024081404511727000_btae489-B4","doi-asserted-by":"crossref","first-page":"7","DOI":"10.1186\/s13742-015-0047-8","article-title":"Second-generation PLINK: rising to the challenge of larger and richer datasets","volume":"4","author":"Chang","year":"2015","journal-title":"Gigascience"},{"key":"2024081404511727000_btae489-B5","doi-asserted-by":"crossref","first-page":"2759","DOI":"10.1038\/s41596-020-0353-1","article-title":"Tutorial: a guide to performing polygenic risk score analyses","volume":"15","author":"Choi","year":"2020","journal-title":"Nat Protoc"},{"key":"2024081404511727000_btae489-B6","doi-asserted-by":"crossref","first-page":"298","DOI":"10.1093\/bfgp\/elv037","article-title":"Quality control, imputation and analysis of genome-wide genotyping data from the Illumina HumanCoreExome microarray","volume":"15","author":"Coleman","year":"2016","journal-title":"Brief Funct Genomics"},{"key":"2024081404511727000_btae489-B7","doi-asserted-by":"crossref","first-page":"65","DOI":"10.1038\/s41588-020-00748-0","article-title":"Trans-ancestry genome-wide association meta-analysis of prostate cancer identifies new susceptibility loci and informs genetic risk prediction","volume":"53","author":"Conti","year":"2021","journal-title":"Nat Genet"},{"key":"2024081404511727000_btae489-B8","doi-asserted-by":"crossref","first-page":"1284","DOI":"10.1038\/ng.3656","article-title":"Next-generation genotype imputation service and methods","volume":"48","author":"Das","year":"2016","journal-title":"Nat Genet"},{"key":"2024081404511727000_btae489-B9","doi-asserted-by":"crossref","first-page":"379","DOI":"10.1038\/nrg3472","article-title":"Meta-analysis methods for genome-wide association studies and beyond","volume":"14","author":"Evangelou","year":"2013","journal-title":"Nat Rev Genet"},{"key":"2024081404511727000_btae489-B10","doi-asserted-by":"crossref","first-page":"1717","DOI":"10.1093\/ije\/dyx028","article-title":"Two-sample Mendelian randomization: avoiding the downsides of a powerful, widely applicable but potentially fallible technique","volume":"45","author":"Hartwig","year":"2016","journal-title":"Int J Epidemiol"},{"key":"2024081404511727000_btae489-B11","doi-asserted-by":"crossref","first-page":"e1608","DOI":"10.1002\/mpr.1608","article-title":"A tutorial on conducting genome-wide association studies: quality control and statistical analysis","volume":"27","author":"Marees","year":"2018","journal-title":"Int J Methods Psychiatr Res"},{"key":"2024081404511727000_btae489-B12","doi-asserted-by":"crossref","first-page":"92","DOI":"10.1038\/nature24284","article-title":"Association analysis identifies 65 new breast cancer risk loci","volume":"551","author":"Michailidou","year":"2017","journal-title":"Nature"},{"key":"2024081404511727000_btae489-B13","doi-asserted-by":"crossref","first-page":"559","DOI":"10.1086\/519795","article-title":"PLINK: a tool set for whole-genome association and population-based linkage analyses","volume":"81","author":"Purcell","year":"2007","journal-title":"Am J Hum Genet"},{"key":"2024081404511727000_btae489-B14","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/s43586-021-00092-5","article-title":"Mendelian randomization","volume":"2","author":"Sanderson","year":"2022","journal-title":"Nat Rev Methods Primers"},{"key":"2024081404511727000_btae489-B15","author":"Talwar","year":"2024"},{"key":"2024081404511727000_btae489-B16","doi-asserted-by":"crossref","first-page":"1285","DOI":"10.1038\/nprot.2015.077","article-title":"Population-specific genotype imputations using minimac or IMPUTE2","volume":"10","author":"van Leeuwen","year":"2015","journal-title":"Nat Protoc"},{"key":"2024081404511727000_btae489-B17","doi-asserted-by":"crossref","first-page":"191","DOI":"10.2217\/14622416.10.2.191","article-title":"Meta-analysis in genome-wide association studies","volume":"10","author":"Zeggini","year":"2009","journal-title":"Pharmacogenomics"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/advance-article-pdf\/doi\/10.1093\/bioinformatics\/btae489\/58689558\/btae489.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/40\/8\/btae489\/58813736\/btae489.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/40\/8\/btae489\/58813736\/btae489.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,8,14]],"date-time":"2024-08-14T04:51:36Z","timestamp":1723611096000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/doi\/10.1093\/bioinformatics\/btae489\/7723992"}},"subtitle":[],"editor":[{"given":"Macha","family":"Nikolski","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]}],"short-title":[],"issued":{"date-parts":[[2024,7,30]]},"references-count":17,"journal-issue":{"issue":"8","published-print":{"date-parts":[[2024,8,2]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btae489","relation":{},"ISSN":["1367-4811"],"issn-type":[{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2024,8]]},"published":{"date-parts":[[2024,7,30]]},"article-number":"btae489"}}