{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,20]],"date-time":"2026-08-20T03:15:15Z","timestamp":1787195715343,"version":"build-2736575974"},"reference-count":17,"publisher":"Oxford University Press (OUP)","issue":"2","license":[{"start":{"date-parts":[[2018,7,10]],"date-time":"2018-07-10T00:00:00Z","timestamp":1531180800000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100004440","name":"Wellcome Trust","doi-asserted-by":"publisher","award":["WT098051"],"award-info":[{"award-number":["WT098051"]}],"id":[{"id":"10.13039\/100004440","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019,1,15]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Motivation<\/jats:title>\n                    <jats:p>The bulk of space taken up by NGS sequencing CRAM files consists of per-base quality values. Most of these are unnecessary for variant calling, offering an opportunity for space saving.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>On the Syndip test set, a 17 fold reduction in the quality storage portion of a CRAM file can be achieved while maintaining variant calling accuracy. The size reduction of an entire CRAM file varied from 2.2 to 7.4 fold, depending on the non-quality content of the original file (see Supplementary Material S6 for details).<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Availability and implementation<\/jats:title>\n                    <jats:p>Crumble is OpenSource and can be obtained from https:\/\/github.com\/jkbonfield\/crumble.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Supplementary information<\/jats:title>\n                    <jats:p>Supplementary data are available at Bioinformatics online.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1093\/bioinformatics\/bty608","type":"journal-article","created":{"date-parts":[[2018,7,9]],"date-time":"2018-07-09T15:32:39Z","timestamp":1531150359000},"page":"337-339","source":"Crossref","is-referenced-by-count":24,"title":["Crumble: reference free lossy compression of sequence quality values"],"prefix":"10.1093","volume":"35","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6447-4112","authenticated-orcid":false,"given":"James K","family":"Bonfield","sequence":"first","affiliation":[{"name":"DNA Pipelines, Wellcome Sanger Institute, Wellcome Genome Campus, Hinxton, UK"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2715-4187","authenticated-orcid":false,"given":"Shane A","family":"McCarthy","sequence":"additional","affiliation":[{"name":"DNA Pipelines, Wellcome Sanger Institute, Wellcome Genome Campus, Hinxton, UK"},{"name":"Department of Genetics, University of Cambridge, Cambridge, UK"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Richard","family":"Durbin","sequence":"additional","affiliation":[{"name":"DNA Pipelines, Wellcome Sanger Institute, Wellcome Genome Campus, Hinxton, UK"},{"name":"Department of Genetics, University of Cambridge, Cambridge, UK"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2018,7,10]]},"reference":[{"key":"2023013107231987200_bty608-B1","doi-asserted-by":"crossref","first-page":"288.","DOI":"10.1186\/s12859-015-0709-7","article-title":"Reference-free compression of high throughput sequencing data with a probabilistic de Bruijn graph","volume":"16","author":"Benoit","year":"2015","journal-title":"BMC Bioinformatics"},{"key":"2023013107231987200_bty608-B2","doi-asserted-by":"crossref","first-page":"1699","DOI":"10.1093\/bioinformatics\/btq268","article-title":"Gap5\u2013editing the billion fragment sequence assembly","volume":"26","author":"Bonfield","year":"2010","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B3","doi-asserted-by":"crossref","first-page":"2130","DOI":"10.1093\/bioinformatics\/btu183","article-title":"Lossy compression of quality scores in genomic data","volume":"30","author":"C\u00e1novas","year":"2014","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B4","doi-asserted-by":"crossref","first-page":"734","DOI":"10.1101\/gr.114819.110","article-title":"Efficient storage of high throughput dna sequencing data using reference-based compression","volume":"21","author":"Fritz","year":"2011","journal-title":"Genome Res"},{"key":"2023013107231987200_bty608-B5","first-page":"3907.","article-title":"Haplotype-based variant detection from short-read sequencing","volume":"1207","author":"Garrison","year":"2012","journal-title":"arXiv Preprint arXiv"},{"key":"2023013107231987200_bty608-B6","doi-asserted-by":"crossref","first-page":"3124","DOI":"10.1093\/bioinformatics\/btw385","article-title":"GeneCodeq: quality score compression and improved genotyping using a Bayesian framework","volume":"32","author":"Greenfield","year":"2016","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B7","author":"Illumina","year":"2014"},{"key":"2023013107231987200_bty608-B8","doi-asserted-by":"crossref","first-page":"2987","DOI":"10.1093\/bioinformatics\/btr509","article-title":"A statistical framework for snp calling, mutation discovery, association mapping and population genetical parameter estimation from sequencing data","volume":"27","author":"Li","year":"2011","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B9","doi-asserted-by":"crossref","first-page":"2078","DOI":"10.1093\/bioinformatics\/btp352","article-title":"The sequence alignment\/map format and SAMtools","volume":"25","author":"Li","year":"2009","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B10","doi-asserted-by":"crossref","DOI":"10.1038\/s41592-018-0054-7","article-title":"A synthetic-diploid benchmark for accurate variant calling evaluation","author":"Li","year":"2018","journal-title":"Nat. Methods"},{"key":"2023013107231987200_bty608-B11","doi-asserted-by":"crossref","first-page":"3122","DOI":"10.1093\/bioinformatics\/btv330","article-title":"QVZ: lossy compression of quality values","volume":"31","author":"Malysa","year":"2015","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B12","doi-asserted-by":"crossref","first-page":"1005","DOI":"10.1038\/nmeth.4037","article-title":"Comparison of high-throughput sequencing data compression tools","volume":"13","author":"Numanagi\u0107","year":"2016","journal-title":"Nat. Methods"},{"key":"2023013107231987200_bty608-B13","article-title":"Scaling accurate genetic variant discovery to tens of thousands of samples","author":"Poplin","year":"2017","journal-title":"bioRxiv"},{"key":"2023013107231987200_bty608-B14","doi-asserted-by":"crossref","DOI":"10.1093\/bioinformatics\/bty205","article-title":"FaStore: a space-saving solution for raw sequencing data","volume":"34","author":"Roguski","year":"2018","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B15","doi-asserted-by":"crossref","first-page":"849","DOI":"10.1101\/gr.213611.116","article-title":"Evaluation of GRCh38 and de novo haploid genome assemblies demonstrates the enduring quality of the reference assembly","volume":"27","author":"Schneider","year":"2017","journal-title":"Genome Res"},{"key":"2023013107231987200_bty608-B16","doi-asserted-by":"crossref","first-page":"1650","DOI":"10.1093\/bioinformatics\/btx737","article-title":"Calq: compression of quality values of aligned sequencing data","volume":"34","author":"Voges","year":"2018","journal-title":"Bioinformatics"},{"key":"2023013107231987200_bty608-B17","author":"Wetterstrand","year":"2016"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/2\/337\/48963434\/bioinformatics_35_2_337.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/2\/337\/48963434\/bioinformatics_35_2_337.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,7,7]],"date-time":"2024-07-07T21:44:59Z","timestamp":1720388699000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/35\/2\/337\/5051198"}},"subtitle":[],"editor":[{"given":"Inanc","family":"Birol","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]}],"short-title":[],"issued":{"date-parts":[[2018,7,10]]},"references-count":17,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2019,1,15]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/bty608","relation":{"has-preprint":[{"id-type":"doi","id":"10.1101\/243030","asserted-by":"object"}]},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2019,1,15]]},"published":{"date-parts":[[2018,7,10]]}}}