{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,27]],"date-time":"2025-07-27T07:13:21Z","timestamp":1753600401363,"version":"3.37.3"},"reference-count":32,"publisher":"Oxford University Press (OUP)","issue":"2","license":[{"start":{"date-parts":[[2021,10,8]],"date-time":"2021-10-08T00:00:00Z","timestamp":1633651200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/academic.oup.com\/journals\/pages\/open_access\/funder_policies\/chorus\/standard_publication_model"}],"funder":[{"name":"Institute of Information & Communications Technology Planning & Evaluation"},{"name":"Korea government","award":["2020-0-01450"],"award-info":[{"award-number":["2020-0-01450"]}]},{"name":"Artificial Intelligence Convergence Research Center"},{"name":"National Research Foundation of Korea (NRF) grant funded by the Korea government","award":["2021R1A2C2010775"],"award-info":[{"award-number":["2021R1A2C2010775"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,1,3]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:sec>\n                  <jats:title>Motivation<\/jats:title>\n                  <jats:p>Over the past decades, vast amounts of genome sequencing data have been produced, requiring an enormous level of storage capacity. The time and resources needed to store and transfer such data cause bottlenecks in genome sequencing analysis. To resolve this issue, various compression techniques have been proposed to reduce the size of original FASTQ raw sequencing data, but these remain suboptimal. Long-read sequencing has become dominant in genomics, whereas most existing compression methods focus on short-read sequencing only.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Results<\/jats:title>\n                  <jats:p>We designed a compression algorithm based on read reordering using a novel scoring model for reducing FASTQ file size with no information loss. We integrated all data processing steps into a software package called FastqCLS and provided it as a Docker image for ease of installation and execution to help users easily install and run. We compared our method with existing major FASTQ compression tools using benchmark datasets. We also included new long-read sequencing data in this validation. As a result, FastqCLS outperformed in terms of compression ratios for storing long-read sequencing data.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Availability and implementation<\/jats:title>\n                  <jats:p>FastqCLS can be downloaded from https:\/\/github.com\/krlucete\/FastqCLS.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Supplementary information<\/jats:title>\n                  <jats:p>Supplementary data are available at Bioinformatics online.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btab696","type":"journal-article","created":{"date-parts":[[2021,10,6]],"date-time":"2021-10-06T21:41:28Z","timestamp":1633556488000},"page":"351-356","source":"Crossref","is-referenced-by-count":9,"title":["FastqCLS: a FASTQ compressor for long-read sequencing via read reordering using a novel scoring model"],"prefix":"10.1093","volume":"38","author":[{"given":"Dohyeon","family":"Lee","sequence":"first","affiliation":[{"name":"School of Computer Science and Engineering, Pusan National University , Busan 46241, South Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8796-4678","authenticated-orcid":false,"given":"Giltae","family":"Song","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Pusan National University , Busan 46241, South Korea"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2021,10,8]]},"reference":[{"year":"2016","author":"Adler","key":"2023020108463730500_btab696-B1"},{"key":"2023020108463730500_btab696-B2","doi-asserted-by":"crossref","first-page":"85","DOI":"10.1016\/j.coisb.2017.07.004","article-title":"Single cells make big data: new challenges and opportunities in transcriptomics","volume":"4","author":"Angerer","year":"2017","journal-title":"Curr. Opin. Syst. Biol"},{"year":"2012","author":"Blaszczyk","key":"2023020108463730500_btab696-B3"},{"key":"2023020108463730500_btab696-B4","doi-asserted-by":"crossref","first-page":"288","DOI":"10.1186\/s12859-015-0709-7","article-title":"Reference-free compression of high throughput sequencing data with a probabilistic de Bruijn graph","volume":"16","author":"Benoit","year":"2015","journal-title":"BMC Bioinformatics"},{"key":"2023020108463730500_btab696-B5","doi-asserted-by":"crossref","first-page":"e59190","DOI":"10.1371\/journal.pone.0059190","article-title":"Compression of FASTQ and SAM format sequencing data","volume":"8","author":"Bonfield","year":"2013","journal-title":"PLoS One"},{"key":"2023020108463730500_btab696-B6","doi-asserted-by":"crossref","first-page":"2130","DOI":"10.1093\/bioinformatics\/btu183","article-title":"Lossy compression of quality scores in genomic data","volume":"30","author":"C\u00e1novas","year":"2014","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B7","doi-asserted-by":"crossref","first-page":"558","DOI":"10.1093\/bioinformatics\/btx639","article-title":"Compression of genomic sequencing reads via hash-based reordering: algorithm and analysis","volume":"34","author":"Chandak","year":"2018","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B8","doi-asserted-by":"crossref","first-page":"2674","DOI":"10.1093\/bioinformatics\/bty1015","article-title":"SPRING: a next-generation compressor for FASTQ data","volume":"35","author":"Chandak","year":"2018","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B9","doi-asserted-by":"crossref","first-page":"1541003","DOI":"10.1142\/S0219720015410036","article-title":"FQC: a novel approach for efficient compression, archival, and dissemination of fastq datasets","volume":"13","author":"Dutta","year":"2015","journal-title":"J. Bioinf. Comput. Biol"},{"key":"2023020108463730500_btab696-B11","doi-asserted-by":"crossref","first-page":"1389","DOI":"10.1093\/bioinformatics\/btu844","article-title":"Disk-based compression of data from genome sequencing","volume":"31","author":"Grabowski","year":"2015","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B12","doi-asserted-by":"crossref","first-page":"3124","DOI":"10.1093\/bioinformatics\/btw385","article-title":"GeneCodeq: quality score compression and improved genotyping using a Bayesian framework","volume":"32","author":"Greenfield","year":"2016","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B13","doi-asserted-by":"crossref","first-page":"3051","DOI":"10.1093\/bioinformatics\/bts593","article-title":"SCALCE: boosting sequence compression algorithms using locally consistent encoding","volume":"28","author":"Hach","year":"2012","journal-title":"Bioinformatics"},{"year":"2017","author":"Illumina","key":"2023020108463730500_btab696-B15"},{"key":"2023020108463730500_btab696-B16","doi-asserted-by":"crossref","first-page":"2796","DOI":"10.1093\/bioinformatics\/btu387","article-title":"BEETL-fastq: a searchable compressed archive for DNA reads","volume":"30","author":"Janin","year":"2014","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B17","doi-asserted-by":"crossref","first-page":"e171","DOI":"10.1093\/nar\/gks754","article-title":"Compression of next-generation sequencing reads aided by highly efficient de novo assembly","volume":"40","author":"Jones","year":"2012","journal-title":"Nucleic Acids Res"},{"key":"2023020108463730500_btab696-B18","doi-asserted-by":"crossref","first-page":"1920","DOI":"10.1093\/bioinformatics\/btv071","article-title":"Reference-based compression of short-read sequences using path encoding","volume":"31","author":"Kingsford","year":"2015","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B20","first-page":"1","article-title":"Long-read sequencing reveals genomic structural variations that underlie creation of quality protein maize","volume":"11","author":"Li","year":"2020","journal-title":"Nat. Commun"},{"key":"2023020108463730500_btab696-B21","doi-asserted-by":"crossref","first-page":"2066","DOI":"10.1093\/bioinformatics\/bty936","article-title":"Index suffix\u2013prefix overlaps by (w, k)-minimizer to generate long contigs for reads compression","volume":"35","author":"Liu","year":"2019","journal-title":"Bioinformatics"},{"article-title":"The Zpaq compression algorithm","year":"2015","author":"Mahoney","key":"2023020108463730500_btab696-B22"},{"key":"2023020108463730500_btab696-B23","doi-asserted-by":"crossref","first-page":"3122","DOI":"10.1093\/bioinformatics\/btv330","article-title":"QVZ: lossy compression of quality values","volume":"31","author":"Malysa","year":"2015","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B24","doi-asserted-by":"crossref","first-page":"3276","DOI":"10.1093\/bioinformatics\/btv384","article-title":"LFQC: a lossless compression algorithm for FASTQ files","volume":"31","author":"Nicolae","year":"2015","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B25","doi-asserted-by":"crossref","first-page":"1005","DOI":"10.1038\/nmeth.4037","article-title":"Comparison of high-throughput sequencing data compression tools","volume":"13","author":"Numanagi\u0107","year":"2016","journal-title":"Nat. Methods"},{"key":"2023020108463730500_btab696-B26","doi-asserted-by":"crossref","first-page":"187","DOI":"10.1186\/1471-2105-14-187","article-title":"QualComp: a new lossy compressor for quality scores based on rate distortion theory","volume":"14","author":"Ochoa","year":"2013","journal-title":"BMC Bioinformatics"},{"key":"2023020108463730500_btab696-B27","first-page":"183","article-title":"Effect of lossy compression of quality scores on variant calling","volume":"18","author":"Ochoa","year":"2016","journal-title":"Brief. Bioinf"},{"key":"2023020108463730500_btab696-B28","doi-asserted-by":"crossref","first-page":"R234","DOI":"10.1093\/hmg\/ddy177","article-title":"Long reads: their purpose and place","volume":"27","author":"Pollard","year":"2018","journal-title":"Hum. Mol. Genet"},{"key":"2023020108463730500_btab696-B29","doi-asserted-by":"crossref","first-page":"2213","DOI":"10.1093\/bioinformatics\/btu208","article-title":"DSRC 2\u2014industry-oriented compression of FASTQ files","volume":"30","author":"Roguski","year":"2014","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B30","doi-asserted-by":"crossref","first-page":"2748","DOI":"10.1093\/bioinformatics\/bty205","article-title":"FaStore: a space-saving solution for raw sequencing data","volume":"34","author":"Roguski","year":"2018","journal-title":"Bioinformatics"},{"key":"2023020108463730500_btab696-B31","doi-asserted-by":"crossref","first-page":"243","DOI":"10.1038\/nature20098","article-title":"De novo assembly and phasing of a Korean human genome","volume":"538","author":"Seo","year":"2016","journal-title":"Nature"},{"key":"2023020108463730500_btab696-B32","doi-asserted-by":"crossref","first-page":"12065","DOI":"10.1038\/ncomms12065","article-title":"Long-read sequencing and de novo assembly of a Chinese genome","volume":"7","author":"Shi","year":"2016","journal-title":"Nat. Commun"},{"key":"2023020108463730500_btab696-B33","doi-asserted-by":"crossref","first-page":"e1002195","DOI":"10.1371\/journal.pbio.1002195","article-title":"Big data: astronomical or genomical?","volume":"13","author":"Stephens","year":"2015","journal-title":"PLoS Biol"},{"key":"2023020108463730500_btab696-B34","doi-asserted-by":"crossref","first-page":"e0224806","DOI":"10.1371\/journal.pone.0224806","article-title":"LFastqC: a lossless non-reference-based FASTQ compressor","volume":"14","author":"Yami","year":"2019","journal-title":"PLoS One"},{"key":"2023020108463730500_btab696-B37","doi-asserted-by":"crossref","first-page":"75","DOI":"10.1016\/j.gene.2015.12.053","article-title":"A FASTQ compressor based on integer-mapped k-mer indexing for biologist","volume":"579","author":"Zhang","year":"2016","journal-title":"Gene"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/academic.oup.com\/bioinformatics\/advance-article-pdf\/doi\/10.1093\/bioinformatics\/btab696\/40934552\/btab696.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/38\/2\/351\/49007259\/btab696.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/38\/2\/351\/49007259\/btab696.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,1]],"date-time":"2023-02-01T20:03:02Z","timestamp":1675281782000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/38\/2\/351\/6384565"}},"subtitle":[],"editor":[{"given":"Jinbo","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2021,10,8]]},"references-count":32,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2022,1,3]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btab696","relation":{},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"type":"print","value":"1367-4803"},{"type":"electronic","value":"1367-4811"}],"subject":[],"published-other":{"date-parts":[[2022,1,15]]},"published":{"date-parts":[[2021,10,8]]}}}