{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,26]],"date-time":"2026-02-26T20:34:50Z","timestamp":1772138090575,"version":"3.50.1"},"reference-count":28,"publisher":"Oxford University Press (OUP)","issue":"2","license":[{"start":{"date-parts":[[2018,7,13]],"date-time":"2018-07-13T00:00:00Z","timestamp":1531440000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/academic.oup.com\/journals\/pages\/open_access\/funder_policies\/chorus\/standard_publication_model"}],"funder":[{"name":"Polish National Science Centre under","award":["DEC-2015\/17\/B\/ST6\/01890"],"award-info":[{"award-number":["DEC-2015\/17\/B\/ST6\/01890"]}]},{"name":"Polish National Science Centre under","award":["POIG.02.03.01-24-099\/13"],"award-info":[{"award-number":["POIG.02.03.01-24-099\/13"]}]},{"name":"\u2018GeCONiI\u2014Upper Silesian Center for Computational Science and Engineering\u2019"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019,1,15]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Motivation<\/jats:title>\n                    <jats:p>Bioinformatics databases grow rapidly and achieve values hardly to imagine a decade ago. Among numerous bioinformatics processes generating hundreds of GB is multiple sequence alignments of protein families. Its largest database, i.e. Pfam, consumes 40\u2013230 GB, depending of the variant. Storage and transfer of such massive data has become a challenge.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>We propose a novel compression algorithm, CoMSA, designed especially for aligned data. It is based on a generalization of the positional Burrows\u2013Wheeler transform for non-binary alphabets. CoMSA handles FASTA, as well as Stockholm files. It offers up to six times better compression ratio than other commonly used compressors, i.e. gzip. Performed experiments resulted in an analysis of the influence of a protein family size on the compression ratio.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Availability and implementation<\/jats:title>\n                    <jats:p>CoMSA is available for free at https:\/\/github.com\/refresh-bio\/comsa and http:\/\/sun.aei.polsl.pl\/REFRESH\/comsa.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Supplementary material<\/jats:title>\n                    <jats:p>Supplementary data are available at Bioinformatics online.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1093\/bioinformatics\/bty619","type":"journal-article","created":{"date-parts":[[2018,7,13]],"date-time":"2018-07-13T07:22:43Z","timestamp":1531466563000},"page":"227-234","source":"Crossref","is-referenced-by-count":11,"title":["CoMSA: compression of protein multiple sequence alignment files"],"prefix":"10.1093","volume":"35","author":[{"given":"Sebastian","family":"Deorowicz","sequence":"first","affiliation":[{"name":"Institute of Informatics, Faculty of Automatic Control, Electronics and Computer Science, Silesian University of Technology, Gliwice, Poland"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Joanna","family":"Walczyszyn","sequence":"additional","affiliation":[{"name":"Institute of Informatics, Faculty of Automatic Control, Electronics and Computer Science, Silesian University of Technology, Gliwice, Poland"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Agnieszka","family":"Debudaj-Grabysz","sequence":"additional","affiliation":[{"name":"Institute of Informatics, Faculty of Automatic Control, Electronics and Computer Science, Silesian University of Technology, Gliwice, Poland"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2018,7,13]]},"reference":[{"key":"2023013107231655000_bty619-B1","doi-asserted-by":"crossref","first-page":"320","DOI":"10.1145\/5684.5688","article-title":"A locally adaptive data compression scheme","volume":"29","author":"Bentley","year":"1986","journal-title":"Commun. ACM"},{"key":"2023013107231655000_bty619-B2","doi-asserted-by":"crossref","first-page":"e59190","DOI":"10.1371\/journal.pone.0059190","article-title":"Compression of FASTQ and SAM format sequencing data","volume":"8","author":"Bonfield","year":"2013","journal-title":"PLoS One"},{"key":"2023013107231655000_bty619-B3","doi-asserted-by":"crossref","first-page":"396","DOI":"10.1109\/TCOM.1984.1096090","article-title":"Data compression using adaptive coding and partial string matching","volume":"32","author":"Cleary","year":"1984","journal-title":"IEEE Trans. Commun."},{"key":"2023013107231655000_bty619-B4","doi-asserted-by":"crossref","first-page":"i283","DOI":"10.1093\/bioinformatics\/btt214","article-title":"Compressive genomics for protein databases","volume":"29","author":"Daniels","year":"2013","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B5","doi-asserted-by":"crossref","first-page":"99","DOI":"10.1002\/spe.426","article-title":"Second step algorithms in the Burrows\u2013Wheeler compression algorithm","volume":"32","author":"Deorowicz","year":"2002","journal-title":"Software Pract. Exper."},{"key":"2023013107231655000_bty619-B6","doi-asserted-by":"crossref","first-page":"33964","DOI":"10.1038\/srep33964","article-title":"FAMSA: fast and accurate miltiple sequence alignment of huge protein families","volume":"6","author":"Deorowicz","year":"2016","journal-title":"Sci. Rep."},{"key":"2023013107231655000_bty619-B7","doi-asserted-by":"crossref","first-page":"2572","DOI":"10.1093\/bioinformatics\/btt460","article-title":"Genome compression: a novel approach for large collections","volume":"29","author":"Deorowicz","year":"2013","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B8","doi-asserted-by":"crossref","first-page":"25","DOI":"10.1186\/1748-7188-8-25","article-title":"Data compression for sequencing data","volume":"8","author":"Deorowicz","year":"2013","journal-title":"Algorithms Mol. Biol."},{"key":"2023013107231655000_bty619-B9","doi-asserted-by":"crossref","first-page":"1266","DOI":"10.1093\/bioinformatics\/btu014","article-title":"Efficient haplotype matching and storage using the positional Burrows-Wheeler transform (PBWT)","volume":"30","author":"Durbin","year":"2014","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B10","doi-asserted-by":"crossref","first-page":"731","DOI":"10.1093\/comjnl\/39.9.731","article-title":"The Burrows\u2013Wheeler transform for block sorting text compression: principles and Improvements","volume":"39","author":"Fenwick","year":"1996","journal-title":"Comput. J."},{"key":"2023013107231655000_bty619-B11","doi-asserted-by":"crossref","first-page":"D279","DOI":"10.1093\/nar\/gkv1344","article-title":"The Pfam protein families database: towards a more sustainable future","volume":"44","author":"Finn","year":"2016","journal-title":"Nucleic Acids Res."},{"key":"2023013107231655000_bty619-B12","doi-asserted-by":"crossref","first-page":"696","DOI":"10.1109\/TIT.2009.2037052","article-title":"Compression of Whole Genome Alignments","volume":"56","author":"Hanus","year":"2010","journal-title":"IEEE Trans. Inf. Theory"},{"key":"2023013107231655000_bty619-B13","doi-asserted-by":"crossref","first-page":"56","DOI":"10.3390\/info7040056","article-title":"A Survey on Data Compression Methods for Biological Sequences","volume":"7","author":"Hosseini","year":"2016","journal-title":"Information"},{"key":"2023013107231655000_bty619-B14","doi-asserted-by":"crossref","first-page":"1098","DOI":"10.1109\/JRPROC.1952.273898","article-title":"A method for the construction of minimum-redundancy codes","volume":"40","author":"Huffman","year":"1952","journal-title":"Proc. IRE"},{"key":"2023013107231655000_bty619-B15","doi-asserted-by":"crossref","first-page":"772","DOI":"10.1093\/molbev\/mst010","article-title":"MAFFT multiple sequence alignment software version 7: improvements in performance and usability","volume":"30","author":"Katoh","year":"2013","journal-title":"Mol. Biol. Evol."},{"key":"2023013107231655000_bty619-B16","doi-asserted-by":"crossref","first-page":"590","DOI":"10.1093\/bioinformatics\/btv613","article-title":"BGT: efficient and flexible genotype query across many samples","volume":"32","author":"Li","year":"2016","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B17","doi-asserted-by":"crossref","first-page":"e0116082","DOI":"10.1371\/journal.pone.0116082","article-title":"MAFCO: a compression tool for MAF files","volume":"10","author":"Matos","year":"2015","journal-title":"PLoS One"},{"key":"2023013107231655000_bty619-B18","doi-asserted-by":"crossref","first-page":"377","DOI":"10.1089\/cmb.2014.0156","article-title":"PASTA: ultra-large multiple sequence alignment for nucleotide and amino-acid sequences","volume":"22","author":"Mirarab","year":"2015","journal-title":"J. Comput. Biol."},{"key":"2023013107231655000_bty619-B19","doi-asserted-by":"crossref","first-page":"1005","DOI":"10.1038\/nmeth.4037","article-title":"Comparison of high-throughput sequencing data compression tools","volume":"13","author":"Numanagi\u0107","year":"2016","journal-title":"Nat. Methods"},{"key":"2023013107231655000_bty619-B20","doi-asserted-by":"crossref","first-page":"117","DOI":"10.1093\/bioinformatics\/btt594","article-title":"MFCompress: a compression tool for FASTA and multi-FASTA data","volume":"30","author":"Pinho","year":"2014","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B21","doi-asserted-by":"crossref","first-page":"911","DOI":"10.1093\/bioinformatics\/btx685","article-title":"ChIPWig: a random access-enabling lossless and lossy compression method for ChIP-seq data","volume":"34","author":"Ravanmehr","year":"2018","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B22","doi-asserted-by":"crossref","first-page":"2213","DOI":"10.1093\/bioinformatics\/btu208","article-title":"DSRC 2: industry-oriented compression of FASTQ files","volume":"30","author":"Roguski","year":"2014","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B23","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-84882-903-9","volume-title":"Handbook of Data Compression","author":"Salomon","year":"2010"},{"key":"2023013107231655000_bty619-B24","doi-asserted-by":"crossref","first-page":"539","DOI":"10.1038\/msb.2011.75","article-title":"Fast, scalable generation of high-quality protein multiple sequence alignments using Clustal Omega","volume":"7","author":"Sievers","year":"2011","journal-title":"Mol. Syst. Biol."},{"key":"2023013107231655000_bty619-B25","doi-asserted-by":"crossref","first-page":"e1002195","DOI":"10.1371\/journal.pbio.1002195","article-title":"Big Data: astronomical or Genomical?","volume":"13","author":"Stephens","year":"2015","journal-title":"PLoS Biol."},{"key":"2023013107231655000_bty619-B26","doi-asserted-by":"crossref","first-page":"173","DOI":"10.1093\/bioinformatics\/btv561","article-title":"smallWig: parallel compression of RNA-seq WIG files","volume":"32","author":"Wang","year":"2016","journal-title":"Bioinformatics"},{"key":"2023013107231655000_bty619-B27","doi-asserted-by":"crossref","first-page":"928","DOI":"10.1145\/322344.322346","article-title":"Data compression via textual substitution","volume":"29","author":"Storer","year":"1982","journal-title":"J. ACM"},{"key":"2023013107231655000_bty619-B28","doi-asserted-by":"crossref","first-page":"337","DOI":"10.1109\/TIT.1977.1055714","article-title":"A universal algorithm for sequential data compression","volume":"23","author":"Ziv","year":"1977","journal-title":"IEEE Trans. Inf. Theory"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/2\/227\/48963235\/bioinformatics_35_2_227.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/2\/227\/48963235\/bioinformatics_35_2_227.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,9,3]],"date-time":"2023-09-03T14:46:48Z","timestamp":1693752408000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/35\/2\/227\/5053318"}},"subtitle":[],"editor":[{"given":"John","family":"Hancock","sequence":"additional","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2018,7,13]]},"references-count":28,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2019,1,15]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/bty619","relation":{"has-preprint":[{"id-type":"doi","id":"10.1101\/240341","asserted-by":"object"}]},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2019,1,15]]},"published":{"date-parts":[[2018,7,13]]}}}