{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T00:39:41Z","timestamp":1784162381290,"version":"3.55.0"},"reference-count":56,"publisher":"Oxford University Press (OUP)","issue":"Supplement_1","license":[{"start":{"date-parts":[[2025,7,15]],"date-time":"2025-07-15T00:00:00Z","timestamp":1752537600000},"content-version":"vor","delay-in-days":14,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100000030","name":"U.S. Centers for Disease Control and Prevention","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000030","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Office of Advanced Molecular Detection","award":["#75D30123C17463"],"award-info":[{"award-number":["#75D30123C17463"]}]},{"name":"AMD AI & HPC Fund"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,7,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:sec>\n                  <jats:title>Motivation<\/jats:title>\n                  <jats:p>Multiple sequence alignment (MSA) is a fundamental operation in bioinformatics, yet existing MSA tools are struggling to keep up with the speed and volume of incoming data. This is because the runtimes and memory requirements of current MSA tools become untenable when processing large numbers of long input sequences, and they also fail to fully harness the parallelism provided by modern CPUs and GPUs.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Results<\/jats:title>\n                  <jats:p>We present Tall and Wide Alignments at High Throughput (TWILIGHT), a novel MSA tool optimized for speed, accuracy, scalability, and memory constraints, with both CPU and GPU support. TWILIGHT incorporates innovative parallelization and memory-efficiency strategies that enable it to build ultralarge alignments at high speed even on memory-constrained devices. On challenging datasets, TWILIGHT outperformed all other tools in speed and accuracy. It scaled beyond the limits of existing tools and performed an alignment of 1 million RNASim sequences within 30\u2009min while utilizing &amp;lt;16 GB of memory. TWILIGHT is the first tool to align over 8 million publicly available SARS-CoV-2 sequences, setting a new standard for large-scale genomic alignment and data analysis.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Availability and implementation<\/jats:title>\n                  <jats:p>TWILIGHT\u2019s code is freely available under the MIT license at https:\/\/github.com\/TurakhiaLab\/TWILIGHT. The test datasets and experimental results, including our alignment of 8 million SARS-CoV-2 sequences, are available at https:\/\/zenodo.org\/records\/14722035.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btaf212","type":"journal-article","created":{"date-parts":[[2025,7,15]],"date-time":"2025-07-15T13:02:40Z","timestamp":1752584560000},"page":"i332-i341","source":"Crossref","is-referenced-by-count":7,"title":["Ultrafast and ultralarge multiple sequence alignments using TWILIGHT"],"prefix":"10.1093","volume":"41","author":[{"ORCID":"https:\/\/orcid.org\/0009-0005-8758-9739","authenticated-orcid":false,"given":"Yu-Hsiang","family":"Tseng","sequence":"first","affiliation":[{"name":"Department of Electrical and Computer Engineering, University of California San Diego , San Diego, CA 92093,","place":["United States"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4557-2339","authenticated-orcid":false,"given":"Sumit","family":"Walia","sequence":"additional","affiliation":[{"name":"Department of Electrical and Computer Engineering, University of California San Diego , San Diego, CA 92093,","place":["United States"]}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5600-2900","authenticated-orcid":false,"given":"Yatish","family":"Turakhia","sequence":"additional","affiliation":[{"name":"Department of Electrical and Computer Engineering, University of California San Diego , San Diego, CA 92093,","place":["United States"]}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2025,7,15]]},"reference":[{"key":"2025071509023238000_btaf212-B1","doi-asserted-by":"crossref","first-page":"2340","DOI":"10.1093\/molbev\/msz142","article-title":"Identifying clusters of high confidence homologies in multiple sequence alignments","volume":"36","author":"Ali","year":"2019","journal-title":"Mol Biol Evol"},{"key":"2025071509023238000_btaf212-B2","doi-asserted-by":"crossref","first-page":"721","DOI":"10.1101\/gr.926603","article-title":"LAGAN and multi-LAGAN: efficient tools for large-scale multiple alignment of genomic DNA","volume":"13","author":"Brudno","year":"2003","journal-title":"Genome Res"},{"key":"2025071509023238000_btaf212-B3","doi-asserted-by":"crossref","first-page":"bbad190","DOI":"10.1093\/bib\/bbad190","article-title":"WMSA 2: a multiple DNA\/RNA sequence alignment tool implemented with accurate progressive mode and a fast win-win mode combining the center star and progressive strategies","volume":"24","author":"Chen","year":"2023","journal-title":"Brief Bioinform"},{"key":"2025071509023238000_btaf212-B4","doi-asserted-by":"crossref","first-page":"D67","DOI":"10.1093\/nar\/gkv1276","article-title":"GenBank","volume":"44","author":"Clark","year":"2016","journal-title":"Nucleic Acids Res"},{"key":"2025071509023238000_btaf212-B5","doi-asserted-by":"crossref","first-page":"746","DOI":"10.1038\/s41588-023-01368-0","article-title":"Maximum likelihood pandemic-scale phylogenetics","volume":"55","author":"De Maio","year":"2023","journal-title":"Nat Genet"},{"key":"2025071509023238000_btaf212-B6","first-page":"205","article-title":"A new generation of homology search tools based on probabilistic inference","volume":"23","author":"Eddy","year":"2009","journal-title":"Genome Inform"},{"key":"2025071509023238000_btaf212-B7","doi-asserted-by":"crossref","first-page":"1792","DOI":"10.1093\/nar\/gkh340","article-title":"MUSCLE: multiple sequence alignment with high accuracy and high throughput","volume":"32","author":"Edgar","year":"2004","journal-title":"Nucleic Acids Res"},{"key":"2025071509023238000_btaf212-B8","doi-asserted-by":"crossref","first-page":"6968","DOI":"10.1038\/s41467-022-34630-w","article-title":"Muscle5: high-accuracy alignment ensembles enable unbiased assessments of sequence homology and phylogeny","volume":"13","author":"Edgar","year":"2022","journal-title":"Nat Commun"},{"key":"2025071509023238000_btaf212-B9","doi-asserted-by":"crossref","first-page":"95","DOI":"10.1109\/MCSE.2022.3163817","article-title":"Nvidia Hopper GPU and grace CPU highlights","volume":"24","author":"Elster","year":"2022","journal-title":"Comput Sci Eng"},{"key":"2025071509023238000_btaf212-B10","doi-asserted-by":"crossref","first-page":"351","DOI":"10.1007\/BF02603120","article-title":"Progressive sequence alignment as a prerequisite to correct phylogenetic trees","volume":"25","author":"Feng","year":"1987","journal-title":"J Mol Evol"},{"key":"2025071509023238000_btaf212-B11","doi-asserted-by":"crossref","first-page":"W29","DOI":"10.1093\/nar\/gkr367","article-title":"HMMER web server: interactive sequence similarity searching","volume":"39","author":"Finn","year":"2011","journal-title":"Nucleic Acids Res"},{"key":"2025071509023238000_btaf212-B12","doi-asserted-by":"crossref","first-page":"1466","DOI":"10.1038\/s41587-019-0333-6","article-title":"Large multiple sequence alignments with a root-TO-leaf regressive method","volume":"37","author":"Garriga","year":"2019","journal-title":"Nat Biotechnol"},{"key":"2025071509023238000_btaf212-B13","doi-asserted-by":"crossref","first-page":"705","DOI":"10.1016\/0022-2836(82)90398-9","article-title":"An improved algorithm for matching biological sequences","volume":"162","author":"Gotoh","year":"1982","journal-title":"J Mol Biol"},{"key":"2025071509023238000_btaf212-B14","doi-asserted-by":"crossref","first-page":"4355","DOI":"10.1073\/pnas.84.13.4355","article-title":"Profile analysis: detection of distantly related proteins","volume":"84","author":"Gribskov","year":"1987","journal-title":"Proc Natl Acad Sci USA"},{"key":"2025071509023238000_btaf212-B15","author":"Guo","year":"2009"},{"key":"2025071509023238000_btaf212-B16","doi-asserted-by":"crossref","first-page":"veac080","DOI":"10.1093\/ve\/veac080","article-title":"The origins and molecular evolution of SARS-CoV-2 lineage B.1.1.7 in the UK","volume":"8","author":"Hill","year":"2022","journal-title":"Virus Evol"},{"key":"2025071509023238000_btaf212-B17","doi-asserted-by":"crossref","first-page":"141","DOI":"10.1038\/s41579-020-00459-7","article-title":"Characteristics of SARS-cov-2 AND COVID-19","volume":"19","author":"Hu","year":"2021","journal-title":"Nat Rev Microbiol"},{"key":"2025071509023238000_btaf212-B18","doi-asserted-by":"crossref","first-page":"583","DOI":"10.1038\/s41586-021-03819-2","article-title":"Highly accurate protein structure prediction with alphafold","volume":"596","author":"Jumper","year":"2021","journal-title":"Nature"},{"key":"2025071509023238000_btaf212-B19","doi-asserted-by":"crossref","first-page":"428","DOI":"10.1038\/s41576-020-0233-0","article-title":"Phylogenetic tree building in the genomic age","volume":"21","author":"Kapli","year":"2020","journal-title":"Nat Rev Genet"},{"key":"2025071509023238000_btaf212-B20","doi-asserted-by":"crossref","first-page":"772","DOI":"10.1093\/molbev\/mst010","article-title":"MAFFT multiple sequence alignment software version 7: improvements in performance and usability","volume":"30","author":"Katoh","year":"2013","journal-title":"Mol Biol Evol"},{"key":"2025071509023238000_btaf212-B21","doi-asserted-by":"crossref","first-page":"372","DOI":"10.1093\/bioinformatics\/btl592","article-title":"PartTree: an algorithm to build an approximate tree from a large number of unaligned sequences","volume":"23","author":"Katoh","year":"2007","journal-title":"Bioinformatics"},{"key":"2025071509023238000_btaf212-B22","doi-asserted-by":"crossref","first-page":"3059","DOI":"10.1093\/nar\/gkf436","article-title":"MAFFT: a novel method for rapid multiple sequence alignment based on fast Fourier transform","volume":"30","author":"Katoh","year":"2002","journal-title":"Nucleic Acids Res"},{"key":"2025071509023238000_btaf212-B23","doi-asserted-by":"crossref","first-page":"511","DOI":"10.1093\/nar\/gki198","article-title":"MAFFT version 5: improvement in accuracy of multiple sequence alignment","volume":"33","author":"Katoh","year":"2005","journal-title":"Nucleic Acids Res"},{"key":"2025071509023238000_btaf212-B24","doi-asserted-by":"crossref","first-page":"1762","DOI":"10.21105\/joss.01762","article-title":"Mashtree: A rapid comparison of whole genome sequence files","volume":"4","author":"Katz","year":"2019","journal-title":"JOSS"},{"key":"2025071509023238000_btaf212-B25","doi-asserted-by":"crossref","first-page":"e02269-23","DOI":"10.1128\/spectrum.02269-23","article-title":"Identifying featured indels associated with SARS-CoV-2 fitness","volume":"11","author":"Li","year":"2023","journal-title":"Microbiol Spectrum"},{"key":"2025071509023238000_btaf212-B26","doi-asserted-by":"crossref","first-page":"90","DOI":"10.1093\/sysbio\/syr095","article-title":"SATe-II: very fast and accurate simultaneous estimation of multiple sequence alignments and phylogenetic trees","volume":"61","author":"Liu","year":"2012","journal-title":"Syst Biol"},{"key":"2025071509023238000_btaf212-B27","doi-asserted-by":"crossref","first-page":"btad540","DOI":"10.1093\/bioinformatics\/btad540","article-title":"AliSim-HPC: parallel sequence simulator for phylogenetics","volume":"39","author":"Ly-Trong","year":"2023","journal-title":"Bioinformatics"},{"key":"2025071509023238000_btaf212-B28","first-page":"24","article-title":"COVID-19 genomics UK (COG-UK) consortium: final report","volume":"9","author":"Marjanovic","year":"2022","journal-title":"Rand Health Q"},{"key":"2025071509023238000_btaf212-B29","doi-asserted-by":"crossref","first-page":"21","DOI":"10.1038\/d41586-021-01069-w","article-title":"One million coronavirus sequences: popular genome site hits mega milestone","volume":"593","author":"Maxmen","year":"2021","journal-title":"Nature"},{"key":"2025071509023238000_btaf212-B30","doi-asserted-by":"crossref","first-page":"5819","DOI":"10.1093\/molbev\/msab264","article-title":"A daily-updated database and tools for comprehensive SARS-CoV-2 mutation-annotated trees","volume":"38","author":"McBroome","year":"2021","journal-title":"Mol Biol Evol"},{"key":"2025071509023238000_btaf212-B31","doi-asserted-by":"crossref","first-page":"1530","DOI":"10.1093\/molbev\/msaa015","article-title":"IQ-TREE 2: new models and efficient methods for phylogenetic inference in the genomic era","volume":"37","author":"Minh","year":"2020","journal-title":"Mol Biol Evol"},{"key":"2025071509023238000_btaf212-B32","doi-asserted-by":"crossref","first-page":"3250","DOI":"10.1093\/bioinformatics\/btr553","article-title":"FASTSP: linear time calculation of alignment accuracy","volume":"27","author":"Mirarab","year":"2011","journal-title":"Bioinformatics"},{"key":"2025071509023238000_btaf212-B33","doi-asserted-by":"crossref","first-page":"377","DOI":"10.1089\/cmb.2014.0156","article-title":"PASTA: ultra-large multiple sequence alignment for nucleotide and amino-acid sequences","volume":"22","author":"Mirarab","year":"2015","journal-title":"J Comput Biol"},{"key":"2025071509023238000_btaf212-B34","doi-asserted-by":"crossref","first-page":"714","DOI":"10.1093\/bioinformatics\/btaa743","article-title":"ViralMSA: massively scalable reference-guided multiple sequence alignment of viral genomes","volume":"37","author":"Moshiri","year":"2021","journal-title":"Bioinformatics"},{"key":"2025071509023238000_btaf212-B35","doi-asserted-by":"crossref","first-page":"443","DOI":"10.1016\/0022-2836(70)90057-4","article-title":"A general method applicable to the search for similarities in the amino acid sequence of two proteins","volume":"48","author":"Needleman","year":"1970","journal-title":"J Mol Biol"},{"key":"2025071509023238000_btaf212-B36","doi-asserted-by":"crossref","first-page":"124","DOI":"10.1186\/s13059-015-0688-z","article-title":"Ultra-large alignments using phylogeny-aware profiles","volume":"16","author":"Nguyen","year":"2015","journal-title":"Genome Biol"},{"key":"2025071509023238000_btaf212-B37","doi-asserted-by":"crossref","first-page":"205","DOI":"10.1006\/jmbi.2000.4042","article-title":"T-Coffee: a novel method for fast and accurate multiple sequence alignment","volume":"302","author":"Notredame","year":"2000","journal-title":"J Mol Biol"},{"key":"2025071509023238000_btaf212-B38","doi-asserted-by":"crossref","first-page":"1595","DOI":"10.1002\/j.1538-7305.1984.tb00055.x","article-title":"The UNIX system: program design in the UNIX environment","volume":"63","author":"Pike","year":"1984","journal-title":"AT&T Bell Lab Tech J"},{"key":"2025071509023238000_btaf212-B39","doi-asserted-by":"crossref","first-page":"e9490","DOI":"10.1371\/journal.pone.0009490","article-title":"FastTree 2\u2014approximately maximum-likelihood trees for large alignments","volume":"5","author":"Price","year":"2010","journal-title":"PLoS One"},{"key":"2025071509023238000_btaf212-B40","doi-asserted-by":"crossref","first-page":"131","DOI":"10.1016\/0025-5564(81)90043-2","article-title":"Comparison of phylogenetic trees","volume":"53","author":"Robinson","year":"1981","journal-title":"Math Biosci"},{"key":"2025071509023238000_btaf212-B41","first-page":"406","article-title":"The neighbor-joining method: a new method for reconstructing phylogenetic trees","volume":"4","author":"Saitou","year":"1987","journal-title":"Mol Biol Evol"},{"key":"2025071509023238000_btaf212-B42","doi-asserted-by":"crossref","first-page":"539","DOI":"10.1038\/msb.2011.75","article-title":"Fast, scalable generation of high-quality protein multiple sequence alignments using Clustal Omega","volume":"7","author":"Sievers","year":"2011","journal-title":"Mol Syst Biol"},{"key":"2025071509023238000_btaf212-B43","doi-asserted-by":"crossref","first-page":"e1008950","DOI":"10.1371\/journal.pcbi.1008950","article-title":"Recursive MAGUS: scalable and accurate multiple sequence alignment","volume":"17","author":"Smirnov","year":"2021","journal-title":"PLoS Comput Biol"},{"key":"2025071509023238000_btaf212-B44","doi-asserted-by":"crossref","first-page":"1666","DOI":"10.1093\/bioinformatics\/btaa992","article-title":"MAGUS: Multiple sequence Alignment using Graph clUStering","volume":"37","author":"Smirnov","year":"2021","journal-title":"Bioinformatics"},{"key":"2025071509023238000_btaf212-B45","doi-asserted-by":"crossref","first-page":"2688","DOI":"10.1093\/bioinformatics\/btl446","article-title":"RAxML-VI-HPC: maximum likelihood-based phylogenetic analyses with thousands of taxa and mixed models","volume":"22","author":"Stamatakis","year":"2006","journal-title":"Bioinformatics"},{"key":"2025071509023238000_btaf212-B46","doi-asserted-by":"crossref","first-page":"msac166","DOI":"10.1093\/molbev\/msac166","article-title":"HAlign 3: fast multiple alignment of ultra-large numbers of similar DNA\/RNA sequences","volume":"39","author":"Tang","year":"2022","journal-title":"Mol Biol Evol"},{"key":"2025071509023238000_btaf212-B47","doi-asserted-by":"crossref","first-page":"4673","DOI":"10.1093\/nar\/22.22.4673","article-title":"CLUSTAL W: improving the sensitivity of progressive multiple sequence alignment through sequence weighting, position-specific gap penalties and weight matrix choice","volume":"22","author":"Thompson","year":"1994","journal-title":"Nucleic Acids Res"},{"key":"2025071509023238000_btaf212-B48","first-page":"19","article-title":"Improved sensitivity of profile searches through the use of sequence weights and gap excision","volume":"10","author":"Thompson","year":"1994","journal-title":"Comput Appl Biosci"},{"key":"2025071509023238000_btaf212-B49","doi-asserted-by":"crossref","first-page":"199","DOI":"10.1145\/3296957.3173193","article-title":"Darwin: a genomics co-processor provides up to 15,000X acceleration on long read assembly","volume":"53","author":"Turakhia","year":"2018","journal-title":"SIGPLAN Not"},{"key":"2025071509023238000_btaf212-B50","first-page":"809","volume-title":"Nat Genet","author":"Turakhia","year":"2021"},{"key":"2025071509023238000_btaf212-B51","doi-asserted-by":"crossref","first-page":"737","DOI":"10.1101\/gr.214270.116","article-title":"Fast and accurate de novo genome assembly from long uncorrected reads","volume":"27","author":"Vaser","year":"2017","journal-title":"Genome Res"},{"key":"2025071509023238000_btaf212-B52","doi-asserted-by":"crossref","first-page":"1783","DOI":"10.1093\/molbev\/msy055","article-title":"Alignment modulates ancestral sequence reconstruction accuracy","volume":"35","author":"Vialle","year":"2018","journal-title":"Mol Biol Evol"},{"key":"2025071509023238000_btaf212-B53","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4842-4398-5","volume-title":"Pro TBB: C++ Parallel Programming with Threading Building Blocks","author":"Voss","year":"2019"},{"key":"2025071509023238000_btaf212-B54","first-page":"91","author":"Walia","year":"2024"},{"key":"2025071509023238000_btaf212-B55","first-page":"462","author":"Zeni","year":"2020"},{"key":"2025071509023238000_btaf212-B56","doi-asserted-by":"crossref","first-page":"203","DOI":"10.1089\/10665270050081478","article-title":"A greedy algorithm for aligning DNA sequences","volume":"7","author":"Zhang","year":"2000","journal-title":"J Comput Biol"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/41\/Supplement_1\/i332\/63745685\/btaf212.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/41\/Supplement_1\/i332\/63745685\/btaf212.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,7,15]],"date-time":"2025-07-15T13:02:49Z","timestamp":1752584569000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/41\/Supplement_1\/i332\/8199405"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,1]]},"references-count":56,"journal-issue":{"issue":"Supplement_1","published-print":{"date-parts":[[2025,7,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btaf212","relation":{},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2025,7]]},"published":{"date-parts":[[2025,7,1]]}}}