{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,6]],"date-time":"2026-07-06T18:21:07Z","timestamp":1783362067342,"version":"3.54.6"},"reference-count":176,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62472064"],"award-info":[{"award-number":["62472064"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Computer Science Review"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.cosrev.2026.101026","type":"journal-article","created":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T19:41:39Z","timestamp":1781811699000},"page":"101026","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Biological sequence clustering: A survey"],"prefix":"10.1016","volume":"62","author":[{"given":"Simeng","family":"Zhang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xinying","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jun","family":"Lou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mudi","family":"Jiang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Quan","family":"Zou","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zengyou","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0005","doi-asserted-by":"crossref","first-page":"3753","DOI":"10.1038\/s41598-019-40452-6","article-title":"Alignment-free method for DNA sequence clustering using fuzzy integral similarity","volume":"9","author":"Saw","year":"2019","journal-title":"Sci. Rep."},{"issue":"D1","key":"10.1016\/j.cosrev.2026.101026_bib0010","doi-asserted-by":"crossref","first-page":"D387","DOI":"10.1093\/nar\/gkab1053","article-title":"The sequence read archive: a decade more of explosive growth","volume":"50","author":"Katz","year":"2022","journal-title":"Nucleic Acids Research"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0015","doi-asserted-by":"crossref","first-page":"107","DOI":"10.1093\/bib\/bbr009","article-title":"A large-scale benchmark study of existing algorithms for taxonomy-independent microbial community analysis","volume":"13","author":"Sun","year":"2012","journal-title":"Brief. Bioinform."},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0020","doi-asserted-by":"crossref","first-page":"500","DOI":"10.1093\/bioinformatics\/18.3.500","article-title":"DIVERGE: phylogeny-based analysis for functional-structural divergence of a protein family","volume":"18","author":"Gu","year":"2002","journal-title":"Bioinformatics"},{"key":"10.1016\/j.cosrev.2026.101026_bib0025","series-title":"AIP Conference Proceedings, 1862","doi-asserted-by":"crossref","DOI":"10.1063\/1.4991238","article-title":"Application of K-means clustering algorithm in grouping the DNA sequences of hepatitis B virus (HBV)","author":"Bustamam","year":"2017"},{"key":"10.1016\/j.cosrev.2026.101026_bib0030","doi-asserted-by":"crossref","DOI":"10.1093\/database\/baw163","article-title":"Duplicates, redundancies and inconsistencies in the primary nucleotide databases: a descriptive study","volume":"2017","author":"Chen","year":"2017","journal-title":"Database"},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0035","doi-asserted-by":"crossref","first-page":"234","DOI":"10.6026\/97320630005234","article-title":"Protein sequence redundancy reduction: comparison of various method","volume":"5","author":"Sikic","year":"2010","journal-title":"Bioinformation"},{"key":"10.1016\/j.cosrev.2026.101026_bib0040","series-title":"International Conference on Computational Advances in Bio and Medical Sciences","first-page":"127","article-title":"Clustering based identification of SARS-CoV-2 subtypes","author":"Melnyk","year":"2020"},{"key":"10.1016\/j.cosrev.2026.101026_bib0045","series-title":"Proceedings of the 5th International Conference on Big Data Research","first-page":"42","article-title":"Effective and scalable clustering of SARS-CoV-2 sequences","author":"Ali","year":"2022"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0050","doi-asserted-by":"crossref","first-page":"6428","DOI":"10.1038\/s41598-024-57001-5","article-title":"Clustering analysis for the evolutionary relationships of SARS-CoV-2 strains","volume":"14","author":"Chen","year":"2024","journal-title":"Sci. Rep."},{"issue":"12","key":"10.1016\/j.cosrev.2026.101026_bib0055","doi-asserted-by":"crossref","first-page":"348","DOI":"10.3390\/a14120348","article-title":"Robust representation and efficient feature selection allows for effective clustering of SARS-COV-2 variants","volume":"14","author":"Tayebi","year":"2021","journal-title":"Algorithms"},{"key":"10.1016\/j.cosrev.2026.101026_bib0060","series-title":"International Conference on Computational Advances in Bio and Medical Sciences","first-page":"133","article-title":"Clustering SARS-CoV-2 variants from raw high-throughput sequencing reads data","author":"Chourasia","year":"2021"},{"issue":"4","key":"10.1016\/j.cosrev.2026.101026_bib0065","doi-asserted-by":"crossref","first-page":"1222","DOI":"10.1093\/bib\/bbx161","article-title":"A survey and evaluations of histogram-based statistics in alignment-free sequence comparison","volume":"20","author":"Luczak","year":"2019","journal-title":"Brief. Bioinform."},{"issue":"13","key":"10.1016\/j.cosrev.2026.101026_bib0070","doi-asserted-by":"crossref","first-page":"1658","DOI":"10.1093\/bioinformatics\/btl158","article-title":"CD-hit: a fast program for clustering and comparing large sets of protein or nucleotide sequences","volume":"22","author":"Li","year":"2006","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0075","doi-asserted-by":"crossref","first-page":"132","DOI":"10.1186\/s13059-016-0997-x","article-title":"Mash: fast genome and metagenome distance estimation using MinHash","volume":"17","author":"Ondov","year":"2016","journal-title":"Genome Biol."},{"issue":"2","key":"10.1016\/j.cosrev.2026.101026_bib0080","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1371\/journal.pcbi.1006721","article-title":"16S rRNA sequence embeddings: meaningful numeric feature representations of nucleotide sequences that are convenient for downstream analyses","volume":"15","author":"Woloszynek","year":"2019","journal-title":"PLOS Comput. Biol."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0085","doi-asserted-by":"crossref","first-page":"43","DOI":"10.1186\/1471-2105-14-43","article-title":"M-pick, a modularity-based method for OTU picking of 16S rRNA sequences","volume":"14","author":"Wang","year":"2013","journal-title":"BMC Bioinform."},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0090","doi-asserted-by":"crossref","first-page":"656","DOI":"10.1093\/bib\/bbs035","article-title":"Ultrafast clustering algorithms for metagenomic sequence analysis","volume":"13","author":"Li","year":"2012","journal-title":"Brief. Bioinform."},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0095","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3131611","article-title":"Comparative analysis of sequence clustering methods for deduplication of biological databases","volume":"9","author":"Chen","year":"2018","journal-title":"Journal of Data & Information Quality"},{"issue":"8","key":"10.1016\/j.cosrev.2026.101026_bib0100","article-title":"A comparison of methods for clustering 16S rRNA sequences into OTUs","volume":"8","author":"Chen","year":"2013","journal-title":"PLoS One"},{"key":"10.1016\/j.cosrev.2026.101026_bib0105","doi-asserted-by":"crossref","DOI":"10.3389\/fmicb.2021.644012","article-title":"Comparison of methods for picking the operational taxonomic units from amplicon sequences","volume":"12","author":"Wei","year":"2021","journal-title":"Front. Microbiol."},{"key":"10.1016\/j.cosrev.2026.101026_bib0110","first-page":"1","article-title":"Sequence clustering in bioinformatics: an empirical study","volume":"21","author":"Zou","year":"2020","journal-title":"Brief. Bioinform."},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0115","doi-asserted-by":"crossref","first-page":"2874","DOI":"10.1109\/TCBB.2023.3253138","article-title":"Comparison of methods for biological sequence clustering","volume":"20","author":"Wei","year":"2023","journal-title":"IEEE\/ACM Trans. Comput. Biol. Bioinform."},{"key":"10.1016\/j.cosrev.2026.101026_bib0120","series-title":"International Symposium on Bioinformatics Research and Applications","first-page":"359","article-title":"An in-depth assessment of sequence clustering software in bioinformatics","author":"Ju","year":"2024"},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0125","doi-asserted-by":"crossref","first-page":"1011","DOI":"10.26599\/BDMA.2025.9020010","article-title":"A comparative study of sequence clustering algorithms","volume":"8","author":"Ju","year":"2025","journal-title":"Big Data Min. Anal."},{"issue":"4","key":"10.1016\/j.cosrev.2026.101026_bib0130","doi-asserted-by":"crossref","first-page":"369","DOI":"10.1007\/s42979-025-03905-6","article-title":"Biological sequence clustering: novel approaches and a comparative study","volume":"6","author":"Matar","year":"2025","journal-title":"SN Comput. Sci."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0135","doi-asserted-by":"crossref","first-page":"393","DOI":"10.1093\/bib\/bbz170","article-title":"Deep learning-based clustering approaches for bioinformatics","volume":"22","author":"Karim","year":"2021","journal-title":"Brief. Bioinform."},{"key":"10.1016\/j.cosrev.2026.101026_bib0140","doi-asserted-by":"crossref","DOI":"10.1016\/j.sbi.2025.103078","article-title":"Large-scale protein clustering in the age of deep learning","volume":"94","author":"Pereira","year":"2025","journal-title":"Curr. Opin. Struct. Biol."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0145","doi-asserted-by":"crossref","first-page":"121","DOI":"10.1186\/s13059-023-02961-6","article-title":"RabbitTClust: enabling fast clustering analysis of millions of bacteria genomes with MinHash sketches","volume":"24","author":"Xu","year":"2023","journal-title":"Genome Biol."},{"key":"10.1016\/j.cosrev.2026.101026_bib0150","doi-asserted-by":"crossref","DOI":"10.1016\/j.compbiomed.2019.103439","article-title":"SpCLUST: towards a fast and reliable clustering for potentially divergent biological sequences","volume":"114","author":"Matar","year":"2019","journal-title":"Comput. Biol. Med."},{"key":"10.1016\/j.cosrev.2026.101026_bib0155","doi-asserted-by":"crossref","first-page":"66","DOI":"10.1016\/j.compbiomed.2017.12.003","article-title":"A clustering package for nucleotide sequences using Laplacian eigenmaps and Gaussian mixture model","volume":"93","author":"Bruneau","year":"2018","journal-title":"Comput. Biol. Med."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0160","doi-asserted-by":"crossref","first-page":"186","DOI":"10.1186\/s13059-017-1319-7","article-title":"Alignment-free sequence comparison: benefits, applications, and tools","volume":"18","author":"Zielezinski","year":"2017","journal-title":"Genome Biol."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0165","doi-asserted-by":"crossref","first-page":"132","DOI":"10.1186\/s13059-016-0997-x","article-title":"Mash: fast genome and metagenome distance estimation using MinHash","volume":"17","author":"Ondov","year":"2016","journal-title":"Genome Biol."},{"issue":"19","key":"10.1016\/j.cosrev.2026.101026_bib0170","doi-asserted-by":"crossref","first-page":"3547","DOI":"10.1093\/bioinformatics\/btz272","article-title":"Evolution of biosequence search algorithms: a brief survey","volume":"35","author":"Kucherov","year":"2019","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0175","doi-asserted-by":"crossref","first-page":"119","DOI":"10.1109\/TCBB.2022.3140873","article-title":"Alignment-free sequence comparison: a systematic survey from a machine learning perspective","volume":"20","author":"Bohnsack","year":"2023","journal-title":"IEEE\/ACM Trans. Comput. Biol. Bioinform."},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0180","doi-asserted-by":"crossref","first-page":"538","DOI":"10.1007\/BF02602925","article-title":"Average values of a dissimilarity measure not requiring sequence alignment are twice the averages of conventional mismatch counts requiring sequence alignment for a computer-generated model system","volume":"29","author":"Blaisdell","year":"1989","journal-title":"Journal of Molecular Evolution"},{"issue":"10","key":"10.1016\/j.cosrev.2026.101026_bib0185","doi-asserted-by":"crossref","first-page":"1391","DOI":"10.1093\/oxfordjournals.molbev.a026048","article-title":"Genomic signature: characterization and classification of species assessed by chaos game representation of sequences","volume":"16","author":"Deschavanne","year":"1999","journal-title":"Mol. Biol. Evol."},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0190","doi-asserted-by":"crossref","DOI":"10.1371\/journal.pone.0173288","article-title":"On DNA numerical representations for genomic similarity computation","volume":"12","author":"Mendizabal-Ruiz","year":"2017","journal-title":"PLoS One"},{"key":"10.1016\/j.cosrev.2026.101026_bib0195","series-title":"Affective Computing and Intelligent Interaction","first-page":"379","article-title":"DNA sequences analysis based on classifications of nucleotide bases","author":"Shi","year":"2012"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0200","doi-asserted-by":"crossref","DOI":"10.1155\/S111086570430925X","article-title":"Autoregressive modeling and feature analysis of DNA sequences","volume":"2004","author":"Chakravarthy","year":"2004","journal-title":"EURASIP Journal on Advances in Signal Processing"},{"issue":"8","key":"10.1016\/j.cosrev.2026.101026_bib0205","doi-asserted-by":"crossref","first-page":"10727","DOI":"10.1007\/s13369-023-07719-7","article-title":"A novel clustering-based hybrid feature selection approach using ant colony optimization","volume":"48","author":"Dwivedi","year":"2023","journal-title":"Arab. J. Sci. Eng."},{"key":"10.1016\/j.cosrev.2026.101026_bib0210","series-title":"International Conference on Neural Information Processing","first-page":"659","article-title":"A hybrid feature selection approach for data clustering based on ant colony optimization","author":"Dwivedi","year":"2022"},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0215","doi-asserted-by":"crossref","first-page":"3554","DOI":"10.1007\/s11227-023-05602-8","article-title":"A novel apache spark-based 14-dimensional scalable feature extraction approach for the clustering of genomics data","volume":"80","author":"Dwivedi","year":"2024","journal-title":"The Journal of Supercomputing"},{"issue":"7","key":"10.1016\/j.cosrev.2026.101026_bib0220","doi-asserted-by":"crossref","first-page":"3165","DOI":"10.1007\/s00500-025-10622-y","article-title":"A scalable method for extracting features using a complex network from SNP sequences and clustering using the scalable max of Min algorithm","volume":"29","author":"Kansal","year":"2025","journal-title":"Soft Comput."},{"issue":"34","key":"10.1016\/j.cosrev.2026.101026_bib0225","doi-asserted-by":"crossref","first-page":"43225","DOI":"10.1007\/s11042-025-20864-5","article-title":"Scalable alignment-free feature extraction approach for genome data and their cluster analysis","volume":"84","author":"Tripathi","year":"2025","journal-title":"Multimed. Tools Appl."},{"issue":"4","key":"10.1016\/j.cosrev.2026.101026_bib0230","doi-asserted-by":"crossref","first-page":"513","DOI":"10.1093\/bioinformatics\/btg005","article-title":"Alignment-free sequence comparison\u2014a review","volume":"19","author":"Vinga","year":"2003","journal-title":"Bioinformatics"},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0235","doi-asserted-by":"crossref","first-page":"376","DOI":"10.1093\/bib\/bbt068","article-title":"Information theory applications for biological sequence analysis","volume":"15","author":"Vinga","year":"2014","journal-title":"Brief. Bioinform."},{"issue":"12","key":"10.1016\/j.cosrev.2026.101026_bib0240","doi-asserted-by":"crossref","first-page":"1615","DOI":"10.1089\/cmb.2009.0198","article-title":"Alignment-free sequence comparison (I): statistics and power","volume":"16","author":"Reinert","year":"2009","journal-title":"J. Comput. Biol."},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0245","doi-asserted-by":"crossref","first-page":"890","DOI":"10.1093\/bib\/bbt052","article-title":"Alignment-free genetic sequence comparisons: a review of recent approaches by word analysis","volume":"15","author":"Bonham-Carter","year":"2014","journal-title":"Brief. Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0250","doi-asserted-by":"crossref","first-page":"78","DOI":"10.1016\/j.mbs.2008.06.001","article-title":"WSE, a new sequence distance measure based on word frequencies","volume":"215","author":"Wang","year":"2008","journal-title":"Math. Biosci."},{"issue":"2\u20133","key":"10.1016\/j.cosrev.2026.101026_bib0255","doi-asserted-by":"crossref","first-page":"67","DOI":"10.1016\/j.biosystems.2011.06.009","article-title":"A mathematical consideration of the word-composition vector method in comparison of biological sequences","volume":"106","author":"Aita","year":"2011","journal-title":"Biosystems"},{"issue":"13","key":"10.1016\/j.cosrev.2026.101026_bib0260","doi-asserted-by":"crossref","first-page":"1609","DOI":"10.1093\/bioinformatics\/btp275","article-title":"A practical algorithm for finding maximal exact matches in large sequence datasets using sparse suffix arrays","volume":"25","author":"Khan","year":"2009","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0265","doi-asserted-by":"crossref","first-page":"199","DOI":"10.1186\/s13059-019-1809-x","article-title":"When the levee breaks: a practical guide to sketching algorithms for processing the flood of genomic data","volume":"20","author":"Rowe","year":"2019","journal-title":"Genome Biol."},{"key":"10.1016\/j.cosrev.2026.101026_bib0270","doi-asserted-by":"crossref","DOI":"10.1016\/j.compeleceng.2025.110175","article-title":"A novel chemical property-based, alignment-free scalable feature extraction method for genomic data clustering","volume":"123","author":"Dwivedi","year":"2025","journal-title":"Comput. Electr. Eng."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0275","doi-asserted-by":"crossref","first-page":"75","DOI":"10.1109\/TIT.1976.1055501","article-title":"On the complexity of finite sequences","volume":"22","author":"Lempel","year":"2003","journal-title":"IEEE Trans. Inf. Theory"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0280","doi-asserted-by":"crossref","first-page":"428","DOI":"10.1186\/1471-2105-11-428","article-title":"Clustering of protein families into functional subtypes using relative complexity measure with reduced amino acid alphabets","volume":"11","author":"Albayrak","year":"2010","journal-title":"BMC Bioinform."},{"key":"10.1016\/j.cosrev.2026.101026_bib0285","first-page":"1","article-title":"Scalable homology detection with ERAST","author":"Jiang","year":"2026","journal-title":"Nat. Biotechnol."},{"key":"10.1016\/j.cosrev.2026.101026_bib0290","series-title":"Mathematical and Statistical Methods for Genetic Analysis","volume":"vol. 488","author":"Lange","year":"2002"},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0295","doi-asserted-by":"crossref","first-page":"1009","DOI":"10.1093\/bib\/bbv099","article-title":"Multiple sequence alignment modeling: methods and applications","volume":"17","author":"Chatzou","year":"2016","journal-title":"Brief. Bioinform."},{"issue":"16","key":"10.1016\/j.cosrev.2026.101026_bib0300","doi-asserted-by":"crossref","first-page":"2122","DOI":"10.1093\/bioinformatics\/btg295","article-title":"A new sequence distance measure for phylogenetic tree construction","volume":"19","author":"Otu","year":"2003","journal-title":"Bioinformatics"},{"issue":"12","key":"10.1016\/j.cosrev.2026.101026_bib0305","doi-asserted-by":"crossref","first-page":"3250","DOI":"10.1109\/TIT.2004.838101","article-title":"The similarity metric","volume":"50","author":"Li","year":"2004","journal-title":"IEEE Trans. Inf. Theory"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0310","doi-asserted-by":"crossref","first-page":"778","DOI":"10.1016\/j.ygeno.2020.10.009","article-title":"Clustering and classification of virus sequence through music communication protocol and wavelet transform","volume":"113","author":"Paul","year":"2021","journal-title":"Genomics"},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0315","doi-asserted-by":"crossref","first-page":"282","DOI":"10.1093\/bioinformatics\/17.3.282","article-title":"Clustering of highly homologous sequences to reduce the size of large protein databases","volume":"17","author":"Li","year":"2001","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0320","doi-asserted-by":"crossref","first-page":"77","DOI":"10.1093\/bioinformatics\/18.1.77","article-title":"Tolerating some redundancy significantly speeds up clustering of large protein databases","volume":"18","author":"Li","year":"2002","journal-title":"Bioinformatics"},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0325","doi-asserted-by":"crossref","first-page":"680","DOI":"10.1093\/bioinformatics\/btq003","article-title":"CD-HIT suite: a web server for clustering and comparing biological sequences","volume":"26","author":"Huang","year":"2010","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0330","doi-asserted-by":"crossref","first-page":"187","DOI":"10.1186\/1471-2105-11-187","article-title":"Artificial and natural duplicates in pyrosequencing reads of metagenomic data","volume":"11","author":"Niu","year":"2010","journal-title":"BMC Bioinform."},{"issue":"23","key":"10.1016\/j.cosrev.2026.101026_bib0335","doi-asserted-by":"crossref","first-page":"3150","DOI":"10.1093\/bioinformatics\/bts565","article-title":"CD-HIT: accelerated for clustering the next-generation sequencing data","volume":"28","author":"Fu","year":"2012","journal-title":"Bioinformatics"},{"issue":"19","key":"10.1016\/j.cosrev.2026.101026_bib0340","doi-asserted-by":"crossref","first-page":"2460","DOI":"10.1093\/bioinformatics\/btq461","article-title":"Search and clustering orders of magnitude faster than BLAST","volume":"26","author":"Edgar","year":"2010","journal-title":"Bioinformatics"},{"issue":"10","key":"10.1016\/j.cosrev.2026.101026_bib0345","doi-asserted-by":"crossref","first-page":"996","DOI":"10.1038\/nmeth.2604","article-title":"UPARSE: highly accurate OTU sequences from microbial amplicon reads","volume":"10","author":"Edgar","year":"2013","journal-title":"Nat. Methods"},{"key":"10.1016\/j.cosrev.2026.101026_bib0350","doi-asserted-by":"crossref","DOI":"10.7717\/peerj.2584","article-title":"VSEARCH: a versatile open source tool for metagenomics","volume":"4","author":"Rognes","year":"2016","journal-title":"PeerJ"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0355","doi-asserted-by":"crossref","first-page":"601","DOI":"10.1186\/1471-2105-11-601","article-title":"A grammar-based distance metric enables fast and accurate clustering of large sets of 16S sequences","volume":"11","author":"Russell","year":"2010","journal-title":"BMC Bioinform."},{"key":"10.1016\/j.cosrev.2026.101026_bib0360","series-title":"Programs and Abstracts of the SeqBio 2013 Workshop","first-page":"27","article-title":"SUMATRA and SUMACLUST: fast and exact comparison and clustering of sequences","author":"Mercier","year":"2013"},{"issue":"18","key":"10.1016\/j.cosrev.2026.101026_bib0365","doi-asserted-by":"crossref","first-page":"2502","DOI":"10.1093\/bioinformatics\/btr447","article-title":"SEED: efficient clustering of next-generation sequences","volume":"27","author":"Bao","year":"2011","journal-title":"Bioinformatics"},{"key":"10.1016\/j.cosrev.2026.101026_bib0370","doi-asserted-by":"crossref","first-page":"80","DOI":"10.1016\/j.jtbi.2017.04.019","article-title":"DBH: a de Bruijn graph-based heuristic method for clustering large-scale 16S rRNA sequences into OTUs","volume":"425","author":"Wei","year":"2017","journal-title":"J. Theor. Biol."},{"issue":"16","key":"10.1016\/j.cosrev.2026.101026_bib0375","doi-asserted-by":"crossref","first-page":"2182","DOI":"10.1093\/bioinformatics\/bts355","article-title":"DySC: software for greedy clustering of 16S rRNA reads","volume":"28","author":"Zheng","year":"2012","journal-title":"Bioinformatics"},{"issue":"Suppl 8","key":"10.1016\/j.cosrev.2026.101026_bib0380","doi-asserted-by":"crossref","first-page":"S7","DOI":"10.1186\/1471-2105-14-S8-S7","article-title":"Acceleration of sequence clustering using longest common subsequence filtering","volume":"14","author":"Namiki","year":"2013","journal-title":"BMC Bioinform."},{"key":"10.1016\/j.cosrev.2026.101026_bib0385","doi-asserted-by":"crossref","first-page":"e593","DOI":"10.7717\/peerj.593","article-title":"Swarm: robust and fast clustering method for amplicon-based studies","volume":"2","author":"Mah\u00e9","year":"2014","journal-title":"PeerJ"},{"issue":"2","key":"10.1016\/j.cosrev.2026.101026_bib0390","doi-asserted-by":"crossref","first-page":"441","DOI":"10.1109\/TCBB.2016.2535326","article-title":"hc-OTU: a fast and accurate method for clustering operational taxonomic units based on homopolymer compaction","volume":"15","author":"Park","year":"2016","journal-title":"IEEE\/ACM Trans. Comput. Biol. Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0395","doi-asserted-by":"crossref","first-page":"2542","DOI":"10.1038\/s41467-018-04964-5","article-title":"Clustering huge protein sequence sets in linear time","volume":"9","author":"Steinegger","year":"2018","journal-title":"Nat. Commun."},{"key":"10.1016\/j.cosrev.2026.101026_bib0400","doi-asserted-by":"crossref","first-page":"428","DOI":"10.3389\/fmicb.2019.00428","article-title":"DMSC: a dynamic multi-seeds method for clustering 16S rRNA sequences into OTUs","volume":"10","author":"Wei","year":"2019","journal-title":"Front. Microbiol."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0405","doi-asserted-by":"crossref","first-page":"271","DOI":"10.1186\/1471-2105-12-271","article-title":"DNACLUST: accurate and efficient clustering of phylogenetic marker genes","volume":"12","author":"Ghodsi","year":"2011","journal-title":"BMC Bioinform."},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0410","doi-asserted-by":"crossref","first-page":"347","DOI":"10.1016\/j.mimet.2013.07.004","article-title":"MSClust: a multi-seeds based clustering algorithm for microbiome profiling using 16S rRNA sequence","volume":"94","author":"Chen","year":"2013","journal-title":"J. Microbiol. Methods"},{"issue":"Suppl 4","key":"10.1016\/j.cosrev.2026.101026_bib0415","doi-asserted-by":"crossref","first-page":"S11","DOI":"10.1186\/1752-0509-7-S4-S11","article-title":"16S rRNA metagenome clustering and diversity estimation using locality sensitive hashing","volume":"7","author":"Rasheed","year":"2013","journal-title":"BMC Syst. Biol."},{"key":"10.1016\/j.cosrev.2026.101026_bib0420","first-page":"1","article-title":"Clustering the protein universe of life using DIAMOND DeepClust","author":"Buchfink","year":"2026","journal-title":"Nat. Methods"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0425","doi-asserted-by":"crossref","first-page":"9743","DOI":"10.1038\/srep09743","article-title":"MICCA: a complete and accurate software for taxonomic profiling of metagenomic data","volume":"5","author":"Albanese","year":"2015","journal-title":"Sci. Rep."},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0430","doi-asserted-by":"crossref","first-page":"496","DOI":"10.1016\/j.gpb.2018.10.008","article-title":"Gclust: a parallel clustering tool for microbial genomic data","volume":"17","author":"Li","year":"2019","journal-title":"Genomics, Proteomics & Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0435","doi-asserted-by":"crossref","first-page":"392","DOI":"10.1186\/s12859-019-2973-4","article-title":"RAFTS3G: an efficient and versatile clustering software to analyses in large protein datasets","volume":"20","author":"de Lima Nichio","year":"2019","journal-title":"BMC Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0440","doi-asserted-by":"crossref","first-page":"3047","DOI":"10.1038\/s41467-024-47371-9","article-title":"Accurately clustering biological sequences in linear time by relatedness sorting","volume":"15","author":"Wright","year":"2024","journal-title":"Nat. Commun."},{"key":"10.1016\/j.cosrev.2026.101026_bib0445","series-title":"International Symposium on Bioinformatics Research and Applications","first-page":"596","article-title":"An efficient greedy incremental sequence clustering algorithm","author":"Ju","year":"2021"},{"key":"10.1016\/j.cosrev.2026.101026_bib0450","doi-asserted-by":"crossref","first-page":"221","DOI":"10.1016\/j.future.2022.05.024","article-title":"nGIA: a novel greedy incremental alignment based algorithm for gene sequence clustering","volume":"136","author":"Ju","year":"2022","journal-title":"Future Gener. Comput. Syst."},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0455","doi-asserted-by":"crossref","first-page":"1501","DOI":"10.1128\/AEM.71.3.1501-1506.2005","article-title":"Introducing DOTUR, a computer program for defining operational taxonomic units and estimating species richness","volume":"71","author":"Schloss","year":"2005","journal-title":"Appl. Environ. Microbiol."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0460","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/BF02703678","article-title":"SWORDS: a statistical tool for analysing large DNA sequences","volume":"27","author":"Chaudhuri","year":"2002","journal-title":"Journal of Biosciences"},{"issue":"2","key":"10.1016\/j.cosrev.2026.101026_bib0465","doi-asserted-by":"crossref","first-page":"647","DOI":"10.1093\/nar\/gkj448","article-title":"Hierarchical clustering algorithm for comprehensive orthologous-domain classification in multiple genomes","volume":"34","author":"Uchiyama","year":"2006","journal-title":"Nucleic Acids Research"},{"issue":"23","key":"10.1016\/j.cosrev.2026.101026_bib0470","doi-asserted-by":"crossref","first-page":"7537","DOI":"10.1128\/AEM.01541-09","article-title":"Introducing mothur: open-source, platform-independent, community-supported software for describing and comparing microbial communities","volume":"75","author":"Schloss","year":"2009","journal-title":"Appl. Environ. Microbiol."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0475","doi-asserted-by":"crossref","first-page":"15","DOI":"10.1186\/1471-2105-6-15","article-title":"Large scale hierarchical clustering of protein sequences","volume":"6","author":"Krause","year":"2005","journal-title":"BMC Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0480","doi-asserted-by":"crossref","first-page":"286","DOI":"10.1186\/1471-2105-8-286","article-title":"CLUSS: clustering of protein sequences based on a new similarity measure","volume":"8","author":"Kelil","year":"2007","journal-title":"BMC Bioinform."},{"issue":"7","key":"10.1016\/j.cosrev.2026.101026_bib0485","doi-asserted-by":"crossref","first-page":"1889","DOI":"10.1111\/j.1462-2920.2010.02193.x","article-title":"Ironing out the wrinkles in the rare biosphere through improved OTU clustering","volume":"12","author":"Huse","year":"2010","journal-title":"Environ. Microbiol."},{"issue":"10","key":"10.1016\/j.cosrev.2026.101026_bib0490","doi-asserted-by":"crossref","first-page":"e76","DOI":"10.1093\/nar\/gkp285","article-title":"ESPRIT: estimating species richness using large collections of 16S rRNA pyrosequences","volume":"37","author":"Sun","year":"2009","journal-title":"Nucleic Acids Research"},{"issue":"14","key":"10.1016\/j.cosrev.2026.101026_bib0495","doi-asserted-by":"crossref","first-page":"e95","DOI":"10.1093\/nar\/gkr349","article-title":"ESPRIT-tree: hierarchical clustering analysis of millions of 16S rRNA pyrosequences in quasilinear computational time","volume":"39","author":"Cai","year":"2011","journal-title":"Nucleic Acids Research"},{"issue":"4","key":"10.1016\/j.cosrev.2026.101026_bib0500","doi-asserted-by":"crossref","DOI":"10.1371\/journal.pcbi.1005518","article-title":"ESPRIT-forest: parallel clustering of massive amplicon sequence data in subquadratic time","volume":"13","author":"Cai","year":"2017","journal-title":"PLOS Comput. Biol."},{"issue":"11","key":"10.1016\/j.cosrev.2026.101026_bib0505","doi-asserted-by":"crossref","DOI":"10.1099\/mgen.0.000231","article-title":"SynerClust: a highly scalable, synteny-aware orthologue clustering tool","volume":"4","author":"Georgescu","year":"2018","journal-title":"Microbial Genomics"},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0510","doi-asserted-by":"crossref","first-page":"380","DOI":"10.1093\/bioinformatics\/bty617","article-title":"A parallel computational framework for ultra-large-scale sequence clustering analysis","volume":"35","author":"Zheng","year":"2019","journal-title":"Bioinformatics"},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0515","doi-asserted-by":"crossref","first-page":"1773","DOI":"10.1109\/TCBB.2018.2840996","article-title":"3gClust: human protein cluster analysis","volume":"16","author":"Halder","year":"2018","journal-title":"IEEE\/ACM Trans. Comput. Biol. Bioinform."},{"issue":"13","key":"10.1016\/j.cosrev.2026.101026_bib0520","doi-asserted-by":"crossref","first-page":"i41","DOI":"10.1093\/bioinformatics\/btn174","article-title":"Efficient algorithms for accurate hierarchical clustering of huge datasets: tackling the entire protein space","volume":"24","author":"Loewenstein","year":"2008","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0525","doi-asserted-by":"crossref","first-page":"174","DOI":"10.1186\/1471-2105-13-174","article-title":"A novel hierarchical clustering algorithm for gene sequences","volume":"13","author":"Wei","year":"2012","journal-title":"BMC Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0530","doi-asserted-by":"crossref","first-page":"248","DOI":"10.1186\/1471-2105-14-248","article-title":"kClust: fast and sensitive clustering of large protein sequence databases","volume":"14","author":"Hauser","year":"2013","journal-title":"BMC Bioinform."},{"issue":"D1","key":"10.1016\/j.cosrev.2026.101026_bib0535","doi-asserted-by":"crossref","first-page":"D633","DOI":"10.1093\/nar\/gkt1244","article-title":"Ribosomal database project: data and tools for high throughput rRNA analysis","volume":"42","author":"Cole","year":"2014","journal-title":"Nucleic Acids Research"},{"issue":"2","key":"10.1016\/j.cosrev.2026.101026_bib0540","doi-asserted-by":"crossref","first-page":"287","DOI":"10.1093\/bioinformatics\/btt657","article-title":"HPC-CLUST: distributed hierarchical clustering for large sets of nucleotide sequences","volume":"30","author":"Matias Rodrigues","year":"2014","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0545","doi-asserted-by":"crossref","first-page":"43","DOI":"10.1186\/s40168-015-0105-6","article-title":"Improved OTU-picking using long-read 16S rRNA gene amplicon sequencing and generic hierarchical clustering","volume":"3","author":"Franz\u00e9n","year":"2015","journal-title":"Microbiome"},{"issue":"9","key":"10.1016\/j.cosrev.2026.101026_bib0550","doi-asserted-by":"crossref","first-page":"1293","DOI":"10.1093\/bioinformatics\/btw793","article-title":"A new method for decontamination of de novo transcriptomes using a hierarchical clustering algorithm","volume":"33","author":"Lafond-Lapalme","year":"2017","journal-title":"Bioinformatics"},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0555","doi-asserted-by":"crossref","DOI":"10.1093\/molbev\/msaf136","article-title":"Exploring large protein sequence space through homology-and representation-based hierarchical clustering","volume":"42","author":"Chen","year":"2025","journal-title":"Mol. Biol. Evol."},{"issue":"Suppl 4","key":"10.1016\/j.cosrev.2026.101026_bib0560","doi-asserted-by":"crossref","first-page":"S10","DOI":"10.1186\/1471-2105-7-S4-S10","article-title":"SEQOPTICS: a protein sequence clustering system","volume":"7","author":"Chen","year":"2006","journal-title":"BMC Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0565","doi-asserted-by":"crossref","first-page":"49","DOI":"10.1093\/nar\/28.1.49","article-title":"ProtoMap: automatic classification of protein sequences and hierarchy of protein families","volume":"28","author":"Yona","year":"2000","journal-title":"Nucleic Acids Research"},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0570","doi-asserted-by":"crossref","first-page":"451","DOI":"10.1093\/bioinformatics\/16.5.451","article-title":"GeneRAGE: a robust algorithm for sequence clustering and domain detection","volume":"16","author":"Enright","year":"2000","journal-title":"Bioinformatics"},{"issue":"7","key":"10.1016\/j.cosrev.2026.101026_bib0575","doi-asserted-by":"crossref","first-page":"1575","DOI":"10.1093\/nar\/30.7.1575","article-title":"An efficient algorithm for large-scale detection of protein families","volume":"30","author":"Enright","year":"2002","journal-title":"Nucleic Acids Research"},{"key":"10.1016\/j.cosrev.2026.101026_bib0580","doi-asserted-by":"crossref","first-page":"94","DOI":"10.1016\/j.compbiomed.2014.02.016","article-title":"A fast hierarchical clustering algorithm for large-scale protein sequence data sets","volume":"48","author":"Szil\u00e1gyi","year":"2014","journal-title":"Comput. Biol. Med."},{"issue":"suppl_2","key":"10.1016\/j.cosrev.2026.101026_bib0585","doi-asserted-by":"crossref","first-page":"S182","DOI":"10.1093\/bioinformatics\/18.suppl_2.S182","article-title":"ProClust: improved clustering of protein sequences with an extended graph-based approach","volume":"18","author":"Pipenbacher","year":"2002","journal-title":"Bioinformatics"},{"issue":"2","key":"10.1016\/j.cosrev.2026.101026_bib0590","doi-asserted-by":"crossref","first-page":"178","DOI":"10.1504\/IJDMB.2006.010855","article-title":"BAG: a graph theoretic sequence clustering algorithm","volume":"1","author":"Kim","year":"2006","journal-title":"International Journal of Data Mining and Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0595","doi-asserted-by":"crossref","first-page":"396","DOI":"10.1186\/1471-2105-8-396","article-title":"Large scale clustering of protein sequences with FORCE-A layout based heuristic for weighted cluster editing","volume":"8","author":"Wittkop","year":"2007","journal-title":"BMC Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0600","doi-asserted-by":"crossref","first-page":"116","DOI":"10.1186\/1471-2105-12-116","article-title":"Ultra-fast sequence clustering from similarity networks with SiLiX","volume":"12","author":"Miele","year":"2011","journal-title":"BMC Bioinform."},{"issue":"22","key":"10.1016\/j.cosrev.2026.101026_bib0605","doi-asserted-by":"crossref","first-page":"e172","DOI":"10.1093\/nar\/gks757","article-title":"PanOCT: automated clustering of orthologs using conserved gene neighborhood for pan-genomic analysis of bacterial strains and closely related species","volume":"40","author":"Fouts","year":"2012","journal-title":"Nucleic Acids Research"},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0610","doi-asserted-by":"crossref","DOI":"10.1371\/annotation\/bb3baaad-6b58-41a0-96cc-7bdc819de411","article-title":"CLUSTOM: a novel method for clustering 16S rRNA next generation sequences by overlap minimization","volume":"8","author":"Hwang","year":"2013","journal-title":"PLoS One"},{"issue":"22","key":"10.1016\/j.cosrev.2026.101026_bib0615","doi-asserted-by":"crossref","first-page":"3691","DOI":"10.1093\/bioinformatics\/btv421","article-title":"Roary: rapid large-scale prokaryote pan genome analysis","volume":"31","author":"Page","year":"2015","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0620","doi-asserted-by":"crossref","first-page":"378","DOI":"10.1186\/1471-2105-11-378","article-title":"Graph-based clustering and characterization of repetitive sequences in next-generation sequencing data","volume":"11","author":"Nov\u00e1k","year":"2010","journal-title":"BMC Bioinform."},{"issue":"7","key":"10.1016\/j.cosrev.2026.101026_bib0625","doi-asserted-by":"crossref","first-page":"1907","DOI":"10.1039\/C5MB00089K","article-title":"MtHc: a motif-based hierarchical method for clustering massive 16S rRNA sequences into OTUs","volume":"11","author":"Wei","year":"2015","journal-title":"Molecular BioSystems"},{"issue":"12","key":"10.1016\/j.cosrev.2026.101026_bib0630","doi-asserted-by":"crossref","DOI":"10.1002\/minf.201600059","article-title":"DMclust, a density-based modularity method for accurate OTU picking of 16S rRNA sequences","volume":"36","author":"Wei","year":"2017","journal-title":"Mol. Inform."},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0635","doi-asserted-by":"crossref","first-page":"331","DOI":"10.1111\/imm.12984","article-title":"Development of a novel clustering tool for linear peptide sequences","volume":"155","author":"Dhanda","year":"2018","journal-title":"Immunology"},{"key":"10.1016\/j.cosrev.2026.101026_bib0640","article-title":"Boundary-forest clustering: large-scale consensus clustering of biological sequences","author":"Surujonu","year":"2020","journal-title":"Biorxiv"},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0645","doi-asserted-by":"crossref","first-page":"663","DOI":"10.1093\/bioinformatics\/btab723","article-title":"AncestralClust: clustering of divergent nucleotide sequences by ancestral sequence reconstruction using phylogenetic trees","volume":"38","author":"Pipes","year":"2022","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0650","doi-asserted-by":"crossref","first-page":"108","DOI":"10.1186\/s12859-022-04643-9","article-title":"Clustering biological sequences with dynamic sequence similarity threshold","volume":"23","author":"Chiu","year":"2022","journal-title":"BMC Bioinform."},{"key":"10.1016\/j.cosrev.2026.101026_bib0655","doi-asserted-by":"crossref","DOI":"10.7717\/peerj.14779","article-title":"Complet+: a computationally scalable method to improve completeness of large-scale protein sequence clustering","volume":"11","author":"Nguyen","year":"2023","journal-title":"PeerJ"},{"key":"10.1016\/j.cosrev.2026.101026_bib0660","first-page":"1","article-title":"Ultrafast and accurate sequence alignment and clustering of viral genomes","author":"Zielezinski","year":"2025","journal-title":"Nat. Methods"},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0665","doi-asserted-by":"crossref","first-page":"611","DOI":"10.1093\/bioinformatics\/btq725","article-title":"Clustering 16S rRNA for OTU prediction: a method of unsupervised Bayesian clustering","volume":"27","author":"Hao","year":"2011","journal-title":"Bioinformatics"},{"issue":"12","key":"10.1016\/j.cosrev.2026.101026_bib0670","doi-asserted-by":"crossref","first-page":"5240","DOI":"10.1093\/nar\/gks227","article-title":"Bayesian estimation of bacterial community composition from 454 sequencing data","volume":"40","author":"Cheng","year":"2012","journal-title":"Nucleic Acids Research"},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0675","doi-asserted-by":"crossref","first-page":"461","DOI":"10.1080\/08839514.2013.805598","article-title":"Scaled self-organizing map\u2013hidden Markov model architecture for biological sequence clustering","volume":"27","author":"Ferles","year":"2013","journal-title":"Appl. Artif. Intell."},{"issue":"10","key":"10.1016\/j.cosrev.2026.101026_bib0680","doi-asserted-by":"crossref","first-page":"940","DOI":"10.1089\/cmb.2015.0084","article-title":"Application of subspace clustering in DNA sequence analysis","volume":"22","author":"Wallace","year":"2015","journal-title":"J. Comput. Biol."},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0685","doi-asserted-by":"crossref","first-page":"834","DOI":"10.1093\/bioinformatics\/btw722","article-title":"DACE: a scalable DP-means algorithm for clustering extremely large sequence data","volume":"33","author":"Jiang","year":"2017","journal-title":"Bioinformatics"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0690","doi-asserted-by":"crossref","first-page":"8","DOI":"10.1093\/bioinformatics\/bts621","article-title":"Simultaneous alignment and clustering of peptide data using a gibbs sampling approach","volume":"29","author":"Andreatta","year":"2013","journal-title":"Bioinformatics"},{"issue":"W1","key":"10.1016\/j.cosrev.2026.101026_bib0695","doi-asserted-by":"crossref","first-page":"W458","DOI":"10.1093\/nar\/gkx248","article-title":"GibbsCluster: unsupervised clustering and alignment of peptide sequences","volume":"45","author":"Andreatta","year":"2017","journal-title":"Nucleic Acids Research"},{"issue":"3","key":"10.1016\/j.cosrev.2026.101026_bib0700","doi-asserted-by":"crossref","first-page":"58","DOI":"10.32350\/sir.83.03","article-title":"Optimized spectral clustering methods for potentially divergent biological sequences","volume":"8","author":"Matar","year":"2024","journal-title":"Scientific Inquiry and Review"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0705","doi-asserted-by":"crossref","first-page":"3","DOI":"10.1186\/1756-0381-2-3","article-title":"Partitioning clustering algorithms for protein sequence data sets","volume":"2","author":"Fayech","year":"2009","journal-title":"Biodata Min."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0710","doi-asserted-by":"crossref","DOI":"10.1111\/exsy.12827","article-title":"MapReduce paradigm: DNA sequence clustering based on repeats as features","volume":"39","author":"Dasari","year":"2022","journal-title":"Expert Syst."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0715","doi-asserted-by":"crossref","first-page":"42","DOI":"10.1186\/s12859-024-05659-z","article-title":"Anchor clustering for million-scale immune repertoire sequencing data","volume":"25","author":"Chang","year":"2024","journal-title":"BMC Bioinform."},{"issue":"19","key":"10.1016\/j.cosrev.2026.101026_bib0720","doi-asserted-by":"crossref","first-page":"15453","DOI":"10.1007\/s13369-024-09878-7","article-title":"Enhancing K-means clustering performance with a two-stage hybrid preprocessing strategy","volume":"50","author":"Tripathi","year":"2025","journal-title":"Arab. J. Sci. Eng."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0725","doi-asserted-by":"crossref","first-page":"72","DOI":"10.1186\/s44147-022-00125-0","article-title":"Unsupervised clustering of SARS-CoV-2 using deep convolutional autoencoder","volume":"69","author":"Sherif","year":"2022","journal-title":"J. Eng. Appl. Sci."},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0730","doi-asserted-by":"crossref","first-page":"929","DOI":"10.2174\/0113862073359729250220131623","article-title":"20D-dynamic representation of protein sequences combined with K-means clustering","volume":"29","author":"Bielinska-Waz","year":"2026","journal-title":"Comb. Chem. High Throughput Screen."},{"key":"10.1016\/j.cosrev.2026.101026_bib0735","doi-asserted-by":"crossref","DOI":"10.7717\/peerj.4264","article-title":"Genomic signal processing for DNA sequence clustering","volume":"6","author":"Mendizabal-Ruiz","year":"2018","journal-title":"PeerJ"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0740","doi-asserted-by":"crossref","DOI":"10.1371\/journal.pone.0261531","article-title":"DeLUCS: deep learning for unsupervised clustering of DNA sequences","volume":"17","author":"Mill\u00e1n Arias","year":"2022","journal-title":"PLoS One"},{"issue":"9","key":"10.1016\/j.cosrev.2026.101026_bib0745","doi-asserted-by":"crossref","DOI":"10.1093\/bioinformatics\/btad508","article-title":"iDeLUCS: a deep learning interactive tool for alignment-free clustering of DNA sequences","volume":"39","author":"Millan Arias","year":"2023","journal-title":"Bioinformatics"},{"issue":"5","key":"10.1016\/j.cosrev.2026.101026_bib0750","doi-asserted-by":"crossref","DOI":"10.1093\/gbe\/evad084","article-title":"Unsupervised deep learning can identify protein functional groups from unaligned sequences","volume":"15","author":"David","year":"2023","journal-title":"Genome Biology and Evolution"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0755","doi-asserted-by":"crossref","first-page":"1214","DOI":"10.1186\/s12864-024-11135-y","article-title":"CGRclust: chaos game representation for twin contrastive clustering of unlabelled DNA sequences","volume":"25","author":"Alipour","year":"2024","journal-title":"BMC Genom."},{"key":"10.1016\/j.cosrev.2026.101026_bib0760","series-title":"Proceedings of International Conference on Frontiers in Computing and Systems: COMSYS 2020","first-page":"601","article-title":"Analysis of large-scale human protein sequences using an efficient spark-based DBSCAN algorithm","author":"Sekhar Bandyopadhyay","year":"2020"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0765","doi-asserted-by":"crossref","first-page":"121","DOI":"10.1186\/s12859-021-04013-x","article-title":"Density peak clustering of protein sequences associated to a pfam clan reveals clear similarities and interesting differences with respect to manual family annotation","volume":"22","author":"Russo","year":"2021","journal-title":"BMC Bioinform."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0770","doi-asserted-by":"crossref","first-page":"568","DOI":"10.1038\/s41597-024-03131-4","article-title":"Protein family annotation for the unified human gastrointestinal proteome by DPCfam clustering","volume":"11","author":"Barone","year":"2024","journal-title":"Sci. Data"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0775","doi-asserted-by":"crossref","first-page":"317","DOI":"10.1186\/1471-2105-14-317","article-title":"Automated analysis of phylogenetic clusters","volume":"14","author":"Ragonnet-Cronin","year":"2013","journal-title":"BMC Bioinform."},{"issue":"8","key":"10.1016\/j.cosrev.2026.101026_bib0780","doi-asserted-by":"crossref","DOI":"10.1371\/journal.pone.0221068","article-title":"TreeCluster: clustering biological sequences using phylogenetic trees","volume":"14","author":"Balaban","year":"2019","journal-title":"PLoS One"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0785","doi-asserted-by":"crossref","first-page":"82","DOI":"10.1186\/s13059-018-1450-0","article-title":"HmmUFOtu: an HMM and phylogenetic placement based ultra-fast taxonomic assignment and OTU picking tool for microbiome amplicon sequencing studies","volume":"19","author":"Zheng","year":"2018","journal-title":"Genome Biol."},{"issue":"8","key":"10.1016\/j.cosrev.2026.101026_bib0790","doi-asserted-by":"crossref","first-page":"e46","DOI":"10.1093\/nar\/gkad158","article-title":"SCRAPT: an iterative algorithm for clustering large 16S rRNA gene data sets","volume":"51","author":"Luan","year":"2023","journal-title":"Nucleic Acids Research"},{"key":"10.1016\/j.cosrev.2026.101026_bib0795","series-title":"Proceedings. 2004 IEEE Computational Systems Bioinformatics Conference, 2004. CSB 2004","first-page":"578","article-title":"Meanshift clustering for DNA microarray analysis","author":"Barash","year":"2004"},{"issue":"14","key":"10.1016\/j.cosrev.2026.101026_bib0800","doi-asserted-by":"crossref","first-page":"e83","DOI":"10.1093\/nar\/gky315","article-title":"MeShClust: an intelligent tool for clustering DNA sequences","volume":"46","author":"James","year":"2018","journal-title":"Nucleic Acids Research"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0805","doi-asserted-by":"crossref","first-page":"423","DOI":"10.1186\/s12864-022-08619-0","article-title":"MeShClust v3. 0: high-quality clustering of DNA sequences using the mean shift algorithm and alignment-free identity scores","volume":"23","author":"Girgis","year":"2022","journal-title":"BMC Genom."},{"issue":"6","key":"10.1016\/j.cosrev.2026.101026_bib0810","doi-asserted-by":"crossref","DOI":"10.1142\/S0219720017400066","article-title":"Metagenome sequence clustering with hash-based canopies","volume":"15","author":"Rahman","year":"2017","journal-title":"J. Bioinform. Comput. Biol."},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0815","doi-asserted-by":"crossref","first-page":"e5","DOI":"10.1093\/nar\/gkx977","article-title":"panX: pan-genome analysis and exploration","volume":"46","author":"Ding","year":"2018","journal-title":"Nucleic Acids Research"},{"key":"10.1016\/j.cosrev.2026.101026_bib0820","series-title":"2023 IEEE International Conference on Bioinformatics and Biomedicine (BIBM)","first-page":"690","article-title":"EdtClust: a fast homologous protein sequences clustering method based on edit distance","author":"Xiang","year":"2023"},{"key":"10.1016\/j.cosrev.2026.101026_bib0825","series-title":"Pacific-Asia Conference on Knowledge Discovery and Data Mining","first-page":"142","article-title":"DNA sequence clustering in high error rates via hash sketches fuzzy clustering for efficient stored data reconstruction","author":"Shao","year":"2025"},{"issue":"2","key":"10.1016\/j.cosrev.2026.101026_bib0830","doi-asserted-by":"crossref","first-page":"10","DOI":"10.1128\/mSphereDirect.00073-17","article-title":"OptiClust, an improved method for assigning amplicon-based sequence data to operational taxonomic units","volume":"2","author":"Westcott","year":"2017","journal-title":"MSphere"},{"key":"10.1016\/j.cosrev.2026.101026_bib0835","series-title":"KDD, 96","first-page":"226","article-title":"A density-based algorithm for discovering clusters in large spatial databases with noise","author":"Ester","year":"1996"},{"key":"10.1016\/j.cosrev.2026.101026_bib0840","series-title":"Pacific-Asia Conference on Knowledge Discovery and Data Mining","first-page":"160","article-title":"Density-based clustering based on hierarchical density estimates","author":"Campello","year":"2013"},{"issue":"7996","key":"10.1016\/j.cosrev.2026.101026_bib0845","doi-asserted-by":"crossref","first-page":"832","DOI":"10.1038\/s41586-023-06832-9","article-title":"Predicting multiple conformations via sequence clustering and AlphaFold2","volume":"625","author":"Wayment-Steele","year":"2024","journal-title":"Nature"},{"issue":"1","key":"10.1016\/j.cosrev.2026.101026_bib0850","doi-asserted-by":"crossref","DOI":"10.1142\/S0219720013400015","article-title":"Large-scale metagenomic sequence clustering on map-reduce clusters","volume":"11","author":"Yang","year":"2013","journal-title":"J. Bioinform. Comput. Biol."},{"issue":"8","key":"10.1016\/j.cosrev.2026.101026_bib0855","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/3789495","article-title":"Interpretable clustering: a survey","volume":"58","author":"Hu","year":"2026","journal-title":"ACM Comput. Surv."},{"key":"10.1016\/j.cosrev.2026.101026_bib0860","doi-asserted-by":"crossref","DOI":"10.1016\/j.ins.2025.121972","article-title":"Significance-based interpretable sequence clustering","volume":"704","author":"He","year":"2025","journal-title":"Inf. Sci."},{"key":"10.1016\/j.cosrev.2026.101026_bib0865","doi-asserted-by":"crossref","DOI":"10.1016\/j.ins.2024.121453","article-title":"Interpretable sequence clustering","volume":"689","author":"Dong","year":"2025","journal-title":"Inf. Sci."},{"key":"10.1016\/j.cosrev.2026.101026_bib0870","doi-asserted-by":"crossref","DOI":"10.1016\/j.chaos.2025.117783","article-title":"Global explainable clustering via equivalence relation","volume":"205","author":"Zhang","year":"2026","journal-title":"Chaos Solit. Fractals"},{"issue":"12","key":"10.1016\/j.cosrev.2026.101026_bib0875","doi-asserted-by":"crossref","DOI":"10.1093\/gigascience\/giz150","article-title":"GraphClust2: annotation and discovery of structured RNAs with scalable and accessible integrative clustering","volume":"8","author":"Miladi","year":"2019","journal-title":"Gigascience"},{"issue":"13","key":"10.1016\/j.cosrev.2026.101026_bib0880","doi-asserted-by":"crossref","first-page":"38145","DOI":"10.1007\/s11042-023-17134-7","article-title":"An incremental clustering method based on multiple objectives for dynamic data analysis","volume":"83","author":"Dwivedi","year":"2024","journal-title":"Multimed. Tools Appl."}],"container-title":["Computer Science Review"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1574013726001346?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1574013726001346?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,6]],"date-time":"2026-07-06T18:04:24Z","timestamp":1783361064000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1574013726001346"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":176,"alternative-id":["S1574013726001346"],"URL":"https:\/\/doi.org\/10.1016\/j.cosrev.2026.101026","relation":{},"ISSN":["1574-0137"],"issn-type":[{"value":"1574-0137","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Biological sequence clustering: A survey","name":"articletitle","label":"Article Title"},{"value":"Computer Science Review","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.cosrev.2026.101026","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Inc. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"101026"}}