{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T06:06:37Z","timestamp":1784873197207,"version":"3.55.0"},"reference-count":53,"publisher":"Oxford University Press (OUP)","issue":"13","license":[{"start":{"date-parts":[[2016,10,12]],"date-time":"2016-10-12T00:00:00Z","timestamp":1476230400000},"content-version":"vor","delay-in-days":229,"URL":"http:\/\/creativecommons.org\/licenses\/by-nc\/4.0\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2016,7,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:p>Motivation: We present a new feature of the MAFFT multiple alignment program for suppressing over-alignment (aligning unrelated segments). Conventional MAFFT is highly sensitive in aligning conserved regions in remote homologs, but the risk of over-alignment is recently becoming greater, as low-quality or noisy sequences are increasing in protein sequence databases, due, for example, to sequencing errors and difficulty in gene prediction.<\/jats:p>\n               <jats:p>Results: The proposed method utilizes a variable scoring matrix for different pairs of sequences (or groups) in a single multiple sequence alignment, based on the global similarity of each pair. This method significantly increases the correctly gapped sites in real examples and in simulations under various conditions. Regarding sensitivity, the effect of the proposed method is slightly negative in real protein-based benchmarks, and mostly neutral in simulation-based benchmarks. This approach is based on natural biological reasoning and should be compatible with many methods based on dynamic programming for multiple sequence alignment.<\/jats:p>\n               <jats:p>Availability and implementation: The new feature is available in MAFFT versions 7.263 and higher. http:\/\/mafft.cbrc.jp\/alignment\/software\/<\/jats:p>\n               <jats:p>Contact: \u00a0katoh@ifrec.osaka-u.ac.jp<\/jats:p>\n               <jats:p>Supplementary information: \u00a0Supplementary data are available at Bioinformatics online.<\/jats:p>","DOI":"10.1093\/bioinformatics\/btw108","type":"journal-article","created":{"date-parts":[[2016,2,27]],"date-time":"2016-02-27T02:10:41Z","timestamp":1456539041000},"page":"1933-1942","source":"Crossref","is-referenced-by-count":534,"title":["A simple method to control over-alignment in the MAFFT multiple sequence alignment program"],"prefix":"10.1093","volume":"32","author":[{"given":"Kazutaka","family":"Katoh","sequence":"first","affiliation":[{"name":"1 Immunology Frontier Research Center, Osaka University, Suita 565-0871, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Daron M.","family":"Standley","sequence":"additional","affiliation":[{"name":"1 Immunology Frontier Research Center, Osaka University, Suita 565-0871, Japan"},{"name":"2 Institute for Virus Research, Kyoto University, Kyoto 606-8507, Japan"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2016,2,26]]},"reference":[{"key":"2023020112344143800_btw108-B1","doi-asserted-by":"crossref","first-page":"327","DOI":"10.1016\/0022-2836(87)90316-0","article-title":"A strategy for the rapid multiple alignment of protein sequences. confidence levels from tertiary structure comparisons","volume":"198","author":"Barton","year":"1987","journal-title":"J. Mol. Biol"},{"key":"2023020112344143800_btw108-B2","first-page":"479","article-title":"A novel randomized iterative strategy for aligning multiple protein sequences","volume":"7","author":"Berger","year":"1991","journal-title":"Comput. Appl. Biosci"},{"key":"2023020112344143800_btw108-B3","doi-asserted-by":"crossref","first-page":"642","DOI":"10.1093\/molbev\/mss256","article-title":"Class of multiple sequence alignment algorithm affects genomic analysis","volume":"30","author":"Blackburne","year":"2012","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B4","doi-asserted-by":"crossref","first-page":"495","DOI":"10.1093\/bioinformatics\/btr701","article-title":"Measuring the distance between multiple sequence alignments","volume":"28","author":"Blackburne","year":"2012","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B5","doi-asserted-by":"crossref","first-page":"e1000392.","DOI":"10.1371\/journal.pcbi.1000392","article-title":"Fast statistical alignment","volume":"5","author":"Bradley","year":"2009","journal-title":"PLoS Comput. Biol"},{"key":"2023020112344143800_btw108-B6","doi-asserted-by":"crossref","first-page":"1777","DOI":"10.1101\/gr.3866105","article-title":"Genome annotation past, present, and future: how to define an ORF at each locus","volume":"15","author":"Brent","year":"2005","journal-title":"Genome Res"},{"key":"2023020112344143800_btw108-B7","doi-asserted-by":"crossref","first-page":"1972","DOI":"10.1093\/bioinformatics\/btp348","article-title":"trimAl: a tool for automated alignment trimming in large-scale phylogenetic analyses","volume":"25","author":"Capella-Gutierrez","year":"2009","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B8","doi-asserted-by":"crossref","first-page":"540","DOI":"10.1093\/oxfordjournals.molbev.a026334","article-title":"Selection of conserved blocks from multiple alignments for their use in phylogenetic analysis","volume":"17","author":"Castresana","year":"2000","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B9","doi-asserted-by":"crossref","first-page":"1625","DOI":"10.1093\/molbev\/msu117","article-title":"TCS: a new multiple sequence alignment reliability measure to estimate alignment accuracy and improve phylogenetic tree reconstruction","volume":"31","author":"Chang","year":"2014","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B10","first-page":"345","volume-title":"Atlas of Protein Sequence and Structure","author":"Dayhoff","year":"1978"},{"key":"2023020112344143800_btw108-B11","doi-asserted-by":"crossref","first-page":"330","DOI":"10.1101\/gr.2821705","article-title":"ProbCons: Probabilistic consistency-based multiple sequence alignment","volume":"15","author":"Do","year":"2005","journal-title":"Genome Res"},{"key":"2023020112344143800_btw108-B12","doi-asserted-by":"crossref","first-page":"113.","DOI":"10.1186\/1471-2105-5-113","article-title":"MUSCLE: a multiple sequence alignment method with reduced time and space complexity","volume":"5","author":"Edgar","year":"2004","journal-title":"BMC Bioinf"},{"key":"2023020112344143800_btw108-B13","doi-asserted-by":"crossref","first-page":"1792","DOI":"10.1093\/nar\/gkh340","article-title":"MUSCLE: multiple sequence alignment with high accuracy and high throughput","volume":"32","author":"Edgar","year":"2004","journal-title":"Nucleic Acids Res"},{"key":"2023020112344143800_btw108-B14","doi-asserted-by":"crossref","first-page":"2145","DOI":"10.1093\/nar\/gkp1196","article-title":"Quality measures for protein alignment benchmarks","volume":"38","author":"Edgar","year":"2010","journal-title":"Nucleic Acids Res"},{"key":"2023020112344143800_btw108-B15","doi-asserted-by":"crossref","first-page":"351","DOI":"10.1007\/BF02603120","article-title":"Progressive sequence alignment as a prerequisite to correct phylogenetic trees","volume":"25","author":"Feng","year":"1987","journal-title":"J. Mol. Evol"},{"key":"2023020112344143800_btw108-B16","doi-asserted-by":"crossref","first-page":"1879","DOI":"10.1093\/molbev\/msp098","article-title":"INDELible: a flexible simulator of biological sequence evolution","volume":"26","author":"Fletcher","year":"2009","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B17","doi-asserted-by":"crossref","first-page":"1443","DOI":"10.1126\/science.1604319","article-title":"Exhaustive matching of the entire protein sequence database","volume":"256","author":"Gonnet","year":"1992","journal-title":"Science"},{"key":"2023020112344143800_btw108-B18","doi-asserted-by":"crossref","first-page":"823","DOI":"10.1006\/jmbi.1996.0679","article-title":"Significant improvement in accuracy of multiple protein sequence alignments by iterative refinement as assessed by reference to structural alignments","volume":"264","author":"Gotoh","year":"1996","journal-title":"J. Mol. Biol"},{"key":"2023020112344143800_btw108-B19","doi-asserted-by":"crossref","first-page":"189.","DOI":"10.1186\/1471-2105-15-189","article-title":"Assessment and refinement of eukaryotic gene structure prediction with gene-structure-aware multiple protein sequence alignment","volume":"15","author":"Gotoh","year":"2014","journal-title":"BMC Bioinf"},{"key":"2023020112344143800_btw108-B20","doi-asserted-by":"crossref","first-page":"308.","DOI":"10.1186\/1471-2148-11-308","article-title":"Abundance of ultramicro inversions within local alignments between human and chimpanzee genomes","volume":"11","author":"Hara","year":"2011","journal-title":"BMC Evol. Biol"},{"key":"2023020112344143800_btw108-B21","doi-asserted-by":"crossref","first-page":"10915","DOI":"10.1073\/pnas.89.22.10915","article-title":"Amino acid substitution matrices from protein blocks","volume":"89","author":"Henikoff","year":"1992","journal-title":"Proc. Natl. Acad. Sci. U. S. A"},{"key":"2023020112344143800_btw108-B22","doi-asserted-by":"crossref","first-page":"237","DOI":"10.1016\/0378-1119(88)90330-7","article-title":"CLUSTAL: a package for performing multiple sequence alignment on a microcomputer","volume":"73","author":"Higgins","year":"1988","journal-title":"Gene"},{"key":"2023020112344143800_btw108-B23","first-page":"275","article-title":"The rapid generation of mutation data matrices from protein sequences","volume":"8","author":"Jones","year":"1992","journal-title":"Comput. Appl. Biosci"},{"key":"2023020112344143800_btw108-B24","doi-asserted-by":"crossref","first-page":"772","DOI":"10.1093\/molbev\/mst010","article-title":"MAFFT multiple sequence alignment software version 7: improvements in performance and usability","volume":"30","author":"Katoh","year":"2013","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B25","doi-asserted-by":"crossref","first-page":"3059","DOI":"10.1093\/nar\/gkf436","article-title":"MAFFT: a novel method for rapid multiple sequence alignment based on fast Fourier transform","volume":"30","author":"Katoh","year":"2002","journal-title":"Nucleic Acids Res"},{"key":"2023020112344143800_btw108-B26","doi-asserted-by":"crossref","first-page":"453","DOI":"10.1016\/j.jmb.2003.08.015","article-title":"Sequence alignments and pair hidden Markov models using evolutionary history","volume":"333","author":"Knudsen","year":"2003","journal-title":"J. Mol. Biol"},{"key":"2023020112344143800_btw108-B27","doi-asserted-by":"crossref","first-page":"1380","DOI":"10.1093\/molbev\/msm060","article-title":"Heads or tails: a simple reliability check for multiple sequence alignments","volume":"24","author":"Landan","year":"2007","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B28","doi-asserted-by":"crossref","first-page":"1958","DOI":"10.1093\/bioinformatics\/btq338","article-title":"MSAProbs: multiple sequence alignment based on pair hidden Markov models and partition function posterior probabilities","volume":"26","author":"Liu","year":"2010","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B29","doi-asserted-by":"crossref","first-page":"10557","DOI":"10.1073\/pnas.0409137102","article-title":"An algorithm for progressive multiple alignment of sequences with insertions","volume":"102","author":"L\u00f6ytynoja","year":"2005","journal-title":"Proc. Natl. Acad. Sci. U. S. A"},{"key":"2023020112344143800_btw108-B30","doi-asserted-by":"crossref","first-page":"1632","DOI":"10.1126\/science.1158395","article-title":"Phylogeny-aware gap placement prevents errors in sequence alignment and evolutionary analysis","volume":"320","author":"L\u00f6ytynoja","year":"2008","journal-title":"Science"},{"key":"2023020112344143800_btw108-B31","doi-asserted-by":"crossref","first-page":"2167","DOI":"10.1093\/molbev\/msp127","article-title":"CGIN1: a retroviral contribution to mammalian genomes","volume":"26","author":"Marco","year":"2009","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B32","doi-asserted-by":"crossref","first-page":"3007","DOI":"10.1093\/bioinformatics\/btt517","article-title":"Adjusting scoring matrices to correct overextended alignments","volume":"29","author":"Mills","year":"2013","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B33","doi-asserted-by":"crossref","first-page":"3250","DOI":"10.1093\/bioinformatics\/btr553","article-title":"FastSP: linear time calculation of alignment accuracy","volume":"27","author":"Mirarab","year":"2011","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B34","doi-asserted-by":"crossref","first-page":"377","DOI":"10.1089\/cmb.2014.0156","article-title":"PASTA: ultra-large multiple sequence alignment for nucleotide and amino-acid sequences","volume":"22","author":"Mirarab","year":"2015","journal-title":"J. Comput. Biol"},{"key":"2023020112344143800_btw108-B35","doi-asserted-by":"crossref","first-page":"doi:10.1093\/database\/bat053.","DOI":"10.1093\/database\/bat053","article-title":"MisPred: a resource for identification of erroneous protein sequences in public databases","volume":"2013","author":"Nagy","year":"2013","journal-title":"Database"},{"key":"2023020112344143800_btw108-B36","doi-asserted-by":"crossref","first-page":"443","DOI":"10.1016\/0022-2836(70)90057-4","article-title":"A general method applicable to the search for similarities in the amino acid sequence of two proteins","volume":"48","author":"Needleman","year":"1970","journal-title":"J. Mol. Biol"},{"key":"2023020112344143800_btw108-B37","doi-asserted-by":"crossref","first-page":"407","DOI":"10.1093\/bioinformatics\/14.5.407","article-title":"COFFEE: an objective function for multiple sequence alignments","volume":"14","author":"Notredame","year":"1998","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B38","doi-asserted-by":"crossref","first-page":"1759","DOI":"10.1093\/molbev\/msq066","article-title":"An alignment confidence score capturing robustness to guide tree uncertainty","volume":"27","author":"Penn","year":"2010","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B39","doi-asserted-by":"crossref","first-page":"47.","DOI":"10.1186\/1471-2105-4-47","article-title":"OXBench: a benchmark for evaluation of protein multiple sequence alignment accuracy","volume":"4","author":"Raghava","year":"2003","journal-title":"BMC Bioinf"},{"key":"2023020112344143800_btw108-B40","doi-asserted-by":"crossref","first-page":"1979","DOI":"10.1093\/molbev\/msu174","article-title":"Erasing errors due to alignment ambiguity when estimating positive selection","volume":"31","author":"Redelings","year":"2014","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B41","doi-asserted-by":"crossref","first-page":"40.","DOI":"10.1186\/1471-2148-7-40","article-title":"Incorporating indel information into phylogeny estimation for rapidly emerging pathogens","volume":"7","author":"Redelings","year":"2007","journal-title":"BMC Evol. Biol"},{"key":"2023020112344143800_btw108-B42","doi-asserted-by":"crossref","first-page":"e24","DOI":"10.1093\/bioinformatics\/btl311","article-title":"Multiple alignment by sequence annealing","volume":"23","author":"Schwartz","year":"2007","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B43","doi-asserted-by":"crossref","first-page":"539.","DOI":"10.1038\/msb.2011.75","article-title":"Fast, scalable generation of high-quality protein multiple sequence alignments using Clustal Omega","volume":"7","author":"Sievers","year":"2011","journal-title":"Mol. Syst. Biol"},{"key":"2023020112344143800_btw108-B44","doi-asserted-by":"crossref","first-page":"2047","DOI":"10.1093\/bioinformatics\/btl175","article-title":"BAli-Phy: simultaneous Bayesian inference of alignment and phylogeny","volume":"22","author":"Suchard","year":"2006","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B45","doi-asserted-by":"crossref","first-page":"4673","DOI":"10.1093\/nar\/22.22.4673","article-title":"CLUSTAL W: improving the sensitivity of progressive multiple sequence alignment through sequence weighting, position-specific gap penalties and weight matrix choice","volume":"22","author":"Thompson","year":"1994","journal-title":"Nucleic Acids Res"},{"key":"2023020112344143800_btw108-B46","doi-asserted-by":"crossref","first-page":"e18093.","DOI":"10.1371\/journal.pone.0018093","article-title":"A comprehensive benchmark study of multiple sequence alignment methods: current challenges and future perspectives","volume":"6","author":"Thompson","year":"2011","journal-title":"PLoS One"},{"key":"2023020112344143800_btw108-B47","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/S0022-2836(05)80006-3","article-title":"Sequence alignment and penalty choice. review of concepts, case studies and implications","volume":"235","author":"Vingron","year":"1994","journal-title":"J. Mol. Biol"},{"key":"2023020112344143800_btw108-B48","doi-asserted-by":"crossref","first-page":"1692","DOI":"10.1093\/nar\/gkl091","article-title":"M-Coffee: combining multiple sequence alignment methods with T-Coffee","volume":"34","author":"Wallace","year":"2006","journal-title":"Nucleic Acids Res"},{"key":"2023020112344143800_btw108-B49","doi-asserted-by":"crossref","first-page":"1189","DOI":"10.1093\/bioinformatics\/btp033","article-title":"Jalview Version 2 \u2013 a multiple sequence alignment editor and analysis workbench","volume":"25","author":"Waterhouse","year":"2009","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B50","doi-asserted-by":"crossref","first-page":"691","DOI":"10.1093\/oxfordjournals.molbev.a003851","article-title":"A general empirical model of protein evolution derived from multiple protein families using a maximum-likelihood approach","volume":"18","author":"Whelan","year":"2001","journal-title":"Mol. Biol. Evol"},{"key":"2023020112344143800_btw108-B51","doi-asserted-by":"crossref","first-page":"317","DOI":"10.1093\/bioinformatics\/btt694","article-title":"Revisiting amino acid substitution matrices for identifying distantly related proteins","volume":"30","author":"Yamada","year":"2014","journal-title":"Bioinformatics"},{"key":"2023020112344143800_btw108-B52","doi-asserted-by":"crossref","first-page":"329","DOI":"10.1038\/nrg3174","article-title":"A beginner\u2019s guide to eukaryotic genome annotation","volume":"13","author":"Yandell","year":"2012","journal-title":"Nat. Rev. Genet"},{"key":"2023020112344143800_btw108-B53","doi-asserted-by":"crossref","first-page":"306","DOI":"10.1007\/BF00160154","article-title":"Maximum likelihood phylogenetic estimation from DNA sequences with variable rates over sites: approximate methods","volume":"39","author":"Yang","year":"1994","journal-title":"J. Mol. Evol"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/32\/13\/1933\/49020257\/bioinformatics_32_13_1933.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/32\/13\/1933\/49020257\/bioinformatics_32_13_1933.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,2,1]],"date-time":"2023-02-01T22:46:36Z","timestamp":1675291596000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/32\/13\/1933\/1743504"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,2,26]]},"references-count":53,"journal-issue":{"issue":"13","published-print":{"date-parts":[[2016,7,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btw108","relation":{},"ISSN":["1367-4811","1367-4803"],"issn-type":[{"value":"1367-4811","type":"electronic"},{"value":"1367-4803","type":"print"}],"subject":[],"published-other":{"date-parts":[[2016,7,1]]},"published":{"date-parts":[[2016,2,26]]}}}