{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,14]],"date-time":"2026-08-14T20:31:34Z","timestamp":1786739494187,"version":"3.56.0"},"reference-count":43,"publisher":"Oxford University Press (OUP)","issue":"1","license":[{"start":{"date-parts":[[2023,1,17]],"date-time":"2023-01-17T00:00:00Z","timestamp":1673913600000},"content-version":"vor","delay-in-days":16,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/100000051","name":"National Human Genome Research Institute","doi-asserted-by":"publisher","award":["R01HG010040"],"award-info":[{"award-number":["R01HG010040"]}],"id":[{"id":"10.13039\/100000051","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100014989","name":"Chan-Zuckerberg Initiative","doi-asserted-by":"crossref","award":["237653"],"award-info":[{"award-number":["237653"]}],"id":[{"id":"10.13039\/100014989","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,1,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:sec>\n                  <jats:title>Motivation<\/jats:title>\n                  <jats:p>Protein-to-genome alignment is critical to annotating genes in non-model organisms. While there are a few tools for this purpose, all of them were developed over 10 years ago and did not incorporate the latest advances in alignment algorithms. They are inefficient and could not keep up with the rapid production of new genomes and quickly growing protein databases.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Results<\/jats:title>\n                  <jats:p>Here, we describe miniprot, a new aligner for mapping protein sequences to a complete genome. Miniprot integrates recent techniques such as k-mer sketch and vectorized\u00a0dynamic programming. It is tens of times faster than existing tools while achieving comparable accuracy on real data.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Availability and implementation<\/jats:title>\n                  <jats:p>https:\/\/github.com\/lh3\/miniport.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btad014","type":"journal-article","created":{"date-parts":[[2023,1,17]],"date-time":"2023-01-17T22:39:59Z","timestamp":1673995199000},"source":"Crossref","is-referenced-by-count":454,"title":["Protein-to-genome alignment with miniprot"],"prefix":"10.1093","volume":"39","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4874-2874","authenticated-orcid":false,"given":"Heng","family":"Li","sequence":"first","affiliation":[{"name":"Department of Data Sciences, Dana-Farber Cancer Institute , Boston, MA 02215, USA"},{"name":"Department of Biomedical Informatics, Harvard Medical School , Boston, MA 02115, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2023,1,17]]},"reference":[{"key":"2023012312141952300_btad014-B1","doi-asserted-by":"crossref","first-page":"baw093","DOI":"10.1093\/database\/baw093","article-title":"The Ensembl gene annotation system","volume":"2016","author":"Aken","year":"2016","journal-title":"Database (Oxford)"},{"key":"2023012312141952300_btad014-B2","doi-asserted-by":"crossref","first-page":"249","DOI":"10.1186\/s13059-021-02443-7","article-title":"Technology dictates algorithms: recent developments in read alignment","volume":"22","author":"Alser","year":"2021","journal-title":"Genome Biol"},{"key":"2023012312141952300_btad014-B3","doi-asserted-by":"crossref","first-page":"603","DOI":"10.1016\/S0092-8240(86)90010-8","article-title":"Optimal sequence alignment using affine gap costs","volume":"48","author":"Altschul","year":"1986","journal-title":"Bull. Math. Biol"},{"key":"2023012312141952300_btad014-B4","first-page":"56","article-title":"Dynamite: a flexible code generating language for dynamic programming methods used in sequence comparison","volume":"5","author":"Birney","year":"1997","journal-title":"Proc. Int. Conf. Intell. Syst. Mol. Biol"},{"key":"2023012312141952300_btad014-B5","doi-asserted-by":"crossref","first-page":"988","DOI":"10.1101\/gr.1865504","article-title":"Genewise and genomewise","volume":"14","author":"Birney","year":"2004","journal-title":"Genome Res"},{"key":"2023012312141952300_btad014-B6","doi-asserted-by":"crossref","first-page":"lqaa026","DOI":"10.1093\/nargab\/lqaa026","article-title":"GeneMark-EP+: eukaryotic gene prediction with self-training in the space of genes and proteins","volume":"2","author":"Br\u016fna","year":"2020","journal-title":"NAR Genom. Bioinform"},{"key":"2023012312141952300_btad014-B7","doi-asserted-by":"crossref","first-page":"lqaa108","DOI":"10.1093\/nargab\/lqaa108","article-title":"BRAKER2: automatic eukaryotic genome annotation with GeneMark-EP+ and AUGUSTUS supported by a protein database","volume":"3","author":"Br\u016fna","year":"2021","journal-title":"NAR Genom. Bioinform"},{"key":"2023012312141952300_btad014-B8","doi-asserted-by":"crossref","first-page":"188","DOI":"10.1101\/gr.6743907","article-title":"MAKER: an easy-to-use annotation pipeline designed for emerging model organism genomes","volume":"18","author":"Cantarel","year":"2008","journal-title":"Genome Res"},{"key":"2023012312141952300_btad014-B9","doi-asserted-by":"crossref","first-page":"170","DOI":"10.1038\/s41592-020-01056-5","article-title":"Haplotype-resolved de novo assembly using phased assembly graphs with hifiasm","volume":"18","author":"Cheng","year":"2021","journal-title":"Nat. Methods"},{"key":"2023012312141952300_btad014-B10","doi-asserted-by":"crossref","first-page":"1332","DOI":"10.1038\/s41587-022-01261-x","article-title":"Haplotype-resolved assembly of diploid genomes without parental data","volume":"40","author":"Cheng","year":"2022","journal-title":"Nat. Biotechnol"},{"key":"2023012312141952300_btad014-B11","doi-asserted-by":"crossref","first-page":"15","DOI":"10.1093\/bioinformatics\/bts635","article-title":"STAR: ultrafast universal RNA-seq aligner","volume":"29","author":"Dobin","year":"2013","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B12","doi-asserted-by":"crossref","first-page":"e1002195","DOI":"10.1371\/journal.pcbi.1002195","article-title":"Accelerated profile HMM searches","volume":"7","author":"Eddy","year":"2011","journal-title":"PLoS Comput. Biol"},{"key":"2023012312141952300_btad014-B13","doi-asserted-by":"crossref","first-page":"380","DOI":"10.1093\/nar\/gkh180","article-title":"Local homology recognition and distance measures in linear time using compressed amino acid alphabets","volume":"32","author":"Edgar","year":"2004","journal-title":"Nucleic Acids Res"},{"key":"2023012312141952300_btad014-B14","doi-asserted-by":"crossref","first-page":"156","DOI":"10.1093\/bioinformatics\/btl582","article-title":"Striped Smith-Waterman speeds database searches six times over other SIMD implementations","volume":"23","author":"Farrar","year":"2007","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B15","doi-asserted-by":"crossref","first-page":"1029","DOI":"10.1101\/gr.233460.117","article-title":"Comparative annotation toolkit (CAT)-simultaneous clade and personal genome annotation","volume":"28","author":"Fiddes","year":"2018","journal-title":"Genome Res"},{"key":"2023012312141952300_btad014-B16","doi-asserted-by":"crossref","first-page":"2438","DOI":"10.1093\/bioinformatics\/btn460","article-title":"Direct mapping and alignment of protein sequences onto genomic sequence","volume":"24","author":"Gotoh","year":"2008","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B17","doi-asserted-by":"crossref","first-page":"965","DOI":"10.1016\/j.infsof.2005.09.005","article-title":"Engineering a software tool for gene structure prediction in higher organisms","volume":"47","author":"Gremme","year":"2005","journal-title":"Inf. Softw. Technol"},{"key":"2023012312141952300_btad014-B18","doi-asserted-by":"crossref","first-page":"R7","DOI":"10.1186\/gb-2008-9-1-r7","article-title":"Automated eukaryotic gene structure annotation using EVidenceModeler and the program to assemble spliced alignments","volume":"9","author":"Haas","year":"2008","journal-title":"Genome Biol"},{"key":"2023012312141952300_btad014-B19","doi-asserted-by":"crossref","first-page":"10915","DOI":"10.1073\/pnas.89.22.10915","article-title":"Amino acid substitution matrices from protein blocks","volume":"89","author":"Henikoff","year":"1992","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2023012312141952300_btad014-B20","doi-asserted-by":"crossref","first-page":"491","DOI":"10.1186\/1471-2105-12-491","article-title":"MAKER2: an annotation pipeline and genome-database management tool for second-generation genome projects","volume":"12","author":"Holt","year":"2011","journal-title":"BMC Bioinformatics"},{"key":"2023012312141952300_btad014-B21","doi-asserted-by":"crossref","first-page":"e1000148","DOI":"10.1371\/journal.pgen.1000148","article-title":"Evolutionary convergence on highly-conserved 3\u2032 intron structures in intron-poor eukaryotes and insights into the ancestral eukaryotic genome","volume":"4","author":"Irimia","year":"2008","journal-title":"PLoS Genet"},{"key":"2023012312141952300_btad014-B22","doi-asserted-by":"crossref","first-page":"e161","DOI":"10.1093\/nar\/gks708","article-title":"Benchmarking spliced alignment programs including Spaln2, an extended version of Spaln that incorporates additional species-specific features","volume":"40","author":"Iwata","year":"2012","journal-title":"Nucleic Acids Res"},{"key":"2023012312141952300_btad014-B23","doi-asserted-by":"crossref","first-page":"20","DOI":"10.1186\/1745-6150-3-20","article-title":"Splign: algorithms for computing spliced alignments with identification of paralogs","volume":"3","author":"Kapustin","year":"2008","journal-title":"Biol. Direct"},{"key":"2023012312141952300_btad014-B24","doi-asserted-by":"crossref","first-page":"161","DOI":"10.1007\/978-1-4939-9173-0_9","article-title":"GeMoMa: homology-based gene prediction utilizing intron position conservation and RNA-seq data","volume":"1962","author":"Keilwagen","year":"2019","journal-title":"Methods Mol. Biol"},{"key":"2023012312141952300_btad014-B25","doi-asserted-by":"crossref","first-page":"278","DOI":"10.1186\/s13059-019-1910-1","article-title":"Transcriptome assembly from long-read RNA-seq alignments with StringTie2","volume":"20","author":"Kovaka","year":"2019","journal-title":"Genome Biol"},{"key":"2023012312141952300_btad014-B26","doi-asserted-by":"crossref","first-page":"4325","DOI":"10.1073\/pnas.1720115115","article-title":"Earth BioGenome project: sequencing life for the future of life","volume":"115","author":"Lewin","year":"2018","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2023012312141952300_btad014-B27","doi-asserted-by":"crossref","first-page":"2103","DOI":"10.1093\/bioinformatics\/btw152","article-title":"Minimap and miniasm: fast mapping and de novo assembly for noisy long sequences","volume":"32","author":"Li","year":"2016","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B28","doi-asserted-by":"crossref","first-page":"3094","DOI":"10.1093\/bioinformatics\/bty191","article-title":"Minimap2: pairwise alignment for nucleotide sequences","volume":"34","author":"Li","year":"2018","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B29","doi-asserted-by":"crossref","first-page":"349","DOI":"10.1186\/1471-2105-8-349","article-title":"A cross-species alignment tool (CAT)","volume":"8","author":"Li","year":"2007","journal-title":"BMC Bioinformatics"},{"key":"2023012312141952300_btad014-B30","doi-asserted-by":"crossref","first-page":"4647","DOI":"10.1093\/molbev\/msab199","article-title":"BUSCO update: novel and streamlined workflows along with broader and deeper phylogenetic coverage for scoring of eukaryotic, prokaryotic, and viral genomes","volume":"38","author":"Manni","year":"2021","journal-title":"Mol. Biol. Evol"},{"key":"2023012312141952300_btad014-B31","doi-asserted-by":"crossref","first-page":"1291","DOI":"10.1101\/gr.263566.120","article-title":"HiCanu: accurate assembly of segmental duplications, satellites, and allelic variants from high-fidelity long reads","volume":"30","author":"Nurk","year":"2020","journal-title":"Genome Res"},{"key":"2023012312141952300_btad014-B32","doi-asserted-by":"crossref","first-page":"737","DOI":"10.1038\/s41586-021-03451-0","article-title":"Towards complete and error-free genome assemblies of all vertebrate species","volume":"592","author":"Rhie","year":"2021","journal-title":"Nature"},{"key":"2023012312141952300_btad014-B33","doi-asserted-by":"crossref","first-page":"293","DOI":"10.1186\/s12864-020-6707-9","article-title":"A benchmark study of ab initio gene prediction methods in diverse eukaryotic organisms","volume":"21","author":"Scalzitti","year":"2020","journal-title":"BMC Genomics"},{"key":"2023012312141952300_btad014-B34","doi-asserted-by":"crossref","first-page":"2141","DOI":"10.1093\/bioinformatics\/btr342","article-title":"genBlastG: using blast searches to build homologous gene models","volume":"27","author":"She","year":"2011","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B35","doi-asserted-by":"crossref","first-page":"3955","DOI":"10.1093\/nar\/gkl556","article-title":"Comprehensive splice-site analysis using comparative genomics","volume":"34","author":"Sheth","year":"2006","journal-title":"Nucleic Acids Res"},{"key":"2023012312141952300_btad014-B36","doi-asserted-by":"crossref","first-page":"1639","DOI":"10.1093\/bioinformatics\/btaa1016","article-title":"Liftoff: accurate mapping of gene annotations","volume":"37","author":"Shumate","year":"2020","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B37","doi-asserted-by":"crossref","first-page":"407","DOI":"10.1038\/nrg.2016.46","article-title":"Lessons from non-canonical splicing","volume":"17","author":"Sibley","year":"2016","journal-title":"Nat. Rev. Genet"},{"key":"2023012312141952300_btad014-B38","doi-asserted-by":"crossref","first-page":"31","DOI":"10.1186\/1471-2105-6-31","article-title":"Automated generation of heuristics for biological sequence comparison","volume":"6","author":"Slater","year":"2005","journal-title":"BMC Bioinformatics"},{"key":"2023012312141952300_btad014-B39","doi-asserted-by":"crossref","first-page":"1026","DOI":"10.1038\/nbt.3988","article-title":"MMseqs2 enables sensitive protein sequence searching for the analysis of massive data sets","volume":"35","author":"Steinegger","year":"2017","journal-title":"Nat. Biotechnol"},{"key":"2023012312141952300_btad014-B40","doi-asserted-by":"crossref","first-page":"1075","DOI":"10.1006\/jmbi.2000.3641","article-title":"Gene structure prediction by spliced alignment of genomic DNA with protein sequences: increased accuracy by differential splice site scoring","volume":"297","author":"Usuka","year":"2000","journal-title":"J. Mol. Biol"},{"key":"2023012312141952300_btad014-B41","doi-asserted-by":"crossref","first-page":"1155","DOI":"10.1038\/s41587-019-0217-9","article-title":"Accurate circular consensus long-read sequencing improves variant detection and assembly of a human genome","volume":"37","author":"Wenger","year":"2019","journal-title":"Nat. Biotechnol"},{"key":"2023012312141952300_btad014-B42","doi-asserted-by":"crossref","first-page":"1859","DOI":"10.1093\/bioinformatics\/bti310","article-title":"GMAP: a genomic mapping and alignment program for mRNA and EST sequences","volume":"21","author":"Wu","year":"2005","journal-title":"Bioinformatics"},{"key":"2023012312141952300_btad014-B43","doi-asserted-by":"crossref","first-page":"339","DOI":"10.1089\/cmb.1997.4.339","article-title":"Aligning a DNA sequence with a protein sequence","volume":"4","author":"Zhang","year":"1997","journal-title":"J. Comput. Biol"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/advance-article-pdf\/doi\/10.1093\/bioinformatics\/btad014\/48745004\/btad014.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/39\/1\/btad014\/48827638\/btad014.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/39\/1\/btad014\/48827638\/btad014.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,23]],"date-time":"2023-01-23T12:29:24Z","timestamp":1674476964000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/doi\/10.1093\/bioinformatics\/btad014\/6989621"}},"subtitle":[],"editor":[{"given":"Alfonso","family":"Valencia","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"editor"}]}],"short-title":[],"issued":{"date-parts":[[2023,1,1]]},"references-count":43,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2023,1,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btad014","relation":{},"ISSN":["1367-4811"],"issn-type":[{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2023,1,1]]},"published":{"date-parts":[[2023,1,1]]},"article-number":"btad014"}}