{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,8]],"date-time":"2025-10-08T22:12:40Z","timestamp":1759961560658,"version":"3.41.2"},"reference-count":30,"publisher":"Oxford University Press (OUP)","license":[{"start":{"date-parts":[[2020,11,18]],"date-time":"2020-11-18T00:00:00Z","timestamp":1605657600000},"content-version":"vor","delay-in-days":322,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"name":"Junta de Andaluc\u00eda PAIDI Group","award":["BIO 147"],"award-info":[{"award-number":["BIO 147"]}]},{"name":"University Pablo de Olavide"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2020,1,1]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>The genomics era is resulting in the generation of a plethora of biological sequences that are usually stored in public databases. There are many computational tools that facilitate the annotation of these sequences, but sometimes they produce mistakes that enter the databases and can be propagated when erroneous data are used for secondary analyses, such as gene prediction or homology searching. While developing a computational gene finder based on protein-coding sequences, we discovered that the reference UniProtKB protein database is contaminated with some spurious sequences translated from DNA containing clustered regularly interspaced short palindromic repeats. We therefore encourage developers of prokaryotic computational gene finders and protein database curators to consider this source of error.<\/jats:p>","DOI":"10.1093\/database\/baaa088","type":"journal-article","created":{"date-parts":[[2020,9,10]],"date-time":"2020-09-10T11:38:42Z","timestamp":1599737922000},"source":"Crossref","is-referenced-by-count":5,"title":["CRISPR sequences are sometimes erroneously translated and can contaminate public databases with spurious proteins containing spaced repeats"],"prefix":"10.1093","volume":"2020","author":[{"given":"Alejandro","family":"Rubio","sequence":"first","affiliation":[{"name":"Centro Andaluz de Biologia del Desarrollo (CABD, UPO-CSIC-JA). Facultad de Ciencias Experimentales (\u00c1rea de Gen\u00e9tica), Universidad Pablo de Olavide, Ctra. Utrera, Km.1, 41013, Sevilla, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3663-2352","authenticated-orcid":false,"given":"Pablo","family":"Mier","sequence":"additional","affiliation":[{"name":"Faculty of Biology, Johannes Gutenberg University Mainz, Gresemundweg 2, 55128, Mainz, Germany"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6650-1711","authenticated-orcid":false,"given":"Miguel A","family":"Andrade-Navarro","sequence":"additional","affiliation":[{"name":"Faculty of Biology, Johannes Gutenberg University Mainz, Gresemundweg 2, 55128, Mainz, Germany"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Andr\u00e9s","family":"Garz\u00f3n","sequence":"additional","affiliation":[{"name":"Centro Andaluz de Biologia del Desarrollo (CABD, UPO-CSIC-JA). Facultad de Ciencias Experimentales (\u00c1rea de Gen\u00e9tica), Universidad Pablo de Olavide, Ctra. Utrera, Km.1, 41013, Sevilla, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-3851-7393","authenticated-orcid":false,"given":"Juan","family":"Jim\u00e9nez","sequence":"additional","affiliation":[{"name":"Centro Andaluz de Biologia del Desarrollo (CABD, UPO-CSIC-JA). Facultad de Ciencias Experimentales (\u00c1rea de Gen\u00e9tica), Universidad Pablo de Olavide, Ctra. Utrera, Km.1, 41013, Sevilla, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3343-2822","authenticated-orcid":false,"given":"Antonio J","family":"P\u00e9rez-Pulido","sequence":"additional","affiliation":[{"name":"Centro Andaluz de Biologia del Desarrollo (CABD, UPO-CSIC-JA). Facultad de Ciencias Experimentales (\u00c1rea de Gen\u00e9tica), Universidad Pablo de Olavide, Ctra. Utrera, Km.1, 41013, Sevilla, Spain"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2020,11,18]]},"reference":[{"key":"2020120621242012800_R1","doi-asserted-by":"publisher","first-page":"D649","DOI":"10.1093\/nar\/gky977","article-title":"Genomes OnLine Database (GOLD) v.7: updates and new features","volume":"47","author":"Mukherjee","year":"2019","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R2","doi-asserted-by":"publisher","DOI":"10.1186\/1471-2105-11-119","article-title":"Prodigal: prokaryotic gene recognition and translation initiation site identification","volume":"11","author":"Hyatt","year":"2010","journal-title":"BMC Bioinform."},{"key":"2020120621242012800_R3","doi-asserted-by":"publisher","first-page":"6614","DOI":"10.1093\/nar\/gkw569","article-title":"NCBI prokaryotic genome annotation pipeline","volume":"44","author":"Tatusova","year":"2016","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R4","doi-asserted-by":"publisher","first-page":"3723","DOI":"10.1093\/nar\/gkg590","article-title":"AMIGene: Annotation of MIcrobial Genes","volume":"31","author":"Bocs","year":"2003","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R5","doi-asserted-by":"publisher","DOI":"10.1093\/database\/bat053","article-title":"MisPred: a resource for identification of erroneous protein sequences in public databases","volume":"2013","author":"Nagy","year":"2013","journal-title":"Database J. Biol. Databases Curation"},{"key":"2020120621242012800_R6","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pcbi.1003998","article-title":"Extensive error in the number of genes inferred from draft genome assemblies","volume":"10","author":"Denton","year":"2014","journal-title":"PLoS Comput. Biol."},{"key":"2020120621242012800_R7","doi-asserted-by":"publisher","DOI":"10.1186\/s13059-019-1715-2","article-title":"Next-generation genome annotation: we still struggle to get it right","volume":"20","author":"Salzberg","year":"2019","journal-title":"Genome Biol."},{"key":"2020120621242012800_R8","doi-asserted-by":"publisher","DOI":"10.1186\/1944-3277-10-18","article-title":"Large-scale contamination of microbial isolate genomes by Illumina PhiX control","volume":"10","author":"Mukherjee","year":"2015","journal-title":"Stand Genomic Sci."},{"key":"2020120621242012800_R9","doi-asserted-by":"publisher","DOI":"10.1073\/pnas.1602711113","article-title":"No evidence for extensive horizontal gene transfer from the draft genome of a tardigrade","volume":"113","author":"Arakawa","year":"2016","journal-title":"Proc. Natl. Acad. Sci. U.S.A."},{"key":"2020120621242012800_R10","doi-asserted-by":"publisher","first-page":"D506","DOI":"10.1093\/nar\/gky1049","article-title":"UniProt: a worldwide hub of protein knowledge","volume":"47","author":"UniProt Consortium","year":"2019","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R11","doi-asserted-by":"publisher","first-page":"8792","DOI":"10.1093\/nar\/gkr576","article-title":"Misannotations of rRNA can now generate 90% false positive protein matches in metatranscriptomic studies","volume":"39","author":"Tripp","year":"2011","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R12","doi-asserted-by":"publisher","first-page":"10994","DOI":"10.1093\/nar\/gkz841","article-title":"Tandem repeats lead to sequence assembly errors and impose multi-level challenges for genome and protein databases","volume":"47","author":"T\u00f8rresen","year":"2019","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R13","doi-asserted-by":"publisher","first-page":"954","DOI":"10.1101\/gr.245373.118","article-title":"Human contamination in bacterial genomes has created thousands of spurious proteins","volume":"29","author":"Breitwieser","year":"2019","journal-title":"Genome Res."},{"key":"2020120621242012800_R14","doi-asserted-by":"publisher","DOI":"10.1128\/JB.00580-17","article-title":"History of CRISPR-Cas from encounter with a mysterious repeated sequence to genome editing technology","author":"Ishino","year":"2018","journal-title":"J. Bacteriol."},{"key":"2020120621242012800_R15","doi-asserted-by":"publisher","first-page":"W246","DOI":"10.1093\/nar\/gky425","article-title":"CRISPRCasFinder, an update of CRISRFinder, includes a portable version, enhanced performance and integrates search for Cas proteins","volume":"46","author":"Couvin","year":"2018","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R16","doi-asserted-by":"publisher","DOI":"10.1101\/2020.05.15.097824","article-title":"CRISPRCasTyper: an automated tool for the identification, annotation and classification of CRISPR-Cas loci","volume":"05","author":"Russel","year":"2020","journal-title":"bioRxiv"},{"key":"2020120621242012800_R17","doi-asserted-by":"publisher","first-page":"D535","DOI":"10.1093\/nar\/gkz915","article-title":"CRISPRCasdb a successor of CRISPRdb containing CRISPR arrays and cas genes from complete genome sequences, and tools to download and query lists of repeats and spacers","volume":"48","author":"Pourcel","year":"2020","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R18","doi-asserted-by":"publisher","first-page":"D427","DOI":"10.1093\/nar\/gky995","article-title":"The Pfam protein families database in 2019","volume":"47","author":"El-Gebali","year":"2019","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R19","doi-asserted-by":"publisher","first-page":"D200","DOI":"10.1093\/nar\/gkw1129","article-title":"CDD\/SPARCLE: functional classification of proteins via subfamily domain architectures","volume":"45","author":"Marchler-Bauer","year":"2017","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R20","doi-asserted-by":"crossref","first-page":"3389","DOI":"10.1093\/nar\/25.17.3389","article-title":"Gapped BLAST and PSI-BLAST: a new generation of protein database search programs","volume":"25","author":"Altschul","year":"1997","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R21","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1038\/s41579-019-0299-x","article-title":"Evolutionary classification of CRISPR-Cas systems: a burst of class 2 and derived variants","volume":"18","author":"Makarova","year":"2020","journal-title":"Nat. Rev. Microbiol."},{"key":"2020120621242012800_R22","doi-asserted-by":"publisher","DOI":"10.12688\/f1000research.14050.1","article-title":"Gene unprediction with Spurio: a tool to identify spurious protein sequences","volume":"7","author":"H\u00f6ps","year":"2018","journal-title":"F1000Res."},{"key":"2020120621242012800_R23","doi-asserted-by":"publisher","first-page":"439","DOI":"10.1093\/dnares\/dsv025","article-title":"AnABlast: a new in silico strategy for the genome-wide search of novel genes and fossil regions","volume":"22","author":"Jimenez","year":"2015","journal-title":"DNA Res."},{"key":"2020120621242012800_R24","doi-asserted-by":"publisher","first-page":"171","DOI":"10.1089\/crispr.2017.0022","article-title":"CRISPR disco: an automated pipeline for the discovery and analysis of CRISPR-Cas systems","volume":"1","author":"Crawley","year":"2018","journal-title":"Crispr J."},{"key":"2020120621242012800_R25","doi-asserted-by":"crossref","first-page":"719","DOI":"10.1101\/gad.14.6.719","article-title":"The zinc ribbon domains of the general transcription factors TFIIB and Brf: conserved functional surfaces but different roles in transcription initiation","volume":"14","author":"Hahn","year":"2000","journal-title":"Genes Dev."},{"key":"2020120621242012800_R26","doi-asserted-by":"publisher","first-page":"W52","DOI":"10.1093\/nar\/gkm360","article-title":"CRISPRFinder: a web tool to identify clustered regularly interspaced short palindromic repeats","volume":"35","author":"Grissa","year":"2007","journal-title":"Nucleic Acids Res."},{"key":"2020120621242012800_R27","doi-asserted-by":"publisher","DOI":"10.1186\/1471-2105-8-18","article-title":"PILER-CR: fast and accurate identification of CRISPR repeats","volume":"8","author":"Edgar","year":"2007","journal-title":"BMC Bioinform."},{"key":"2020120621242012800_R28","doi-asserted-by":"publisher","DOI":"10.1186\/1471-2105-8-209","article-title":"CRISPR recognition tool (CRT): a tool for automatic detection of clustered regularly interspaced palindromic repeats","volume":"8","author":"Bland","year":"2007","journal-title":"BMC Bioinform."},{"key":"2020120621242012800_R29","doi-asserted-by":"publisher","first-page":"2068","DOI":"10.1093\/bioinformatics\/btu153","article-title":"Prokka: rapid prokaryotic genome annotation","volume":"30","author":"Seemann","year":"2014","journal-title":"Bioinf. Oxf. Engl."},{"key":"2020120621242012800_R30","doi-asserted-by":"publisher","DOI":"10.1038\/srep08365","article-title":"RASTtk: a modular and extensible implementation of the RAST algorithm for building custom annotation pipelines and annotating batches of genomes","volume":"5","author":"Brettin","year":"2015","journal-title":"Sci. Rep."}],"container-title":["Database"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/academic.oup.com\/database\/article-pdf\/doi\/10.1093\/database\/baaa088\/34385700\/baaa088.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"http:\/\/academic.oup.com\/database\/article-pdf\/doi\/10.1093\/database\/baaa088\/34385700\/baaa088.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,11,17]],"date-time":"2022-11-17T18:06:00Z","timestamp":1668708360000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/database\/article\/doi\/10.1093\/database\/baaa088\/5989497"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,1,1]]},"references-count":30,"URL":"https:\/\/doi.org\/10.1093\/database\/baaa088","relation":{},"ISSN":["1758-0463"],"issn-type":[{"type":"electronic","value":"1758-0463"}],"subject":[],"published-other":{"date-parts":[[2020]]},"published":{"date-parts":[[2020,1,1]]},"article-number":"baaa088"}}