{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,12]],"date-time":"2025-11-12T03:16:40Z","timestamp":1762917400041},"reference-count":25,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2012,6,18]],"date-time":"2012-06-18T00:00:00Z","timestamp":1339977600000},"content-version":"unspecified","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["BioData Mining"],"published-print":{"date-parts":[[2012,12]]},"abstract":"<jats:title>Abstract<\/jats:title>\n          <jats:sec>\n            <jats:title>Background<\/jats:title>\n            <jats:p>Next-generation sequencing technologies generate a significant number of short reads that are utilized to address a variety of biological questions. However, quite often, sequencing reads tend to have low quality at the 3\u2019 end and are generated from the repetitive regions of a genome. It is unclear how different alignment programs perform under these different cases. In order to investigate this question, we use both real data and simulated data with the above issues to evaluate the performance of four commonly used algorithms: SOAP2, Bowtie, BWA, and Novoalign.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Methods<\/jats:title>\n            <jats:p>The performance of different alignment algorithms are measured in terms of concordance between any pair of aligners (for real sequencing data without known truth) and the accuracy of simulated read alignment.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Results<\/jats:title>\n            <jats:p>Our results show that, for sequencing data with reads that have relatively good quality or that have had low quality bases trimmed off, all four alignment programs perform similarly. We have also demonstrated that trimming off low quality ends markedly increases the number of aligned reads and improves the consistency among different aligners as well, especially for low quality data. However, Novoalign is more sensitive to the improvement of data quality. Trimming off low quality ends significantly increases the concordance between Novoalign and other aligners. As for aligning reads from repetitive regions, our simulation data show that reads from repetitive regions tend to be aligned incorrectly, and suppressing reads with multiple hits can improve alignment accuracy.<\/jats:p>\n          <\/jats:sec>\n          <jats:sec>\n            <jats:title>Conclusions<\/jats:title>\n            <jats:p>This study provides a systematic comparison of commonly used alignment algorithms in the context of sequencing data with varying qualities and from repetitive regions. Our approach can be applied to different sequencing data sets generated from different platforms. It can also be utilized to study the performance of other alignment programs.<\/jats:p>\n          <\/jats:sec>","DOI":"10.1186\/1756-0381-5-6","type":"journal-article","created":{"date-parts":[[2012,6,25]],"date-time":"2012-06-25T14:42:51Z","timestamp":1340635371000},"update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":30,"title":["How do alignment programs perform on sequencing data with varying qualities and from repetitive regions?"],"prefix":"10.1186","volume":"5","author":[{"given":"Xiaoqing","family":"Yu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Kishore","family":"Guda","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Joseph","family":"Willis","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Martina","family":"Veigl","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhenghe","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sanford","family":"Markowitz","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mark D","family":"Adams","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuying","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2012,6,18]]},"reference":[{"issue":"5","key":"62_CR1","doi-asserted-by":"publisher","first-page":"473","DOI":"10.1093\/bib\/bbq015","volume":"11","author":"H Li","year":"2010","unstructured":"Li H, Homer N: A survey of sequence alignment algorithms for next-generation sequencing. Brief Bioinform. 2010, 11 (5): 473-483. 10.1093\/bib\/bbq015.","journal-title":"Brief Bioinform"},{"issue":"3","key":"62_CR2","doi-asserted-by":"publisher","first-page":"440","DOI":"10.1093\/bioinformatics\/18.3.440","volume":"18","author":"B Ma","year":"2002","unstructured":"Ma B, Tromp J, Li M: PatternHunter: faster and more sensitive homology search. Bioinformatics. 2002, 18 (3): 440-445. 10.1093\/bioinformatics\/18.3.440.","journal-title":"Bioinformatics"},{"issue":"5","key":"62_CR3","doi-asserted-by":"publisher","first-page":"713","DOI":"10.1093\/bioinformatics\/btn025","volume":"24","author":"R Li","year":"2008","unstructured":"Li R, Li Y, Kristiansen K, Wang J: SOAP: short oligonucleotide alignment program. Bioinformatics. 2008, 24 (5): 713-714. 10.1093\/bioinformatics\/btn025.","journal-title":"Bioinformatics"},{"issue":"20","key":"62_CR4","doi-asserted-by":"publisher","first-page":"2395","DOI":"10.1093\/bioinformatics\/btn429","volume":"24","author":"H Jiang","year":"2008","unstructured":"Jiang H, Wong WH: SeqMap: mapping massive amount of oligonucleotides to the genome. Bioinformatics. 2008, 24 (20): 2395-2396. 10.1093\/bioinformatics\/btn429.","journal-title":"Bioinformatics"},{"issue":"11","key":"62_CR5","doi-asserted-by":"publisher","first-page":"1851","DOI":"10.1101\/gr.078212.108","volume":"18","author":"H Li","year":"2008","unstructured":"Li H, Ruan J, Durbin R: Mapping short DNA sequencing reads and calling variants using mapping quality scores. Genome Res. 2008, 18 (11): 1851-1858. 10.1101\/gr.078212.108.","journal-title":"Genome Res"},{"issue":"21","key":"62_CR6","doi-asserted-by":"publisher","first-page":"2431","DOI":"10.1093\/bioinformatics\/btn416","volume":"24","author":"H Lin","year":"2008","unstructured":"Lin H, Zhang Z, Zhang MQ, Ma B, Li M: ZOOM! Zillions of oligos mapped. Bioinformatics. 2008, 24 (21): 2431-2437. 10.1093\/bioinformatics\/btn416.","journal-title":"Bioinformatics"},{"issue":"11","key":"62_CR7","doi-asserted-by":"publisher","first-page":"1363","DOI":"10.1093\/bioinformatics\/btp236","volume":"25","author":"MC Schatz","year":"2009","unstructured":"Schatz MC: CloudBurst: highly sensitive read mapping with MapReduce. Bioinformatics. 2009, 25 (11): 1363-1369. 10.1093\/bioinformatics\/btp236.","journal-title":"Bioinformatics"},{"issue":"19","key":"62_CR8","doi-asserted-by":"publisher","first-page":"2514","DOI":"10.1093\/bioinformatics\/btp486","volume":"25","author":"Y Chen","year":"2009","unstructured":"Chen Y, Souaiaia T, Chen T: PerM: efficient mapping of short sequencing reads with periodic full sensitive spaced seeds. Bioinformatics. 2009, 25 (19): 2514-2521. 10.1093\/bioinformatics\/btp486.","journal-title":"Bioinformatics"},{"issue":"5","key":"62_CR9","doi-asserted-by":"publisher","first-page":"e1000386","DOI":"10.1371\/journal.pcbi.1000386","volume":"5","author":"SM Rumble","year":"2009","unstructured":"Rumble SM, Lacroute P, Dalca AV, Fiume M, Sidow A, Brudno M: SHRiMP: Accurate Mapping of Short Color-space Reads. PLoS Comput Biol. 2009, 5 (5): e1000386-10.1371\/journal.pcbi.1000386.","journal-title":"PLoS Comput Biol"},{"issue":"9","key":"62_CR10","doi-asserted-by":"publisher","first-page":"1646","DOI":"10.1101\/gr.088823.108","volume":"19","author":"D Weese","year":"2009","unstructured":"Weese D, Emde A-K, Rausch T, D\u00f6ring A, Reinert K: RazerS\u2014fast read mapping with sensitivity control. Genome Res. 2009, 19 (9): 1646-1654. 10.1101\/gr.088823.108.","journal-title":"Genome Res"},{"issue":"15","key":"62_CR11","doi-asserted-by":"publisher","first-page":"1966","DOI":"10.1093\/bioinformatics\/btp336","volume":"25","author":"R Li","year":"2009","unstructured":"Li R, Yu C, Li Y, Lam T, Yiu S, Kristiansen K, Wang J: SOAP2: an improved ultrafast tool for short read alignment. Bioinformatics. 2009, 25 (15): 1966-10.1093\/bioinformatics\/btp336.","journal-title":"Bioinformatics"},{"issue":"6","key":"62_CR12","doi-asserted-by":"publisher","first-page":"791","DOI":"10.1093\/bioinformatics\/btn032","volume":"24","author":"TW Lam","year":"2008","unstructured":"Lam TW, Sung WK, Tam SL, Wong CK, Yiu SM: Compressed indexing and local alignment of DNA. Bioinformatics. 2008, 24 (6): 791-797. 10.1093\/bioinformatics\/btn032.","journal-title":"Bioinformatics"},{"issue":"5","key":"62_CR13","doi-asserted-by":"publisher","first-page":"589","DOI":"10.1093\/bioinformatics\/btp698","volume":"26","author":"H Li","year":"2010","unstructured":"Li H, Durbin R: Fast and accurate long-read alignment with Burrows\u2013Wheeler transform. Bioinformatics. 2010, 26 (5): 589-595. 10.1093\/bioinformatics\/btp698.","journal-title":"Bioinformatics"},{"issue":"Suppl 10","key":"62_CR14","doi-asserted-by":"publisher","first-page":"O7","DOI":"10.1186\/1471-2105-9-S10-O7","volume":"9","author":"F De Bona","year":"2008","unstructured":"De Bona F, Ossowski S, Schneeberger K, Ratsch G: Optimal spliced alignments of short sequence reads. BMC Bioinforma. 2008, 9 (Suppl 10): O7-10.1186\/1471-2105-9-S10-O7.","journal-title":"BMC Bioinforma"},{"issue":"3","key":"62_CR15","doi-asserted-by":"publisher","first-page":"R25","DOI":"10.1186\/gb-2009-10-3-r25","volume":"10","author":"B Langmead","year":"2009","unstructured":"Langmead B, Trapnell C, Pop M, Salzberg S: Ultrafast and memory-efficient alignment of short DNA sequences to the human genome. Genome Biol. 2009, 10 (3): R25-10.1186\/gb-2009-10-3-r25.","journal-title":"Genome Biol"},{"issue":"14","key":"62_CR16","doi-asserted-by":"publisher","first-page":"1754","DOI":"10.1093\/bioinformatics\/btp324","volume":"25","author":"H Li","year":"2009","unstructured":"Li H, Durbin R: Fast and accurate short read alignment with Burrows\u2013Wheeler transform. Bioinformatics. 2009, 25 (14): 1754-1760. 10.1093\/bioinformatics\/btp324.","journal-title":"Bioinformatics"},{"issue":"10","key":"62_CR17","doi-asserted-by":"publisher","first-page":"1725","DOI":"10.1101\/gr.194201","volume":"11","author":"Z Ning","year":"2001","unstructured":"Ning Z, Cox AJ, Mullikin JC: SSAHA: A Fast Search Method for Large DNA Databases. Genome Res. 2001, 11 (10): 1725-1729. 10.1101\/gr.194201.","journal-title":"Genome Res"},{"issue":"4","key":"62_CR18","doi-asserted-by":"publisher","first-page":"572","DOI":"10.1093\/bioinformatics\/btp706","volume":"26","author":"E Harris","year":"2010","unstructured":"Harris E, Ponts N, Levchuk A, Roch K, Lonardi S: BRAT: bisulfite-treated reads analysis tool. Bioinformatics. 2010, 26 (4): 572-10.1093\/bioinformatics\/btp706.","journal-title":"Bioinformatics"},{"issue":"10","key":"62_CR19","doi-asserted-by":"publisher","first-page":"1061","DOI":"10.1038\/ng.437","volume":"41","author":"C Alkan","year":"2009","unstructured":"Alkan C, Kidd JM, Marques-Bonet T, Aksay G, Antonacci F, Hormozdiari F, Kitzman JO, Baker C, Malig M, Mutlu O: Personalized copy number and segmental duplication maps using next-generation sequencing. Nat Genet. 2009, 41 (10): 1061-1067. 10.1038\/ng.437.","journal-title":"Nat Genet"},{"issue":"8","key":"62_CR20","doi-asserted-by":"publisher","first-page":"576","DOI":"10.1038\/nmeth0810-576","volume":"7","author":"F Hach","year":"2010","unstructured":"Hach F, Hormozdiari F, Alkan C, Hormozdiari F, Birol I, Eichler EE, Sahinalp SC: mrsFAST: a cache-oblivious algorithm for short-read mapping. Nat Meth. 2010, 7 (8): 576-577. 10.1038\/nmeth0810-576.","journal-title":"Nat Meth"},{"issue":"3","key":"62_CR21","doi-asserted-by":"publisher","first-page":"443","DOI":"10.1016\/0022-2836(70)90057-4","volume":"48","author":"SB Needleman","year":"1970","unstructured":"Needleman SB, Wunsch CD: A general method applicable to the search for similarities in the amino acid sequence of two proteins. J Mol Biol. 1970, 48 (3): 443-453. 10.1016\/0022-2836(70)90057-4.","journal-title":"J Mol Biol"},{"key":"62_CR22","volume-title":"Proceedings of the 41st Annual Symposium on Foundations of Computer Science (FOCS 2000)","author":"P Ferragina","year":"2000","unstructured":"Ferragina P, Manzini G: Opportunistic data structures with applications. Proceedings of the 41st Annual Symposium on Foundations of Computer Science (FOCS 2000). 2000, IEEE Computer Society, IEEE Computer Society"},{"issue":"3","key":"62_CR23","doi-asserted-by":"publisher","first-page":"403","DOI":"10.1016\/S0022-2836(05)80360-2","volume":"215","author":"SF Altschul","year":"1990","unstructured":"Altschul SF, Gish W, Miller W, Myers EW, Lipman DJ: Basic local alignment search tool. J Mol Biol. 1990, 215 (3): 403-410.","journal-title":"J Mol Biol"},{"key":"62_CR24","volume-title":"Technical Report 124","author":"M Burrows","year":"1994","unstructured":"Burrows M, Wheeler DJ: A block sorting lossless data compression algorithm. Technical Report 124. 1994, Digital Equipment Corporation, Palo Alto, CA"},{"issue":"20","key":"62_CR25","doi-asserted-by":"publisher","first-page":"2790","DOI":"10.1093\/bioinformatics\/btr477","volume":"27","author":"M Ruffalo","year":"2011","unstructured":"Ruffalo M, LaFramboise T, Koyut M: Comparative analysis of algorithms for next-generation sequencing read alignment. Bioinformatics. 2011, 27 (20): 2790-2796. 10.1093\/bioinformatics\/btr477.","journal-title":"Bioinformatics"}],"container-title":["BioData Mining"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/1756-0381-5-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1186\/1756-0381-5-6\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1186\/1756-0381-5-6","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/1756-0381-5-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2021,9,1]],"date-time":"2021-09-01T19:27:59Z","timestamp":1630524479000},"score":1,"resource":{"primary":{"URL":"https:\/\/biodatamining.biomedcentral.com\/articles\/10.1186\/1756-0381-5-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2012,6,18]]},"references-count":25,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2012,12]]}},"alternative-id":["62"],"URL":"https:\/\/doi.org\/10.1186\/1756-0381-5-6","relation":{},"ISSN":["1756-0381"],"issn-type":[{"value":"1756-0381","type":"electronic"}],"subject":[],"published":{"date-parts":[[2012,6,18]]},"assertion":[{"value":"18 January 2012","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 June 2012","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 June 2012","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}],"article-number":"6"}}