{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,23]],"date-time":"2026-07-23T17:51:38Z","timestamp":1784829098920,"version":"3.55.0"},"reference-count":53,"publisher":"Oxford University Press (OUP)","issue":"Supplement_2","license":[{"start":{"date-parts":[[2024,9,4]],"date-time":"2024-09-04T00:00:00Z","timestamp":1725408000000},"content-version":"vor","delay-in-days":3,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"name":"Klaus Tschira Foundation gGmbH","award":["KT25\/GSO"],"award-info":[{"award-number":["KT25\/GSO"]}]},{"DOI":"10.13039\/501100001659","name":"Deutsche Forschungsgemeinschaft","doi-asserted-by":"publisher","award":["RE2474\/5\u20131"],"award-info":[{"award-number":["RE2474\/5\u20131"]}],"id":[{"id":"10.13039\/501100001659","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2024,9,1]]},"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Motivation<\/jats:title>\n                    <jats:p>Accurate quantitative information about protein abundance is crucial for understanding a biological system and its dynamics. Protein abundance is commonly estimated using label-free, bottom-up mass spectrometry (MS) protocols. Here, proteins are digested into peptides before quantification via MS. However, missing peptide abundance values, which can make up more than 50% of all abundance values, are a common issue. They result in missing protein abundance values, which then hinder accurate and reliable downstream analyses.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>To impute missing abundance values, we propose PEPerMINT, a graph neural network model working directly on the peptide level that flexibly takes both peptide-to-protein relationships in a graph format as well as amino acid sequence information into account. We benchmark our method against 11 common imputation methods on 6 diverse datasets, including cell lines, tissue, and plasma samples. We observe that PEPerMINT consistently outperforms other imputation methods. Its prediction performance remains high for varying degrees of missingness, different evaluation approaches, and differential expression prediction. As an additional novel feature, PEPerMINT provides meaningful uncertainty estimates and allows for tailoring imputation to the user\u2019s needs based on the reliability of imputed values.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Availability and implementation<\/jats:title>\n                    <jats:p>The code is available at https:\/\/github.com\/DILiS-lab\/pepermint.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1093\/bioinformatics\/btae389","type":"journal-article","created":{"date-parts":[[2024,6,17]],"date-time":"2024-06-17T09:32:32Z","timestamp":1718616752000},"page":"ii70-ii78","source":"Crossref","is-referenced-by-count":6,"title":["PEPerMINT: peptide abundance imputation in mass spectrometry-based proteomics using graph neural networks"],"prefix":"10.1093","volume":"40","author":[{"given":"Tobias","family":"Pietz","sequence":"first","affiliation":[{"name":"Hasso Plattner Institute, Digital Engineering Faculty, University of Potsdam , Potsdam, 14482, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8974-8482","authenticated-orcid":false,"given":"Sukrit","family":"Gupta","sequence":"additional","affiliation":[{"name":"Hasso Plattner Institute, Digital Engineering Faculty, University of Potsdam , Potsdam, 14482, Germany"},{"name":"Department of Computer Science and Engineering, Indian Institute of Technology , Ropar, Rupnagar, 140001, India"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2717-3406","authenticated-orcid":false,"given":"Christoph N","family":"Schlaffner","sequence":"additional","affiliation":[{"name":"Hasso Plattner Institute, Digital Engineering Faculty, University of Potsdam , Potsdam, 14482, Germany"},{"name":"Department of Pathology, Boston Children\u2019s Hospital and Harvard Medical School , Boston, MA, 02115, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0293-036X","authenticated-orcid":false,"given":"Saima","family":"Ahmed","sequence":"additional","affiliation":[{"name":"Department of Pathology, Boston Children\u2019s Hospital and Harvard Medical School , Boston, MA, 02115, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0179-6648","authenticated-orcid":false,"given":"Hanno","family":"Steen","sequence":"additional","affiliation":[{"name":"Department of Pathology, Boston Children\u2019s Hospital and Harvard Medical School , Boston, MA, 02115, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4589-9809","authenticated-orcid":false,"given":"Bernhard Y","family":"Renard","sequence":"additional","affiliation":[{"name":"Hasso Plattner Institute, Digital Engineering Faculty, University of Potsdam , Potsdam, 14482, Germany"},{"name":"Windreich Department for Artificial Intelligence and Human Health and Hasso Plattner Institute at Mount Sinai, Icahn School of Medicine at Mount Sinai , New York City, NY, 10029, United States"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7256-0566","authenticated-orcid":false,"given":"Katharina","family":"Baum","sequence":"additional","affiliation":[{"name":"Hasso Plattner Institute, Digital Engineering Faculty, University of Potsdam , Potsdam, 14482, Germany"},{"name":"Windreich Department for Artificial Intelligence and Human Health and Hasso Plattner Institute at Mount Sinai, Icahn School of Medicine at Mount Sinai , New York City, NY, 10029, United States"},{"name":"Department of Mathematics and Computer Science, Free University Berlin , Berlin, 14195, Germany"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2024,9,4]]},"reference":[{"key":"2024090413591681700_btae389-B1","doi-asserted-by":"crossref","first-page":"341","DOI":"10.1007\/s13365-022-01077-0","article-title":"Using plasma proteomics to investigate viral infections of the central nervous system including patients with HIV-associated neurocognitive disorders","volume":"28","author":"Ahmed","year":"2022","journal-title":"J Neurovirol"},{"key":"2024090413591681700_btae389-B2","doi-asserted-by":"crossref","first-page":"3575","DOI":"10.1093\/bioinformatics\/bth446","article-title":"Quantifying reproducibility for differential proteomics: noise analysis for protein liquid chromatography-mass spectrometry of human serum","volume":"20","author":"Anderle","year":"2004","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B3","doi-asserted-by":"crossref","first-page":"1853","DOI":"10.1002\/elps.1150191103","article-title":"Proteome and proteomics: new technologies, new concepts, and new words","volume":"19","author":"Anderson","year":"1998","journal-title":"Electrophoresis"},{"key":"2024090413591681700_btae389-B4","doi-asserted-by":"crossref","first-page":"211","DOI":"10.1186\/s13059-019-1837-6","article-title":"DeepImpute: an accurate, fast, and scalable deep neural network method to impute single-cell RNA-seq data","volume":"20","author":"Arisdakessian","year":"2019","journal-title":"Genome Biol"},{"key":"2024090413591681700_btae389-B5","doi-asserted-by":"crossref","first-page":"2057","DOI":"10.1016\/j.csbj.2022.04.017","article-title":"Predicting missing proteomics values using machine learning: filling the gap using transcriptomics and other biological features","volume":"20","author":"Asensio","year":"2022","journal-title":"Comput Struct Biotechnol J"},{"key":"2024090413591681700_btae389-B6","doi-asserted-by":"crossref","first-page":"4756","DOI":"10.1021\/pr800333e","article-title":"The impact of peptide abundance and dynamic range on stable-isotope-based quantitative proteomic analyses","volume":"7","author":"Bakalarski","year":"2008","journal-title":"J Proteome Res"},{"key":"2024090413591681700_btae389-B7","doi-asserted-by":"crossref","first-page":"e2000009","DOI":"10.1002\/pmic.202000009","article-title":"Using deep learning to extrapolate protein expression measurements","volume":"20","author":"Barzine","year":"2020","journal-title":"Proteomics"},{"key":"2024090413591681700_btae389-B8","author":"Bishop","year":"1994"},{"key":"2024090413591681700_btae389-B9","first-page":"382","article-title":"Bayesian PCA","volume":"11","author":"Bishop","year":"1998","journal-title":"Adv Neural Inf Process Syst"},{"key":"2024090413591681700_btae389-B10","author":"Brody","year":"2022"},{"key":"2024090413591681700_btae389-B11","doi-asserted-by":"crossref","first-page":"630","DOI":"10.1038\/s41576-020-0258-4","article-title":"mRNAs, proteins and the emerging principles of gene expression control","volume":"21","author":"Buccitelli","year":"2020","journal-title":"Nat Rev Genet"},{"key":"2024090413591681700_btae389-B12","doi-asserted-by":"crossref","first-page":"101561","DOI":"10.1016\/j.molmet.2022.101561","article-title":"Histone lysine demethylase inhibition reprograms prostate cancer metabolism and mechanics","volume":"64","author":"Chianese","year":"2022","journal-title":"Mol Metab"},{"key":"2024090413591681700_btae389-B13","doi-asserted-by":"crossref","first-page":"2513","DOI":"10.1074\/mcp.M113.031591","article-title":"Accurate proteome-wide label-free quantification by delayed normalization and maximal peptide ratio extraction, termed MaxLFQ","volume":"13","author":"Cox","year":"2014","journal-title":"Mol Cell Proteomics"},{"key":"2024090413591681700_btae389-B14","doi-asserted-by":"crossref","first-page":"2494","DOI":"10.1021\/acsomega.0c04030","article-title":"Benchmarking quantitative performance in label-free proteomics","volume":"6","author":"Dowell","year":"2021","journal-title":"ACS Omega"},{"key":"2024090413591681700_btae389-B15","doi-asserted-by":"crossref","first-page":"7112","DOI":"10.1109\/TPAMI.2021.3095381","article-title":"ProtTrans: toward understanding the language of life through self-supervised learning","volume":"44","author":"Elnaggar","year":"2021","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2024090413591681700_btae389-B16","author":"Etourneau","year":"2023"},{"key":"2024090413591681700_btae389-B17","doi-asserted-by":"crossref","DOI":"10.1093\/bioinformatics\/btad526","article-title":"DEP2: an upgraded comprehensive analysis toolkit for quantitative proteomics data","volume":"39","author":"Feng","year":"2023","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B18","doi-asserted-by":"crossref","first-page":"1040","DOI":"10.1093\/bioinformatics\/btv675","article-title":"iPQF: a new peptide-to-protein summarization method using peptide spectra characteristics to improve protein quantification","volume":"32","author":"Fischer","year":"2016","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B19","doi-asserted-by":"crossref","first-page":"288","DOI":"10.1093\/bioinformatics\/btr645","article-title":"MSnbase-an R\/bioconductor package for isobaric tagged mass spectrometry data visualization, processing and quantitation","volume":"28","author":"Gatto","year":"2012","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B20","doi-asserted-by":"crossref","first-page":"2200011","DOI":"10.1002\/pmic.202200011","article-title":"Recent advances of data-independent acquisition mass spectrometry-based proteomics","volume":"23","author":"Guo","year":"2023","journal-title":"Proteomics"},{"key":"2024090413591681700_btae389-B21","doi-asserted-by":"crossref","first-page":"3427","DOI":"10.1021\/acs.jproteome.3c00205","article-title":"Evaluating proteomics imputation methods with improved criteria","author":"Harris","year":"2023","journal-title":"J Proteome Res"},{"key":"2024090413591681700_btae389-B22","first-page":"221","author":"Ioannidis","year":"2019"},{"key":"2024090413591681700_btae389-B23","article-title":"Identifying drivers of predictive uncertainty using variance feature attribution","volume-title":"arXiv","author":"Iversen","year":"2023"},{"key":"2024090413591681700_btae389-B24","doi-asserted-by":"crossref","first-page":"1760","DOI":"10.1038\/s41598-021-81279-4","article-title":"A comparative study of evaluating missing value imputation methods in label-free proteomics","volume":"11","author":"Jin","year":"2021","journal-title":"Sci Rep"},{"issue":"Suppl 16","key":"2024090413591681700_btae389-B25","doi-asserted-by":"crossref","first-page":"S5","DOI":"10.1186\/1471-2105-13-S16-S5","article-title":"Normalization and missing value imputation for label-free LC-MS analysis","volume":"13","author":"Karpievitch","year":"2012","journal-title":"BMC Bioinformatics"},{"key":"2024090413591681700_btae389-B26","doi-asserted-by":"crossref","first-page":"e2200092","DOI":"10.1002\/pmic.202200092","article-title":"Dealing with missing values in proteomics data","volume":"22","author":"Kong","year":"2022","journal-title":"Proteomics"},{"key":"2024090413591681700_btae389-B27","doi-asserted-by":"crossref","first-page":"bbad233","DOI":"10.1093\/bib\/bbad233","article-title":"ProJect: a powerful mixed-model missing value imputation method","volume":"24","author":"Kong","year":"2023","journal-title":"Brief Bioinform"},{"key":"2024090413591681700_btae389-B28","doi-asserted-by":"crossref","first-page":"1116","DOI":"10.1021\/acs.jproteome.5b00981","article-title":"Accounting for the multiple natures of missing values in label-free quantitative proteomics data sets to compare imputation strategies","volume":"15","author":"Lazar","year":"2016","journal-title":"J Proteome Res"},{"key":"2024090413591681700_btae389-B29","doi-asserted-by":"crossref","first-page":"1966","DOI":"10.1001\/jama.2015.15281","article-title":"Multiple imputation: a flexible tool for handling missing data","volume":"314","author":"Li","year":"2015","journal-title":"JAMA"},{"key":"2024090413591681700_btae389-B30","first-page":"109","author":"Li","year":"2021"},{"key":"2024090413591681700_btae389-B31","doi-asserted-by":"crossref","first-page":"bbaa112","DOI":"10.1093\/bib\/bbaa112","article-title":"Proper imputation of missing values in proteomics datasets for differential expression analysis","volume":"22","author":"Liu","year":"2021","journal-title":"Brief Bioinform"},{"key":"2024090413591681700_btae389-B32","doi-asserted-by":"crossref","first-page":"757","DOI":"10.1080\/14789450.2016.1209418","article-title":"Metaproteomic data analysis at a glance: advances in computational microbial community proteomics","volume":"13","author":"Muth","year":"2016","journal-title":"Expert Rev Proteomics"},{"key":"2024090413591681700_btae389-B33","doi-asserted-by":"crossref","first-page":"2088","DOI":"10.1093\/bioinformatics\/btg287","article-title":"A Bayesian missing value estimation method for gene expression profile data","volume":"19","author":"Oba","year":"2003","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B34","first-page":"2825","article-title":"Scikit-learn: machine learning in python","volume":"12","author":"Pedregosa","year":"2011","journal-title":"J Mach Learn Res"},{"key":"2024090413591681700_btae389-B35","doi-asserted-by":"crossref","first-page":"104","DOI":"10.1038\/s41523-022-00476-0","article-title":"Immunologically \u2018cold\u2019 triple negative breast cancers engraft at a higher rate in patient derived xenografts","volume":"8","author":"Petrosyan","year":"2022","journal-title":"NPJ Breast Cancer"},{"key":"2024090413591681700_btae389-B36","doi-asserted-by":"crossref","first-page":"173","DOI":"10.3390\/metabo12020173","article-title":"A modular and expandable ecosystem for metabolomics data annotation in R","volume":"12","author":"Rainer","year":"2022","journal-title":"Metabolites"},{"key":"2024090413591681700_btae389-B37","doi-asserted-by":"crossref","first-page":"M111","DOI":"10.1074\/mcp.M111.014167","article-title":"Overcoming species boundaries in peptide identification with Bayesian information criterion-driven error-tolerant peptide search (BICEPS)","volume":"11","author":"Renard","year":"2012","journal-title":"Mol Cell Proteomics"},{"key":"2024090413591681700_btae389-B38","first-page":"85","volume-title":"Quantitative Mass Spectrometry-Based Proteomics: An overview","author":"Rozanova","year":"2021"},{"key":"2024090413591681700_btae389-B39","doi-asserted-by":"crossref","first-page":"1067","DOI":"10.1038\/s41598-022-04938-0","article-title":"Comparative assessment and novel strategy on methods for imputing proteomics data","volume":"12","author":"Shen","year":"2022","journal-title":"Sci Rep"},{"key":"2024090413591681700_btae389-B40","doi-asserted-by":"crossref","first-page":"207","DOI":"10.1146\/annurev-biodatasci-080917-013516","article-title":"Computational methods for understanding mass spectrometry-based shotgun proteomics data","volume":"1","author":"Sinitcyn","year":"2018","journal-title":"Annu Rev Biomed Data Sci"},{"key":"2024090413591681700_btae389-B41","first-page":"127929","article-title":"Optimal training of mean variance estimation neural networks","volume-title":"Neurocomputing","author":"Sluijterman","year":"2024"},{"key":"2024090413591681700_btae389-B42","doi-asserted-by":"crossref","first-page":"1164","DOI":"10.1093\/bioinformatics\/btm069","article-title":"pcaMethods\u2014a bioconductor package providing PCA methods for incomplete data","volume":"23","author":"Stacklies","year":"2007","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B43","doi-asserted-by":"crossref","first-page":"112","DOI":"10.1093\/bioinformatics\/btr597","article-title":"MissForest-non-parametric missing value imputation for mixed-type data","volume":"28","author":"Stekhoven","year":"2012","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B44","first-page":"5593","article-title":"Faithful heteroscedastic regression with neural networks","author":"Stirn","year":"2023"},{"key":"2024090413591681700_btae389-B45","doi-asserted-by":"crossref","first-page":"520","DOI":"10.1093\/bioinformatics\/17.6.520","article-title":"Missing value estimation methods for DNA microarrays","volume":"17","author":"Troyanskaya","year":"2001","journal-title":"Bioinformatics"},{"key":"2024090413591681700_btae389-B46","first-page":"1","article-title":"Mice: multivariate imputation by chained equations in R","volume":"45","author":"Van Buuren","year":"2011","journal-title":"J Stat Soft"},{"key":"2024090413591681700_btae389-B47","doi-asserted-by":"crossref","first-page":"1737","DOI":"10.1093\/ecco-jcc\/jjab061","article-title":"Potential role of epithelial endoplasmic reticulum stress and anterior gradient protein 2 homologue in Crohn\u2019s disease fibrosis","volume":"15","author":"Vieujean","year":"2021","journal-title":"J Crohns Colitis"},{"key":"2024090413591681700_btae389-B48","first-page":"1344","article-title":"A comprehensive evaluation of popular proteomics software workflows for label-free proteome quantification and imputation","volume":"19","author":"V\u00e4likangas","year":"2017","journal-title":"Brief Bioinform"},{"key":"2024090413591681700_btae389-B49","doi-asserted-by":"crossref","first-page":"e83","DOI":"10.1093\/nar\/gkaa498","article-title":"NAguideR: performing and prioritizing missing value imputations for consistent bottom-up proteomic analyses","volume":"48","author":"Wang","year":"2020","journal-title":"Nucleic Acids Res"},{"key":"2024090413591681700_btae389-B50","doi-asserted-by":"crossref","first-page":"1993","DOI":"10.1021\/pr501138h","article-title":"Review, evaluation, and discussion of the challenges of missing value imputation for mass spectrometry-based label-free global proteomics","volume":"14","author":"Webb-Robertson","year":"2015","journal-title":"J Proteome Res"},{"key":"2024090413591681700_btae389-B51","first-page":"1","article-title":"Imputation of label-free quantitative mass spectrometry-based proteomics using self supervised deep learning","volume-title":"Nature Communications","author":"Webel","year":"2024"},{"key":"2024090413591681700_btae389-B52","article-title":"DreamAI: algorithm for the imputation of proteomics data","volume-title":"bioRxiv","author":"Weiping","year":"2021"},{"key":"2024090413591681700_btae389-B53","article-title":"Mobility data improve forecasting of covid-19 incidence trends using graph neural networks","author":"Witzke","year":"2023"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/40\/Supplement_2\/ii70\/59016979\/btae389.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/40\/Supplement_2\/ii70\/59016979\/btae389.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,9,5]],"date-time":"2024-09-05T03:42:13Z","timestamp":1725507733000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/40\/Supplement_2\/ii70\/7749076"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,9,1]]},"references-count":53,"journal-issue":{"issue":"Supplement_2","published-print":{"date-parts":[[2024,9,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btae389","relation":{"has-preprint":[{"id-type":"doi","id":"10.1101\/2024.03.23.586248","asserted-by":"object"}]},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"value":"1367-4803","type":"print"},{"value":"1367-4811","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2024,9]]},"published":{"date-parts":[[2024,9,1]]}}}