{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,7,30]],"date-time":"2025-07-30T11:43:12Z","timestamp":1753875792828,"version":"3.41.2"},"reference-count":30,"publisher":"Oxford University Press (OUP)","issue":"1","license":[{"start":{"date-parts":[[2022,12,28]],"date-time":"2022-12-28T00:00:00Z","timestamp":1672185600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"name":"National Science Foundation, Division of Mathematical Sciences","award":["1810829","2113707"],"award-info":[{"award-number":["1810829","2113707"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2023,1,1]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:sec><jats:title>Motivation<\/jats:title><jats:p>In the training of predictive models using high-dimensional genomic data, multiple studies\u2019 worth of data are often combined to increase sample size and improve generalizability. A drawback of this approach is that there may be different sets of features measured in each study due to variations in expression measurement platform or technology. It is often common practice to work only with the intersection of features measured in common across all studies, which results in the blind discarding of potentially useful feature information that is measured in individual or subsets of studies.<\/jats:p><\/jats:sec><jats:sec><jats:title>Results<\/jats:title><jats:p>We characterize the loss in predictive performance incurred by using only the intersection of feature information available across all studies when training predictors using gene expression data from microarray and sequencing datasets. We study the properties of linear and polynomial regression for imputing discarded features and demonstrate improvements in the external performance of prediction functions through simulation and in gene expression data collected on breast cancer patients. To improve this process, we propose a pairwise strategy that applies any imputation algorithm to two studies at a time and averages imputed features across pairs. We demonstrate that the pairwise strategy is preferable to first merging all datasets together and imputing any resulting missing features. Finally, we provide insights on which subsets of intersected and study-specific features should be used so that missing-feature imputation best promotes cross-study replicability.<\/jats:p><\/jats:sec><jats:sec><jats:title>Availability and implementation<\/jats:title><jats:p>The code is available at https:\/\/github.com\/YujieWuu\/Pairwise_imputation.<\/jats:p><\/jats:sec><jats:sec><jats:title>Supplementary information<\/jats:title><jats:p>Supplementary information is available at Bioinformatics online.<\/jats:p><\/jats:sec>","DOI":"10.1093\/bioinformatics\/btac839","type":"journal-article","created":{"date-parts":[[2022,12,28]],"date-time":"2022-12-28T10:02:38Z","timestamp":1672221758000},"source":"Crossref","is-referenced-by-count":0,"title":["A pairwise strategy for imputing predictive features when combining multiple datasets"],"prefix":"10.1093","volume":"39","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-2906-9998","authenticated-orcid":false,"given":"Yujie","family":"Wu","sequence":"first","affiliation":[{"name":"Department of Biostatistics, Harvard T.H. Chan School of Public Health , Boston, MA 02115, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Boyu","family":"Ren","sequence":"additional","affiliation":[{"name":"Laboratory for Psychiatric Biostatistics, McLean Hospital , Belmont, MA 02478, USA"},{"name":"Department of Psychiatry, Harvard Medical School , Boston, MA 02115, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Prasad","family":"Patil","sequence":"additional","affiliation":[{"name":"Department of Biostatistics, Boston University School of Public Health , Boston, MA 02118, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2022,12,28]]},"reference":[{"key":"2023011212505684900_btac839-B1","doi-asserted-by":"crossref","first-page":"871","DOI":"10.1007\/s10549-011-1470-x","article-title":"A signature of immune function genes associated with recurrence-free survival in breast cancer patients","volume":"131","author":"Ascierto","year":"2012","journal-title":"Breast Cancer Res. Treat"},{"key":"2023011212505684900_btac839-B2","doi-asserted-by":"crossref","first-page":"i105","DOI":"10.1093\/bioinformatics\/btu279","article-title":"Cross-study validation for the assessment of prediction algorithms","volume":"30","author":"Bernau","year":"2014","journal-title":"Bioinformatics"},{"first-page":"307","year":"2020","author":"Bobak","key":"2023011212505684900_btac839-B3"},{"key":"2023011212505684900_btac839-B4","doi-asserted-by":"crossref","first-page":"412","DOI":"10.1186\/1471-2105-12-412","article-title":"Prediction using step-wise l1, l2 regularization and feature selection for small data sets with large number of features","volume":"12","author":"Demir-Kavuk","year":"2011","journal-title":"BMC Bioinformatics"},{"year":"2013","author":"Fakoor","key":"2023011212505684900_btac839-B5"},{"key":"2023011212505684900_btac839-B6","doi-asserted-by":"crossref","first-page":"bat013","DOI":"10.1093\/database\/bat013","article-title":"Curatedovariandata: clinically annotated data for the ovarian cancer transcriptome","volume":"2013","author":"Ganzfried","year":"2013","journal-title":"Database (Oxford)"},{"key":"2023011212505684900_btac839-B7","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/s41389-019-0157-8","article-title":"Deepcc: a novel deep learning-based framework for cancer molecular subtype classification","volume":"8","author":"Gao","year":"2019","journal-title":"Oncogenesis"},{"key":"2023011212505684900_btac839-B8","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/s41598-019-45165-4","article-title":"Metagxdata: clinically annotated breast, ovarian and pancreatic cancer datasets and their use in generating a multi-cancer gene signature","volume":"9","author":"Gendoo","year":"2019","journal-title":"Sci. Rep"},{"year":"2019","author":"Guan","key":"2023011212505684900_btac839-B9"},{"key":"2023011212505684900_btac839-B10","doi-asserted-by":"crossref","first-page":"2149","DOI":"10.1158\/1078-0432.CCR-04-1673","article-title":"Gene expression profiles predict early relapse in ovarian cancer after platinum-paclitaxel chemotherapy","volume":"11","author":"Hartmann","year":"2005","journal-title":"Clin. Cancer Res"},{"key":"2023011212505684900_btac839-B11","doi-asserted-by":"crossref","DOI":"10.1007\/978-0-387-84858-7","volume-title":"The Elements of Statistical Learning: Data Mining, Inference, and Prediction","author":"Hastie","year":"2009"},{"key":"2023011212505684900_btac839-B12","first-page":"41","article-title":"Applications of support vector machine (SVM) learning in cancer genomics","volume":"15","author":"Huang","year":"2018","journal-title":"Cancer Genomics Proteomics"},{"key":"2023011212505684900_btac839-B13","doi-asserted-by":"crossref","first-page":"2578","DOI":"10.1073\/pnas.1708283115","article-title":"Training replicable predictors in multiple studies","volume":"115","author":"Patil","year":"2018","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2023011212505684900_btac839-B14","doi-asserted-by":"crossref","first-page":"S13","DOI":"10.1186\/1471-2164-9-S1-S13","article-title":"A comparative study of different machine learning methods on microarray gene expression data","volume":"9","author":"Pirooznia","year":"2008","journal-title":"BMC Genomics"},{"first-page":"138","year":"2013","author":"Planey","key":"2023011212505684900_btac839-B15"},{"key":"2023011212505684900_btac839-B16","doi-asserted-by":"crossref","first-page":"68","DOI":"10.1038\/nm0102-68","article-title":"Diffuse large b-cell lymphoma outcome prediction by gene-expression profiling and supervised machine learning","volume":"8","author":"Shipp","year":"2002","journal-title":"Nat. Med"},{"key":"2023011212505684900_btac839-B17","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1038\/s41598-020-77220-w","article-title":"A comparison of machine learning methods for survival analysis of high-dimensional clinical data for dementia prediction","volume":"10","author":"Spooner","year":"2020","journal-title":"Sci. Rep"},{"key":"2023011212505684900_btac839-B18","doi-asserted-by":"crossref","first-page":"345106","DOI":"10.1155\/2014\/345106","article-title":"Comparison of merging and meta-analysis as alternative approaches for integrative gene expression analysis","volume":"2014","author":"Taminau","year":"2014","journal-title":"ISRN Bioinform"},{"issue":"3 Suppl","key":"2023011212505684900_btac839-B19","first-page":"S75","article-title":"Ensemble machine learning on gene expression data for cancer classification","volume":"2","author":"Tan","year":"2003","journal-title":"Appl. Bioinformatics"},{"key":"2023011212505684900_btac839-B20","doi-asserted-by":"crossref","first-page":"375","DOI":"10.1186\/1471-2164-9-375","article-title":"Pooling breast cancer datasets has a synergetic effect on classification performance and improves signature stability","volume":"9","author":"van Vliet","year":"2008","journal-title":"BMC Genomics"},{"key":"2023011212505684900_btac839-B21","doi-asserted-by":"crossref","first-page":"530","DOI":"10.1038\/415530a","article-title":"Gene expression profiling predicts clinical outcome of breast cancer","volume":"415","author":"van 't Veer","year":"2002","journal-title":"Nature"},{"key":"2023011212505684900_btac839-B22","first-page":"2023","article-title":"Learning using privileged information: similarity control and knowledge transfer","volume":"16","author":"Vapnik","year":"2015","journal-title":"J. Mach. Learn Res"},{"key":"2023011212505684900_btac839-B23","doi-asserted-by":"crossref","first-page":"1564","DOI":"10.1200\/JCO.2004.08.186","article-title":"Gene expression profiles and molecular markers to predict recurrence of dukes\u2019 B colon cancer","volume":"22","author":"Wang","year":"2004","journal-title":"J. Clin. Oncol"},{"key":"2023011212505684900_btac839-B24","doi-asserted-by":"crossref","first-page":"671","DOI":"10.1016\/S0140-6736(05)17947-1","article-title":"Gene-expression profiles to predict distant metastasis of lymph-node-negative primary breast cancer","volume":"365","author":"Wang","year":"2005","journal-title":"Lancet"},{"key":"2023011212505684900_btac839-B25","doi-asserted-by":"crossref","first-page":"3905","DOI":"10.1093\/bioinformatics\/bti647","article-title":"Robust prostate cancer marker genes emerge from direct integration of inter-study microarray data","volume":"21","author":"Xu","year":"2005","journal-title":"Bioinformatics"},{"key":"2023011212505684900_btac839-B26","doi-asserted-by":"crossref","first-page":"125","DOI":"10.1186\/1471-2105-9-125","article-title":"Merging microarray data from separate breast cancer studies provides a robust prognostic test","volume":"9","author":"Xu","year":"2008","journal-title":"BMC Bioinformatics"},{"key":"2023011212505684900_btac839-B27","doi-asserted-by":"crossref","first-page":"e7431","DOI":"10.1371\/journal.pone.0007431","article-title":"Can survival prediction be improved by merging gene expression data sets?","volume":"4","author":"Yasrebi","year":"2009","journal-title":"PLoS One"},{"key":"2023011212505684900_btac839-B28","doi-asserted-by":"crossref","first-page":"416","DOI":"10.1038\/nm843","article-title":"Predicting hepatitis b virus\u2013positive metastatic hepatocellular carcinomas using gene expression profiling and supervised machine learning","volume":"9","author":"Ye","year":"2003","journal-title":"Nat. Med"},{"key":"2023011212505684900_btac839-B29","doi-asserted-by":"crossref","DOI":"10.1007\/978-1-4419-9326-7","volume-title":"Ensemble Machine Learning: Methods and Applications","author":"Zhang","year":"2012"},{"key":"2023011212505684900_btac839-B30","doi-asserted-by":"crossref","first-page":"522","DOI":"10.1093\/bioinformatics\/btw664","article-title":"Imputing gene expression to maximize platform compatibility","volume":"33","author":"Zhou","year":"2017","journal-title":"Bioinformatics"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/advance-article-pdf\/doi\/10.1093\/bioinformatics\/btac839\/48437388\/btac839.pdf","content-type":"application\/pdf","content-version":"am","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/39\/1\/btac839\/48646680\/btac839.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/39\/1\/btac839\/48646680\/btac839.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,3,19]],"date-time":"2023-03-19T08:16:01Z","timestamp":1679213761000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/doi\/10.1093\/bioinformatics\/btac839\/6964381"}},"subtitle":[],"editor":[{"given":"Jonathan","family":"Wren","sequence":"additional","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2022,12,28]]},"references-count":30,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2023,1,1]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btac839","relation":{},"ISSN":["1367-4811"],"issn-type":[{"type":"electronic","value":"1367-4811"}],"subject":[],"published-other":{"date-parts":[[2023,1,1]]},"published":{"date-parts":[[2022,12,28]]},"article-number":"btac839"}}