{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,2,22]],"date-time":"2025-02-22T00:38:29Z","timestamp":1740184709139,"version":"3.37.3"},"reference-count":38,"publisher":"Oxford University Press (OUP)","issue":"4","license":[{"start":{"date-parts":[[2018,7,28]],"date-time":"2018-07-28T00:00:00Z","timestamp":1532736000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/academic.oup.com\/journals\/pages\/open_access\/funder_policies\/chorus\/standard_publication_model"}],"funder":[{"DOI":"10.13039\/100000002","name":"National Institutes of Health","doi-asserted-by":"publisher","award":["5 R01 GM114029-03","5 R01 DK088892-02","3 U24 DK097153-05S2"],"award-info":[{"award-number":["5 R01 GM114029-03","5 R01 DK088892-02","3 U24 DK097153-05S2"]}],"id":[{"id":"10.13039\/100000002","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CCF 1540093","IIS 1632730"],"award-info":[{"award-number":["CCF 1540093","IIS 1632730"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019,2,15]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:sec>\n                  <jats:title>Motivation<\/jats:title>\n                  <jats:p>The diversity of biological omics data provides richness of information, but also presents an analytic challenge. While there has been much methodological and theoretical development on the statistical handling of large volumes of biological data, far less attention has been devoted to characterizing their veracity and variability.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Results<\/jats:title>\n                  <jats:p>We propose a method of statistically quantifying heterogeneity among multiple groups of datasets, derived from different omics modalities over various experimental and\/or disease conditions. It draws upon strategies from analysis of variance and principal component analysis in order to reduce dimensionality of the variability across multiple data groups. The resulting hypothesis-based inference procedure is demonstrated with synthetic and real data from a cell line study of growth factor responsiveness based on a factorial experimental design.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Availability and implementation<\/jats:title>\n                  <jats:p>Source code and datasets are freely available at https:\/\/github.com\/yangzi4\/gPCA.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Supplementary information<\/jats:title>\n                  <jats:p>Supplementary data are available at Bioinformatics online.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1093\/bioinformatics\/bty671","type":"journal-article","created":{"date-parts":[[2018,7,27]],"date-time":"2018-07-27T11:09:29Z","timestamp":1532689769000},"page":"553-559","source":"Crossref","is-referenced-by-count":1,"title":["Quantifying heterogeneity of expression data based on principal components"],"prefix":"10.1093","volume":"35","author":[{"given":"Zi","family":"Yang","sequence":"first","affiliation":[{"name":"Department of Statistics, University of Michigan, Ann Arbor, MI, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"George","family":"Michailidis","sequence":"additional","affiliation":[{"name":"Department of Statistics, University of Florida, Gainesville, FL, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2018,7,28]]},"reference":[{"key":"2023051601055938800_bty671-B1","doi-asserted-by":"crossref","first-page":"288","DOI":"10.1016\/j.laa.2005.10.004","article-title":"On the largest principal angle between random subspaces","volume":"414","author":"Absil","year":"2006","journal-title":"Linear Algebra Appl"},{"key":"2023051601055938800_bty671-B2","doi-asserted-by":"crossref","first-page":"2877","DOI":"10.1214\/08-AOS664","article-title":"High-dimensional analysis of semidefinite relaxations for sparse principal components","volume":"37","author":"Amini","year":"2009","journal-title":"Ann. Stat"},{"key":"2023051601055938800_bty671-B3","doi-asserted-by":"crossref","first-page":"948","DOI":"10.1093\/jnci\/djj295","article-title":"Breast cancer heterogeneity: a mixture of at least two main types?","volume":"98","author":"Anderson","year":"2006","journal-title":"J. Natl. Cancer Inst"},{"key":"2023051601055938800_bty671-B4","doi-asserted-by":"crossref","first-page":"R214.","DOI":"10.1186\/gb-2007-8-10-r214","article-title":"MicroRNA expression profiling of human breast cancer identifies new markers of tumor subtype","volume":"8","author":"Blenkiron","year":"2007","journal-title":"Genome Biol"},{"key":"2023051601055938800_bty671-B5","doi-asserted-by":"crossref","first-page":"1438","DOI":"10.1198\/016214508000000869","article-title":"High-dimensional sparse factor modeling: applications in gene expression genomics","volume":"103","author":"Carvalho","year":"2008","journal-title":"J. Am. Stat. Assoc"},{"key":"2023051601055938800_bty671-B6","doi-asserted-by":"crossref","DOI":"10.1017\/CBO9780511813559","volume-title":"Principles of Statistical Inference","author":"Cox","year":"2006"},{"key":"2023051601055938800_bty671-B7","doi-asserted-by":"crossref","first-page":"1544","DOI":"10.2202\/1544-6115.1147","article-title":"Dimension reduction for classification with gene expression microarray data","volume":"5","author":"Dai","year":"2006","journal-title":"Stat. Appl. Genet. Molec. Biol"},{"key":"2023051601055938800_bty671-B8","doi-asserted-by":"crossref","first-page":"9885","DOI":"10.1073\/pnas.0603553103","article-title":"Low-dimensional, free-energy landscapes of protein-folding reactions by nonlinear dimensionality reduction","volume":"103","author":"Das","year":"2006","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2023051601055938800_bty671-B9","doi-asserted-by":"crossref","first-page":"930","DOI":"10.1198\/jcgs.2010.08127","article-title":"Principal Component Analysis With Sparse Fused Loadings","volume":"19","author":"Guo","year":"2010","journal-title":"J. Comput. Graph. Stat"},{"key":"2023051601055938800_bty671-B10","doi-asserted-by":"crossref","DOI":"10.1007\/978-0-387-84858-7","volume-title":"The Elements of Statistical Learning","author":"Hastie","year":"2009","edition":"2"},{"key":"2023051601055938800_bty671-B11","doi-asserted-by":"crossref","first-page":"2204","DOI":"10.2307\/1939574","article-title":"Stopping rules in principal components analysis: a comparison of heuristical and statistical approaches","volume":"74","author":"Jackson","year":"1993","journal-title":"Ecology"},{"key":"2023051601055938800_bty671-B12","doi-asserted-by":"crossref","first-page":"773","DOI":"10.1080\/01621459.1995.10476572","article-title":"Bayes factors","volume":"90","author":"Kass","year":"1995","journal-title":"J. Am. Stat. Assoc"},{"key":"2023051601055938800_bty671-B13","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1016\/j.chemolab.2008.06.002","article-title":"Determining the number of components in a factor model from limited noisy data","volume":"94","author":"Kritchman","year":"2008","journal-title":"Chemom. Intell. Lab. Syst"},{"key":"2023051601055938800_bty671-B14","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1007\/BF02289565","article-title":"Multidimensional scaling by optimizing goodness of fit to a nonmetric hypothesis","volume":"29","author":"Kruskal","year":"1964","journal-title":"Psychometrika"},{"key":"2023051601055938800_bty671-B15","first-page":"556","article-title":"Algorithms for non-negative matrix factorization","volume":"13","author":"Lee","year":"2001","journal-title":"Adv. Neural Inform. Proc. Syst"},{"key":"2023051601055938800_bty671-B16","doi-asserted-by":"crossref","first-page":"2458","DOI":"10.1093\/bioinformatics\/bts476","article-title":"Identifying multi-layer gene regulatory modules from multi-dimensional genomic data","volume":"28","author":"Li","year":"2012","journal-title":"Bioinformatics"},{"key":"2023051601055938800_bty671-B17","doi-asserted-by":"crossref","first-page":"2235","DOI":"10.1002\/sim.6866","article-title":"Integrative and regularized principal component analysis of multiple sources of data","volume":"35","author":"Liu","year":"2016","journal-title":"Stat. Med"},{"key":"2023051601055938800_bty671-B18","doi-asserted-by":"crossref","first-page":"523","DOI":"10.1214\/12-AOAS597","article-title":"Joint and individual variation explained (JIVE) for integrated analysis of multiple data types","volume":"7","author":"Lock","year":"2013","journal-title":"Ann. Appl. Stat"},{"key":"2023051601055938800_bty671-B19","doi-asserted-by":"crossref","first-page":"255","DOI":"10.1038\/498255a","article-title":"Biology: the big challenges of big data","volume":"498","author":"Marx","year":"2013","journal-title":"Nature"},{"year":"2000","author":"Minka","key":"2023051601055938800_bty671-B20"},{"key":"2023051601055938800_bty671-B21","doi-asserted-by":"crossref","first-page":"20.","DOI":"10.1186\/1741-7007-12-20","article-title":"Analysis of growth factor signaling in genetically diverse breast cancer lines","volume":"12","author":"Niepel","year":"2014","journal-title":"BMC Biol"},{"key":"2023051601055938800_bty671-B22","doi-asserted-by":"crossref","first-page":"4","DOI":"10.3121\/cmr.2008.825","article-title":"Breast cancer subtypes based on ER\/PR and Her2 expression: comparison of clinicopathologic features and survival","volume":"7","author":"Onitilo","year":"2009","journal-title":"Clin. Med. Res"},{"key":"2023051601055938800_bty671-B23","doi-asserted-by":"crossref","first-page":"593","DOI":"10.1111\/j.1524-4741.2009.00822.x","article-title":"Breast cancer subtypes as defined by the estrogen receptor (ER), progesterone receptor (PR), and the human epidermal growth factor receptor 2 (HER2) among women with invasive breast cancer in California, 1999-2004","volume":"15","author":"Parise","year":"2009","journal-title":"Breast J"},{"key":"2023051601055938800_bty671-B24","first-page":"2825","article-title":"Scikit-learn: machine learning in Python","volume":"12","author":"Pedregosa","year":"2011","journal-title":"J. Mach. Learn. Res"},{"key":"2023051601055938800_bty671-B25","doi-asserted-by":"crossref","first-page":"904","DOI":"10.1038\/ng1847","article-title":"Principal components analysis corrects for stratification in genome-wide association studies","volume":"38","author":"Price","year":"2006","journal-title":"Nat. Genet"},{"key":"2023051601055938800_bty671-B26","doi-asserted-by":"crossref","first-page":"2323","DOI":"10.1126\/science.290.5500.2323","article-title":"Nonlinear dimensionality reduction by locally linear embedding","volume":"290","author":"Roweis","year":"2000","journal-title":"Science"},{"key":"2023051601055938800_bty671-B27","doi-asserted-by":"crossref","first-page":"8418","DOI":"10.1073\/pnas.0932692100","article-title":"Repeated observation of breast tumor subtypes in independent gene expression data sets","volume":"100","author":"Sorlie","year":"2003","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2023051601055938800_bty671-B28","doi-asserted-by":"crossref","first-page":"1241","DOI":"10.1214\/10-AOS870","article-title":"Sparse linear discriminant analysis by thresholding for high dimensional data","volume":"39","author":"Shao","year":"2011","journal-title":"Ann. Stat"},{"key":"2023051601055938800_bty671-B29","doi-asserted-by":"crossref","first-page":"617","DOI":"10.1089\/10665270360688228","article-title":"Understanding protein flexibility through dimensionality reduction","volume":"10","author":"Teodoro","year":"2003","journal-title":"J. Comput. Biol"},{"key":"2023051601055938800_bty671-B30","doi-asserted-by":"crossref","first-page":"61","DOI":"10.1038\/nature11412","article-title":"Comprehensive molecular portraits of human breast tumors","volume":"490","year":"2012","journal-title":"Nature"},{"key":"2023051601055938800_bty671-B31","doi-asserted-by":"crossref","first-page":"R245","DOI":"10.1677\/ERC-10-0136","article-title":"Current and emerging biomarkers in breast cancer: prognosis and prediction","volume":"17","author":"Weigel","year":"2010","journal-title":"Endocr. Relat. Cancer"},{"key":"2023051601055938800_bty671-B32","doi-asserted-by":"crossref","first-page":"1","DOI":"10.2202\/1544-6115.1470","article-title":"Extensions of sparse canonical correlation analysis with applications to genomic data","volume":"8","author":"Witten","year":"2009","journal-title":"Stat. Appl. Genet. Mol. Biol"},{"key":"2023051601055938800_bty671-B33","doi-asserted-by":"crossref","first-page":"37","DOI":"10.1016\/0169-7439(87)80084-9","article-title":"Principal component analysis","volume":"2","author":"Wold","year":"1987","journal-title":"Chemom. Intell. Lab. Syst"},{"key":"2023051601055938800_bty671-B34","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1093\/bioinformatics\/btv544","article-title":"A non-negative matrix factorization method for detecting modules in heterogeneous omics multi-modal data","volume":"32","author":"Yang","year":"2015","journal-title":"Bioinformatics"},{"key":"2023051601055938800_bty671-B35","doi-asserted-by":"crossref","first-page":"763","DOI":"10.1093\/bioinformatics\/17.9.763","article-title":"Principal component analysis for clustering gene expression data","volume":"17","author":"Yeung","year":"2001","journal-title":"Bioinformatics"},{"key":"2023051601055938800_bty671-B36","doi-asserted-by":"crossref","first-page":"3326","DOI":"10.1093\/bioinformatics\/bts606","article-title":"A high-performance computing toolset for relatedness and principal component analysis of SNP data","volume":"28","author":"Zheng","year":"2012","journal-title":"Bioinformatics"},{"key":"2023051601055938800_bty671-B37","doi-asserted-by":"crossref","first-page":"301","DOI":"10.1111\/j.1467-9868.2005.00503.x","article-title":"Regularization and variable selection via the elastic net","volume":"67","author":"Zou","year":"2005","journal-title":"J. R. Stat. Soc. Series B Stat. Methodol"},{"key":"2023051601055938800_bty671-B38","doi-asserted-by":"crossref","first-page":"265","DOI":"10.1198\/106186006X113430","article-title":"Sparse principal component analysis","volume":"15","author":"Zou","year":"2006","journal-title":"J. Comput. Graph. Stat"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/4\/553\/50321044\/bioinformatics_35_4_553.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/35\/4\/553\/50321044\/bioinformatics_35_4_553.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,5,16]],"date-time":"2023-05-16T01:07:17Z","timestamp":1684199237000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/35\/4\/553\/5061160"}},"subtitle":[],"editor":[{"given":"John","family":"Hancock","sequence":"additional","affiliation":[],"role":[{"role":"editor","vocabulary":"crossref"}]}],"short-title":[],"issued":{"date-parts":[[2018,7,28]]},"references-count":38,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2019,2,15]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/bty671","relation":{},"ISSN":["1367-4803","1367-4811"],"issn-type":[{"type":"print","value":"1367-4803"},{"type":"electronic","value":"1367-4811"}],"subject":[],"published-other":{"date-parts":[[2019,2,15]]},"published":{"date-parts":[[2018,7,28]]}}}