{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,31]],"date-time":"2025-10-31T19:58:59Z","timestamp":1761940739896,"version":"build-2065373602"},"reference-count":41,"publisher":"Oxford University Press (OUP)","issue":"10","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2006,5,15]]},"abstract":"<jats:title>Abstract<\/jats:title><jats:p>Motivation: Because co-expressed genes are likely to share the same biological function, cluster analysis of gene expression profiles has been applied for gene function discovery. Most existing clustering methods ignore known gene functions in the process of clustering.<\/jats:p><jats:p>Results: To take advantage of accumulating gene functional annotations, we propose incorporating known gene functions into a new distance metric, which shrinks a gene expression-based distance towards 0 if and only if the two genes share a common gene function. A two-step procedure is used. First, the shrinkage distance metric is used in any distance-based clustering method, e.g. K-medoids or hierarchical clustering, to cluster the genes with known functions. Second, while keeping the clustering results from the first step for the genes with known functions, the expression-based distance metric is used to cluster the remaining genes of unknown function, assigning each of them to either one of the clusters obtained in the first step or some new clusters. A simulation study and an application to gene function prediction for the yeast demonstrate the advantage of our proposal over the standard method.<\/jats:p><jats:p>Contact: \u00a0weip@biostat.umn.edu<\/jats:p>","DOI":"10.1093\/bioinformatics\/btl065","type":"journal-article","created":{"date-parts":[[2006,2,25]],"date-time":"2006-02-25T01:14:23Z","timestamp":1140830063000},"page":"1259-1268","source":"Crossref","is-referenced-by-count":91,"title":["Incorporating biological knowledge into distance-based clustering analysis of microarray gene expression data"],"prefix":"10.1093","volume":"22","author":[{"given":"Desheng","family":"Huang","sequence":"first","affiliation":[{"name":"Department of Mathematics, China Medical University 1 \u00a0 1 \u00a0 \u00a0 Shenyang, China"},{"name":"Division of Biostatistics, School of Public Health, University of Minnesota 2 \u00a0 2 \u00a0 \u00a0 Minneapolis, MN 55455-0392, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Pan","sequence":"additional","affiliation":[{"name":"Division of Biostatistics, School of Public Health, University of Minnesota 2 \u00a0 2 \u00a0 \u00a0 Minneapolis, MN 55455-0392, USA"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"286","published-online":{"date-parts":[[2006,2,24]]},"reference":[{"key":"2023012408202283800_b1","doi-asserted-by":"crossref","first-page":"2988","DOI":"10.1093\/bioinformatics\/bti457","article-title":"Discovering molecular functions significantly related to phenotypes by combining gene expression data and biological information","volume":"21","author":"Al-Shahrour","year":"2005","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b2","doi-asserted-by":"crossref","first-page":"25","DOI":"10.1038\/75556","article-title":"Gene ontology: tool for the unification of biology. The Gene Ontology Consortium","volume":"25","author":"Ashburner","year":"2000","journal-title":"Nat. Genet."},{"volume-title":"Classification and Regression Trees","year":"1984","author":"Breiman","key":"2023012408202283800_b3"},{"key":"2023012408202283800_b4","doi-asserted-by":"crossref","first-page":"671","DOI":"10.1089\/106652702760277381","article-title":"Bayesian hierarchical model for identifying changes in gene expression from microarray experiments","volume":"9","author":"Broet","year":"2002","journal-title":"J. Comput. Biol."},{"key":"2023012408202283800_b5","doi-asserted-by":"crossref","first-page":"262","DOI":"10.1073\/pnas.97.1.262","article-title":"Knowledge-based analysis of microarray gene expression data using support vector machines","volume":"97","author":"Brown","year":"2000","journal-title":"Proc. Natl Acad. Sci. USA"},{"key":"2023012408202283800_b6","doi-asserted-by":"crossref","DOI":"10.1201\/9781420057669","volume-title":"Bayes and Empirical Bayes Methods for Data Analysis","author":"Carlin","year":"2000"},{"key":"2023012408202283800_b7","doi-asserted-by":"crossref","first-page":"687","DOI":"10.1081\/BIP-200025659","article-title":"A knowledge-based clustering algorithm driven by gene ontology","volume":"14","author":"Cheng","year":"2004","journal-title":"J. Biopharm. Stat."},{"key":"2023012408202283800_b8","doi-asserted-by":"crossref","first-page":"459","DOI":"10.1093\/bioinformatics\/btg025","article-title":"Comparisons and validation of statistical clustering techniques for microarray gene expression data","volume":"19","author":"Datta","year":"2003","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b9","doi-asserted-by":"crossref","DOI":"10.1186\/gb-2002-3-7-research0036","article-title":"A prediction-based resampling method for estimating the number of clusters in a dataset","volume":"3","author":"Dudoit","year":"2002","journal-title":"Genome Biol."},{"key":"2023012408202283800_b10","doi-asserted-by":"crossref","first-page":"14863","DOI":"10.1073\/pnas.95.25.14863","article-title":"Cluster analysis and display of genome-wide expression patterns","volume":"95","author":"Eisen","year":"1998","journal-title":"Proc. Natl. Acad. Sci. USA"},{"key":"2023012408202283800_b11","doi-asserted-by":"crossref","DOI":"10.1016\/j.jbi.2005.08.004","article-title":"Knowledge guided analysis of microarray data","author":"Fang","year":"2006","journal-title":"J. Biomed. Inform."},{"key":"2023012408202283800_b12","doi-asserted-by":"crossref","first-page":"275","DOI":"10.1093\/bioinformatics\/18.2.275","article-title":"Mixture modeling of gene expression data from microarray experiments","volume":"18","author":"Ghosh","year":"2002","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b13","doi-asserted-by":"crossref","first-page":"3201","DOI":"10.1093\/bioinformatics\/bti517","article-title":"Computational cluster validation in post-genomic data analysis","volume":"21","author":"Handl","year":"2005","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b14","doi-asserted-by":"crossref","first-page":"145","DOI":"10.1093\/bioinformatics\/18.suppl_1.S145","article-title":"Co-clustering of biological networks and gene expression data","volume":"18","author":"Hanisch","year":"2002","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b15","doi-asserted-by":"crossref","first-page":"155","DOI":"10.1111\/j.2517-6161.1996.tb02073.x","article-title":"Discriminant analysis by mixture modelling","volume":"58","author":"Hastie","year":"1995","journal-title":"J. R. Statist. Soc. B."},{"volume-title":"The Elements of Statistical Learning. Data mining, Inference, and Prediction","year":"2001","author":"Hastie","key":"2023012408202283800_b16"},{"key":"2023012408202283800_b17","doi-asserted-by":"crossref","DOI":"10.1089\/omi.2006.10.28","article-title":"Combining gene annotations and gene expression data in model-based clustering: a weighted method","author":"Huang","year":"2006","journal-title":"OMICS"},{"key":"2023012408202283800_b18","doi-asserted-by":"crossref","first-page":"109","DOI":"10.1016\/S0092-8674(00)00015-5","article-title":"Functional discovery via a compendium of expression profiles","volume":"102","author":"Hughes","year":"2000","journal-title":"Cell"},{"key":"2023012408202283800_b19","doi-asserted-by":"crossref","DOI":"10.1002\/9780470316801","volume-title":"Fitting Groups in Data: An Introduction to Cluster Analysis","author":"Kaufman","year":"1990"},{"key":"2023012408202283800_b20","first-page":"34","article-title":"Toward pathway engineering: a new database of genetic and molecular pathway","volume":"59","author":"Kanehisa","year":"1996","journal-title":"Sci. Technol. Japan"},{"key":"2023012408202283800_b21","doi-asserted-by":"crossref","first-page":"8961","DOI":"10.1073\/pnas.161273698","article-title":"Bootstrapping cluster analysis: assessing the reliability of conclusions from microarray experiments","volume":"98","author":"Kerr","year":"2001","journal-title":"Proc. Natl Acad. Sci. USA"},{"key":"2023012408202283800_b22","doi-asserted-by":"crossref","first-page":"3587","DOI":"10.1093\/bioinformatics\/bti565","article-title":"Ontological analysis of gene expression data: current tools, limitations, and open problems","volume":"21","author":"Khatri","year":"2005","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b23","doi-asserted-by":"crossref","first-page":"1971","DOI":"10.1093\/bioinformatics\/bti292","article-title":"Molecular decomposition of complex clinical phenotypes using biologically structured analysis of microarray data","volume":"21","author":"Lottaz","year":"2005","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b24","doi-asserted-by":"crossref","first-page":"413","DOI":"10.1093\/bioinformatics\/18.3.413","article-title":"A mixture model-based approach to the clustering of microarray expression data","volume":"18","author":"McLachlan","year":"2002","journal-title":"Bioinformatics"},{"volume-title":"Finite Mixture Model","year":"2002","author":"McLachlan","key":"2023012408202283800_b25"},{"key":"2023012408202283800_b26","doi-asserted-by":"crossref","first-page":"1194","DOI":"10.1093\/bioinformatics\/18.9.1194","article-title":"Bayesian infinite mixture model based clustering of gene expression profiles","volume":"18","author":"Medvedovic","year":"2002","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b27","doi-asserted-by":"crossref","first-page":"D41","DOI":"10.1093\/nar\/gkh092","article-title":"MIPS: analysis and annotation of proteins from whole genomes","volume":"32","author":"Mewes","year":"2004","journal-title":"Nucleic Acids Res."},{"key":"2023012408202283800_b28","doi-asserted-by":"crossref","first-page":"267","DOI":"10.1038\/ng1180","article-title":"PGC-1 alpha-responsive genes involved in oxidative phosphorylation are coordinately downregulated in human diabetes","volume":"34","author":"Mootha","year":"2003","journal-title":"Nature Genetics"},{"key":"2023012408202283800_b29","doi-asserted-by":"crossref","DOI":"10.2202\/1544-6115.1124","article-title":"Incorporating biological information as a prior in an empirical Bayes approach to analyzing microarray data","volume":"4","author":"Pan","year":"2005","journal-title":"Stat. Appl. Genet. Mol. Biol."},{"key":"2023012408202283800_b30","doi-asserted-by":"crossref","first-page":"795","DOI":"10.1093\/bioinformatics\/btl011","article-title":"Incorporating gene functions as priors in model-based clustering of microarray gene expression data","volume":"22","author":"Pan","year":"2006","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b31","doi-asserted-by":"crossref","DOI":"10.1186\/gb-2002-3-2-research0009","article-title":"Model-based cluster analysis of microarray gene-expression data","volume":"3","author":"Pan","year":"2002","journal-title":"Genome Biol."},{"key":"2023012408202283800_b32","doi-asserted-by":"crossref","first-page":"2907","DOI":"10.1073\/pnas.96.6.2907","article-title":"Interpreting patterns of gene expression with self-organizing maps: methods and application to hematopoietic differentiation","volume":"96","author":"Tamayo","year":"1999","journal-title":"Proc. Natl Acad. Sci. USA"},{"key":"2023012408202283800_b33","doi-asserted-by":"crossref","first-page":"281","DOI":"10.1038\/10343","article-title":"Systematic determination of genetic network architecture","volume":"22","author":"Tavazoie","year":"1999","journal-title":"Nat. Genet."},{"key":"2023012408202283800_b34","doi-asserted-by":"crossref","first-page":"13544","DOI":"10.1073\/pnas.0506577102","article-title":"Discovering statistically significant pathways in expression profiling studies","volume":"102","author":"Tian","year":"2005","journal-title":"Proc. Natl Acad. Sci. USA"},{"key":"2023012408202283800_b35","doi-asserted-by":"crossref","first-page":"10","DOI":"10.1111\/j.0006-341X.2005.031032.x","article-title":"Tight clustering: a resampling-based approach for identifying stable and tight patterns in data","volume":"61","author":"Tseng","year":"2005","journal-title":"Biometrics"},{"key":"2023012408202283800_b36","doi-asserted-by":"crossref","first-page":"575","DOI":"10.1080\/0094965031000136012","article-title":"A new partitioning around medoids algorithm","volume":"73","author":"van der Laan","year":"2003","journal-title":"J. Stat. Comput. Sim."},{"key":"2023012408202283800_b37","doi-asserted-by":"crossref","first-page":"255","DOI":"10.1038\/ng906","article-title":"Large-scale prediction of Saccharomyces cerevisiae gene function using overlapping transcriptional clusters","volume":"31","author":"Wu","year":"2002","journal-title":"Nat. Genet."},{"key":"2023012408202283800_b38","doi-asserted-by":"crossref","first-page":"1371","DOI":"10.1142\/S0219720005001612","article-title":"Gene function prediction by a combined analysis of gene expression data and protein\u2013protein interaction data","volume":"3","author":"Xiao","year":"2005","journal-title":"J. Bioinform. Comput. Biol."},{"key":"2023012408202283800_b39","doi-asserted-by":"crossref","first-page":"977","DOI":"10.1093\/bioinformatics\/17.10.977","article-title":"Model-based clustering and data transformations for gene expression data","volume":"17","author":"Yeung","year":"2001","journal-title":"Bioinformatics"},{"key":"2023012408202283800_b40","doi-asserted-by":"crossref","first-page":"156","DOI":"10.1007\/s101420000019","article-title":"Assessing reliability of gene clusters from gene expression data","volume":"1","author":"Zhang","year":"2000","journal-title":"Funct Integr Genomics"},{"key":"2023012408202283800_b41","doi-asserted-by":"crossref","first-page":"12783","DOI":"10.1073\/pnas.192159399","article-title":"Transitive functional annotation by shortest-path analysis of gene expression data","volume":"99","author":"Zhou","year":"2002","journal-title":"Proc. Natl Acad. Sci. USA"}],"container-title":["Bioinformatics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/22\/10\/1259\/48837831\/bioinformatics_22_10_1259.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article-pdf\/22\/10\/1259\/48837831\/bioinformatics_22_10_1259.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,7]],"date-time":"2025-01-07T21:38:51Z","timestamp":1736285931000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/bioinformatics\/article\/22\/10\/1259\/236902"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2006,2,24]]},"references-count":41,"journal-issue":{"issue":"10","published-print":{"date-parts":[[2006,5,15]]}},"URL":"https:\/\/doi.org\/10.1093\/bioinformatics\/btl065","relation":{},"ISSN":["1367-4811","1367-4803"],"issn-type":[{"type":"electronic","value":"1367-4811"},{"type":"print","value":"1367-4803"}],"subject":[],"published-other":{"date-parts":[[2006,5,15]]},"published":{"date-parts":[[2006,2,24]]}}}