{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,11]],"date-time":"2025-10-11T03:04:03Z","timestamp":1760151843518,"version":"build-2065373602"},"reference-count":12,"publisher":"MDPI AG","issue":"12","license":[{"start":{"date-parts":[[2022,11,29]],"date-time":"2022-11-29T00:00:00Z","timestamp":1669680000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Entropy"],"abstract":"<jats:p>We propose a non-parametric method to cluster mixed data containing both continuous and discrete random variables. The product space of the continuous and discrete sample space is transformed into a new product space based on adaptive quantization on the continuous part. Detection of cluster patterns on the product space is determined locally by using a weighted modified chi-squared test. Our algorithm does not require any user input since the number of clusters is determined automatically by data. Simulation studies and real data analysis results show that our proposed method outperforms the benchmark method, AutoClass, in various settings.<\/jats:p>","DOI":"10.3390\/e24121749","type":"journal-article","created":{"date-parts":[[2022,11,30]],"date-time":"2022-11-30T02:21:57Z","timestamp":1669774917000},"page":"1749","update-policy":"https:\/\/doi.org\/10.3390\/mdpi_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Nonparametric Clustering of Mixed Data Using Modified Chi-Squared Tests"],"prefix":"10.3390","volume":"24","author":[{"given":"Yawen","family":"Xu","sequence":"first","affiliation":[{"name":"Department of Mathematics and Statistics, York University, Toronto, ON M3J 1P3, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8057-5100","authenticated-orcid":false,"given":"Xin","family":"Gao","sequence":"additional","affiliation":[{"name":"Department of Mathematics and Statistics, York University, Toronto, ON M3J 1P3, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiaogang","family":"Wang","sequence":"additional","affiliation":[{"name":"Department of Mathematics and Statistics, York University, Toronto, ON M3J 1P3, Canada"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"1968","published-online":{"date-parts":[[2022,11,29]]},"reference":[{"key":"ref_1","unstructured":"Kaufman, L., and Rousseeuw, P.J. (2009). Finding Groups in Data: An Introduction to Cluster Analysis, John Wiley & Sons."},{"key":"ref_2","doi-asserted-by":"crossref","first-page":"803","DOI":"10.2307\/2532201","article-title":"Model-based Gaussian and non-Gaussian clustering","volume":"49","author":"Banfield","year":"1993","journal-title":"Biometrics"},{"key":"ref_3","unstructured":"Bradley, P.S., Fayyad, U.M., and Reina, C.A. (1998). Scaling EM (Expectation-Maximization) Clustering to Large Databases, Microsoft Research."},{"key":"ref_4","doi-asserted-by":"crossref","first-page":"578","DOI":"10.1093\/comjnl\/41.8.578","article-title":"How Many Clusters? Which Clustering Method? Answers Via Model-Based Cluster Analysis","volume":"41","author":"Fraley","year":"1998","journal-title":"Comput. J."},{"key":"ref_5","doi-asserted-by":"crossref","first-page":"283","DOI":"10.1023\/A:1009769707641","article-title":"Extensions to the k-means algorithm for clustering large data sets with categorical values","volume":"2","author":"Huang","year":"1998","journal-title":"Data Min. Knowl. Discov."},{"key":"ref_6","first-page":"153","article-title":"Bayesian classification (AutoClass): Theory and results","volume":"180","author":"Cheeseman","year":"1996","journal-title":"Adv. Knowl. Discov. Data Min."},{"key":"ref_7","doi-asserted-by":"crossref","first-page":"503","DOI":"10.1016\/j.datak.2007.03.016","article-title":"A K-mean clustering algorithm for mixed numeric and categorical data","volume":"63","author":"Ahmad","year":"2007","journal-title":"Data Knowl. Eng."},{"key":"ref_8","doi-asserted-by":"crossref","first-page":"355","DOI":"10.1198\/016214505000000312","article-title":"Clustering Categorical Data Based on Distance Vectors","volume":"101","author":"Zhang","year":"2006","journal-title":"J. Am. Stat. Assoc."},{"key":"ref_9","doi-asserted-by":"crossref","unstructured":"Gersho, A., and Gray, R.M. (1992). Vector Quantization and Signal Compression, Springer.","DOI":"10.1007\/978-1-4615-3626-0"},{"key":"ref_10","doi-asserted-by":"crossref","unstructured":"Graf, S., and Luschgy, H. (2000). Foundations of Quantization for Probability Distributions, Springer.","DOI":"10.1007\/BFb0103945"},{"key":"ref_11","unstructured":"Roman, S. (1992). Coding and Information Theory, Springer Science & Business Media."},{"key":"ref_12","first-page":"169","article-title":"Hamming distance geometry of a protein conformational space: Application to the clustering of a 4-ns molecular dynamics trajectory of the HIV-1 integrase catalytic core. Proteins","volume":"47","author":"Laboulais","year":"2002","journal-title":"Data Knowl. Eng."}],"container-title":["Entropy"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.mdpi.com\/1099-4300\/24\/12\/1749\/pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,10,11]],"date-time":"2025-10-11T01:29:41Z","timestamp":1760146181000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.mdpi.com\/1099-4300\/24\/12\/1749"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,11,29]]},"references-count":12,"journal-issue":{"issue":"12","published-online":{"date-parts":[[2022,12]]}},"alternative-id":["e24121749"],"URL":"https:\/\/doi.org\/10.3390\/e24121749","relation":{},"ISSN":["1099-4300"],"issn-type":[{"type":"electronic","value":"1099-4300"}],"subject":[],"published":{"date-parts":[[2022,11,29]]}}}