{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T15:27:45Z","timestamp":1784561265654,"version":"3.55.0"},"reference-count":55,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2024,10,7]],"date-time":"2024-10-07T00:00:00Z","timestamp":1728259200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,10,7]],"date-time":"2024-10-07T00:00:00Z","timestamp":1728259200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"DOI":"10.13039\/501100005247","name":"University of British Columbia","doi-asserted-by":"publisher","award":["AWD-019941 UBCOVPR 2021"],"award-info":[{"award-number":["AWD-019941 UBCOVPR 2021"]}],"id":[{"id":"10.13039\/501100005247","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Classif"],"published-print":{"date-parts":[[2025,7]]},"DOI":"10.1007\/s00357-024-09493-z","type":"journal-article","created":{"date-parts":[[2024,10,7]],"date-time":"2024-10-07T00:01:29Z","timestamp":1728259289000},"page":"311-334","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":8,"title":["Mixed-Type Distance Shrinkage and Selection for Clustering via Kernel Metric Learning"],"prefix":"10.1007","volume":"42","author":[{"ORCID":"https:\/\/orcid.org\/0009-0001-6645-1766","authenticated-orcid":false,"given":"Jesse S.","family":"Ghashti","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6303-449X","authenticated-orcid":false,"given":"John R. J.","family":"Thompson","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,10,7]]},"reference":[{"key":"9493_CR1","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511542749","volume-title":"Kazhdan\u2019s Property","author":"B Bekka","year":"2008","unstructured":"Bekka, B., de la Harpe, P., & Valette, A. (2008). Kazhdan\u2019s Property. New Mathematical Monographs: Cambridge University Press."},{"issue":"4","key":"9493_CR2","doi-asserted-by":"publisher","first-page":"338","DOI":"10.22271\/chemi.2020.v8.i4f.10087","volume":"8","author":"S Bishnoi","year":"2020","unstructured":"Bishnoi, S., & Hooda, B. (2020). A survey of distance measures for mixed variables. International Journal of Chemical Studies, 8(4), 338\u2013343.","journal-title":"International Journal of Chemical Studies"},{"key":"9493_CR3","volume-title":"Pattern recognition and machine learning,","author":"CM Bishop","year":"2006","unstructured":"Bishop, C. M. (2006). Pattern recognition and machine learning, (Vol. 4). Springer."},{"key":"9493_CR4","unstructured":"Buchta, C., & Hahsler, M. (2022). cba: clustering for business analytics. R package version 0.2-23."},{"issue":"1","key":"9493_CR5","first-page":"43","volume":"8","author":"S-S Choi","year":"2010","unstructured":"Choi, S.-S., Cha, S.-H., & Tappert, C. C. (2010). A survey of binary similarity and distance measures. Journal of Systemics, Cybernetics and Informatics, 8(1), 43\u201348.","journal-title":"Journal of Systemics, Cybernetics and Informatics"},{"key":"9493_CR6","doi-asserted-by":"publisher","first-page":"100642","DOI":"10.1016\/j.softx.2020.100642","volume":"13","author":"M Christoph","year":"2021","unstructured":"Christoph, M., & Stier, Q. (2021). Fundamental clustering algorithms suite. SoftwareX, 13, 100642.","journal-title":"SoftwareX"},{"key":"9493_CR7","doi-asserted-by":"crossref","unstructured":"Coombes, K. R. (2019). Thresher: Threshing and reaping for principal components. R Package Version, 1(1),3.","DOI":"10.32614\/CRAN.package.Thresher"},{"issue":"1","key":"9493_CR8","doi-asserted-by":"publisher","first-page":"174","DOI":"10.1016\/j.jmva.2003.08.006","volume":"92","author":"AR de Leon","year":"2005","unstructured":"de Leon, A. R., & Carriere, K. C. (2005). A generalized Mahalanobis distance for mixed data. Journal of Multivariate Analysis, 92(1), 174\u2013185.","journal-title":"Journal of Multivariate Analysis"},{"key":"9493_CR9","doi-asserted-by":"crossref","unstructured":"Dougherty, J., Kohavi, R., & Sahami, M. (1995). Supervised and unsupervised discretization of continuous features. In: Machine Learning Proceedings 1995, (pp. 194\u2013202). Elsevier.","DOI":"10.1016\/B978-1-55860-377-6.50032-3"},{"key":"9493_CR10","unstructured":"Dua, D., & Graff, C. (2017). UCI Machine Learning Repository."},{"issue":"1","key":"9493_CR11","doi-asserted-by":"publisher","first-page":"153","DOI":"10.1137\/1114019","volume":"14","author":"VA Epanechnikov","year":"1969","unstructured":"Epanechnikov, V. A. (1969). Non-parametric estimation of a multivariate probability density. Theory of Probability & Its Applications, 14(1), 153\u2013158.","journal-title":"Theory of Probability & Its Applications"},{"issue":"13","key":"9493_CR12","doi-asserted-by":"publisher","first-page":"1","DOI":"10.18637\/jss.v083.i13","volume":"83","author":"AH Foss","year":"2018","unstructured":"Foss, A. H., & Markatou, M. (2018). kamila: Clustering mixed-type data in R and Hadoop. Journal of Statistical Software, 83(13), 1\u201345.","journal-title":"Journal of Statistical Software"},{"issue":"1","key":"9493_CR13","doi-asserted-by":"publisher","first-page":"80","DOI":"10.1111\/insr.12274","volume":"87","author":"AH Foss","year":"2019","unstructured":"Foss, A. H., Markatou, M., & Ray, B. (2019). Distance metrics and clustering methods for mixed-type data. International Statistical Review, 87(1), 80\u2013109.","journal-title":"International Statistical Review"},{"key":"9493_CR14","doi-asserted-by":"publisher","first-page":"419","DOI":"10.1007\/s10994-016-5575-7","volume":"105","author":"AH Foss","year":"2016","unstructured":"Foss, A. H., Markatou, M., Ray, B., & Heching, A. (2016). A semiparametric method for clustering mixed data. Machine Learning, 105, 419\u2013458.","journal-title":"Machine Learning"},{"issue":"458","key":"9493_CR15","doi-asserted-by":"publisher","first-page":"611","DOI":"10.1198\/016214502760047131","volume":"97","author":"C Fraley","year":"2002","unstructured":"Fraley, C., & Raftery, A. E. (2002). Model-based clustering, discriminant analysis, and density estimation. Journal of the American Statistical Association, 97(458), 611\u2013631.","journal-title":"Journal of the American Statistical Association"},{"key":"9493_CR16","unstructured":"Ghashti, J. (2024). Similarity maximization and shrinkage approach in kernel metric learning for clustering mixed-type data. Master\u2019s thesis, The University of British Columbia."},{"key":"9493_CR17","doi-asserted-by":"crossref","unstructured":"Ghashti, J.S., & Thompson, J.R.J. (2023). The complexity of financial wellness: examining survey patterns via kernel metric learning and clustering of mixed-type data. In: Proceedings of the Fourth ACM International Conference on AI in Finance, (pp. 314\u2013322).","DOI":"10.1145\/3604237.3626849"},{"issue":"4","key":"9493_CR18","doi-asserted-by":"publisher","first-page":"857","DOI":"10.2307\/2528823","volume":"24","author":"JC Gower","year":"1971","unstructured":"Gower, J. C. (1971). A general coefficient of similarity and some of its properties. Biometrics, 24(4), 857\u2013871.","journal-title":"Biometrics"},{"issue":"5","key":"9493_CR19","doi-asserted-by":"publisher","first-page":"345","DOI":"10.1016\/S0306-4379(00)00022-3","volume":"25","author":"S Guha","year":"2000","unstructured":"Guha, S., Rastogi, R., & Shim, K. (2000). ROCK: A robust clustering algorithm for categorical attributes. Information Systems, 25(5), 345\u2013366.","journal-title":"Information Systems"},{"issue":"1","key":"9493_CR20","doi-asserted-by":"publisher","first-page":"287","DOI":"10.1093\/biomet\/68.1.287","volume":"68","author":"P Hall","year":"1981","unstructured":"Hall, P. (1981). On nonparametric multivariate binary discrimination. Biometrika, 68(1), 287\u2013294.","journal-title":"Biometrika"},{"issue":"1","key":"9493_CR21","first-page":"100","volume":"28","author":"JA Hartigan","year":"1979","unstructured":"Hartigan, J. A., & Wong, M. A. (1979). Algorithm as 136: A k-means clustering algorithm. Journal of the Royal Statistical Society. Series C (Applied Statistics), 28(1), 100\u2013108.","journal-title":"Journal of the Royal Statistical Society. Series C (Applied Statistics)"},{"key":"9493_CR22","doi-asserted-by":"crossref","unstructured":"Heinz, G., Peterson, L. J., Johnson, R. W., & Kerk, C. J. (2003). Exploring relationships in body dimensions. Journal of Statistics Education,11(2).","DOI":"10.1080\/10691898.2003.11910711"},{"key":"9493_CR23","doi-asserted-by":"publisher","DOI":"10.1201\/b19706","volume-title":"Handbook of cluster analysis","author":"C Hennig","year":"2015","unstructured":"Hennig, C., Meila, M., Murtagh, F., & Rocci, R. (2015). Handbook of cluster analysis. CRC Press."},{"issue":"3","key":"9493_CR24","doi-asserted-by":"publisher","first-page":"283","DOI":"10.1023\/A:1009769707641","volume":"2","author":"Z Huang","year":"1998","unstructured":"Huang, Z. (1998). Extensions to the k-means algorithm for clustering large data sets with categorical values. Data Mining and Knowledge Discovery, 2(3), 283\u2013304.","journal-title":"Data Mining and Knowledge Discovery"},{"key":"9493_CR25","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1007\/BF01908075","volume":"2","author":"L Hubert","year":"1985","unstructured":"Hubert, L., & Arabie, P. (1985). Comparing partitions. Journal of Classification, 2, 193\u2013218.","journal-title":"Journal of Classification"},{"issue":"5","key":"9493_CR26","doi-asserted-by":"publisher","first-page":"297","DOI":"10.1016\/j.jmp.2008.03.001","volume":"52","author":"F J\u00e4kel","year":"2008","unstructured":"J\u00e4kel, F., Sch\u00f6lkopf, B., & Wichmann, F. A. (2008). Similarity, kernels, and the triangle inequality. Journal of Mathematical Psychology, 52(5), 297\u2013303.","journal-title":"Journal of Mathematical Psychology"},{"key":"9493_CR27","doi-asserted-by":"crossref","unstructured":"Joshi, S., Kommaraji, R.V., Phillips, J.M., Venkatasubramanian, S. (2011). Comparing distributions and shapes using the kernel distance. In: Proceedings of the Twenty-Seventh Annual Symposium on Computational Geometry, (pp. 47\u201356).","DOI":"10.1145\/1998196.1998204"},{"key":"9493_CR28","doi-asserted-by":"publisher","first-page":"68","DOI":"10.1002\/9780470316801.ch2","volume":"344","author":"L Kaufman","year":"1990","unstructured":"Kaufman, L. (1990). Partitioning around medoids (program pam). Finding Groups in Data, 344, 68\u2013125.","journal-title":"Finding Groups in Data"},{"issue":"4","key":"9493_CR29","doi-asserted-by":"publisher","first-page":"373","DOI":"10.1093\/comjnl\/9.4.373","volume":"9","author":"GN Lance","year":"1967","unstructured":"Lance, G. N., & Williams, W. T. (1967). A general theory of classificatory sorting strategies: 1. Hierarchical systems. The Computer Journal, 9(4), 373\u2013380.","journal-title":"The Computer Journal"},{"key":"9493_CR30","unstructured":"Li, Q., & Racine, J.S. (2023). Nonparametric econometrics: Theory and practice. Princeton University Press."},{"issue":"2","key":"9493_CR31","doi-asserted-by":"publisher","first-page":"983","DOI":"10.1214\/009053607000000956","volume":"36","author":"BG Lindsay","year":"2008","unstructured":"Lindsay, B. G., Markatou, M., Ray, S., Yang, K., & Chen, S.-C. (2008). Quadratic distances on probabilities: A unified foundation. The Annals of Statistics, 36(2), 983\u20131006.","journal-title":"The Annals of Statistics"},{"key":"9493_CR32","volume-title":"Some statistical and other numerical techniques for classifying individuals","author":"PNM Macnaughton-Smith","year":"1965","unstructured":"Macnaughton-Smith, P. N. M. (1965). Some statistical and other numerical techniques for classifying individuals. London: H.M.S.O."},{"key":"9493_CR33","unstructured":"Maechler, M., Rousseeuw, P., Struyf, A., Hubert, M., & Hornik, K. (2022). Cluster: Cluster analysis basics and extensions."},{"issue":"2","key":"9493_CR34","first-page":"1","volume":"1","author":"D McParland","year":"2017","unstructured":"McParland, D., & Gormley, I. C. (2017). clustMD: Model based clustering for mixed data. R Package Version, 1(2), 1.","journal-title":"R Package Version"},{"key":"9493_CR35","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1023\/A:1024016609528","volume":"52","author":"DS Modha","year":"2003","unstructured":"Modha, D. S., & Spangler, W. S. (2003). Feature weighting in k-means clustering. Machine Learning, 52, 217\u2013237.","journal-title":"Machine Learning"},{"key":"9493_CR36","unstructured":"Morbieu, S. (2018). Generate datasets to understand some clustering algorithms behavior: RVI-bloggers. https:\/\/www.r-bloggers.com\/2018\/11\/generate-datasets-to-understand-some-clustering-algorithms-behavior\/. Accessed: 28-Aug-2024."},{"key":"9493_CR37","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2023.109353","volume":"138","author":"E Mousavi","year":"2023","unstructured":"Mousavi, E., & Sehhati, M. (2023). A generalized multi-aspect distance metric for mixed-type data clustering. Pattern Recognition, 138, 109353.","journal-title":"Pattern Recognition"},{"issue":"7","key":"9493_CR38","doi-asserted-by":"publisher","first-page":"5309","DOI":"10.1007\/s10462-020-09821-w","volume":"53","author":"S Onta\u00f1\u00f3n","year":"2020","unstructured":"Onta\u00f1\u00f3n, S. (2020). An overview of distance and similarity functions for structured data. Artificial Intelligence Review, 53(7), 5309\u20135351.","journal-title":"Artificial Intelligence Review"},{"issue":"3","key":"9493_CR39","doi-asserted-by":"publisher","first-page":"1065","DOI":"10.1214\/aoms\/1177704472","volume":"33","author":"E Parzen","year":"1962","unstructured":"Parzen, E. (1962). On estimation of a probability density function and mode. The Annals of Mathematical Statistics, 33(3), 1065\u20131076.","journal-title":"The Annals of Mathematical Statistics"},{"key":"9493_CR40","unstructured":"Phillips, J.M., Venkatasubramanian, S. (2011). A gentle introduction to the kernel distance. arXiv:1103.1625."},{"issue":"2","key":"9493_CR41","doi-asserted-by":"publisher","first-page":"331","DOI":"10.2307\/1224438","volume":"48","author":"J Podani","year":"1999","unstructured":"Podani, J. (1999). Extending Gower\u2019s general coefficient of similarity to ordinal characters. Taxon, 48(2), 331\u2013340.","journal-title":"Taxon"},{"key":"9493_CR42","volume-title":"R: A language and environment for statistical computing","author":"R Core Team","year":"2024","unstructured":"R Core Team. (2024). R: A language and environment for statistical computing. Vienna, Austria: R Foundation for Statistical Computing."},{"issue":"3","key":"9493_CR43","doi-asserted-by":"publisher","first-page":"832","DOI":"10.1214\/aoms\/1177728190","volume":"27","author":"M Rosenblatt","year":"1956","unstructured":"Rosenblatt, M. (1956). Remarks on some nonparametric estimates of a density function. The Annals of Mathematical Statistics, 27(3), 832\u2013837.","journal-title":"The Annals of Mathematical Statistics"},{"issue":"427","key":"9493_CR44","doi-asserted-by":"publisher","first-page":"807","DOI":"10.1080\/01621459.1994.10476814","volume":"89","author":"SR Sain","year":"1994","unstructured":"Sain, S. R., Baggerly, K. A., & Scott, D. W. (1994). Cross-validation of multivariate densities. Journal of the American Statistical Association, 89(427), 807\u2013817.","journal-title":"Journal of the American Statistical Association"},{"issue":"1","key":"9493_CR45","doi-asserted-by":"publisher","first-page":"289","DOI":"10.32614\/RJ-2016-021","volume":"8","author":"L Scrucca","year":"2016","unstructured":"Scrucca, L., Fop, M., Murphy, T. B., & Raftery, A. E. (2016). mclust 5: Clustering, classification and density estimation using Gaussian finite mixture models. The R Journal, 8(1), 289.","journal-title":"The R Journal"},{"key":"9493_CR46","volume-title":"Density estimation for statistics and data analysis","author":"BW Silverman","year":"1986","unstructured":"Silverman, B. W. (1986). Density estimation for statistics and data analysis. Routledge."},{"issue":"3","key":"9493_CR47","doi-asserted-by":"publisher","first-page":"386","DOI":"10.1037\/1082-989X.9.3.386","volume":"9","author":"D Steinley","year":"2004","unstructured":"Steinley, D. (2004). Properties of the Hubert-arable adjusted rand index. Psychological Methods, 9(3), 386.","journal-title":"Psychological Methods"},{"issue":"2","key":"9493_CR48","doi-asserted-by":"publisher","first-page":"200","DOI":"10.32614\/RJ-2018-048","volume":"10","author":"G Szepannek","year":"2018","unstructured":"Szepannek, G. (2018). clustMixType: User-friendly clustering of mixed-type data in R. The R Journal, 10(2), 200\u2013208.","journal-title":"The R Journal"},{"key":"9493_CR49","doi-asserted-by":"crossref","unstructured":"Thompson, J. R.J., & Ghashti, J.S. (2024). kdml: Kernel distance metric learning for mixed-type data. R package version 1.0.0.","DOI":"10.32614\/CRAN.package.kdml"},{"key":"9493_CR50","doi-asserted-by":"publisher","first-page":"109704","DOI":"10.1016\/j.asoc.2022.109704","volume":"130","author":"C Tortora","year":"2022","unstructured":"Tortora, C., & Palumbo, F. (2022). Clustering mixed-type data using a probabilistic distance algorithm. Applied Soft Computing, 130, 109704.","journal-title":"Applied Soft Computing"},{"key":"9493_CR51","doi-asserted-by":"publisher","DOI":"10.1016\/j.patcog.2024.110547","volume":"153","author":"M van de Velden","year":"2024","unstructured":"van de Velden, M., D\u2019Enza, A. I., Markos, A., & Cavicchia, C. (2024). A general framework for implementing distances for categorical variables. Pattern Recognition, 153, 110547.","journal-title":"Pattern Recognition"},{"issue":"1","key":"9493_CR52","doi-asserted-by":"publisher","first-page":"301","DOI":"10.1093\/biomet\/68.1.301","volume":"68","author":"M-C Wang","year":"1981","unstructured":"Wang, M.-C., & Van Ryzin, J. (1981). A class of smooth estimators for discrete distributions. Biometrika, 68(1), 301\u2013309.","journal-title":"Biometrika"},{"issue":"301","key":"9493_CR53","doi-asserted-by":"publisher","first-page":"236","DOI":"10.1080\/01621459.1963.10500845","volume":"58","author":"JH Ward Jr","year":"1963","unstructured":"Ward, J. H., Jr. (1963). Hierarchical grouping to optimize an objective function. Journal of the American Statistical Association, 58(301), 236\u2013244.","journal-title":"Journal of the American Statistical Association"},{"key":"9493_CR54","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/3-540-28397-8_36","volume-title":"Data Analysis and Decision Support, Berlin","author":"C Weihs","year":"2005","unstructured":"Weihs, C., Ligges, U., Luebke, K., & Raabe, N. (2005). klaR: Analyzing German business cycles. In D. Baier, R. Decker, & L. Schmidt-Thieme (Eds.), Data Analysis and Decision Support, Berlin (pp. 335\u2013343). Springer-Verlag."},{"key":"9493_CR55","doi-asserted-by":"crossref","unstructured":"Wishart, D. (2003). K-means clustering with outlier detection, mixed variables and missing values. In: Exploratory Data Analysis in Empirical Research: Proceedings of the 25th Annual Conference of the Gesellschaft f\u00fcr Klassifikation eV, University of Munich, March 14\u201316, 2001, (pp. 216\u2013226). Springer.","DOI":"10.1007\/978-3-642-55721-7_23"}],"container-title":["Journal of Classification"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00357-024-09493-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00357-024-09493-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00357-024-09493-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,6]],"date-time":"2025-09-06T00:46:16Z","timestamp":1757119576000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00357-024-09493-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,7]]},"references-count":55,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2025,7]]}},"alternative-id":["9493"],"URL":"https:\/\/doi.org\/10.1007\/s00357-024-09493-z","relation":{},"ISSN":["0176-4268","1432-1343"],"issn-type":[{"value":"0176-4268","type":"print"},{"value":"1432-1343","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,10,7]]},"assertion":[{"value":"24 September 2024","order":1,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 October 2024","order":2,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no competing interests.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of Interest"}},{"value":"The research study did not involve any human participants or animals.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical Approval"}}]}}