{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,13]],"date-time":"2026-07-13T10:04:34Z","timestamp":1783937074877,"version":"3.55.0"},"reference-count":97,"publisher":"Springer Science and Business Media LLC","issue":"3","license":[{"start":{"date-parts":[[2024,4,8]],"date-time":"2024-04-08T00:00:00Z","timestamp":1712534400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2024,4,8]],"date-time":"2024-04-08T00:00:00Z","timestamp":1712534400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Data Sci Anal"],"published-print":{"date-parts":[[2024,9]]},"DOI":"10.1007\/s41060-024-00540-x","type":"journal-article","created":{"date-parts":[[2024,4,8]],"date-time":"2024-04-08T19:01:26Z","timestamp":1712602886000},"page":"239-258","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":11,"title":["A comprehensive and analytical review of text clustering techniques"],"prefix":"10.1007","volume":"18","author":[{"given":"Vivek","family":"Mehta","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mohit","family":"Agarwal","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rohit Kumar","family":"Kaliyar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2024,4,8]]},"reference":[{"key":"540_CR1","doi-asserted-by":"publisher","first-page":"114324","DOI":"10.1016\/j.eswa.2020.114324","volume":"167","author":"Z Abbasi-Moud","year":"2021","unstructured":"Abbasi-Moud, Z., Vahdat-Nejad, H., Sadri, J.: Tourism recommendation system based on semantic clustering and sentiment analysis. Expert Syst. Appl. 167, 114324 (2021)","journal-title":"Expert Syst. Appl."},{"issue":"1","key":"540_CR2","doi-asserted-by":"publisher","first-page":"5","DOI":"10.1007\/s10618-005-1396-1","volume":"11","author":"R Agrawal","year":"2005","unstructured":"Agrawal, R., Gehrke, J., Gunopulos, D., Raghavan, P.: Automatic subspace clustering of high dimensional data. Data Min. Knowl. Disc. 11(1), 5\u201333 (2005)","journal-title":"Data Min. Knowl. Disc."},{"key":"540_CR3","unstructured":"Alammar, J.: The illustrated Bert, Elmo, and Co. http:\/\/jalammar.github.io\/illustrated-bert\/ (2018). Accessed 25 Jan 2021"},{"key":"540_CR4","unstructured":"Almeida, F., Xex\u00e9o, G.: Word embeddings: a survey (2019). arXiv preprint arXiv:1901.09069"},{"issue":"11","key":"540_CR5","doi-asserted-by":"publisher","first-page":"1310","DOI":"10.1016\/j.patrec.2010.03.012","volume":"31","author":"H Alt\u0131n\u00e7ay","year":"2010","unstructured":"Alt\u0131n\u00e7ay, H., Erenel, Z.: Analytical evaluation of term weighting schemes for text categorization. Pattern Recogn. Lett. 31(11), 1310\u20131323 (2010)","journal-title":"Pattern Recogn. Lett."},{"key":"540_CR6","doi-asserted-by":"crossref","unstructured":"Ankerst, M., Breunig, M.M., Kriegel, H.P., Sander, J.: Optics: ordering points to identify the clustering structure. In: ACM Sigmod Record, vol.\u00a028, pp. 49\u201360. ACM (1999)","DOI":"10.1145\/304181.304187"},{"key":"540_CR7","doi-asserted-by":"crossref","unstructured":"Baghel, R., Dhir, R.: Text document clustering based on frequent concepts. In: 2010 First International Conference On Parallel, Distributed and Grid Computing (PDGC 2010), pp. 366\u2013371. IEEE (2010)","DOI":"10.1109\/PDGC.2010.5679969"},{"key":"540_CR8","unstructured":"Bakarov, A.: A survey of word embeddings evaluation methods (2018). arXiv preprint arXiv:1801.09536"},{"key":"540_CR9","doi-asserted-by":"crossref","unstructured":"Beyer, K., Goldstein, J., Ramakrishnan, R., Shaft, U.: When is \u201cnearest neighbor\u201d meaningful? In: International Conference on Database Theory, pp. 217\u2013235. Springer, Berlin (1999)","DOI":"10.1007\/3-540-49257-7_15"},{"issue":"2\u20133","key":"540_CR10","doi-asserted-by":"publisher","first-page":"191","DOI":"10.1016\/0098-3004(84)90020-7","volume":"10","author":"JC Bezdek","year":"1984","unstructured":"Bezdek, J.C., Ehrlich, R., Full, W.: FCM: the fuzzy c-means clustering algorithm. Comput. Geosci. 10(2\u20133), 191\u2013203 (1984)","journal-title":"Comput. Geosci."},{"issue":"Jan","key":"540_CR11","first-page":"993","volume":"3","author":"DM Blei","year":"2003","unstructured":"Blei, D.M., Ng, A.Y., Jordan, M.I.: Latent Dirichlet allocation. J. Mach. Learn. Res. 3(Jan), 993\u20131022 (2003)","journal-title":"J. Mach. Learn. Res."},{"key":"540_CR12","doi-asserted-by":"publisher","first-page":"135","DOI":"10.1162\/tacl_a_00051","volume":"5","author":"P Bojanowski","year":"2017","unstructured":"Bojanowski, P., Grave, E., Joulin, A., Mikolov, T.: Enriching word vectors with subword information. Trans. Assoc. Comput. Linguist. 5, 135\u2013146 (2017)","journal-title":"Trans. Assoc. Comput. Linguist."},{"key":"540_CR13","doi-asserted-by":"crossref","unstructured":"Bottou, L.: Stochastic gradient descent tricks. In: Neural networks: Tricks of the Trade, pp. 421\u2013436. Springer, Berlin (2012)","DOI":"10.1007\/978-3-642-35289-8_25"},{"key":"540_CR14","doi-asserted-by":"publisher","first-page":"115","DOI":"10.1016\/j.knosys.2012.06.015","volume":"36","author":"C Bouras","year":"2012","unstructured":"Bouras, C., Tsogkas, V.: A clustering technique for news articles using wordnet. Knowl.-Based Syst. 36, 115\u2013128 (2012)","journal-title":"Knowl.-Based Syst."},{"issue":"10","key":"540_CR15","first-page":"1126","volume":"13","author":"J Brainard","year":"2020","unstructured":"Brainard, J.: Scientists are drowning in covid-19 papers. can new tools keep them afloat. Science 13(10), 1126 (2020)","journal-title":"Science"},{"key":"540_CR16","unstructured":"Covid-19 research highlights. https:\/\/www.springernature.com\/in\/researchers\/campaigns\/coronavirus (2020). Accessed 06 May 2022"},{"key":"540_CR17","doi-asserted-by":"publisher","first-page":"743","DOI":"10.1613\/jair.1.11259","volume":"63","author":"J Camacho-Collados","year":"2018","unstructured":"Camacho-Collados, J., Pilehvar, M.T.: From word to sense embeddings: a survey on vector representations of meaning. J. Artif. Intell. Res. 63, 743\u2013788 (2018)","journal-title":"J. Artif. Intell. Res."},{"key":"540_CR18","doi-asserted-by":"publisher","first-page":"733","DOI":"10.1007\/s10579-018-9415-1","volume":"52","author":"FM Cecchini","year":"2018","unstructured":"Cecchini, F.M., Riedl, M., Fersini, E., Biemann, C.: A comparison of graph-based word sense induction clustering algorithms in a pseudoword evaluation framework. Lang. Resour. Eval. 52, 733\u2013770 (2018)","journal-title":"Lang. Resour. Eval."},{"issue":"6","key":"540_CR19","doi-asserted-by":"publisher","first-page":"391","DOI":"10.1002\/(SICI)1097-4571(199009)41:6<391::AID-ASI1>3.0.CO;2-9","volume":"41","author":"S Deerwester","year":"1990","unstructured":"Deerwester, S., Dumais, S.T., Furnas, G.W., Landauer, T.K., Harshman, R.: Indexing by latent semantic analysis. J. Am. Soc. Inf. Sci. 41(6), 391\u2013407 (1990)","journal-title":"J. Am. Soc. Inf. Sci."},{"key":"540_CR20","doi-asserted-by":"crossref","unstructured":"Dempster, A.P., Laird, N.M., Rubin, D.B.: Maximum likelihood from incomplete data via the EM algorithm. J. R. Stat. Soc. Ser. B (Methodol.) 1\u201338 (1977)","DOI":"10.1111\/j.2517-6161.1977.tb01600.x"},{"key":"540_CR21","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: Pre-training of deep bidirectional transformers for language understanding (2018). arXiv preprint arXiv:1810.04805"},{"key":"540_CR22","doi-asserted-by":"crossref","unstructured":"Dey, A., Bhattacharyya, S., Dey, S., Platos, J., Snasel, V.: A quantum inspired differential evolution algorithm for automatic clustering of real life datasets. Multimedia Tools Appl. 1\u201330 (2023)","DOI":"10.1007\/s11042-023-15704-3"},{"key":"540_CR23","doi-asserted-by":"crossref","unstructured":"Duan, T., Lou, Q., Srihari, S.N., Xie, X.: Sequential embedding induced text clustering, a non-parametric Bayesian approach. In: Pacific-Asia Conference on Knowledge Discovery and Data Mining, pp. 68\u201380. Springer, Berlin (2019)","DOI":"10.1007\/978-3-030-16142-2_6"},{"issue":"4","key":"540_CR24","doi-asserted-by":"publisher","first-page":"44","DOI":"10.4018\/IJSI.2017100104","volume":"5","author":"MK Elhadad","year":"2017","unstructured":"Elhadad, M.K., Badran, K.M., Salama, G.I.: A novel approach for ontology-based dimensionality reduction for web text document classification. Int. J. Software Innov. (IJSI) 5(4), 44\u201358 (2017)","journal-title":"Int. J. Software Innov. (IJSI)"},{"key":"540_CR25","unstructured":"Ester, M., Kriegel, H.P., Sander, J., Xu, X., et\u00a0al.: A density-based algorithm for discovering clusters in large spatial databases with noise. In: KDD, vol.\u00a096, pp. 226\u2013231 (1996)"},{"key":"540_CR26","unstructured":"Firth, J.R.: A synopsis of linguistic theory, 1930-1955. Studies in linguistic analysis (1957)"},{"issue":"2","key":"540_CR27","doi-asserted-by":"publisher","first-page":"139","DOI":"10.1007\/BF00114265","volume":"2","author":"DH Fisher","year":"1987","unstructured":"Fisher, D.H.: Knowledge acquisition via incremental conceptual clustering. Mach. Learn. 2(2), 139\u2013172 (1987)","journal-title":"Mach. Learn."},{"issue":"2","key":"540_CR28","doi-asserted-by":"publisher","first-page":"395","DOI":"10.1007\/s10115-010-0370-4","volume":"28","author":"S Fodeh","year":"2011","unstructured":"Fodeh, S., Punch, B., Tan, P.N.: On ontology-driven document clustering using core semantic features. Knowl. Inf. Syst. 28(2), 395\u2013421 (2011)","journal-title":"Knowl. Inf. Syst."},{"issue":"1\u20133","key":"540_CR29","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1016\/0004-3702(89)90046-5","volume":"40","author":"JH Gennari","year":"1989","unstructured":"Gennari, J.H., Langley, P., Fisher, D.: Models of incremental concept formation. Artif. Intell. 40(1\u20133), 11\u201361 (1989)","journal-title":"Artif. Intell."},{"key":"540_CR30","doi-asserted-by":"crossref","unstructured":"Guha, S., Rastogi, R., Shim, K.: Cure: an efficient clustering algorithm for large databases. In: ACM Sigmod Record, vol.\u00a027, pp. 73\u201384. ACM (1998)","DOI":"10.1145\/276305.276312"},{"issue":"5","key":"540_CR31","doi-asserted-by":"publisher","first-page":"345","DOI":"10.1016\/S0306-4379(00)00022-3","volume":"25","author":"S Guha","year":"2000","unstructured":"Guha, S., Rastogi, R., Shim, K.: ROCK: a robust clustering algorithm for categorical attributes. Inf. Syst. 25(5), 345\u2013366 (2000)","journal-title":"Inf. Syst."},{"key":"540_CR32","volume-title":"Data Mining: Concepts and Techniques","author":"J Han","year":"2011","unstructured":"Han, J., Pei, J., Kamber, M.: Data Mining: Concepts and Techniques. Elsevier, New York (2011)"},{"issue":"2\u20133","key":"540_CR33","doi-asserted-by":"publisher","first-page":"146","DOI":"10.1080\/00437956.1954.11659520","volume":"10","author":"ZS Harris","year":"1954","unstructured":"Harris, Z.S.: Distributional structure. Word 10(2\u20133), 146\u2013162 (1954)","journal-title":"Word"},{"key":"540_CR34","unstructured":"Hinneburg, A., Keim, D.A.: Optimal grid-clustering: towards breaking the curse of dimensionality in high-dimensional clustering. In: Proceedings of the 25th International Conference on Very Large Databases, pp. 506\u2013517 (1999)"},{"key":"540_CR35","unstructured":"Hinneburg, A., Keim, D.A., et\u00a0al.: An efficient approach to clustering in large multimedia databases with noise. In: KDD, vol.\u00a098, pp. 58\u201365 (1998)"},{"key":"540_CR36","first-page":"305","volume":"305","author":"G Hirst","year":"1998","unstructured":"Hirst, G., St-Onge, D., et al.: Lexical chains as representations of context for the detection and correction of malapropisms. WordNet Electronic Lexical Database 305, 305\u2013332 (1998)","journal-title":"WordNet Electronic Lexical Database"},{"key":"540_CR37","unstructured":"Hofmann, T.: Probabilistic latent semantic analysis (2013). arXiv preprint arXiv:1301.6705"},{"issue":"8","key":"540_CR38","doi-asserted-by":"publisher","first-page":"10861","DOI":"10.1007\/s11042-022-12155-0","volume":"81","author":"S Hosseini","year":"2022","unstructured":"Hosseini, S., Varzaneh, Z.A.: Deep text clustering using stacked AutoEncoder. Multimedia Tools Appl. 81(8), 10861\u201310881 (2022)","journal-title":"Multimedia Tools Appl."},{"key":"540_CR39","doi-asserted-by":"crossref","unstructured":"Hotho, A., Staab, S., Stumme, G.: Ontologies improve text document clustering. In: Third IEEE International Conference on Data Mining, pp. 541\u2013544. IEEE (2003)","DOI":"10.1109\/ICDM.2003.1250972"},{"key":"540_CR40","doi-asserted-by":"crossref","unstructured":"Huang, A., Milne, D., Frank, E., Witten, I.H.: Clustering documents using a wikipedia-based concept representation. In: Pacific-Asia Conference on Knowledge Discovery and Data Mining, pp. 628\u2013636. Springer, Berlin (2009)","DOI":"10.1007\/978-3-642-01307-2_62"},{"issue":"8","key":"540_CR41","first-page":"34","volume":"3","author":"Z Huang","year":"1997","unstructured":"Huang, Z.: A fast clustering algorithm to cluster very large categorical data sets in data mining. DMKD 3(8), 34\u201339 (1997)","journal-title":"DMKD"},{"key":"540_CR42","doi-asserted-by":"publisher","first-page":"193","DOI":"10.1007\/BF01908075","volume":"2","author":"L Hubert","year":"1985","unstructured":"Hubert, L., Arabie, P.: Comparing partitions. J Classif 2, 193\u2013218 (1985)","journal-title":"J Classif"},{"key":"540_CR43","volume-title":"Algorithms for Clustering Data","author":"AK Jain","year":"1988","unstructured":"Jain, A.K., Dubes, R.C.: Algorithms for Clustering Data. Prentice Hall, Englewood Cliffs (1988)"},{"key":"540_CR44","doi-asserted-by":"crossref","unstructured":"Jain, D., Borah, M.D., Biswas, A.: A sentence is known by the company it keeps: improving legal document summarization using deep clustering. Artif. Intell. Law 1\u201336 (2023)","DOI":"10.1007\/s10506-023-09345-y"},{"issue":"5","key":"540_CR45","doi-asserted-by":"publisher","first-page":"217","DOI":"10.1016\/0020-0271(71)90051-9","volume":"7","author":"N Jardine","year":"1971","unstructured":"Jardine, N., van Rijsbergen, C.J.: The use of hierarchic clustering in information retrieval. Inf. Storage Retrieval 7(5), 217\u2013240 (1971)","journal-title":"Inf. Storage Retrieval"},{"issue":"1","key":"540_CR46","doi-asserted-by":"publisher","first-page":"49","DOI":"10.1007\/s41060-022-00346-9","volume":"15","author":"A Jasinska-Piadlo","year":"2023","unstructured":"Jasinska-Piadlo, A., Bond, R., Biglarbeigi, P., Brisk, R., Campbell, P., Browne, F., McEneaneny, D.: Data-driven versus a domain-led approach to k-means clustering on an open heart failure dataset. Int. J. Data Sci. Anal. 15(1), 49\u201366 (2023)","journal-title":"Int. J. Data Sci. Anal."},{"key":"540_CR47","unstructured":"Jayarajan, D., Deodhare, D., Ravindran, B.: Document clustering using lexical chains (2007)"},{"key":"540_CR48","unstructured":"Jayarajan, D., Deodhare, D., Ravindran, B.: Lexical chains as document features. In: Proceedings of the Third International Joint Conference on Natural Language Processing: Volume-I (2008)"},{"key":"540_CR49","doi-asserted-by":"crossref","unstructured":"Joulin, A., Grave, E., Bojanowski, P., Mikolov, T.: Bag of tricks for efficient text classification (2016). arXiv preprint arXiv:1607.01759","DOI":"10.18653\/v1\/E17-2068"},{"issue":"8","key":"540_CR50","doi-asserted-by":"publisher","first-page":"68","DOI":"10.1109\/2.781637","volume":"32","author":"G Karypis","year":"1999","unstructured":"Karypis, G., Han, E.H., Kumar, V.: Chameleon: Hierarchical clustering using dynamic modeling. Computer 32(8), 68\u201375 (1999)","journal-title":"Computer"},{"key":"540_CR51","doi-asserted-by":"crossref","unstructured":"Kim, J., Yoon, J., Park, E., Choi, S.: Patent document clustering with deep embeddings. Scientometrics 1\u201315 (2020)","DOI":"10.1007\/s11192-020-03396-7"},{"issue":"1\u20133","key":"540_CR52","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/S0925-2312(98)00030-7","volume":"21","author":"T Kohonen","year":"1998","unstructured":"Kohonen, T.: The self-organizing map. Neurocomputing 21(1\u20133), 1\u20136 (1998)","journal-title":"Neurocomputing"},{"key":"540_CR53","unstructured":"Lan, M., Sung, S.Y., Low, H.B., Tan, C.L.: A comparative study on term weighting schemes for text categorization. In: Proceedings. 2005 IEEE International Joint Conference on Neural Networks, 2005., vol.\u00a01, pp. 546\u2013551. IEEE (2005)"},{"key":"540_CR54","doi-asserted-by":"crossref","unstructured":"Li, Y., Cai, J., Wang, J.: A text document clustering method based on weighted Bert model. In: 2020 IEEE 4th Information Technology, Networking, Electronic and Automation Control Conference (ITNEC), vol.\u00a01, pp. 1426\u20131430. IEEE (2020)","DOI":"10.1109\/ITNEC48623.2020.9085059"},{"issue":"2","key":"540_CR55","doi-asserted-by":"publisher","first-page":"933","DOI":"10.1007\/s10586-015-0450-z","volume":"18","author":"Y Li","year":"2015","unstructured":"Li, Y., Luo, C., Chung, S.M.: A parallel text document clustering algorithm based on neighbors. Clust. Comput. 18(2), 933\u2013948 (2015)","journal-title":"Clust. Comput."},{"key":"540_CR56","doi-asserted-by":"publisher","DOI":"10.1007\/978-981-15-5573-2","volume-title":"Representation Learning for Natural Language Processing","author":"Z Liu","year":"2020","unstructured":"Liu, Z., Lin, Y., Sun, M.: Representation Learning for Natural Language Processing. Springer Nature, Berlin (2020)"},{"issue":"11","key":"540_CR57","doi-asserted-by":"publisher","first-page":"1271","DOI":"10.1016\/j.datak.2009.06.007","volume":"68","author":"C Luo","year":"2009","unstructured":"Luo, C., Li, Y., Chung, S.M.: Text document clustering based on neighbors. Data Knowl. Eng. 68(11), 1271\u20131288 (2009)","journal-title":"Data Knowl. Eng."},{"key":"540_CR58","unstructured":"MacQueen, J., et\u00a0al.: Some methods for classification and analysis of multivariate observations. In: Proceedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, vol.\u00a01, pp. 281\u2013297. Oakland, CA, USA (1967)"},{"key":"540_CR59","doi-asserted-by":"publisher","DOI":"10.1017\/CBO9780511809071","volume-title":"Introduction to Information Retrieval","author":"CD Manning","year":"2008","unstructured":"Manning, C.D., Sch\u00fctze, H., Raghavan, P.: Introduction to Information Retrieval. Cambridge University Press, Cambridge (2008)"},{"issue":"11","key":"540_CR60","doi-asserted-by":"publisher","first-page":"205","DOI":"10.21105\/joss.00205","volume":"2","author":"L McInnes","year":"2017","unstructured":"McInnes, L., Healy, J., Astels, S.: hdbscan: Hierarchical density based clustering. J. Open Source Softw. 2(11), 205 (2017)","journal-title":"J. Open Source Softw."},{"key":"540_CR61","doi-asserted-by":"publisher","first-page":"114710","DOI":"10.1016\/j.eswa.2021.114710","volume":"174","author":"V Mehta","year":"2021","unstructured":"Mehta, V., Bawa, S., Singh, J.: Stamantic clustering: Combining statistical and semantic features for clustering of large text datasets. Expert Syst. Appl. 174, 114710 (2021)","journal-title":"Expert Syst. Appl."},{"issue":"6","key":"540_CR62","doi-asserted-by":"publisher","first-page":"3211","DOI":"10.1007\/s40747-021-00512-9","volume":"7","author":"V Mehta","year":"2021","unstructured":"Mehta, V., Bawa, S., Singh, J.: Weclustering: word embeddings based text clustering technique for large datasets. Complex Intell. Syst. 7(6), 3211\u20133224 (2021)","journal-title":"Complex Intell. Syst."},{"key":"540_CR63","unstructured":"Mikolov, T., Chen, K., Corrado, G., Dean, J.: Efficient estimation of word representations in vector space (2013). arXiv preprint arXiv:1301.3781"},{"key":"540_CR64","first-page":"3111","volume":"26","author":"T Mikolov","year":"2013","unstructured":"Mikolov, T., Sutskever, I., Chen, K., Corrado, G.S., Dean, J.: Distributed representations of words and phrases and their compositionality. Adv. Neural. Inf. Process. Syst. 26, 3111\u20133119 (2013)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"issue":"11","key":"540_CR65","doi-asserted-by":"publisher","first-page":"39","DOI":"10.1145\/219717.219748","volume":"38","author":"GA Miller","year":"1995","unstructured":"Miller, G.A.: Wordnet: a lexical database for English. Commun. ACM 38(11), 39\u201341 (1995)","journal-title":"Commun. ACM"},{"issue":"1","key":"540_CR66","first-page":"21","volume":"17","author":"J Morris","year":"1991","unstructured":"Morris, J., Hirst, G.: Lexical cohesion computed by thesaural relations as an indicator of the structure of text. Comput. Linguist. 17(1), 21\u201348 (1991)","journal-title":"Comput. Linguist."},{"key":"540_CR67","doi-asserted-by":"crossref","unstructured":"Mustafi, D., Mustafi, A.: A differential evolution based algorithm to cluster text corpora using lazy re-evaluation of fringe points. Multimedia Tools Appl. 1\u201325 (2023)","DOI":"10.1007\/s11042-023-14716-3"},{"issue":"4","key":"540_CR68","doi-asserted-by":"publisher","first-page":"297","DOI":"10.1007\/s41060-017-0089-3","volume":"6","author":"A Naik","year":"2018","unstructured":"Naik, A., Maeda, H., Kanojia, V., Fujita, S.: Scalable Twitter user clustering approach boosted by Personalized PageRank. Int. J. Data Sci. Anal. 6(4), 297\u2013309 (2018)","journal-title":"Int. J. Data Sci. Anal."},{"key":"540_CR69","doi-asserted-by":"publisher","first-page":"216","DOI":"10.1016\/j.knosys.2013.09.012","volume":"54","author":"JA Nasir","year":"2013","unstructured":"Nasir, J.A., Varlamis, I., Karim, A., Tsatsaronis, G.: Semantic smoothing for text clustering. Knowl.-Based Syst. 54, 216\u2013229 (2013)","journal-title":"Knowl.-Based Syst."},{"key":"540_CR70","unstructured":"Ng, R.T., Han, J.: Efficient and effective clustering methods for spatial data mining. In: Proceedings of VLDB, pp. 144\u2013155 (1994)"},{"issue":"5","key":"540_CR71","doi-asserted-by":"publisher","first-page":"1003","DOI":"10.1109\/TKDE.2002.1033770","volume":"14","author":"RT Ng","year":"2002","unstructured":"Ng, R.T., Han, J.: CLARANS: a method for clustering objects for spatial data mining. IEEE Trans. Knowl. Data Eng. 14(5), 1003\u20131016 (2002)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"issue":"2","key":"540_CR72","doi-asserted-by":"publisher","first-page":"3336","DOI":"10.1016\/j.eswa.2008.01.039","volume":"36","author":"HS Park","year":"2009","unstructured":"Park, H.S., Jun, C.H.: A simple and fast algorithm for k-medoids clustering. Expert Syst. Appl. 36(2), 3336\u20133341 (2009)","journal-title":"Expert Syst. Appl."},{"key":"540_CR73","doi-asserted-by":"publisher","first-page":"157","DOI":"10.1016\/j.eswa.2019.06.068","volume":"137","author":"J Park","year":"2019","unstructured":"Park, J., Park, C., Kim, J., Cho, M., Park, S.: ADC: advanced document clustering using contextualized representations. Expert Syst. Appl. 137, 157\u2013166 (2019)","journal-title":"Expert Syst. Appl."},{"key":"540_CR74","unstructured":"Patil, L.H., Atique, M.: A semantic approach for effective document clustering using wordnet (2013). arXiv preprint arXiv:1303.0489"},{"key":"540_CR75","doi-asserted-by":"crossref","unstructured":"Pennington, J., Socher, R., Manning, C.D.: Glove: Global vectors for word representation. In: Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP), pp. 1532\u20131543 (2014)","DOI":"10.3115\/v1\/D14-1162"},{"key":"540_CR76","doi-asserted-by":"crossref","unstructured":"Peters, M.E., Neumann, M., Iyyer, M., Gardner, M., Clark, C., Lee, K., Zettlemoyer, L.: Deep contextualized word representations (2018). arXiv preprint arXiv:1802.05365","DOI":"10.18653\/v1\/N18-1202"},{"issue":"6","key":"540_CR77","doi-asserted-by":"publisher","first-page":"563","DOI":"10.1007\/s10791-007-9035-7","volume":"10","author":"DR Recupero","year":"2007","unstructured":"Recupero, D.R.: A new unsupervised method for document clustering by using wordnet lexical and conceptual relations. Inf. Retrieval 10(6), 563\u2013579 (2007)","journal-title":"Inf. Retrieval"},{"issue":"5","key":"540_CR78","doi-asserted-by":"publisher","first-page":"503","DOI":"10.1108\/00220410410560582","volume":"60","author":"S Robertson","year":"2004","unstructured":"Robertson, S.: Understanding inverse document frequency: on theoretical arguments for IDF. J. Doc. 60(5), 503\u2013520 (2004)","journal-title":"J. Doc."},{"key":"540_CR79","doi-asserted-by":"publisher","first-page":"269","DOI":"10.1007\/s41060-018-0112-3","volume":"5","author":"RK Roul","year":"2018","unstructured":"Roul, R.K.: An effective approach for semantic-based clustering and topic-based ranking of web documents. Int. J. Data Sci. Anal. 5, 269\u2013284 (2018)","journal-title":"Int. J. Data Sci. Anal."},{"issue":"3","key":"540_CR80","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3068335","volume":"42","author":"E Schubert","year":"2017","unstructured":"Schubert, E., Sander, J., Ester, M., Kriegel, H.P., Xu, X.: DBSCAN revisited, revisited: why and how you should (still) use DBSCAN. ACM Trans. Database Syst. (TODS) 42(3), 1\u201321 (2017)","journal-title":"ACM Trans. Database Syst. (TODS)"},{"key":"540_CR81","doi-asserted-by":"crossref","unstructured":"Sedding, J., Kazakov, D.: Wordnet-based text document clustering. In: proceedings of the 3rd Workshop on Robust Methods in Analysis of Natural Language Data, pp. 104\u2013113. Association for Computational Linguistics (2004)","DOI":"10.3115\/1621445.1621458"},{"issue":"3","key":"540_CR82","first-page":"3074","volume":"5","author":"G Sehgal","year":"2014","unstructured":"Sehgal, G., Garg, D.K.: Comparison of various clustering algorithms. Int. J. Comput. Sci. Inf. Technol. 5(3), 3074\u20133076 (2014)","journal-title":"Int. J. Comput. Sci. Inf. Technol."},{"key":"540_CR83","unstructured":"Sheikholeslami, G., Chatterjee, S., Zhang, A.: Wavecluster: a multi-resolution clustering approach for very large spatial databases. In: VLDB, vol.\u00a098, pp. 428\u2013439 (1998)"},{"key":"540_CR84","unstructured":"Shi, H., Wang, C., Sakai, T.: Self-supervised document clustering based on Bert with data augment (2020). arXiv preprint arXiv:2011.08523"},{"issue":"12","key":"540_CR85","doi-asserted-by":"publisher","first-page":"e0144059","DOI":"10.1371\/journal.pone.0144059","volume":"10","author":"AS Shirkhorshidi","year":"2015","unstructured":"Shirkhorshidi, A.S., Aghabozorgi, S., Wah, T.Y.: A comparison study on similarity and dissimilarity measures in clustering continuous data. PLoS ONE 10(12), e0144059 (2015)","journal-title":"PLoS ONE"},{"key":"540_CR86","doi-asserted-by":"publisher","first-page":"955","DOI":"10.1016\/j.knosys.2018.10.026","volume":"163","author":"RA Sinoara","year":"2019","unstructured":"Sinoara, R.A., Camacho-Collados, J., Rossi, R.G., Navigli, R., Rezende, S.O.: Knowledge-enhanced document embeddings for text classification. Knowl.-Based Syst. 163, 955\u2013971 (2019)","journal-title":"Knowl.-Based Syst."},{"key":"540_CR87","doi-asserted-by":"crossref","unstructured":"Steinbach, M., Ert\u00f6z, L., Kumar, V.: The challenges of clustering high dimensional data. In: New Directions in Statistical Physics, pp. 273\u2013309. Springer, Berlin (2004)","DOI":"10.1007\/978-3-662-08968-2_16"},{"key":"540_CR88","unstructured":"Steinbach, M., Karypis, G., Kumar, V., et\u00a0al.: A comparison of document clustering techniques. In: KDD Workshop on Text Mining, vol. 400, pp. 525\u2013526. Boston (2000)"},{"issue":"23","key":"540_CR89","doi-asserted-by":"publisher","first-page":"32995","DOI":"10.1007\/s11042-022-12506-x","volume":"81","author":"G Urkude","year":"2022","unstructured":"Urkude, G., Pandey, M.: Design and development of density-based effective document clustering method using ontology. Multimedia Tools Appl. 81(23), 32995\u201333015 (2022)","journal-title":"Multimedia Tools Appl."},{"key":"540_CR90","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141., Polosukhin, I.: Attention is all you need. In: Advances in Neural Information Processing Systems, vol. 30 (2017)"},{"issue":"3","key":"540_CR91","doi-asserted-by":"publisher","first-page":"717","DOI":"10.1007\/s00607-019-00768-7","volume":"102","author":"S Wang","year":"2020","unstructured":"Wang, S., Zhou, W., Jiang, C.: A survey of word embeddings based on deep learning. Computing 102(3), 717\u2013740 (2020)","journal-title":"Computing"},{"key":"540_CR92","unstructured":"Wang, W., Yang, J., Muntz, R., et\u00a0al.: Sting: a statistical information grid approach to spatial data mining. In: VLDB, vol.\u00a097, pp. 186\u2013195 (1997)"},{"issue":"4","key":"540_CR93","doi-asserted-by":"publisher","first-page":"2264","DOI":"10.1016\/j.eswa.2014.10.023","volume":"42","author":"T Wei","year":"2015","unstructured":"Wei, T., Lu, Y., Chang, H., Zhou, Q., Bao, X.: A semantic approach for text clustering using wordnet and lexical chains. Expert Syst. Appl. 42(4), 2264\u20132275 (2015)","journal-title":"Expert Syst. Appl."},{"issue":"2","key":"540_CR94","doi-asserted-by":"publisher","first-page":"165","DOI":"10.1007\/s40745-015-0040-1","volume":"2","author":"D Xu","year":"2015","unstructured":"Xu, D., Tian, Y.: A comprehensive survey of clustering algorithms. Ann. Data Sci. 2(2), 165\u2013193 (2015)","journal-title":"Ann. Data Sci."},{"key":"540_CR95","unstructured":"Xu, X., Ester, M., Kriegel, H.P., Sander, J.: A distribution-based clustering algorithm for mining in large spatial databases. In: 14th International Conference on Data Engineering, 1998. Proceedings, pp. 324\u2013331. IEEE (1998)"},{"key":"540_CR96","doi-asserted-by":"publisher","first-page":"148","DOI":"10.1016\/j.datak.2015.04.008","volume":"100","author":"L Yue","year":"2015","unstructured":"Yue, L., Zuo, W., Peng, T., Wang, Y., Han, X.: A fuzzy document clustering approach based on domain-specified ontology. Data Knowl. Eng. 100, 148\u2013166 (2015)","journal-title":"Data Knowl. Eng."},{"key":"540_CR97","doi-asserted-by":"crossref","unstructured":"Zhang, T., Ramakrishnan, R., Livny, M.: Birch: an efficient data clustering method for very large databases. In: ACM Sigmod Record, vol.\u00a025, pp. 103\u2013114. ACM (1996)","DOI":"10.1145\/235968.233324"}],"container-title":["International Journal of Data Science and Analytics"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s41060-024-00540-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s41060-024-00540-x\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s41060-024-00540-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,11,15]],"date-time":"2024-11-15T22:21:14Z","timestamp":1731709274000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s41060-024-00540-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,4,8]]},"references-count":97,"journal-issue":{"issue":"3","published-print":{"date-parts":[[2024,9]]}},"alternative-id":["540"],"URL":"https:\/\/doi.org\/10.1007\/s41060-024-00540-x","relation":{},"ISSN":["2364-415X","2364-4168"],"issn-type":[{"value":"2364-415X","type":"print"},{"value":"2364-4168","type":"electronic"}],"subject":[],"published":{"date-parts":[[2024,4,8]]},"assertion":[{"value":"6 October 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"18 March 2024","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 April 2024","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"On behalf of all authors, the corresponding author states that there is no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}]}}