{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,19]],"date-time":"2025-11-19T06:58:45Z","timestamp":1763535525957,"version":"3.37.3"},"reference-count":71,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2018,5,23]],"date-time":"2018-05-23T00:00:00Z","timestamp":1527033600000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2018,5,23]],"date-time":"2018-05-23T00:00:00Z","timestamp":1527033600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/100000006","name":"Office of Naval Research","doi-asserted-by":"publisher","award":["N00014-16-1-2119"],"award-info":[{"award-number":["N00014-16-1-2119"]}],"id":[{"id":"10.13039\/100000006","id-type":"DOI","asserted-by":"publisher"}]},{"name":"City of Los Angeles, Gang Reduction Youth Development (GRYD) Analysis Program"},{"name":"AFOSR MURI","award":["FA9550-10-1-0569"],"award-info":[{"award-number":["FA9550-10-1-0569"]}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["DMS-1045536","DMS-1417674"],"award-info":[{"award-number":["DMS-1045536","DMS-1417674"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["DMS-1737770"],"award-info":[{"award-number":["DMS-1737770"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Data Sci Anal"],"published-print":{"date-parts":[[2018,9]]},"DOI":"10.1007\/s41060-018-0129-7","type":"journal-article","created":{"date-parts":[[2018,5,23]],"date-time":"2018-05-23T09:15:10Z","timestamp":1527066910000},"page":"109-129","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":13,"title":["Unsupervised record matching with noisy and incomplete data"],"prefix":"10.1007","volume":"6","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-4953-8314","authenticated-orcid":false,"given":"Yves","family":"van Gennip","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Blake","family":"Hunter","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anna","family":"Ma","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Daniel","family":"Moyer","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ryan","family":"de Vera","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Andrea L.","family":"Bertozzi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,5,23]]},"reference":[{"issue":"1","key":"129_CR1","doi-asserted-by":"publisher","first-page":"354","DOI":"10.15623\/ijret.2014.0301062","volume":"3","author":"AA Abraham","year":"2014","unstructured":"Abraham, A.A., Kanmani, S.D.: A survey on various methods used for detecting duplicates in XML data. Int. J. Eng. Res. Technol. 3(1), 354\u2013357 (2014)","journal-title":"Int. J. Eng. Res. Technol."},{"issue":"02","key":"129_CR2","first-page":"416","volume":"2","author":"I Ahmed","year":"2010","unstructured":"Ahmed, I., Aziz, A.: Dynamic approach for data scrubbing process. Int. J. Comput. Sci. Eng. 2(02), 416\u2013423 (2010)","journal-title":"Int. J. Comput. Sci. Eng."},{"key":"129_CR3","unstructured":"Allison, P.D.: Imputation of categorical variables with PROC MI. In: SUGI 30 Proceedings. SAS Institute Inc. Paper 113-30 (2005)"},{"key":"129_CR4","doi-asserted-by":"publisher","first-page":"73","DOI":"10.4135\/9780857020994.n4","volume-title":"The SAGE Handbook of Quantitative Methods in Psychology, Chap. 4","author":"PD Allison","year":"2009","unstructured":"Allison, P.D.: Missing data. In: Millsa, R.E., Maydeu-Olivares, A. (eds.) The SAGE Handbook of Quantitative Methods in Psychology, Chap. 4, pp. 73\u201390. SAGE Publications Ltd., London (2009). https:\/\/doi.org\/10.4135\/9780857020994.n4"},{"key":"129_CR5","doi-asserted-by":"publisher","first-page":"461","DOI":"10.1007\/s10791-008-9066-8","volume":"12","author":"E Amig\u00f3","year":"2009","unstructured":"Amig\u00f3, E., Gonzalo, J., Artiles, J., Verdejo, F.: A comparison of extrinsic clustering evaluation metrics based on formal constraints. Inf. Retr. 12, 461\u2013486 (2009)","journal-title":"Inf. Retr."},{"key":"129_CR6","volume-title":"Modern Information Retrieval","author":"R Baeza-Yates","year":"1999","unstructured":"Baeza-Yates, R., Ribeiro-Neto, B., et al.: Modern Information Retrieval. ACM Press, New York (1999)"},{"issue":"1","key":"129_CR7","first-page":"95","volume":"9","author":"H Bano","year":"2015","unstructured":"Bano, H., Azam, F.: Innovative windows for duplicate detection. Int. J. Softw. Eng. Appl. 9(1), 95\u2013104 (2015)","journal-title":"Int. J. Softw. Eng. Appl."},{"key":"129_CR8","doi-asserted-by":"crossref","unstructured":"Bilenko, M., Mooney, R.J.: Adaptive duplicate detection using learnable string similarity measures. In: Proceedings of the Ninth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, pp. 39\u201348. ACM (2003)","DOI":"10.1145\/956750.956759"},{"key":"129_CR9","unstructured":"Bilenko, M., Mooney, R.J.: On evaluation and training-set construction for duplicate detection. In: Proceedings of the KDD-2003 Workshop on Data Cleaning, Record Linkage, and Object Consolidation, pp. 7\u201312 (2003)"},{"key":"129_CR10","first-page":"993","volume":"3","author":"DM Blei","year":"2003","unstructured":"Blei, D.M., Ng, A.Y., Jordan, M.I.: Latent Dirichlet allocation. J. Mach. Learn. Res. 3, 993\u20131022 (2003)","journal-title":"J. Mach. Learn. Res."},{"key":"129_CR11","unstructured":"Chen, M.: Normalized mutual information. http:\/\/www.mathworks.com\/matlabcentral\/fileexchange\/29047-normalized-mutual-information (2010). Contact: mochen@ie.cuhk.edu.hk. Accessed 26 Feb 2015"},{"issue":"1","key":"129_CR12","doi-asserted-by":"publisher","first-page":"11:1","DOI":"10.1145\/3047307","volume":"50","author":"L Chi","year":"2017","unstructured":"Chi, L., Zhu, X.: Hashing techniques: a survey and taxonomy. ACM Comput. Surv. 50(1), 11:1\u201311:36 (2017)","journal-title":"ACM Comput. Surv."},{"issue":"9","key":"129_CR13","doi-asserted-by":"publisher","first-page":"1537","DOI":"10.1109\/TKDE.2011.127","volume":"24","author":"P Christen","year":"2012","unstructured":"Christen, P.: A survey of indexing techniques for scalable record linkage and deduplication. IEEE Trans. Knowl. Data Eng. 24(9), 1537\u20131555 (2012)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"129_CR14","unstructured":"Cohen, W.W., Ravikumar, P.D., Fienberg, S.E., et\u00a0al.: A comparison of string distance metrics for name-matching tasks. In: IIWEB\u201903 Proceedings of the 2003 International Conference on Information Integration on the Web, pp. 73\u201378 (2003)"},{"key":"129_CR15","doi-asserted-by":"crossref","unstructured":"Cohen, W.W., Richman, J.: Learning to match and cluster large high-dimensional data sets for data integration. In: Proceedings of the Eighth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, pp. 475\u2013480. ACM (2002)","DOI":"10.1145\/775047.775116"},{"key":"129_CR16","unstructured":"Cora citation matching data set. http:\/\/people.cs.umass.edu\/~mccallum\/data.html . Accessed 24 Mar 2014"},{"issue":"2","key":"129_CR17","first-page":"9","volume":"5","author":"T De Vries","year":"2011","unstructured":"De Vries, T., Ke, H., Chawla, S., Christen, P.: Robust record linkage blocking using suffix arrays and bloom filters. ACM Trans. Knowl. Discov. Data (TKDD) 5(2), 9 (2011)","journal-title":"ACM Trans. Knowl. Discov. Data (TKDD)"},{"key":"129_CR18","doi-asserted-by":"crossref","unstructured":"Draisbach, U., Naumann, F.: A generalization of blocking and windowing algorithms for duplicate detection. In: 2011 International Conference on Data and Knowledge Engineering (ICDKE), pp. 18\u201324. IEEE (2011)","DOI":"10.1109\/ICDKE.2011.6053920"},{"issue":"1","key":"129_CR19","doi-asserted-by":"publisher","first-page":"188","DOI":"10.1002\/aris.1440380105","volume":"38","author":"ST Dumais","year":"2004","unstructured":"Dumais, S.T.: Latent semantic analysis. Annu. Rev. Inf. Sci. Technol. 38(1), 188\u2013230 (2004)","journal-title":"Annu. Rev. Inf. Sci. Technol."},{"key":"129_CR20","unstructured":"Duplicate detection, record linkage, and identity uncertainty: datasets. http:\/\/www.cs.utexas.edu\/users\/ml\/riddle\/data.html . Accessed 24 March 2014"},{"issue":"1","key":"129_CR21","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TKDE.2007.250581","volume":"19","author":"AK Elmagarmid","year":"2007","unstructured":"Elmagarmid, A.K., Ipeirotis, P.G., Verykios, V.S.: Duplicate record detection: a survey. IEEE Trans. Knowl. Data Eng. 19(1), 1\u201316 (2007)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"129_CR22","unstructured":"Fiedler, S.: Cell array to CSV-file [cell2csv.m], updated. http:\/\/uk.mathworks.com\/matlabcentral\/fileexchange\/4400-cell-array-to-csv-file--cell2csv-m- (2010). Modified by Rob Kohr. Accessed 4 Sept 2014"},{"key":"129_CR23","volume-title":"The Elements of Statistical Learning","author":"J Friedman","year":"2001","unstructured":"Friedman, J., Hastie, T., Tibshirani, R.: The Elements of Statistical Learning. Springer Series in Statistics. Springer, New York (2001)"},{"key":"129_CR24","doi-asserted-by":"crossref","unstructured":"Fu, Z., Zhou, J., Christen, P., Boot, M.: Multiple instance learning for group record linkage. In: Advances in Knowledge Discovery and Data Mining, pp. 171\u2013182. Springer, Berlin, Heidelberg (2012)","DOI":"10.1007\/978-3-642-30217-6_15"},{"key":"129_CR25","first-page":"91","volume":"40","author":"E Gonz\u00e1lez","year":"2008","unstructured":"Gonz\u00e1lez, E., Turmo, J.: Non-parametric document clustering by ensemble methods. Procesamiento del Lenguaje Natural 40, 91\u201398 (2008)","journal-title":"Procesamiento del Lenguaje Natural"},{"key":"129_CR26","series-title":"Lecture Notes in Computer Science, vol. 6344","doi-asserted-by":"crossref","DOI":"10.1007\/978-3-642-15618-2","volume-title":"Privacy in Statistical Databases","author":"R Hall","year":"2010","unstructured":"Hall, R., Fienberg, S.E.: Privacy-preserving record linkage. In: Domingo-Ferrer, J., Magkos, E. (eds.) Privacy in Statistical Databases. Lecture Notes in Computer Science, vol. 6344. Springer, Berlin (2010)"},{"key":"129_CR27","doi-asserted-by":"crossref","unstructured":"Harris, M., Aubert, X., Haeb-Umbach, R., Beyerlein, P.: A study of broadcast news audio stream segmentation and segment clustering. In: Proceedings of EUROSPEECH99, pp. 1027\u20131030 (1999)","DOI":"10.21437\/Eurospeech.1999-166"},{"issue":"1","key":"129_CR28","doi-asserted-by":"publisher","first-page":"1282","DOI":"10.14778\/1687627.1687771","volume":"2","author":"O Hassanzadeh","year":"2009","unstructured":"Hassanzadeh, O., Chiang, F., Lee, H.C., Miller, R.J.: Framework for evaluating clustering algorithms in duplicate detection. Proc. VLDB Endow. 2(1), 1282\u20131293 (2009)","journal-title":"Proc. VLDB Endow."},{"issue":"1","key":"129_CR29","doi-asserted-by":"publisher","first-page":"79","DOI":"10.1198\/000313007X172556","volume":"61","author":"NJ Horton","year":"2007","unstructured":"Horton, N.J., Kleinman, K.P.: Much ado about nothing. Am. Stat. 61(1), 79\u201390 (2007)","journal-title":"Am. Stat."},{"issue":"1","key":"129_CR30","doi-asserted-by":"crossref","first-page":"1","DOI":"10.21307\/joss-2019-051","volume":"10","author":"M Huisman","year":"2009","unstructured":"Huisman, M.: Imputation of missing network data: some simple procedures. J. Soc. Struct. 10(1), 1\u201329 (2009)","journal-title":"J. Soc. Struct."},{"issue":"406","key":"129_CR31","doi-asserted-by":"publisher","first-page":"414","DOI":"10.1080\/01621459.1989.10478785","volume":"84","author":"MA Jaro","year":"1989","unstructured":"Jaro, M.A.: Advances in record-linkage methodology as applied to matching the 1985 census of Tampa, Florida. J. Am. Stat. Assoc. 84(406), 414\u2013420 (1989)","journal-title":"J. Am. Stat. Assoc."},{"key":"129_CR32","doi-asserted-by":"publisher","first-page":"491","DOI":"10.1002\/sim.4780140510","volume":"14","author":"MA Jaro","year":"1995","unstructured":"Jaro, M.A.: Probabilistic linkage of large public health data file. Stat. Med. 14, 491\u2013498 (1995)","journal-title":"Stat. Med."},{"issue":"2","key":"129_CR33","first-page":"105","volume":"2","author":"RR Kannan","year":"2016","unstructured":"Kannan, R.R., Abarna, D., Aswini, G., Hemavathy, P.: Effective progressive algorithm for duplicate detection on large dataset. Int. J. Sci. Res. Sci. Technol. 2(2), 105\u2013110 (2016)","journal-title":"Int. J. Sci. Res. Sci. Technol."},{"issue":"2","key":"129_CR34","doi-asserted-by":"publisher","first-page":"187","DOI":"10.1093\/bioinformatics\/bth499","volume":"21","author":"H Kim","year":"2005","unstructured":"Kim, H., Golub, G.H., Park, H.: Missing value estimation for dna microarray gene expression data: local least squares imputation. Bioinformatics 21(2), 187\u2013198 (2005). https:\/\/doi.org\/10.1093\/bioinformatics\/bth499","journal-title":"Bioinformatics"},{"issue":"11","key":"129_CR35","doi-asserted-by":"publisher","first-page":"1410","DOI":"10.1093\/bioinformatics\/btk053","volume":"22","author":"H Kim","year":"2006","unstructured":"Kim, H., Golub, G.H., Park, H.: Missing value estimation for DNA microarray gene expression data: local least squares imputation. Bioinformatics 22(11), 1410\u20131411 (2006). https:\/\/doi.org\/10.1093\/bioinformatics\/btk053","journal-title":"Bioinformatics"},{"issue":"2","key":"129_CR36","doi-asserted-by":"publisher","first-page":"713","DOI":"10.1137\/07069239X","volume":"30","author":"H Kim","year":"2008","unstructured":"Kim, H., Park, H.: Nonnegative matrix factorization based on alternating nonnegativity constrained least squares and active set method. SIAM J. Matrix Anal. Appl. 30(2), 713\u2013730 (2008)","journal-title":"SIAM J. Matrix Anal. Appl."},{"key":"129_CR37","unstructured":"Koehler, M.: matrix2latex, updated. http:\/\/www.mathworks.com\/matlabcentral\/fileexchange\/4894-matrix2latex (2004). Accessed 24 March 2014"},{"key":"129_CR38","unstructured":"Komarov, O.: Set functions with multiple inputs, updated. http:\/\/uk.mathworks.com\/matlabcentral\/fileexchange\/28341-set-functions-with-multiple-inputs\/content\/SetMI\/unionm.m (2010). Accessed 24 March 2014"},{"key":"129_CR39","doi-asserted-by":"crossref","DOI":"10.1002\/9781118874059","volume-title":"Discovering Knowledge in Data: An Introduction to Data Mining","author":"DT Larose","year":"2014","unstructured":"Larose, D.T., Larose, C.D.: Discovering Knowledge in Data: An Introduction to Data Mining, 2nd edn. Wiley, Hoboken, NJ (2014)","edition":"2"},{"key":"129_CR40","unstructured":"Layek, A.K., Gupta, A., Ghosh, S., Mandal, S.: Fast near-duplicate detection from image streams on online social media during disaster events. In: India Conference (INDICON), 2016 IEEE Annual, pp. 1\u20136. IEEE (2016)"},{"issue":"5","key":"129_CR41","doi-asserted-by":"publisher","first-page":"1028","DOI":"10.1109\/TKDE.2012.60","volume":"25","author":"L Leitao","year":"2013","unstructured":"Leitao, L., Calado, P., Herschel, M.: Efficient and effective duplicate detection in hierarchical data. IEEE Trans. Knowl. Data Eng. 25(5), 1028\u20131041 (2013)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"129_CR42","doi-asserted-by":"crossref","unstructured":"Manning, C.D., Raghavan, P., Sch\u00fctze, H.: Introduction to Information Retrieval, vol.\u00a01. Cambridge University Press, Cambridge (2008)","DOI":"10.1017\/CBO9780511809071"},{"issue":"2","key":"129_CR43","doi-asserted-by":"publisher","first-page":"127","DOI":"10.1023\/A:1009953814988","volume":"3","author":"AK McCallum","year":"2000","unstructured":"McCallum, A.K., Nigam, K., Rennie, J., Seymore, K.: Automating the construction of internet portals with machine learning. J. Inf. Retr. 3(2), 127\u2013163 (2000)","journal-title":"J. Inf. Retr."},{"key":"129_CR44","doi-asserted-by":"publisher","first-page":"873","DOI":"10.1016\/j.jmva.2006.11.013","volume":"98","author":"M Meil\u0103","year":"2007","unstructured":"Meil\u0103, M.: Comparing clusterings\u2014an information based distance. J. Multivar. Anal. 98, 873\u2013895 (2007)","journal-title":"J. Multivar. Anal."},{"key":"129_CR45","unstructured":"Monge, A.E., Elkan, C.P.: Efficient domain-independent detection of approximately duplicate database records. In: Proceedings of the ACM-SIGMOD Workshop on Research Issues in on Knowledge Discovery and Data Mining (1997)"},{"issue":"1","key":"129_CR46","doi-asserted-by":"publisher","first-page":"1","DOI":"10.2200\/S00262ED1V01Y201003DTM003","volume":"2","author":"F Naumann","year":"2010","unstructured":"Naumann, F., Herschel, M.: An introduction to duplicate detection. Synth. Lect. Data Manag. 2(1), 1\u201387 (2010)","journal-title":"Synth. Lect. Data Manag."},{"issue":"2","key":"129_CR47","first-page":"8","volume":"4","author":"R Nuray-Turan","year":"2013","unstructured":"Nuray-Turan, R., Kalashnikov, D.V., Mehrotra, S.: Adaptive connection strength models for relationship-based entity resolution. J. Data Inf. Qual. (JDIQ) 4(2), 8 (2013)","journal-title":"J. Data Inf. Qual. (JDIQ)"},{"issue":"3","key":"129_CR48","doi-asserted-by":"publisher","first-page":"593","DOI":"10.1007\/s10618-014-0358-x","volume":"29","author":"G Pang","year":"2015","unstructured":"Pang, G., Jin, H., Jiang, S.: CenKNN: a scalable and effective text classifier. Data Min. Knowl. Discov. 29(3), 593\u2013625 (2015)","journal-title":"Data Min. Knowl. Discov."},{"issue":"12","key":"129_CR49","doi-asserted-by":"publisher","first-page":"2665","DOI":"10.1109\/TKDE.2012.150","volume":"25","author":"G Papadakis","year":"2013","unstructured":"Papadakis, G., Ioannou, E., Palpanas, T., Niederee, C., Nejdl, W.: A blocking framework for entity resolution in highly heterogeneous information spaces. IEEE Trans. Knowl. Data Eng. 25(12), 2665\u20132682 (2013)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"129_CR50","doi-asserted-by":"crossref","unstructured":"Papadakis, G., Nejdl, W.: Efficient entity resolution methods for heterogeneous information spaces. In: 2011 IEEE 27th International Conference on Data Engineering Workshops (ICDEW), pp. 304\u2013307. IEEE (2011)","DOI":"10.1109\/ICDEW.2011.5767671"},{"issue":"5","key":"129_CR51","doi-asserted-by":"publisher","first-page":"1316","DOI":"10.1109\/TKDE.2014.2359666","volume":"27","author":"T Papenbrock","year":"2015","unstructured":"Papenbrock, T., Heise, A., Naumann, F.: Progressive duplicate detection. IEEE Trans. Knowl. Data Eng. 27(5), 1316\u20131329 (2015)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"issue":"4","key":"129_CR52","doi-asserted-by":"publisher","first-page":"353","DOI":"10.1076\/edre.7.4.353.8937","volume":"7","author":"TD Pigott","year":"2001","unstructured":"Pigott, T.D.: A review of methods for missing data. Educ. Res. Evaluat. 7(4), 353\u2013383 (2001)","journal-title":"Educ. Res. Evaluat."},{"issue":"5","key":"129_CR53","first-page":"1","volume":"16","author":"R Ramya","year":"2017","unstructured":"Ramya, R., Venugopal, K., Iyengar, S., Patnaik, L.: Feature extraction and duplicate detection for text mining: a survey. Glob. J. Comput. Sci. Technol. 16(5), 1\u201320 (2017)","journal-title":"Glob. J. Comput. Sci. Technol."},{"issue":"5","key":"129_CR54","doi-asserted-by":"publisher","first-page":"513","DOI":"10.1016\/0306-4573(88)90021-0","volume":"24","author":"G Salton","year":"1988","unstructured":"Salton, G., Buckley, C.: Term-weighting approaches in automatic text retrieval. Inf. Process. Manag. 24(5), 513\u2013523 (1988)","journal-title":"Inf. Process. Manag."},{"issue":"11","key":"129_CR55","doi-asserted-by":"publisher","first-page":"613","DOI":"10.1145\/361219.361220","volume":"18","author":"G Salton","year":"1975","unstructured":"Salton, G., Wong, A., Yang, C.S.: A vector space model for automatic indexing. Commun. ACM 18(11), 613\u2013620 (1975)","journal-title":"Commun. ACM"},{"key":"129_CR56","doi-asserted-by":"crossref","unstructured":"Scannapieco, M., Figotin, I., Bertino, E., Elmagarmid, A.K.: Privacy preserving schema and data matching. In: Proceedings of the 2007 ACM SIGMOD International Conference on Management of Data, pp. 653\u2013664. ACM (2007)","DOI":"10.1145\/1247480.1247553"},{"key":"129_CR57","first-page":"583","volume":"3","author":"A Strehl","year":"2002","unstructured":"Strehl, A., Ghosh, J.: Cluster ensembles\u2014a knowledge reuse framework for combining multiple partitions. J. Mach. Learn. Res. 3, 583\u2013617 (2002)","journal-title":"J. Mach. Learn. Res."},{"issue":"4","key":"129_CR58","first-page":"1","volume":"15","author":"JJ Tamilselvi","year":"2011","unstructured":"Tamilselvi, J.J., Gifta, C.B.: Handling duplicate data in data warehouse for data mining. Int. J. Comput. Appl. (0975\u20138887) 15(4), 1\u20139 (2011)","journal-title":"Int. J. Comput. Appl. (0975\u20138887)"},{"issue":"8","key":"129_CR59","doi-asserted-by":"publisher","first-page":"607","DOI":"10.1016\/S0306-4379(01)00042-4","volume":"26","author":"S Tejada","year":"2001","unstructured":"Tejada, S., Knoblock, C.A., Minton, S.: Learning object identification rules for information integration. Inf. Syst. 26(8), 607\u2013633 (2001)","journal-title":"Inf. Syst."},{"issue":"3","key":"129_CR60","doi-asserted-by":"publisher","first-page":"526","DOI":"10.1137\/080734315","volume":"53","author":"AL Traud","year":"2011","unstructured":"Traud, A.L., Kelsic, E.D., Mucha, P.J., Porter, M.A.: Comparing community structure to characteristics in online collegiate social networks. SIAM Rev. 53(3), 526\u2013543 (2011)","journal-title":"SIAM Rev."},{"key":"129_CR61","unstructured":"Traud, A.L., Kelsic, E.D., Mucha, P.J., Porter, M.A.: zrand. http:\/\/netwiki.amath.unc.edu\/GenLouvain\/GenLouvain (2011). Accessed 24 March 2014"},{"key":"129_CR62","unstructured":"Tromp, M., Reitsma, J., Ravelli, A., M\u00e9ray, N., Bonsel, G.: Record linkage: making the most out of errors in linking variables. In: AMIA Annual Symposium Proceedings, p. 779. American Medical Informatics Association (2006)"},{"issue":"1","key":"129_CR63","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1137\/120882093","volume":"73","author":"Y van Gennip","year":"2013","unstructured":"van Gennip, Y., Hunter, B., Ahn, R., Elliott, P., Luh, K., Halvorson, M., Reid, S., Valasik, M., Wo, J., Tita, G.E., Bertozzi, A.L., Brantingham, P.J.: Community detection using spectral clustering on sparse geosocial data. SIAM J. Appl. Math. 73(1), 67\u201383 (2013)","journal-title":"SIAM J. Appl. Math."},{"key":"129_CR64","volume-title":"Information Retrieval","author":"CJ van Rijsbergen","year":"1979","unstructured":"van Rijsbergen, C.J.: Information Retrieval, 2nd edn. Butterworth-Heinemann, Newton, MA (1979)","edition":"2"},{"key":"129_CR65","doi-asserted-by":"crossref","unstructured":"Watada, J., Shi, C., Yabuuchi, Y., Yusof, R., Sahri, Z.: A rough set approach to data imputation and its application to a dissolved gas analysis dataset. In: 2016 Third International Conference on Computing Measurement Control and Sensor Network (CMCSN), pp. 24\u201327. IEEE (2016)","DOI":"10.1109\/CMCSN.2016.48"},{"issue":"5","key":"129_CR66","doi-asserted-by":"publisher","first-page":"1111","DOI":"10.1109\/TKDE.2012.43","volume":"25","author":"SE Whang","year":"2013","unstructured":"Whang, S.E., Marmaros, D., Garcia-Molina, H.: Pay-as-you-go entity resolution. IEEE Trans. Knowl. Data Eng. 25(5), 1111\u20131124 (2013)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"129_CR67","unstructured":"Winkler, W.: String comparator metrics and enhanced decision rules in the Fellegi\u2013Sunter model of record linkage. In: Proceedings of the Section on Survey Research Methods, pp. 354\u2013359. American Statistical Association (1990)"},{"key":"129_CR68","unstructured":"Winkler, W.E.: The state of record linkage and current research problems. In: Statistical Research Division, US Census Bureau (1999)"},{"key":"129_CR69","unstructured":"Winkler, W.E.: Methods for record linkage and Bayesian networks. Technical Report, Series RRS2002\/05, U.S. Bureau of the Census (2002)"},{"key":"129_CR70","doi-asserted-by":"crossref","unstructured":"Winkler, W.E.: Overview of record linkage and current research directions. Technical Report, Bureau of the Census (2006)","DOI":"10.1002\/9780470057339.var022"},{"issue":"3","key":"129_CR71","doi-asserted-by":"publisher","first-page":"15","DOI":"10.1145\/2000824.2000825","volume":"36","author":"C Xiao","year":"2011","unstructured":"Xiao, C., Wang, W., Lin, X., Yu, J.X., Wang, G.: Efficient similarity joins for near-duplicate detection. ACM Trans. Database Syst. (TODS) 36(3), 15 (2011)","journal-title":"ACM Trans. Database Syst. (TODS)"}],"container-title":["International Journal of Data Science and Analytics"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s41060-018-0129-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s41060-018-0129-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s41060-018-0129-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,9,2]],"date-time":"2023-09-02T19:34:29Z","timestamp":1693683269000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s41060-018-0129-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,5,23]]},"references-count":71,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2018,9]]}},"alternative-id":["129"],"URL":"https:\/\/doi.org\/10.1007\/s41060-018-0129-7","relation":{},"ISSN":["2364-415X","2364-4168"],"issn-type":[{"type":"print","value":"2364-415X"},{"type":"electronic","value":"2364-4168"}],"subject":[],"published":{"date-parts":[[2018,5,23]]},"assertion":[{"value":"10 April 2017","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"30 April 2018","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 May 2018","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}