{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T05:52:58Z","timestamp":1778824378139,"version":"3.51.4"},"reference-count":33,"publisher":"Springer Science and Business Media LLC","issue":"2","license":[{"start":{"date-parts":[[2017,3,16]],"date-time":"2017-03-16T00:00:00Z","timestamp":1489622400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["J Supercomput"],"published-print":{"date-parts":[[2019,2]]},"DOI":"10.1007\/s11227-017-2008-8","type":"journal-article","created":{"date-parts":[[2017,3,16]],"date-time":"2017-03-16T08:13:47Z","timestamp":1489652027000},"page":"623-645","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":3,"title":["Unsupervised blocking and probabilistic parallelisation for record matching of distributed big data"],"prefix":"10.1007","volume":"75","author":[{"given":"Chenxiao","family":"Dou","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yi","family":"Cui","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Daniel","family":"Sun","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Raymond","family":"Wong","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Muhammad","family":"Atif","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guoqiang","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Rajiv","family":"Ranjan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2017,3,16]]},"reference":[{"key":"2008_CR1","doi-asserted-by":"crossref","unstructured":"Elmagarmid AK, Ipeirotis PG, Verykios VS (2007) Duplicate record detection: a survey. IEEE Trans Knowl Data Eng 19(1):1","DOI":"10.1109\/TKDE.2007.250581"},{"key":"2008_CR2","doi-asserted-by":"crossref","unstructured":"Bilenko M, Kamath B, Mooney RJ (2006) Adaptive blocking: learning to scale up record linkage. In: ICDM\u201906 Sixth International Conference on Data Mining (IEEE, 2006), pp 87\u201396","DOI":"10.1109\/ICDM.2006.13"},{"key":"2008_CR3","unstructured":"Michelson M, Knoblock CA (2006) Learning blocking schemes for record linkage. In: Proceedings of the National Conference on Artificial Intelligence, vol\u00a021. (Menlo Park, CA; Cambridge, MA; London; AAAI Press; MIT Press; 1999, 2006), p 440"},{"key":"2008_CR4","doi-asserted-by":"crossref","unstructured":"Whang SE, Menestrina D, Koutrika G, Theobald M, Garcia-Molina H (2009) Entity resolution with iterative blocking. In: SIGMOD Conference, pp 219\u2013232","DOI":"10.1145\/1559845.1559870"},{"key":"2008_CR5","doi-asserted-by":"crossref","unstructured":"Dou C, Sun D, Wong R (2016) Unsupervised blocking of imbalanced datasets for record matching. In: International Conference on Web Information Systems Engineering. Springer, Berlin","DOI":"10.1007\/978-3-319-48743-4_14"},{"key":"2008_CR6","doi-asserted-by":"publisher","unstructured":"Dou C, Sun D, Chen YC, Li G, Liu J (2016) Probabilistic parallelisation of blocking non-matched records for big data. In: 2016 IEEE International Conference on Big Data (Big Data), pp 3465\u20133473. doi: 10.1109\/BigData.2016.7841009","DOI":"10.1109\/BigData.2016.7841009"},{"key":"2008_CR7","unstructured":"Chaudhuri S, Chen BC, Ganti V, Kaushik R (2007) Example-driven design of efficient record matching queries. In: Proceedings of the 33rd International Conference on Very Large Data Bases (VLDB Endowment), pp 327\u2013338"},{"key":"2008_CR8","unstructured":"Bilenko M, Mooney RJ (2003) On evaluation and training-set construction for duplicate detection. In: Proceedings of the KDD-2003 Workshop on Data Cleaning, Record Linkage, and Object Consolidation, pp 7\u201312"},{"key":"2008_CR9","doi-asserted-by":"crossref","unstructured":"Arasu A, G\u00f6tz M, Kaushik R (2010) On active learning of record matching packages. In: Proceedings of the 2010 ACM SIGMOD International Conference on Management of Data (ACM), pp 783\u2013794","DOI":"10.1145\/1807167.1807252"},{"key":"2008_CR10","doi-asserted-by":"crossref","unstructured":"Sarawagi S, Bhamidipaty A (2002) Interactive deduplication using active learning. In: KDD. ACM, pp 269\u2013278","DOI":"10.1145\/775047.775087"},{"key":"2008_CR11","first-page":"45","volume":"2","author":"S Tong","year":"2001","unstructured":"Tong S, Koller D (2001) Support vector machine active learning with applications to text classification. J Mach Learn Res 2:45","journal-title":"J Mach Learn Res"},{"key":"2008_CR12","doi-asserted-by":"crossref","unstructured":"Tejada S, Knoblock CA, Minton S (2002) Learning domain-independent string transformation weights for high accuracy object identification. In: Proceedings of the Eighth ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. ACM, pp 350\u2013359","DOI":"10.1145\/775047.775099"},{"key":"2008_CR13","volume-title":"Handbook of record linkage: methods for health and statistical studies, administration, and business","author":"HB Newcombe","year":"1988","unstructured":"Newcombe HB (1988) Handbook of record linkage: methods for health and statistical studies, administration, and business. Oxford University Press, Oxford"},{"key":"2008_CR14","doi-asserted-by":"publisher","unstructured":"Wang R, Sun D, Li G, Atif M, Nepal S, LogProv (2016) Logging events as provenance of big data analytics pipelines with trustworthiness. In: 2016 IEEE International Conference on Big Data (Big Data), pp 1402\u20131411. doi: 10.1109\/BigData.2016.7840748","DOI":"10.1109\/BigData.2016.7840748"},{"issue":"2","key":"2008_CR15","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1109\/MS.2016.35","volume":"33","author":"D Wu","year":"2016","unstructured":"Wu D, Zhu L, Xu X, Sakr S, Sun D, Lu Q (2016) Building pipelines for heterogeneous execution environments for big data processing. IEEE Softw 33(2):60. doi: 10.1109\/MS.2016.35","journal-title":"IEEE Softw"},{"key":"2008_CR16","doi-asserted-by":"publisher","unstructured":"Akbudak K, Aykanat C (2017) Exploiting locality in sparse matrix\u2013matrix multiplication on many-core architectures. IEEE Trans Parallel Distrib Syst PP(99):1\u20131. doi: 10.1109\/TPDS.2017.2656893","DOI":"10.1109\/TPDS.2017.2656893"},{"key":"2008_CR17","doi-asserted-by":"crossref","unstructured":"Kunfang S, Lu H (2016) Efficient querying distributed big-XML data using MapReduce. Int J Grid High Perform Comput 8(3):70","DOI":"10.4018\/IJGHPC.2016070105"},{"issue":"4","key":"2008_CR18","doi-asserted-by":"publisher","first-page":"979","DOI":"10.1109\/TKDE.2014.2357018","volume":"27","author":"Q Zeng","year":"2015","unstructured":"Zeng Q, Zhao M, Liu P, Yadav P, Calo S, Lobo J (2015) Enforcement of autonomous authorizations in collaborative distributed query evaluation. IEEE Trans Knowl Data Eng 27(4):979","journal-title":"IEEE Trans Knowl Data Eng"},{"issue":"3","key":"2008_CR19","doi-asserted-by":"publisher","first-page":"489","DOI":"10.1007\/s10766-013-0288-z","volume":"43","author":"K Slagter","year":"2015","unstructured":"Slagter K, Hsu CH, Chung YC (2015) An adaptive and memory efficient sampling mechanism for partitioning in MapReduce. Int J Parallel Program 43(3):489","journal-title":"Int J Parallel Program"},{"key":"2008_CR20","doi-asserted-by":"crossref","unstructured":"Christen P, Churches T, Hegland M (2004) Febrl\u2014a parallel open source data linkage system. In: Pacific-Asia Conference on Knowledge Discovery and Data Mining. Springer, Berlin, pp 638\u2013647","DOI":"10.1007\/978-3-540-24775-3_75"},{"key":"2008_CR21","doi-asserted-by":"crossref","unstructured":"Kim Hs, Lee D (2007) Parallel linkage. In: Proceedings of the Sixteenth ACM Conference on Conference on Information and Knowledge Management. ACM, pp 283\u2013292","DOI":"10.1145\/1321440.1321482"},{"key":"2008_CR22","doi-asserted-by":"crossref","unstructured":"Efthymiou V, Stefanidis K, Christophides V (2015) Big data entity resolution: from highly to somehow similar entity descriptions in the Web. In: 2015 IEEE International Conference on Big Data (Big Data). IEEE, pp 401\u2013410","DOI":"10.1109\/BigData.2015.7363781"},{"issue":"9","key":"2008_CR23","doi-asserted-by":"publisher","first-page":"1537","DOI":"10.1109\/TKDE.2011.127","volume":"24","author":"P Christen","year":"2012","unstructured":"Christen P (2012) A survey of indexing techniques for scalable record linkage and deduplication. IEEE Trans Knowl Data Eng 24(9):1537","journal-title":"IEEE Trans Knowl Data Eng"},{"issue":"12","key":"2008_CR24","doi-asserted-by":"publisher","first-page":"1878","DOI":"10.14778\/2367502.2367527","volume":"5","author":"L Kolb","year":"2012","unstructured":"Kolb L, Thor A, Rahm E (2012) Dedoop: efficient deduplication with Hadoop. Proc VLDB Endow 5(12):1878","journal-title":"Proc VLDB Endow"},{"key":"2008_CR25","doi-asserted-by":"crossref","unstructured":"Hern\u00e1ndez MA, Stolfo SJ (1995) The merge\/purge problem for large databases. In: ACM Sigmod Record, vol\u00a024. ACM, pp 127\u2013138","DOI":"10.1145\/568271.223807"},{"issue":"1","key":"2008_CR26","doi-asserted-by":"publisher","first-page":"45","DOI":"10.1007\/s00450-011-0177-x","volume":"27","author":"L Kolb","year":"2012","unstructured":"Kolb L, Thor A, Rahm E (2012) Multi-pass sorted neighborhood blocking with MapReduce. Comput Sci Res Dev 27(1):45","journal-title":"Comput Sci Res Dev"},{"key":"2008_CR27","doi-asserted-by":"crossref","unstructured":"Efthymiou V, Papadakis G, Papastefanatos G, Stefanidis K, Palpanas T (2015) Parallel meta-blocking: realizing scalable entity resolution over large, heterogeneous data. In: 2015 IEEE International Conference on Big Data (Big Data). IEEE, pp 411\u2013420","DOI":"10.1109\/BigData.2015.7363782"},{"issue":"8","key":"2008_CR28","doi-asserted-by":"publisher","first-page":"1946","DOI":"10.1109\/TKDE.2013.54","volume":"26","author":"G Papadakis","year":"2014","unstructured":"Papadakis G, Koutrika G, Palpanas T, Nejdl W (2014) Meta-blocking: taking entity resolutionto the next level. IEEE Trans Knowl Data Eng 26(8):1946","journal-title":"IEEE Trans Knowl Data Eng"},{"issue":"3","key":"2008_CR29","doi-asserted-by":"publisher","first-page":"739","DOI":"10.1016\/j.future.2012.09.001","volume":"29","author":"L Wang","year":"2013","unstructured":"Wang L, Tao J, Ranjan R, Marten H, Streit A, Chen J, Chen D (2013) G-Hadoop: MapReduce across distributed data centers for data-intensive computing. Future Gener Comput Syst 29(3):739","journal-title":"Future Gener Comput Syst"},{"issue":"1","key":"2008_CR30","doi-asserted-by":"publisher","first-page":"74","DOI":"10.1109\/TC.2013.121","volume":"63","author":"C Jayalath","year":"2014","unstructured":"Jayalath C, Stephen J, Eugster P (2014) From the cloud to the atmosphere: running mapreduce across data centers. IEEE Trans Comput 63(1):74","journal-title":"IEEE Trans Comput"},{"key":"2008_CR31","doi-asserted-by":"crossref","unstructured":"Luo Y, Plale B (2012) Hierarchical mapreduce programming model and scheduling algorithms. In: Proceedings of the 2012 12th IEEE\/ACM International Symposium on Cluster, Cloud and Grid Computing (Ccgrid 2012). IEEE Computer Society, pp 769\u2013774","DOI":"10.1109\/CCGrid.2012.132"},{"issue":"1","key":"2008_CR32","doi-asserted-by":"publisher","first-page":"2","DOI":"10.1504\/IJBDI.2015.067563","volume":"2","author":"T Shabeera","year":"2015","unstructured":"Shabeera T, Madhu Kumar S (2015) Optimising virtual machine allocation in MapReduce cloud for improved data locality. Int J Big Data Intell 2(1):2","journal-title":"Int J Big Data Intell"},{"key":"2008_CR33","doi-asserted-by":"publisher","first-page":"43","DOI":"10.1016\/j.future.2015.04.006","volume":"53","author":"CH Hsu","year":"2015","unstructured":"Hsu CH, Slagter KD, Chung YC (2015) Locality and loading aware virtual machine mapping techniques for optimizing communications in mapreduce applications. Future Gener Comput Syst 53:43","journal-title":"Future Gener Comput Syst"}],"container-title":["The Journal of Supercomputing"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11227-017-2008-8\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-017-2008-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11227-017-2008-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,9,19]],"date-time":"2019-09-19T20:33:37Z","timestamp":1568925217000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11227-017-2008-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,3,16]]},"references-count":33,"journal-issue":{"issue":"2","published-print":{"date-parts":[[2019,2]]}},"alternative-id":["2008"],"URL":"https:\/\/doi.org\/10.1007\/s11227-017-2008-8","relation":{},"ISSN":["0920-8542","1573-0484"],"issn-type":[{"value":"0920-8542","type":"print"},{"value":"1573-0484","type":"electronic"}],"subject":[],"published":{"date-parts":[[2017,3,16]]},"assertion":[{"value":"16 March 2017","order":1,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}