{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,11]],"date-time":"2026-07-11T15:31:08Z","timestamp":1783783868238,"version":"3.55.0"},"reference-count":50,"publisher":"Oxford University Press (OUP)","issue":"1","license":[{"start":{"date-parts":[[2021,5,6]],"date-time":"2021-05-06T00:00:00Z","timestamp":1620259200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/academic.oup.com\/journals\/pages\/open_access\/funder_policies\/chorus\/standard_publication_model"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2022,1,19]]},"abstract":"<jats:title>Abstract<\/jats:title>\n               <jats:p>A class imbalance problem plays a vital role while dealing with classes with rare number of instances. Noisy class imbalanced datasets create considerable effect on the machine learning classification of classes. Data resampling techniques commonly used for handling class imbalance problem show insignificant behavior in noisy imbalanced datasets. To cure curse of data resampling technique in noisy class imbalanced data, we have proposed improved hybrid bag-boost with proposed resampling technique model. This model contains proposed resampling technique used for handling noisy imbalanced datasets. Proposed resampling technique comprises K-Means SMOTE (Synthetic Minority Oversampling TEchnique) as an oversampling technique and edited nearest neighbor (ENN) undersampling technique used as noise removal. This resampling technique is used to mitigate noise in imbalanced datasets at three levels, i.e. first clusters datasets using K-Means clustering technique, SMOTE inside clusters for handling imbalance by inducing synthetic instances of class in minority and lastly, using ENN technique to remove instances that create noise afterwards. Experiments were performed using 11 binary imbalanced datasets by varying attribute noise percentages, and by using area under receiver operating curve as performance metrics. Experimental results confirmed that proposed model shows better results than the rest. Moreover, it is also confirmed that proposed technique performs better with an increased noise percentage in binary imbalanced datasets.<\/jats:p>","DOI":"10.1093\/comjnl\/bxab039","type":"journal-article","created":{"date-parts":[[2021,3,31]],"date-time":"2021-03-31T19:10:08Z","timestamp":1617217808000},"page":"124-138","source":"Crossref","is-referenced-by-count":58,"title":["Improved Hybrid Bag-Boost Ensemble With K-Means-SMOTE\u2013ENN Technique for Handling Noisy Class Imbalanced Data"],"prefix":"10.1093","volume":"65","author":[{"given":"Arjun","family":"Puri","sequence":"first","affiliation":[{"name":"School of Computer Science and Engineering, Shri Mata Vaishno Devi University, Katra, Jammu and Kashmir 182320, India"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Manoj","family":"Kumar Gupta","sequence":"additional","affiliation":[{"name":"School of Computer Science and Engineering, Shri Mata Vaishno Devi University, Katra, Jammu and Kashmir 182320, India"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"286","published-online":{"date-parts":[[2021,5,6]]},"reference":[{"key":"2022011721241570200_ref1","doi-asserted-by":"crossref","first-page":"429","DOI":"10.3233\/IDA-2002-6504","article-title":"The class imbalance problem: a systematic study","volume":"6","author":"Japkowicz","year":"2002","journal-title":"Intell. Data Anal."},{"key":"2022011721241570200_ref2","first-page":"111","volume-title":"Proc. Int. Conf. Artif. Intell.","author":"Japkowicz","year":"2000"},{"key":"2022011721241570200_ref3","doi-asserted-by":"crossref","first-page":"4915","DOI":"10.1016\/j.eswa.2014.02.026","article-title":"Learned lessons in credit card fraud detection from a practitioner perspective","volume":"41","author":"Dal Pozzolo","year":"2014","journal-title":"Expert Syst. Appl."},{"key":"2022011721241570200_ref4","doi-asserted-by":"crossref","first-page":"380","DOI":"10.1016\/j.patrec.2012.09.003","article-title":"A hybrid method to face class overlap and class imbalance on neural networks and multi-class scenarios","volume":"34","author":"Alejo","year":"2013","journal-title":"Pattern Recognit. Lett."},{"key":"2022011721241570200_ref5","doi-asserted-by":"crossref","first-page":"1060","DOI":"10.1057\/jors.2012.120","article-title":"On the suitability of resampling techniques for the class imbalance problem in credit scoring","volume":"64","author":"Marqu\u00e9s","year":"2013","journal-title":"J. Oper. Res. Soc."},{"key":"2022011721241570200_ref6","doi-asserted-by":"crossref","first-page":"3446","DOI":"10.1016\/j.eswa.2011.09.033","article-title":"An experimental comparison of classification algorithms for imbalanced credit scoring data sets","volume":"39","author":"Brown","year":"2012","journal-title":"Expert Syst. Appl."},{"key":"2022011721241570200_ref7","doi-asserted-by":"crossref","first-page":"23","DOI":"10.1186\/s40537-015-0029-9","article-title":"Survey of review spam detection using machine learning techniques","volume":"2","author":"Crawford","year":"2015","journal-title":"J. Big Data"},{"key":"2022011721241570200_ref8","first-page":"192","volume-title":"2008 Fourth Int. Conf. Nat. Comput.","author":"Guo","year":"2008"},{"key":"2022011721241570200_ref9","first-page":"66","article-title":"Generative oversampling for mining imbalanced datasets","author":"Liu","year":"2007","journal-title":"2007 Int. Conf. Data Min."},{"key":"2022011721241570200_ref10","doi-asserted-by":"crossref","first-page":"17","DOI":"10.1016\/j.ins.2017.05.008","article-title":"Clustering-based undersampling in class-imbalanced data","volume":"409","author":"Lin","year":"2017","journal-title":"Inf. Sci."},{"key":"2022011721241570200_ref11","first-page":"312","volume-title":"Mex. Int. Conf. Artif. Intell.","author":"Prati","year":"2004"},{"key":"2022011721241570200_ref12","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1145\/1007730.1007733","article-title":"Special issue on learning from imbalanced data sets","volume":"6","author":"Chawla","year":"2004","journal-title":"ACM SIGKDD Explore. Newslett."},{"key":"2022011721241570200_ref13","doi-asserted-by":"crossref","first-page":"40","DOI":"10.1145\/1007730.1007737","article-title":"Class imbalances versus small disjuncts","volume":"6","author":"Jo","year":"2004","journal-title":"ACM SIGKDD Explore. Newslett."},{"key":"2022011721241570200_ref14","doi-asserted-by":"crossref","first-page":"72","DOI":"10.1016\/j.eswa.2018.01.008","article-title":"An overlap-sensitive margin classifier for imbalanced and overlapping data","volume":"98","author":"Lee","year":"2018","journal-title":"Expert Syst. Appl."},{"key":"2022011721241570200_ref15","doi-asserted-by":"crossref","first-page":"146","DOI":"10.1016\/j.ins.2017.04.046","article-title":"Noise reduction a priori synthetic over-sampling for class imbalanced data sets","volume":"408","author":"Rivera","year":"2017","journal-title":"Inf. Sci."},{"key":"2022011721241570200_ref16","doi-asserted-by":"crossref","first-page":"1476","DOI":"10.1109\/TFUZZ.2017.2754998","article-title":"Fuzzy-based information decomposition for incomplete and imbalanced data learning","volume":"25","author":"Liu","year":"2017","journal-title":"IEEE Trans. Fuzzy Syst."},{"key":"2022011721241570200_ref17","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2019.112918","article-title":"Cost-sensitive ensemble of stacked denoising autoencoders for class imbalance problems in business domain","volume":"141","author":"Wong","year":"2020","journal-title":"Expert Syst. Appl."},{"key":"2022011721241570200_ref18","doi-asserted-by":"crossref","first-page":"155","DOI":"10.1145\/312129.312220","article-title":"Metacost: a general method for making classifiers cost-sensitive","author":"Domingos","year":"1999","journal-title":"Proc. Fifth ACM SIGKDD Int. Conf. Knowl. Discov. Data Min."},{"key":"2022011721241570200_ref19","doi-asserted-by":"crossref","first-page":"659","DOI":"10.1109\/TKDE.2002.1000348","article-title":"An instance-weighting method to induce cost-sensitive trees","volume":"14","author":"Ting","year":"2002","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"2022011721241570200_ref20","doi-asserted-by":"crossref","first-page":"185","DOI":"10.1109\/TSMCA.2009.2029559","article-title":"Rusboost: a hybrid approach to alleviating class imbalance","volume":"40","author":"Seiffert","year":"2009","journal-title":"IEEE Trans. Syst. Man, Cybernet. A: Syst. Hum."},{"key":"2022011721241570200_ref21","doi-asserted-by":"crossref","DOI":"10.1016\/j.patcog.2020.107262","article-title":"Radial-based undersampling for imbalanced data classification","volume":"102","author":"Koziarski","year":"2020","journal-title":"Pattern Recognit."},{"key":"2022011721241570200_ref22","doi-asserted-by":"crossref","first-page":"463","DOI":"10.1109\/TSMCC.2011.2161285","article-title":"A review on ensembles for the class imbalance problem: bagging-, boosting-, and hybrid-based approaches","volume":"42","author":"Galar","year":"2011","journal-title":"IEEE Trans. Syst. Man. Cybernet. C"},{"key":"2022011721241570200_ref23","doi-asserted-by":"crossref","first-page":"321","DOI":"10.1613\/jair.953","article-title":"Smote: synthetic minority over-sampling technique","volume":"16","author":"Chawla","year":"2002","journal-title":"J. Artif. Intell. Res."},{"key":"2022011721241570200_ref24","first-page":"878","article-title":"Borderline-smote: a new over-sampling method in imbalanced data sets learning","volume-title":"Int. Conf. Intell. Comput.","author":"Han","year":"2005"},{"key":"2022011721241570200_ref25","doi-asserted-by":"crossref","DOI":"10.1142\/S0218213013500085","article-title":"Synthetic oversampling of instances using clustering","volume":"22","author":"S\u00e1nchez","year":"2013","journal-title":"Int. J. Artif. Intell. Tools"},{"key":"2022011721241570200_ref26","doi-asserted-by":"crossref","first-page":"664","DOI":"10.1007\/s10489-011-0287-y","article-title":"Dbsmote: density-based synthetic minority over-sampling technique","volume":"36","author":"Bunkhumpornpat","year":"2012","journal-title":"Appl. Intell."},{"key":"2022011721241570200_ref27","first-page":"303","article-title":"Edited nearest neighbor rule for improving neural networks classifications","author":"Alejo","year":"2010","journal-title":"Int. Symp. Neural Netw."},{"key":"2022011721241570200_ref28","doi-asserted-by":"crossref","first-page":"387","DOI":"10.1007\/s11390-007-9054-2","article-title":"Improving software quality prediction by noise filtering techniques","volume":"22","author":"Khoshgoftaar","year":"2007","journal-title":"J. Comput. Sci. Technol."},{"key":"2022011721241570200_ref29","doi-asserted-by":"crossref","first-page":"20","DOI":"10.1145\/1007730.1007735","article-title":"A study of the behavior of several methods for balancing machine learning training data","volume":"6","author":"Batista","year":"2004","journal-title":"ACM SIGKDD Explore. Newslett."},{"key":"2022011721241570200_ref30","doi-asserted-by":"crossref","first-page":"184","DOI":"10.1016\/j.ins.2014.08.051","article-title":"Smote\u2013IPF: addressing the noisy and borderline examples problem in imbalanced classification by a re-sampling method with filtering","volume":"291","author":"S\u00e1ez","year":"2015","journal-title":"Inf. Sci."},{"key":"2022011721241570200_ref31","first-page":"31","article-title":"Imbalanced data classification: a novel re-sampling approach combining versatile improved smote and rough sets","volume-title":"IFIP Int. Conf. Comput. Inf. Syst. Ind. Manag.15th IFIP TC8 Int. Conf.","author":"Borowska","year":"2016"},{"key":"2022011721241570200_ref32","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.ins.2018.06.056","article-title":"Improving imbalanced learning through a heuristic oversampling method based on k-means and smote","volume":"465","author":"Douzas","year":"2018","journal-title":"Inf. Sci."},{"key":"2022011721241570200_ref33","first-page":"1","article-title":"Comparative analysis of resampling techniques under noisy imbalanced datasets","volume":"1","author":"Puri","year":"2019","journal-title":"2019 Int. Conf. Issues Challenges Intell. Comput. Tech."},{"key":"2022011721241570200_ref34","doi-asserted-by":"crossref","first-page":"3255","DOI":"10.1007\/s13369-016-2179-2","article-title":"A novel algorithm for imbalance data classification based on genetic algorithm improved smote","volume":"41","author":"Jiang","year":"2016","journal-title":"Arabian J. Sci. Eng."},{"key":"2022011721241570200_ref35","doi-asserted-by":"crossref","first-page":"1761","DOI":"10.1016\/j.patcog.2011.01.017","article-title":"An overview of ensemble methods for binary classifiers in multi-class problems: experimental study on one-vs-one and one-vs-all schemes","volume":"44","author":"Galar","year":"2011","journal-title":"Pattern Recognit."},{"key":"2022011721241570200_ref36","doi-asserted-by":"crossref","first-page":"19","DOI":"10.1016\/j.neucom.2018.04.089","article-title":"Radial-based oversampling for noisy imbalanced data classification","volume":"343","author":"Koziarski","year":"2019","journal-title":"Neurocomputing"},{"key":"2022011721241570200_ref37","doi-asserted-by":"crossref","first-page":"49","DOI":"10.1007\/BF00117832","article-title":"Stacked regressions","volume":"24","author":"Breiman","year":"1996","journal-title":"Machine Learn."},{"key":"2022011721241570200_ref38","doi-asserted-by":"crossref","first-page":"123","DOI":"10.1007\/BF00058655","article-title":"Bagging predictors","volume":"24","author":"Breiman","year":"1996","journal-title":"Machine Learn."},{"key":"2022011721241570200_ref39","doi-asserted-by":"crossref","first-page":"5","DOI":"10.1023\/A:1010933404324","article-title":"Random forests","volume":"45","author":"Breiman","year":"2001","journal-title":"Machine Learn."},{"key":"2022011721241570200_ref40","first-page":"24","author":"Chen","year":"2004"},{"key":"2022011721241570200_ref41","doi-asserted-by":"crossref","first-page":"119","DOI":"10.1006\/jcss.1997.1504","article-title":"A decision-theoretic generalization of on-line learning and an application to boosting","volume":"55","author":"Freund","year":"1997","journal-title":"J. Comp. Syst. Sci."},{"key":"2022011721241570200_ref42","first-page":"107","article-title":"Smoteboost: improving prediction of the minority class in boosting","volume-title":"Eur. Conf. Princ. Data Min. Knowl. Discovery","author":"Chawla","year":"2003"},{"key":"2022011721241570200_ref43","first-page":"539","article-title":"Exploratory undersampling for class-imbalance learning","volume":"39","author":"Liu","year":"2008","journal-title":"IEEE Trans. Syst. Man. Cybernet. B"},{"key":"2022011721241570200_ref44","doi-asserted-by":"crossref","first-page":"552","DOI":"10.1109\/TSMCA.2010.2084081","article-title":"Comparing boosting and bagging techniques with noisy and imbalanced data","volume":"41","author":"Khoshgoftaar","year":"2010","journal-title":"IEEE Trans. Syst. Man. Cybernet. A: Syst. Hum."},{"key":"2022011721241570200_ref45","doi-asserted-by":"crossref","first-page":"6911","DOI":"10.1007\/s11042-020-10024-2","article-title":"A class imbalance-aware review rating prediction using hybrid sampling and ensemble learning","volume":"80","author":"Mahadevan","year":"2020","journal-title":"Multimedia Tools Appl."},{"key":"2022011721241570200_ref46","first-page":"1897","article-title":"Bagboo: a scalable hybrid bagging-the-boosting model","volume":"October","author":"Pavlov","year":"2010","journal-title":"Proc. 19th ACM Int. Conf. Inf. Knowl. Manag."},{"key":"2022011721241570200_ref47","first-page":"177","article-title":"Class noise vs. attribute noise: a quantitative study","volume-title":"Artif. Intell. Rev.","author":"Zhu","year":"2004"},{"key":"2022011721241570200_ref48","doi-asserted-by":"crossref","first-page":"861","DOI":"10.1016\/j.patrec.2005.10.010","article-title":"An introduction to roc analysis","volume":"27","author":"Fawcett","year":"2006","journal-title":"Pattern Recognit. Lett."},{"key":"2022011721241570200_ref49","doi-asserted-by":"crossref","first-page":"675","DOI":"10.1080\/01621459.1937.10503522","article-title":"The use of ranks to avoid the assumption of normality implicit in the analysis of variance","volume":"32","author":"Friedman","year":"1937","journal-title":"J. Am. Stat. Assoc."},{"key":"2022011721241570200_ref50","doi-asserted-by":"crossref","first-page":"2044","DOI":"10.1016\/j.ins.2009.12.010","article-title":"Advanced nonparametric tests for multiple comparisons in the design of experiments in computational intelligence and data mining: experimental analysis of power","volume":"180","author":"Garc\u00eda","year":"2010","journal-title":"Inf. Sci."}],"container-title":["The Computer Journal"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/academic.oup.com\/comjnl\/article-pdf\/65\/1\/124\/42152296\/bxab039.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/academic.oup.com\/comjnl\/article-pdf\/65\/1\/124\/42152296\/bxab039.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,1,17]],"date-time":"2022-01-17T21:26:47Z","timestamp":1642454807000},"score":1,"resource":{"primary":{"URL":"https:\/\/academic.oup.com\/comjnl\/article\/65\/1\/124\/6262253"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,5,6]]},"references-count":50,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2021,5,6]]},"published-print":{"date-parts":[[2022,1,19]]}},"URL":"https:\/\/doi.org\/10.1093\/comjnl\/bxab039","relation":{},"ISSN":["0010-4620","1460-2067"],"issn-type":[{"value":"0010-4620","type":"print"},{"value":"1460-2067","type":"electronic"}],"subject":[],"published-other":{"date-parts":[[2022,1]]},"published":{"date-parts":[[2021,5,6]]}}}