{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T15:09:05Z","timestamp":1780412945030,"version":"3.54.1"},"reference-count":39,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,10,1]],"date-time":"2026-10-01T00:00:00Z","timestamp":1790812800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,5,28]],"date-time":"2026-05-28T00:00:00Z","timestamp":1779926400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/creativecommons.org\/licenses\/by\/4.0\/"}],"funder":[{"DOI":"10.13039\/501100008132","name":"Federal University of Pernambuco","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100008132","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100015749","name":"Vale Institute of Technology Sustainable Development","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100015749","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100007382","name":"Federal University of Para","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100007382","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Sciences"],"published-print":{"date-parts":[[2026,10]]},"DOI":"10.1016\/j.ins.2026.123697","type":"journal-article","created":{"date-parts":[[2026,5,29]],"date-time":"2026-05-29T15:14:17Z","timestamp":1780067657000},"page":"123697","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["Enhancing classifier evaluation: A difficulty-aware benchmarking strategy based on ability and robustness"],"prefix":"10.1016","volume":"754","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-3838-3214","authenticated-orcid":false,"given":"Lucas Felipe Ferraro","family":"Cardoso","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7960-3079","authenticated-orcid":false,"given":"Vitor Cirilo Araujo","family":"Santos","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8836-4188","authenticated-orcid":false,"given":"Jos\u00e9 de Sousa","family":"Ribeiro Filho","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3958-064X","authenticated-orcid":false,"given":"Regiane Silva","family":"Kawasaki Franc\u00eas","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7084-1233","authenticated-orcid":false,"given":"Ricardo Bastos Cavalcante","family":"Prud\u00eancio","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4139-0562","authenticated-orcid":false,"given":"Ronnie Cley de Oliveira","family":"Alves","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"1","key":"10.1016\/j.ins.2026.123697_bib0005","first-page":"32","article-title":"Conceitos sobre aprendizado de m\u00e1quina","volume":"1","author":"Monard","year":"2003","journal-title":"Sist. intel.-Fundam. apl."},{"issue":"10","key":"10.1016\/j.ins.2026.123697_bib0010","doi-asserted-by":"crossref","first-page":"78","DOI":"10.1145\/2347736.2347755","article-title":"A few useful things to know about machine learning","volume":"55","author":"Domingos","year":"2012","journal-title":"Commun. ACM"},{"key":"10.1016\/j.ins.2026.123697_bib0015","author":"Dua"},{"issue":"2","key":"10.1016\/j.ins.2026.123697_bib0020","doi-asserted-by":"crossref","first-page":"49","DOI":"10.1145\/2641190.2641198","article-title":"OpenML: networked science in machine learning","volume":"15","author":"Vanschoren","year":"2014","journal-title":"ACM SIGKDD Explor. Newsl."},{"key":"10.1016\/j.ins.2026.123697_bib0025","first-page":"11","article-title":"OpenML benchmarking suites and the OpenML100","volume":"1050","author":"Bischl","year":"2017","journal-title":"stat"},{"key":"10.1016\/j.ins.2026.123697_bib0030","doi-asserted-by":"crossref","first-page":"18","DOI":"10.1016\/j.artint.2018.09.004","article-title":"Item response theory in AI: analysing machine learning classifiers at the instance level","volume":"271","author":"Mart\u00ednez-Plumed","year":"2019","journal-title":"Artif. Intell."},{"issue":"6641","key":"10.1016\/j.ins.2026.123697_bib0035","doi-asserted-by":"crossref","first-page":"136","DOI":"10.1126\/science.adf6369","article-title":"Rethink reporting of evaluation results in AI","volume":"380","author":"Burnell","year":"2023","journal-title":"Science"},{"issue":"5","key":"10.1016\/j.ins.2026.123697_bib0040","article-title":"Efficient and robust model benchmarks with item response theory and adaptive testing","volume":"6","author":"Song","year":"2021","journal-title":"Int. J. Interact. Multimed. Artif. Intell."},{"issue":"1","key":"10.1016\/j.ins.2026.123697_bib0045","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1109\/TCIAIG.2014.2346242","article-title":"Predicting dominance rankings for score-based games","volume":"8","author":"Samothrakis","year":"2014","journal-title":"IEEE Trans. Comput. Intell. AI Games"},{"key":"10.1016\/j.ins.2026.123697_bib0050","series-title":"Example of the Glicko-2 system","first-page":"1","author":"Glickman","year":"2012"},{"issue":"8","key":"10.1016\/j.ins.2026.123697_bib0055","doi-asserted-by":"crossref","first-page":"4376","DOI":"10.1109\/TFUZZ.2024.3397697","article-title":"3WC-gbnrs++: a novel three-way classifier with granular-ball neighborhood rough sets based on uncertainty","volume":"32","author":"Yang","year":"2024","journal-title":"IEEE Trans. Fuzzy Syst."},{"issue":"10","key":"10.1016\/j.ins.2026.123697_bib0060","doi-asserted-by":"crossref","first-page":"3681","DOI":"10.1109\/TFUZZ.2025.3596066","article-title":"CS3w-gbg: a cost-sensitive three-way granular-ball generation method","volume":"33","author":"Yang","year":"2025","journal-title":"IEEE Trans. Fuzzy Syst."},{"issue":"15","key":"10.1016\/j.ins.2026.123697_bib0065","doi-asserted-by":"crossref","first-page":"3044","DOI":"10.3390\/electronics14153044","article-title":"Network-aware Gaussian mixture models for multi-objective SD-WAN controller placement","volume":"14","author":"Abdulghani","year":"2025","journal-title":"Electronics"},{"issue":"4","key":"10.1016\/j.ins.2026.123697_bib0070","doi-asserted-by":"crossref","first-page":"52","DOI":"10.3390\/network5040052","article-title":"Dynamic multi-objective controller placement in SD-WAN: a GMM-MARL hybrid framework","volume":"5","author":"Abdulghani","year":"2025","journal-title":"Network"},{"issue":"5","key":"10.1016\/j.ins.2026.123697_bib0075","doi-asserted-by":"crossref","first-page":"819","DOI":"10.3390\/diagnostics16050819","article-title":"Optimization-driven hybrid machine learning framework for brain tumor classification in MRI with metaheuristic feature selection","volume":"16","author":"\u00d6zkan","year":"2026","journal-title":"Diagnostics"},{"issue":"3","key":"10.1016\/j.ins.2026.123697_bib0080","doi-asserted-by":"crossref","first-page":"148","DOI":"10.3390\/fractalfract9030148","article-title":"A new approach based on metaheuristic optimization using chaotic functional connectivity matrices and fractal dimension analysis for AI-driven detection of orthodontic growth and development stage","volume":"9","author":"Cicek","year":"2025","journal-title":"Fractal Fract."},{"key":"10.1016\/j.ins.2026.123697_bib0085","series-title":"Brazilian Conference on Intelligent Systems","first-page":"412","article-title":"Decoding machine learning benchmarks","author":"Cardoso","year":"2020"},{"key":"10.1016\/j.ins.2026.123697_bib0090","series-title":"An Introduction to Machine Learning","author":"Kubat","year":"2017"},{"issue":"1","key":"10.1016\/j.ins.2026.123697_bib0095","doi-asserted-by":"crossref","first-page":"27","DOI":"10.1016\/j.patrec.2008.08.010","article-title":"An experimental comparison of performance measures for classification","volume":"30","author":"Ferri","year":"2009","journal-title":"Pattern Recognit. Lett."},{"issue":"7","key":"10.1016\/j.ins.2026.123697_bib0100","doi-asserted-by":"crossref","DOI":"10.1016\/j.patter.2025.101317","article-title":"OpenML: insights from 10 years and more than a thousand papers","volume":"6","author":"Bischl","year":"2025","journal-title":"Patterns"},{"key":"10.1016\/j.ins.2026.123697_bib0105","series-title":"The Basics of Item Response Theory","author":"Baker","year":"2001"},{"issue":"4","key":"10.1016\/j.ins.2026.123697_bib0110","doi-asserted-by":"crossref","first-page":"453","DOI":"10.1177\/014662168400800409","article-title":"Comparison of IRT true-score and equipercentile observed-score \u201cequatings\u201d","volume":"8","author":"Lord","year":"1984","journal-title":"Appl. Psychol. Meas."},{"key":"10.1016\/j.ins.2026.123697_bib0115","series-title":"The Rating of Chessplayers, Past and Present","author":"Elo","year":"1978"},{"key":"10.1016\/j.ins.2026.123697_bib0120","doi-asserted-by":"crossref","first-page":"656","DOI":"10.1016\/j.ins.2014.02.154","article-title":"A chess rating system for evolutionary algorithms: a new method for the comparison and ranking of evolutionary algorithms","volume":"277","author":"Ve\u010dek","year":"2014","journal-title":"Inf. Sci."},{"issue":"2","key":"10.1016\/j.ins.2026.123697_bib0125","doi-asserted-by":"crossref","first-page":"121","DOI":"10.1109\/TG.2018.2883773","article-title":"Dual indicators to analyze AI benchmarks: difficulty, discrimination, ability, and generality","volume":"12","author":"Martinez-Plumed","year":"2018","journal-title":"IEEE Trans. Games"},{"key":"10.1016\/j.ins.2026.123697_bib0130","doi-asserted-by":"crossref","first-page":"253","DOI":"10.1613\/jair.3912","article-title":"The arcade learning environment: an evaluation platform for general agents","volume":"47","author":"Bellemare","year":"2013","journal-title":"J. Artif. Intell. Res."},{"issue":"3","key":"10.1016\/j.ins.2026.123697_bib0135","doi-asserted-by":"crossref","first-page":"229","DOI":"10.1109\/TCIAIG.2015.2402393","article-title":"The 2014 general video game playing competition","volume":"8","author":"Perez-Liebana","year":"2015","journal-title":"IEEE Trans. Comput. Intell. AI Games"},{"key":"10.1016\/j.ins.2026.123697_bib0140","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.122986","article-title":"Explanations based on item response theory (eXirt): a model-specific method to explain tree-ensemble model in trust perspective","volume":"244","author":"de Sousa Ribeiro Filho","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.ins.2026.123697_bib0145","author":"Nie"},{"key":"10.1016\/j.ins.2026.123697_bib0150","series-title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","first-page":"4110","article-title":"Dynabench: rethinking benchmarking in NLP","author":"Kiela","year":"2021"},{"key":"10.1016\/j.ins.2026.123697_bib0155","series-title":"Encontro Nacional de Intelig\u00eancia Artificial E Computacional (ENIAC)","first-page":"499","article-title":"Beyond random sampling: instance quality-based data partitioning via item response theory","author":"Cardoso","year":"2025"},{"key":"10.1016\/j.ins.2026.123697_bib0160","series-title":"Statistical Theories of Mental Test Scores. 1968","author":"Lord","year":"1968"},{"key":"10.1016\/j.ins.2026.123697_bib0165","first-page":"2825","article-title":"Scikit-Learn: machine learning in Python","volume":"12","author":"Pedregosa","year":"2011","journal-title":"J. mach. Learn. res."},{"issue":"5","key":"10.1016\/j.ins.2026.123697_bib0170","doi-asserted-by":"crossref","first-page":"1","DOI":"10.18637\/jss.v017.i05","article-title":"ltm: an R package for latent variable modeling and item response theory analyses","volume":"17","author":"Rizopoulos","year":"2006","journal-title":"J. Stat. Softw."},{"key":"10.1016\/j.ins.2026.123697_bib0175","author":"Gautier"},{"key":"10.1016\/j.ins.2026.123697_bib0180","article-title":"Periodic Progress Report 4, ROARS Project ESPRIT II-Number 5516","volume":"79","author":"Alinat","year":"1993"},{"key":"10.1016\/j.ins.2026.123697_bib0185","author":"Meneghetti"},{"key":"10.1016\/j.ins.2026.123697_bib0190","series-title":"Proceedings of the 26th Annual International Conference on Machine Learning","first-page":"41","article-title":"Curriculum learning","author":"Bengio","year":"2009"},{"key":"10.1016\/j.ins.2026.123697_bib0195","series-title":"2014 13th International Conference on Machine Learning and Applications","first-page":"183","article-title":"Reducing the effects of detrimental instances","author":"Smith","year":"2014"}],"container-title":["Information Sciences"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0020025526006286?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0020025526006286?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T14:21:37Z","timestamp":1780410097000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0020025526006286"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,10]]},"references-count":39,"alternative-id":["S0020025526006286"],"URL":"https:\/\/doi.org\/10.1016\/j.ins.2026.123697","relation":{},"ISSN":["0020-0255"],"issn-type":[{"value":"0020-0255","type":"print"}],"subject":[],"published":{"date-parts":[[2026,10]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Enhancing classifier evaluation: A difficulty-aware benchmarking strategy based on ability and robustness","name":"articletitle","label":"Article Title"},{"value":"Information Sciences","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.ins.2026.123697","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 The Author(s). Published by Elsevier Inc.","name":"copyright","label":"Copyright"}],"article-number":"123697"}}