{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T20:57:30Z","timestamp":1781643450848,"version":"3.54.5"},"reference-count":31,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2026,3,20]],"date-time":"2026-03-20T00:00:00Z","timestamp":1773964800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"},{"start":{"date-parts":[[2026,4,9]],"date-time":"2026-04-09T00:00:00Z","timestamp":1775692800000},"content-version":"vor","delay-in-days":20,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0"}],"funder":[{"DOI":"10.13039\/501100002352","name":"Ain Shams University","doi-asserted-by":"crossref","id":[{"id":"10.13039\/501100002352","id-type":"DOI","asserted-by":"crossref"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["BioData Mining"],"abstract":"<jats:title>Abstract<\/jats:title>\n                  <jats:sec>\n                    <jats:title>Background<\/jats:title>\n                    <jats:p>Block-wise missingness is a common challenge in multi-omics data, hindering the development of robust and generalizable machine learning models, as real-world cohorts rarely contain complete omic profiles. Many current methods either discard incomplete samples, use available-case models that need retraining when faced with new missingness patterns, or depend on full-dataset imputation, which can risk biological integrity and model stability.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Methods<\/jats:title>\n                    <jats:p>Using a complete four-omics breast cancer dataset (705 patients, 1,937 features), up to 60% block-wise missingness was simulated across five clinically relevant scenarios and used to compare four strategies for handling missing data: an Imputation-Based model, Dynamic and Exhaustive Available-Case approaches, and the proposed Hybrid Approach that combines profile-guided modeling with selective, test-time imputation. Performance was evaluated using accuracy, F1 score, balanced accuracy, inference time, and variability across 15 random seeds, with significance assessed using the Wilcoxon signed-rank test.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Results<\/jats:title>\n                    <jats:p>The Hybrid Approach consistently achieved the strongest and most stable performance. Relative to the complete-data baseline, it reached an average accuracy of 103.7%, F1 score of 123.3%, and balanced accuracy of 104.8%, outperforming the Imputation-Based method and matching or exceeding both Dynamic and Exhaustive Available-Case strategies. Statistical testing confirmed that these improvements were significant. The method also demonstrated fast and predictable inference (~\u20092\u00a0s) and an average total runtime of ~\u200949\u00a0s per configuration\u2014nearly three times faster than the Exhaustive approach (~\u2009124\u00a0s)\u2014while maintaining high reproducibility and low variance across seeds, a key indicator of computational stability.<\/jats:p>\n                  <\/jats:sec>\n                  <jats:sec>\n                    <jats:title>Conclusion<\/jats:title>\n                    <jats:p>By selectively combining lightweight imputation with profile-specific modeling, the Hybrid Approach provides a computationally efficient and statistically robust solution for block-wise missing data. This framework offers a generalizable strategy for multi-omics data mining, and lays the foundation for future systems incorporating cross-profile learning and advanced imputation.<\/jats:p>\n                  <\/jats:sec>","DOI":"10.1186\/s13040-026-00530-8","type":"journal-article","created":{"date-parts":[[2026,3,20]],"date-time":"2026-03-20T15:55:36Z","timestamp":1774022136000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Profile-guided Hybrid Approach for block-wise missing data handling in multi-omics: a breast cancer case study"],"prefix":"10.1186","volume":"19","author":[{"given":"Esraa Hamdi","family":"Abdelaziz","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Eman","family":"Amin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rasha","family":"Ismail","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mai","family":"Mabrouk","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,3,20]]},"reference":[{"issue":"1","key":"530_CR1","doi-asserted-by":"publisher","first-page":"37","DOI":"10.1186\/s13040-025-00452-x","volume":"18","author":"R Kumar","year":"2025","unstructured":"Kumar R, Romano JD, Ritchie MD. Network-based analyses of multiomics data in biomedicine. BioData Min. 2025;18(1):37.","journal-title":"BioData Min"},{"issue":"1","key":"530_CR2","doi-asserted-by":"publisher","first-page":"38","DOI":"10.1186\/s13040-024-00391-z","volume":"17","author":"JL Ballard","year":"2024","unstructured":"Ballard JL, Wang Z, Li W, Shen L, Long Q. Deep learning-based approaches for multi-omics data integration and analysis. BioData Min. 2024;17(1):38.","journal-title":"BioData Min"},{"key":"530_CR3","doi-asserted-by":"publisher","first-page":"1098308","DOI":"10.3389\/frai.2023.1098308","volume":"6","author":"JE Flores","year":"2023","unstructured":"Flores JE, Claborne DM, Weller ZD, Webb-Robertson B-JM, Waters KM, Bramer LM. Missing data in multi-omics integration: recent advances through artificial intelligence. Front Artif Intell. 2023;6:1098308.","journal-title":"Front Artif Intell"},{"key":"530_CR4","unstructured":"Thesis M. A comparison study of prediction approaches for multiple training data sets and test data with block-wise missing values [Internet]. 2020. Available from: https:\/\/epub.ub.uni-muenchen.de\/73620\/1\/MA_Ludwigs.pdf."},{"key":"530_CR5","doi-asserted-by":"crossref","unstructured":"Hornung R, Ludwigs F, Hagenberg J. Prediction approaches for partly missing multi-omics covariate data: a literature review and an empirical comparison study. Wiley Interdisciplinary [Internet]. 2024; Available from: https:\/\/sci-hub.ren\/wires.onlinelibrary.wiley.com\/doi\/abs\/10.1002\/wics.1626.","DOI":"10.1002\/wics.1626"},{"issue":"10","key":"530_CR6","doi-asserted-by":"publisher","first-page":"6859","DOI":"10.1007\/s10489-021-02225-5","volume":"51","author":"Q Lan","year":"2021","unstructured":"Lan Q, Jiang S. A method of credit evaluation modeling based on block-wise missing data. Appl Intell. 2021;51(10):6859\u201380.","journal-title":"Appl Intell"},{"issue":"1\u20132","key":"530_CR7","doi-asserted-by":"publisher","first-page":"e202400100","DOI":"10.1002\/pmic.202400100","volume":"25","author":"Y Schumann","year":"2025","unstructured":"Schumann Y, Gocke A, Neumann JE. Computational methods for data integration and imputation of missing values in omics datasets. Proteomics. 2025;25(1\u20132):e202400100.","journal-title":"Proteomics"},{"issue":"8","key":"530_CR8","doi-asserted-by":"publisher","first-page":"1278","DOI":"10.1093\/bioinformatics\/bty796","volume":"35","author":"X Dong","year":"2019","unstructured":"Dong X, Lin L, Zhang R, Zhao Y, Christiani DC, Wei Y, et al. TOBMI: trans-omics block missing data imputation using a k-nearest neighbor weighted approach. Bioinformatics. 2019;35(8):1278\u201383.","journal-title":"Bioinformatics"},{"issue":"536","key":"530_CR9","doi-asserted-by":"publisher","first-page":"1914","DOI":"10.1080\/01621459.2020.1751176","volume":"116","author":"F Xue","year":"2021","unstructured":"Xue F, Qu A. Integrating multisource block-wise missing data in model selection. J Am Stat Assoc. 2021;116(536):1914\u201327.","journal-title":"J Am Stat Assoc"},{"key":"530_CR10","doi-asserted-by":"crossref","unstructured":"Klau S, Jurinovic V, Hornung R, Herold T, Boulesteix A-L. Priority-Lasso: a simple hierarchical approach to the prediction of clinical outcome using multi-omics data. BMC Bioinformatics. 2018 Sept 12;19(1):322.","DOI":"10.1186\/s12859-018-2344-6"},{"key":"530_CR11","doi-asserted-by":"crossref","unstructured":"To KT, Fry RC, Reif DM. Characterizing the effects of missing data and evaluating imputation methods for chemical prioritization applications using ToxPi. BioData Min. 2018 June;13:11:10.","DOI":"10.1186\/s13040-018-0169-5"},{"issue":"4","key":"530_CR12","doi-asserted-by":"publisher","first-page":"742","DOI":"10.1021\/jasms.4c00434","volume":"36","author":"DD Krutkin","year":"2025","unstructured":"Krutkin DD, Thomas S, Zuffa S, Rajkumar P, Knight R, Dorrestein PC, et al. To impute or not to impute in untargeted metabolomicsthat is the compositional question. J Am Soc Mass Spectrom. 2025;36(4):742\u201359.","journal-title":"J Am Soc Mass Spectrom"},{"issue":"Pt 3","key":"530_CR13","first-page":"468","volume":"15","author":"M Ingalhalikar","year":"2012","unstructured":"Ingalhalikar M, Parker WA, Bloy L, Roberts TPL, Verma R. Using multiparametric data with missing features for learning patterns of pathology. Med Image Comput Comput Assist Interv. 2012;15(Pt 3):468\u201375.","journal-title":"Med Image Comput Comput Assist Interv"},{"key":"530_CR14","doi-asserted-by":"crossref","unstructured":"Yuan L, Wang Y, Thompson PM, Narayan VA, Ye J. Alzheimer\u2019s disease neuroimaging initiative. multi-source feature learning for joint analysis of incomplete multiple heterogeneous neuroimaging data. Neuroimage. 2012 July 2;61(3):622\u201332.","DOI":"10.1016\/j.neuroimage.2012.03.059"},{"key":"530_CR15","doi-asserted-by":"publisher","first-page":"192","DOI":"10.1016\/j.neuroimage.2013.08.015","volume":"102","author":"S Xiang","year":"2014","unstructured":"Xiang S, Yuan L, Fan W, Wang Y, Thompson PM, Ye J, et al. Bi-level multi-source learning for heterogeneous block-wise missing data. NeuroImage. 2014;102:192\u2013206.","journal-title":"NeuroImage"},{"key":"530_CR16","doi-asserted-by":"crossref","unstructured":"Krautenbacher N, Flach N, B\u00f6ck A, Laubhahn K, Laimighofer M, Theis FJ, et al. A strategy for high-dimensional multivariable analysis classifies childhood asthma phenotypes from genetic, immunological, and environmental factors. Allergy. 2019 July;74(7):1364\u201373.","DOI":"10.1111\/all.13745"},{"key":"530_CR17","doi-asserted-by":"crossref","unstructured":"Baena-Miret S, Reverter F, Vegas E. A framework for block-wise missing data in multi-omics. PLoS One. 2024 July 23;19(7):e0307482.","DOI":"10.1371\/journal.pone.0307482"},{"issue":"7","key":"530_CR18","doi-asserted-by":"publisher","first-page":"3650","DOI":"10.3390\/app15073650","volume":"15","author":"S Baena-Miret","year":"2025","unstructured":"Baena-Miret S, Reverter F, S\u00e1nchez A, Vegas E. A two-step algorithm for handling block-wise missing data in multi-omics. Appl Sci (Basel). 2025;15(7):3650.","journal-title":"Appl Sci (Basel)"},{"key":"530_CR19","unstructured":"Yoon J, Jordon J, Schaar M, Gain. Missing data imputation using generative adversarial nets. In: International conference on machine learning PMLR. 2018."},{"key":"530_CR20","unstructured":"Deepmf Li Z. Deep Matrix Factorization for Multi-Omics Data Integration. Bioinformatics. 2020."},{"key":"530_CR21","doi-asserted-by":"crossref","unstructured":"Argelaguet R. Multi-Omics factor analysis (MOFA+) enables comprehensive integration of multi-modal single-cell data sets. Molecular Systems Biology; 2020.","DOI":"10.1186\/s13059-020-02015-1"},{"issue":"3","key":"530_CR22","doi-asserted-by":"publisher","first-page":"e1010921","DOI":"10.1371\/journal.pcbi.1010921","volume":"19","author":"H Benkirane","year":"2023","unstructured":"Benkirane H, Pradat Y, Michiels S, Courn\u00e8de P-H, CustOmics. A versatile deep-learning based strategy for multi-omics integration. PLoS Comput Biol. 2023;19(3):e1010921.","journal-title":"PLoS Comput Biol"},{"key":"530_CR23","unstructured":"[cited 2025 June 14]. Available from: https:\/\/www.kaggle.com\/datasets\/samdemharter\/brca-multiomics-tcga"},{"key":"530_CR24","unstructured":"Han J, Kamber M, Pei J. Data mining: concepts and techniques. Morgan Kaufmann; 2011."},{"issue":"1","key":"530_CR25","doi-asserted-by":"publisher","first-page":"5","DOI":"10.1023\/A:1010933404324","volume":"45","author":"L Breiman","year":"2001","unstructured":"Breiman L. Mach Learn. 2001;45(1):5\u201332.","journal-title":"Mach Learn"},{"key":"530_CR26","doi-asserted-by":"crossref","unstructured":"Chen T, Guestrin C. XGBoost. In: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining. New York, NY, USA: ACM; 2016;785\u201394.","DOI":"10.1145\/2939672.2939785"},{"key":"530_CR27","unstructured":"Ke G, Meng Q, Finley T, Wang T, Chen W, Ma W, et al. LightGBM: a highly efficient gradient boosting decision tree. Neural Inf Process Syst. 2017;3146\u201354."},{"issue":"8","key":"530_CR28","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J. Long short-term memory. Neural Comput. 1997;9(8):1735\u201380.","journal-title":"Neural Comput"},{"key":"530_CR29","doi-asserted-by":"crossref","unstructured":"Lin T-Y, Goyal P, Girshick R, He K, Doll\u00e1r P. Focal loss for dense object detection. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV. 2017. pp. 2980\u20138.","DOI":"10.1109\/ICCV.2017.324"},{"key":"530_CR30","unstructured":"Kingma DP, Ba J, Adam. A method for stochastic optimization [Internet]. arXiv [cs.LG]. 2014. Available from: http:\/\/arxiv.org\/abs\/1412.6980"},{"key":"530_CR31","unstructured":"Hastie T, Tibshirani R, Sherlock G, Eisen M, Brown P, Botstein D. Imputing missing data for gene expression arrays. 1999."}],"container-title":["BioData Mining"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/article\/10.1186\/s13040-026-00530-8","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13040-026-00530-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1186\/s13040-026-00530-8.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T20:34:30Z","timestamp":1781642070000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1186\/s13040-026-00530-8"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3,20]]},"references-count":31,"journal-issue":{"issue":"1","published-online":{"date-parts":[[2026,12]]}},"alternative-id":["530"],"URL":"https:\/\/doi.org\/10.1186\/s13040-026-00530-8","relation":{},"ISSN":["1756-0381"],"issn-type":[{"value":"1756-0381","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3,20]]},"assertion":[{"value":"28 November 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 February 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"20 March 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"Not applicable. This study used publicly available, de-identified data and did not involve human participants, human tissue, or require institutional ethical approval.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethics approval and consent to participate"}},{"value":"Not applicable. No individual person\u2019s data are included in this study.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Consent for publication"}},{"value":"The authors declare no competing interests.","order":4,"name":"Ethics","group":{"name":"EthicsHeading","label":"Competing interests"}}],"article-number":"23"}}