{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,24]],"date-time":"2026-07-24T10:42:00Z","timestamp":1784889720369,"version":"3.55.0"},"reference-count":70,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,6,1]],"date-time":"2026-06-01T00:00:00Z","timestamp":1780272000000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100012166","name":"National Key Research and Development Program of China","doi-asserted-by":"publisher","award":["2023YFE0204000"],"award-info":[{"award-number":["2023YFE0204000"]}],"id":[{"id":"10.13039\/501100012166","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100005847","name":"Health and Medical Research Fund","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100005847","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003452","name":"Innovation and Technology Commission","doi-asserted-by":"publisher","award":["MHP\/002\/22"],"award-info":[{"award-number":["MHP\/002\/22"]}],"id":[{"id":"10.13039\/501100003452","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100003452","name":"Innovation and Technology Commission","doi-asserted-by":"publisher","award":["GHP\/006\/22GD"],"award-info":[{"award-number":["GHP\/006\/22GD"]}],"id":[{"id":"10.13039\/501100003452","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100002920","name":"University Grants Committee Research Grants Council","doi-asserted-by":"publisher","award":["T45-401\/22-N"],"award-info":[{"award-number":["T45-401\/22-N"]}],"id":[{"id":"10.13039\/501100002920","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100005407","name":"Hong Kong Health Bureau","doi-asserted-by":"publisher","award":["20211021"],"award-info":[{"award-number":["20211021"]}],"id":[{"id":"10.13039\/501100005407","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Medical Image Analysis"],"published-print":{"date-parts":[[2026,6]]},"DOI":"10.1016\/j.media.2026.104027","type":"journal-article","created":{"date-parts":[[2026,3,11]],"date-time":"2026-03-11T07:49:48Z","timestamp":1773215388000},"page":"104027","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":3,"special_numbering":"C","title":["MG-3D: Multi-grained knowledge-enhanced vision-language pre-training for 3D medical image analysis"],"prefix":"10.1016","volume":"111","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-6424-7593","authenticated-orcid":false,"given":"Xuefeng","family":"Ni","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0486-184X","authenticated-orcid":false,"given":"Linshan","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-9287-4263","authenticated-orcid":false,"given":"Jiaxin","family":"Zhuang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0835-3770","authenticated-orcid":false,"given":"Qiong","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2454-1752","authenticated-orcid":false,"given":"Mingxiang","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6677-3194","authenticated-orcid":false,"given":"Varut","family":"Vardhanabhuti","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-3172-6309","authenticated-orcid":false,"given":"Lihai","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6346-0739","authenticated-orcid":false,"given":"Hanyu","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8400-3780","authenticated-orcid":false,"given":"Hao","family":"Chen","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"issue":"1","key":"10.1016\/j.media.2026.104027_bib0001","doi-asserted-by":"crossref","first-page":"4128","DOI":"10.1038\/s41467-022-30695-9","article-title":"The medical segmentation decathlon","volume":"13","author":"Antonelli","year":"2022","journal-title":"Nat. Commun."},{"key":"10.1016\/j.media.2026.104027_bib0002","unstructured":"Bai, F., Du, Y., et al. 2024. M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models. arXiv: 2404.00578."},{"issue":"11","key":"10.1016\/j.media.2026.104027_bib0003","doi-asserted-by":"crossref","first-page":"2514","DOI":"10.1109\/TMI.2018.2837502","article-title":"Deep learning techniques for automatic MRI cardiac multi-Structures segmentation and diagnosis: is the problem solved?","volume":"37","author":"Bernard","year":"2018","journal-title":"IEEE Trans. Med. Imag."},{"key":"10.1016\/j.media.2026.104027_bib0004","unstructured":"Blankemeier, L., Cohen, J. P., et al. 2024. Merlin: A Vision Language Foundation Model for 3D Computed Tomography. arXiv: 2406.06512."},{"key":"10.1016\/j.media.2026.104027_bib0005","series-title":"CVPR","first-page":"11238","article-title":"Bootstrapping chest CT image understanding by distilling knowledge from X-ray expert models","author":"Cao","year":"2024"},{"key":"10.1016\/j.media.2026.104027_bib0006","first-page":"12546","article-title":"Contrastive learning of global and local features for medical image segmentation with limited annotations","volume":"33","author":"Chaitanya","year":"2020","journal-title":"NeurIPS"},{"key":"10.1016\/j.media.2026.104027_bib0007","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2019.101539","article-title":"Self-supervised learning for medical image analysis using image context restoration","volume":"58","author":"Chen","year":"2019","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0008","series-title":"ICASSP","first-page":"1","article-title":"Enhancing 3D medical image understanding with 2D multimodal large language models","author":"Chen","year":"2025"},{"key":"10.1016\/j.media.2026.104027_bib0009","unstructured":"Chen, Y., Liu, C., et al. 2023a. Generative Text-Guided 3D Vision-Language Pretraining for Unified Medical Image Segmentation. arXiv: 2306.04811."},{"key":"10.1016\/j.media.2026.104027_bib0010","series-title":"WACV","first-page":"1970","article-title":"Masked image modeling advances 3D medical image analysis","author":"Chen","year":"2023"},{"key":"10.1016\/j.media.2026.104027_bib0011","series-title":"ICCV","first-page":"23403","article-title":"Towards unifying medical vision-and-Language pre-Training via soft prompts","author":"Chen","year":"2023"},{"key":"10.1016\/j.media.2026.104027_bib0012","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.103018","article-title":"Mapping medical image-text to a joint space via masked modeling","volume":"91","author":"Chen","year":"2024","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0013","series-title":"ACM Mm","first-page":"5152","article-title":"Align, reason and learn: enhancing medical vision-and-Language pre-training with knowledge","author":"Chen","year":"2022"},{"key":"10.1016\/j.media.2026.104027_bib0014","series-title":"ICCV","first-page":"21361","article-title":"PRIOR: Prototype representation joint learning from medical images and reports","author":"Cheng","year":"2023"},{"key":"10.1016\/j.media.2026.104027_bib0015","series-title":"MICCAI","first-page":"605","article-title":"Vox2vec: a framework for self-supervised contrastive learning of voxel-Level representations in medical images","author":"Goncharov","year":"2023"},{"issue":"10","key":"10.1016\/j.media.2026.104027_bib0016","doi-asserted-by":"crossref","first-page":"2857","DOI":"10.1109\/TMI.2021.3060634","article-title":"Transferable visual words: exploiting the semantics of anatomical patterns for self-Supervised learning","volume":"40","author":"Haghighi","year":"2021","journal-title":"IEEE Trans. Med. Imag."},{"key":"10.1016\/j.media.2026.104027_bib0017","unstructured":"Hamamci, I. E., Er, S., et al. 2024. A Foundation Model Utilizing Chest CT Volumes and Radiology Reports for Supervised-Level Zero-Shot Detection of Abnormalities. arXiv: 2403.17834."},{"key":"10.1016\/j.media.2026.104027_bib0018","series-title":"International MICCAI Brain Lesion Workshop","first-page":"272","article-title":"Swin UNETR: swin transformers for semantic segmentation of brain tumors in MRI images","author":"Hatamizadeh","year":"2021"},{"key":"10.1016\/j.media.2026.104027_bib0019","series-title":"WACV","first-page":"574","article-title":"UNETR: Transformers for 3D medical image segmentation","author":"Hatamizadeh","year":"2022"},{"key":"10.1016\/j.media.2026.104027_bib0020","series-title":"CVPR","first-page":"16000","article-title":"Masked autoencoders are scalable vision learners","author":"He","year":"2022"},{"key":"10.1016\/j.media.2026.104027_bib0021","first-page":"2006","article-title":"Benchmarking deep learning models and automated model design for COVID-19 detection with chest CT scans","author":"He","year":"2020","journal-title":"MedRxiv"},{"key":"10.1016\/j.media.2026.104027_bib0022","series-title":"ECCV","first-page":"123","article-title":"Unified medical image pre-training in language-Guided common semantic space","author":"He","year":"2025"},{"key":"10.1016\/j.media.2026.104027_bib0023","doi-asserted-by":"crossref","first-page":"172","DOI":"10.1109\/RBME.2024.3496744","article-title":"Foundation model for advancing healthcare: challenges, opportunities and future directions","volume":"18","author":"He","year":"2025","journal-title":"IEEE Rev. Biomed. Eng."},{"key":"10.1016\/j.media.2026.104027_bib0024","series-title":"CVPR","first-page":"9538","article-title":"Geometric visual similarity learning in 3D medical image self-Supervised pre-Training","author":"He","year":"2023"},{"key":"10.1016\/j.media.2026.104027_bib0025","series-title":"CVPR","first-page":"17980","article-title":"Scaling up vision-Language pre-Training for image captioning","author":"Hu","year":"2022"},{"key":"10.1016\/j.media.2026.104027_bib0026","series-title":"ICLR","article-title":"Unleashing the potential of vision-Language pre-Training for 3D zero-Shot lesion segmentation via mask-Attribute alignment","author":"Jiang","year":"2025"},{"key":"10.1016\/j.media.2026.104027_bib0027","series-title":"ICCV","first-page":"15859","article-title":"Anatomical invariance modeling and semantic alignment for self-supervised learning in 3D medical image analysis","author":"Jiang","year":"2023"},{"key":"10.1016\/j.media.2026.104027_bib0028","unstructured":"Lei, W., Chen, H., et al. 2025. A Data-efficient Pan-tumor Foundation Model for Oncology CT Interpretation. arXiv: 2502.06171."},{"key":"10.1016\/j.media.2026.104027_bib0029","series-title":"ICLR","article-title":"How well do supervised models transfer to 3D image segmentation?","volume":"Vol. 1","author":"Li","year":"2024"},{"key":"10.1016\/j.media.2026.104027_bib0030","unstructured":"Lin, J., Xia, Y., et al. 2024. CT-GLIP: 3D Grounded Language-Image Pretraining with CT Scans and Radiology Reports for Full-Body Scenarios. arXiv: 2404.15272."},{"issue":"12","key":"10.1016\/j.media.2026.104027_bib0031","doi-asserted-by":"crossref","first-page":"3579","DOI":"10.1109\/TMI.2023.3294980","article-title":"Improving medical vision-language contrastive pretraining with semantics-aware triage","volume":"42","author":"Liu","year":"2023","journal-title":"IEEE Trans. Med. Imag."},{"issue":"1","key":"10.1016\/j.media.2026.104027_bib0032","doi-asserted-by":"crossref","first-page":"519","DOI":"10.1109\/TMI.2024.3449690","article-title":"IMITATE: Clinical prior guided hierarchical vision-Language pre-training","volume":"44","author":"Liu","year":"2025","journal-title":"IEEE Trans. Med. Imag."},{"key":"10.1016\/j.media.2026.104027_bib0033","unstructured":"Liu, C., Ouyang, C., et al. 2023b. T3D: Towards 3D Medical Image Understanding through Vision-Language Pre-training. arXiv: 2312.01529."},{"key":"10.1016\/j.media.2026.104027_bib0034","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2024.103226","article-title":"Universal and extensible language-vision models for organ segmentation and tumor detection from abdominal computed tomography","volume":"97","author":"Liu","year":"2024","journal-title":"Med. Image Anal."},{"issue":"1","key":"10.1016\/j.media.2026.104027_bib0035","doi-asserted-by":"crossref","first-page":"3647","DOI":"10.1038\/s41467-025-58798-z","article-title":"A large model for non-invasive and personalized management of breast cancer from multiparametric MRI","volume":"16","author":"Luo","year":"2025","journal-title":"Nat. Commun."},{"issue":"1","key":"10.1016\/j.media.2026.104027_bib0036","doi-asserted-by":"crossref","DOI":"10.1148\/radiol.221263","article-title":"Patient exposure from radiologic and nuclear medicine procedures in the united states and worldwide: 2009\u20132018","volume":"307","author":"Mahesh","year":"2023","journal-title":"Radiol."},{"key":"10.1016\/j.media.2026.104027_bib0037","series-title":"ECCV","first-page":"69","article-title":"Unsupervised learning of visual representations by solving jigsaw puzzles","author":"Noroozi","year":"2016"},{"key":"10.1016\/j.media.2026.104027_bib0038","unstructured":"Qiu, Z., Wang, X., et al. 2025. Large-scale Multi-sequence Pretraining for Generalizable MRI Analysis in Versatile Clinical Applications. arXiv: 2508.07165."},{"issue":"1","key":"10.1016\/j.media.2026.104027_bib0039","doi-asserted-by":"crossref","first-page":"E361","DOI":"10.1148\/radiol.2021210384","article-title":"Study of thoracic CT in COVID-19: the STOIC project","volume":"301","author":"Revel","year":"2021","journal-title":"Radiol."},{"key":"10.1016\/j.media.2026.104027_bib0040","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2022.102605","article-title":"Rapid artificial intelligence solutions in a pandemic\u2013The COVID-19-20 lung CT lesion segmentation challenge","volume":"82","author":"Roth","year":"2022","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0041","doi-asserted-by":"crossref","first-page":"1","DOI":"10.1016\/j.media.2017.06.015","article-title":"Validation, comparison, and combination of algorithms for automatic detection of pulmonary nodules in computed tomography images: the LUNA16 challenge","volume":"42","author":"Setio","year":"2017","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0042","series-title":"ICLR","article-title":"Large-scale and fine-grained vision-language pre-training for enhanced CT image understanding","author":"Shui","year":"2025"},{"key":"10.1016\/j.media.2026.104027_bib0043","series-title":"CVPR","first-page":"20730","article-title":"Self-Supervised pre-Training of swin transformers for 3D medical image analysis","author":"Tang","year":"2022"},{"key":"10.1016\/j.media.2026.104027_bib0044","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.121442","article-title":"Work like a doctor: unifying scan localizer and dynamic generator for automated computed tomography report generation","volume":"237","author":"Tang","year":"2024","journal-title":"Expert Syst. Appl."},{"key":"10.1016\/j.media.2026.104027_bib0045","unstructured":"Wang, G., J., W., et al. 2023a. MIS-FM: 3D Medical Image Segmentation using Foundation Models Pretrained on a Large-Scale Unannotated Dataset. arXiv: 2306.16925."},{"key":"10.1016\/j.media.2026.104027_bib0046","series-title":"CVPR","first-page":"6598","article-title":"All in one: exploring unified video-Language pre-Training","author":"Wang","year":"2023"},{"issue":"12","key":"10.1016\/j.media.2026.104027_bib0047","doi-asserted-by":"crossref","first-page":"4224","DOI":"10.1109\/TMI.2024.3418408","article-title":"MCPL: Multi-modal collaborative prompt learning for medical vision-Language model","volume":"43","author":"Wang","year":"2024","journal-title":"IEEE Trans. Med. Imag."},{"key":"10.1016\/j.media.2026.104027_bib0048","series-title":"Miccai","first-page":"486","article-title":"SwinMM: masked multi-view with swin transformers for 3D medical image segmentation","author":"Wang","year":"2023"},{"key":"10.1016\/j.media.2026.104027_bib0049","doi-asserted-by":"crossref","unstructured":"Wang, Z., Wu, Z., et al. 2022. MedCLIP: Contrastive Learning from Unpaired Medical Images and Text. arXiv: 2210.10163.","DOI":"10.18653\/v1\/2022.emnlp-main.256"},{"key":"10.1016\/j.media.2026.104027_bib0050","unstructured":"Wu, C., Zhang, X., et al. 2023. Towards Generalist Foundation Model for Radiology. arXiv: 2308.02463."},{"key":"10.1016\/j.media.2026.104027_bib0051","unstructured":"Wu, L., Zhuang, J., et al. 2024a. Large-Scale 3D Medical Image Pre-training with Geometric Context Priors. arXiv: 2410.09890."},{"key":"10.1016\/j.media.2026.104027_bib0052","series-title":"Cvpr","first-page":"22873","article-title":"Voco: a simple-yet-Effective volume contrastive learning framework for 3D medical image analysis","author":"Wu","year":"2024"},{"key":"10.1016\/j.media.2026.104027_bib0053","doi-asserted-by":"crossref","unstructured":"Wu, L., Zhuang, J., et al. 2025. Freetumor: Large-scale generative tumor synthesis in computed tomography images for improving tumor recognition. arXiv: 2502.18519.","DOI":"10.1038\/s41467-025-66071-6"},{"key":"10.1016\/j.media.2026.104027_bib0054","article-title":"Doremi: optimizing data mixtures speeds up language model pretraining","volume":"36","author":"Xie","year":"2024","journal-title":"NeurIPS"},{"issue":"12","key":"10.1016\/j.media.2026.104027_bib0055","doi-asserted-by":"crossref","first-page":"10021","DOI":"10.1109\/TPAMI.2024.3436105","article-title":"UnimiSS+: universal medical self-Supervised learning from cross-Dimensional unpaired data","volume":"46","author":"Xie","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.media.2026.104027_bib0056","series-title":"Cvpr","first-page":"1179","article-title":"ULIP: Learning a unified representation of language, images, and point clouds for 3D understanding","author":"Xue","year":"2023"},{"issue":"4","key":"10.1016\/j.media.2026.104027_bib0057","doi-asserted-by":"crossref","DOI":"10.1148\/ryai.210258","article-title":"RadBERT: adapting transformer-based language models to radiology","volume":"4","author":"Yan","year":"2022","journal-title":"Radiol. Artif. Intell."},{"key":"10.1016\/j.media.2026.104027_bib0058","series-title":"Aaai","first-page":"2982","article-title":"Clinical-BERT: vision-Language pre-training for radiograph diagnosis and reports generation","volume":"36","author":"Yan","year":"2022"},{"key":"10.1016\/j.media.2026.104027_bib0059","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102798","article-title":"Radiology report generation with a learned knowledge base and multi-modal alignment","volume":"86","author":"Yang","year":"2023","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0060","article-title":"Core-Periphery multi-Modality feature alignment for zero-Shot medical image analysis","author":"Yu","year":"2024","journal-title":"IEEE Trans. Med. Imag."},{"key":"10.1016\/j.media.2026.104027_bib0061","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102879","article-title":"Dive into the details of self-supervised learning for medical image analysis","volume":"89","author":"Zhang","year":"2023","journal-title":"Med. Image Anal."},{"issue":"8","key":"10.1016\/j.media.2026.104027_bib0062","doi-asserted-by":"crossref","first-page":"5625","DOI":"10.1109\/TPAMI.2024.3369699","article-title":"Vision-Language models for vision tasks: a survey","volume":"46","author":"Zhang","year":"2024","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.media.2026.104027_bib0063","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102996","article-title":"On the challenges and perspectives of foundation models for medical image analysis","volume":"91","author":"Zhang","year":"2024","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0064","series-title":"Iccv","first-page":"3499","article-title":"Preservational learning improves self-Supervised medical image models by reconstructing diverse contexts","author":"Zhou","year":"2021"},{"key":"10.1016\/j.media.2026.104027_bib0065","unstructured":"Zhou, H., Lian, C., et al. 2023a. Advancing radiograph representation learning with masked record modeling. arXiv: 2301.13155."},{"issue":"7","key":"10.1016\/j.media.2026.104027_bib0066","first-page":"8020","article-title":"A unified visual information preservation framework for self-supervised pre-Training in medical image analysis","volume":"45","author":"Zhou","year":"2023","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"10.1016\/j.media.2026.104027_bib0067","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2020.101840","article-title":"Models genesis","volume":"67","author":"Zhou","year":"2021","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0068","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2020.101746","article-title":"Rubik\u2019S cube+: a self-supervised feature learning framework for 3d medical image analysis","volume":"64","author":"Zhu","year":"2020","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104027_bib0069","article-title":"Advancing volumetric medical image segmentation via global-Local masked autoencoders","author":"Zhuang","year":"2025","journal-title":"IEEE Trans. Med. Imag."},{"key":"10.1016\/j.media.2026.104027_bib0070","article-title":"MiM: Mask in mask self-Supervised pre-Training for 3D medical image analysis","author":"Zhuang","year":"2025","journal-title":"IEEE Trans. Med. Imag."}],"container-title":["Medical Image Analysis"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526000964?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526000964?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,5,15]],"date-time":"2026-05-15T00:09:35Z","timestamp":1778803775000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1361841526000964"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,6]]},"references-count":70,"alternative-id":["S1361841526000964"],"URL":"https:\/\/doi.org\/10.1016\/j.media.2026.104027","relation":{},"ISSN":["1361-8415"],"issn-type":[{"value":"1361-8415","type":"print"}],"subject":[],"published":{"date-parts":[[2026,6]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"MG-3D: Multi-grained knowledge-enhanced vision-language pre-training for 3D medical image analysis","name":"articletitle","label":"Article Title"},{"value":"Medical Image Analysis","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.media.2026.104027","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104027"}}