{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T07:47:00Z","timestamp":1785829620173,"version":"3.56.0"},"reference-count":41,"publisher":"Elsevier BV","license":[{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,9,1]],"date-time":"2026-09-01T00:00:00Z","timestamp":1788220800000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100004853","name":"Chinese University of Hong Kong","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100004853","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Medical Image Analysis"],"published-print":{"date-parts":[[2026,9]]},"DOI":"10.1016\/j.media.2026.104189","type":"journal-article","created":{"date-parts":[[2026,7,4]],"date-time":"2026-07-04T15:20:08Z","timestamp":1783178408000},"page":"104189","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"C","title":["HiVLR: Hierarchical Vision-Language Reasoning for interpretable zero-shot radiography image understanding"],"prefix":"10.1016","volume":"113","author":[{"given":"Xilin","family":"Dang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0149-6912","authenticated-orcid":false,"given":"Kang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Pheng Ann","family":"Heng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.media.2026.104189_b1","series-title":"Publicly available clinical BERT embeddings","author":"Alsentzer","year":"2019"},{"key":"10.1016\/j.media.2026.104189_b2","doi-asserted-by":"crossref","unstructured":"Bannur, S., Hyland, S., Liu, Q., Perez-Garcia, F., Ilse, M., Castro, D.C., Boecking, B., Sharma, H., Bouzid, K., Thieme, A., et al., 2023. Learning to exploit temporal structure for biomedical vision-language processing. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 15016\u201315027.","DOI":"10.1109\/CVPR52729.2023.01442"},{"key":"10.1016\/j.media.2026.104189_b3","series-title":"European Conference on Computer Vision","first-page":"1","article-title":"Making the most of text semantics to improve biomedical vision\u2013language processing","author":"Boecking","year":"2022"},{"key":"10.1016\/j.media.2026.104189_b4","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2020.101797","article-title":"Padchest: A large chest x-ray image dataset with multi-label annotated reports","volume":"66","author":"Bustos","year":"2020","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104189_b5","series-title":"2018 IEEE Winter Conference on Applications of Computer Vision","first-page":"839","article-title":"Grad-cam++: Generalized gradient-based visual explanations for deep convolutional networks","author":"Chattopadhay","year":"2018"},{"key":"10.1016\/j.media.2026.104189_b6","series-title":"International Conference on Machine Learning","first-page":"1597","article-title":"A simple framework for contrastive learning of visual representations","author":"Chen","year":"2020"},{"issue":"1","key":"10.1016\/j.media.2026.104189_b7","doi-asserted-by":"crossref","first-page":"414","DOI":"10.1038\/s41597-020-00741-6","article-title":"Chest imaging representing a COVID-19 positive rural US population","volume":"7","author":"Desai","year":"2020","journal-title":"Sci. Data"},{"key":"10.1016\/j.media.2026.104189_b8","series-title":"An image is worth 16x16 words: Transformers for image recognition at scale","author":"Dosovitskiy","year":"2020"},{"key":"10.1016\/j.media.2026.104189_b9","series-title":"Proceedings of the Thirty-First International Joint Conference on Artificial Intelligence","first-page":"5436","article-title":"A survey of vision-language pre-trained models","author":"Du","year":"2022"},{"issue":"14","key":"10.1016\/j.media.2026.104189_b10","doi-asserted-by":"crossref","first-page":"2322","DOI":"10.3390\/math13142322","article-title":"Analyzing diagnostic reasoning of vision\u2013language models via zero-shot chain-of-thought prompting in medical visual question answering","volume":"13","author":"Faria","year":"2025","journal-title":"Mathematics"},{"key":"10.1016\/j.media.2026.104189_b11","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J., 2016. Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 770\u2013778.","DOI":"10.1109\/CVPR.2016.90"},{"key":"10.1016\/j.media.2026.104189_b12","series-title":"Pathohr: Hierarchical reasoning for vision-language models in pathology","author":"Huang","year":"2025"},{"key":"10.1016\/j.media.2026.104189_b13","doi-asserted-by":"crossref","unstructured":"Huang, S.-C., Shen, L., Lungren, M.P., Yeung, S., 2021. Gloria: A multimodal global-local representation learning framework for label-efficient medical image recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 3942\u20133951.","DOI":"10.1109\/ICCV48922.2021.00391"},{"key":"10.1016\/j.media.2026.104189_b14","first-page":"590","article-title":"Chexpert: A large chest radiograph dataset with uncertainty labels and expert comparison","volume":"vol. 33","author":"Irvin","year":"2019"},{"key":"10.1016\/j.media.2026.104189_b15","series-title":"Radgraph: Extracting clinical entities and relations from radiology reports","author":"Jain","year":"2021"},{"issue":"1","key":"10.1016\/j.media.2026.104189_b16","doi-asserted-by":"crossref","first-page":"317","DOI":"10.1038\/s41597-019-0322-0","article-title":"MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports","volume":"6","author":"Johnson","year":"2019","journal-title":"Sci. Data"},{"key":"10.1016\/j.media.2026.104189_b17","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"225","article-title":"Concept bottleneck with visual concept filtering for explainable medical image classification","author":"Kim","year":"2023"},{"key":"10.1016\/j.media.2026.104189_b18","series-title":"International Conference on Machine Learning","first-page":"5338","article-title":"Concept bottleneck models","author":"Koh","year":"2020"},{"issue":"6","key":"10.1016\/j.media.2026.104189_b19","doi-asserted-by":"crossref","first-page":"1595","DOI":"10.1148\/rg.266065168","article-title":"RadLex: a new method for indexing online educational materials","volume":"26","author":"Langlotz","year":"2006","journal-title":"Radiographics"},{"key":"10.1016\/j.media.2026.104189_b20","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2025.102995","article-title":"Vision-language models in medical image analysis: From simple fusion to general large models","volume":"118","author":"Li","year":"2025","journal-title":"Inf. Fusion"},{"key":"10.1016\/j.media.2026.104189_b21","series-title":"International Conference on Machine Learning","first-page":"19730","article-title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","author":"Li","year":"2023"},{"key":"10.1016\/j.media.2026.104189_b22","series-title":"International Conference on Machine Learning","first-page":"12888","article-title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","author":"Li","year":"2022"},{"key":"10.1016\/j.media.2026.104189_b23","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2025.103514","article-title":"Integrating language into medical visual recognition and reasoning: A survey","volume":"102","author":"Lu","year":"2025","journal-title":"Med. Image Anal."},{"key":"10.1016\/j.media.2026.104189_b24","series-title":"Representation learning with contrastive predictive coding","author":"Oord","year":"2018"},{"key":"10.1016\/j.media.2026.104189_b25","doi-asserted-by":"crossref","DOI":"10.3389\/fmed.2022.861680","article-title":"Covid-net cxr-2: An enhanced deep convolutional neural network design for detection of covid-19 cases from chest x-ray images","volume":"9","author":"Pavlova","year":"2022","journal-title":"Front. Med."},{"key":"10.1016\/j.media.2026.104189_b26","doi-asserted-by":"crossref","unstructured":"Phan, V.M.H., Xie, Y., Qi, Y., Liu, L., Liu, L., Zhang, B., Liao, Z., Wu, Q., To, M.-S., Verjans, J.W., 2024. Decomposing Disease Descriptions for Enhanced Pathology Detection: A Multi-Aspect Vision-Language Pre-training Framework. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 11492\u201311501.","DOI":"10.1109\/CVPR52733.2024.01092"},{"key":"10.1016\/j.media.2026.104189_b27","series-title":"International Conference on Machine Learning","first-page":"8748","article-title":"Learning transferable visual models from natural language supervision","author":"Radford","year":"2021"},{"key":"10.1016\/j.media.2026.104189_b28","doi-asserted-by":"crossref","unstructured":"Selvaraju, R.R., Cogswell, M., Das, A., Vedantam, R., Parikh, D., Batra, D., 2017. Grad-cam: Visual explanations from deep networks via gradient-based localization. In: Proceedings of the IEEE International Conference on Computer Vision. pp. 618\u2013626.","DOI":"10.1109\/ICCV.2017.74"},{"issue":"1","key":"10.1016\/j.media.2026.104189_b29","article-title":"Augmenting the national institutes of health chest radiograph dataset with expert annotations of possible pneumonia","volume":"1","author":"Shih","year":"2019","journal-title":"Radiol.: Artif. Intell."},{"key":"10.1016\/j.media.2026.104189_b30","doi-asserted-by":"crossref","unstructured":"Taleb, A., Kirchler, M., Monti, R., Lippert, C., 2022. Contig: Self-supervised multimodal contrastive learning for medical imaging with genetics. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition. pp. 20908\u201320921.","DOI":"10.1109\/CVPR52688.2022.02024"},{"issue":"12","key":"10.1016\/j.media.2026.104189_b31","doi-asserted-by":"crossref","first-page":"1399","DOI":"10.1038\/s41551-022-00936-9","article-title":"Expert-level detection of pathologies from unannotated chest X-ray images via self-supervised learning","volume":"6","author":"Tiu","year":"2022","journal-title":"Nat. Biomed. Eng."},{"key":"10.1016\/j.media.2026.104189_b32","doi-asserted-by":"crossref","unstructured":"Wang, X., Peng, Y., Lu, L., Lu, Z., Bagheri, M., Summers, R.M., 2017. Chestx-ray8: Hospital-scale chest x-ray database and benchmarks on weakly-supervised classification and localization of common thorax diseases. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 2097\u20132106.","DOI":"10.1109\/CVPR.2017.369"},{"issue":"1","key":"10.1016\/j.media.2026.104189_b33","doi-asserted-by":"crossref","first-page":"17","DOI":"10.1038\/s44387-025-00015-9","article-title":"Vision-language foundation model for 3D medical imaging","volume":"1","author":"Wu","year":"2025","journal-title":"Npj Artif. Intell."},{"key":"10.1016\/j.media.2026.104189_b34","doi-asserted-by":"crossref","unstructured":"Wu, C., Zhang, X., Zhang, Y., Wang, Y., Xie, W., 2023. Medklip: Medical knowledge enhanced language-image pre-training for x-ray diagnosis. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 21372\u201321383.","DOI":"10.1109\/ICCV51070.2023.01954"},{"key":"10.1016\/j.media.2026.104189_b35","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"13","article-title":"Medim: Boost medical image representation via radiology report-guided masking","author":"Xie","year":"2023"},{"key":"10.1016\/j.media.2026.104189_b36","doi-asserted-by":"crossref","unstructured":"Yang, Q., Li, W., Li, B., Yuan, Y., 2023. Mrm: Masked relation modeling for medical image pre-training with genetics. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision. pp. 21452\u201321462.","DOI":"10.1109\/ICCV51070.2023.01961"},{"key":"10.1016\/j.media.2026.104189_b37","series-title":"Filip: Fine-grained interactive language-image pre-training","author":"Yao","year":"2021"},{"key":"10.1016\/j.media.2026.104189_b38","series-title":"International Conference on Medical Image Computing and Computer-Assisted Intervention","first-page":"658","article-title":"Anatomy-guided weakly-supervised abnormality localization in chest x-rays","author":"Yu","year":"2022"},{"key":"10.1016\/j.media.2026.104189_b39","series-title":"SIIM-ACR pneumothorax segmentation","author":"Zawacki","year":"2019"},{"key":"10.1016\/j.media.2026.104189_b40","series-title":"Machine Learning for Healthcare Conference","first-page":"2","article-title":"Contrastive learning of medical visual representations from paired images and text","author":"Zhang","year":"2022"},{"key":"10.1016\/j.media.2026.104189_b41","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A., 2016. Learning deep features for discriminative localization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. pp. 2921\u20132929.","DOI":"10.1109\/CVPR.2016.319"}],"container-title":["Medical Image Analysis"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526002586?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S1361841526002586?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,8,4]],"date-time":"2026-08-04T07:04:39Z","timestamp":1785827079000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S1361841526002586"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,9]]},"references-count":41,"alternative-id":["S1361841526002586"],"URL":"https:\/\/doi.org\/10.1016\/j.media.2026.104189","relation":{},"ISSN":["1361-8415"],"issn-type":[{"value":"1361-8415","type":"print"}],"subject":[],"published":{"date-parts":[[2026,9]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"HiVLR: Hierarchical Vision-Language Reasoning for interpretable zero-shot radiography image understanding","name":"articletitle","label":"Article Title"},{"value":"Medical Image Analysis","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.media.2026.104189","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier B.V. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104189"}}