{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,2]],"date-time":"2026-05-02T21:59:19Z","timestamp":1777759159410,"version":"3.51.4"},"publisher-location":"Cham","reference-count":41,"publisher":"Springer Nature Switzerland","isbn-type":[{"value":"9783031966248","type":"print"},{"value":"9783031966255","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,8,7]],"date-time":"2025-08-07T00:00:00Z","timestamp":1754524800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,8,7]],"date-time":"2025-08-07T00:00:00Z","timestamp":1754524800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-3-031-96625-5_11","type":"book-chapter","created":{"date-parts":[[2025,8,6]],"date-time":"2025-08-06T07:09:12Z","timestamp":1754464152000},"page":"157-171","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Taming Masked Image Modeling for\u00a0Chest X-ray Diagnosis by\u00a0Incorporating Clinical Visual Priors"],"prefix":"10.1007","author":[{"given":"Zihao","family":"Zhao","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mei","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhiming","family":"Cui","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Sheng","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qian","family":"Zhou","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Fan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qian","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dinggang","family":"Shen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,8,7]]},"reference":[{"key":"11_CR1","doi-asserted-by":"publisher","first-page":"102630","DOI":"10.1016\/j.media.2022.102630","volume":"82","author":"M Alsharid","year":"2022","unstructured":"Alsharid, M., Cai, Y., Sharma, H., Drukker, L., Papageorghiou, A.T., Noble, J.A.: Gaze-assisted automatic captioning of fetal ultrasound videos using three-way multi-modal deep neural networks. Med. Image Anal. 82, 102630 (2022)","journal-title":"Med. Image Anal."},{"issue":"5","key":"11_CR2","doi-asserted-by":"publisher","first-page":"C75","DOI":"10.12968\/hmed.2019.80.5.C75","volume":"80","author":"T Bansal","year":"2019","unstructured":"Bansal, T., Beese, R.: Interpreting a chest x-ray. Br. J. Hosp. Med. 80(5), C75\u2013C79 (2019)","journal-title":"Br. J. Hosp. Med."},{"key":"11_CR3","unstructured":"Bao, H., Dong, L., Piao, S., Wei, F.: BEit: BERT pre-training of image transformers. In: International Conference on Learning Representations (2022), https:\/\/openreview.net\/forum?id=p-BhZSz59o4"},{"key":"11_CR4","doi-asserted-by":"crossref","unstructured":"Bigolin\u00a0Lanfredi, R., et al.: Reflacx, a dataset of reports and eye-tracking data for localization of abnormalities in chest x-rays. Sci. Data 9(1), 350 (2022)","DOI":"10.1038\/s41597-022-01441-z"},{"issue":"8","key":"11_CR5","doi-asserted-by":"publisher","first-page":"2292","DOI":"10.1109\/JBHI.2020.2967084","volume":"24","author":"B Chen","year":"2020","unstructured":"Chen, B., Li, J., Lu, G., Yu, H., Zhang, D.: Label co-occurrence learning with graph convolutional networks for multi-label chest x-ray image classification. IEEE J. Biomed. Health Inform. 24(8), 2292\u20132302 (2020)","journal-title":"IEEE J. Biomed. Health Inform."},{"issue":"3","key":"11_CR6","doi-asserted-by":"publisher","first-page":"802","DOI":"10.1109\/TMI.2016.2629462","volume":"36","author":"S Chen","year":"2016","unstructured":"Chen, S., et al.: Automatic scoring of multiple semantic attributes with multi-task feature leverage: a study on pulmonary nodules in ct images. IEEE Trans. Med. Imaging 36(3), 802\u2013814 (2016)","journal-title":"IEEE Trans. Med. Imaging"},{"key":"11_CR7","doi-asserted-by":"publisher","first-page":"101949","DOI":"10.1016\/j.media.2020.101949","volume":"69","author":"Z Cui","year":"2021","unstructured":"Cui, Z., et al.: Tsegnet: an efficient and accurate tooth segmentation network on 3d dental model. Med. Image Anal. 69, 101949 (2021)","journal-title":"Med. Image Anal."},{"key":"11_CR8","doi-asserted-by":"crossref","unstructured":"Devlin, J., Chang, M.W., Lee, K., Toutanova, K.: Bert: pre-training of deep bidirectional transformers for language understanding. In: Proceedings of the 2019 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long and Short Papers), pp. 4171\u20134186 (2019)","DOI":"10.18653\/v1\/N19-1423"},{"key":"11_CR9","unstructured":"Dosovitskiy, A., et al.: An image is worth 16x16 words: transformers for image recognition at scale. In: International Conference on Learning Representations (2021), https:\/\/openreview.net\/forum?id=YicbFdNTTy"},{"key":"11_CR10","doi-asserted-by":"publisher","first-page":"101545","DOI":"10.1016\/j.media.2019.101545","volume":"58","author":"J Fan","year":"2019","unstructured":"Fan, J., Cao, X., Wang, Q., Yap, P.T., Shen, D.: Adversarial learning for mono-or multi-modal registration. Med. Image Anal. 58, 101545 (2019)","journal-title":"Med. Image Anal."},{"key":"11_CR11","doi-asserted-by":"publisher","first-page":"222","DOI":"10.1109\/RBME.2021.3115703","volume":"15","author":"MK Ghalati","year":"2021","unstructured":"Ghalati, M.K., Nunes, A., Ferreira, H., Serranho, P., Bernardes, R.: Texture analysis and its applications in biomedical imaging: a survey. IEEE Rev. Biomed. Eng. 15, 222\u2013246 (2021)","journal-title":"IEEE Rev. Biomed. Eng."},{"key":"11_CR12","doi-asserted-by":"crossref","unstructured":"He, K., Chen, X., Xie, S., Li, Y., Doll\u00e1r, P., Girshick, R.: Masked autoencoders are scalable vision learners. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 16000\u201316009 (2022)","DOI":"10.1109\/CVPR52688.2022.01553"},{"key":"11_CR13","doi-asserted-by":"crossref","unstructured":"Holste, G., et\u00a0al.: Towards long-tailed, multi-label disease classification from chest x-ray: Overview of the cxr-lt challenge. Med. Image Anal. 103224 (2024)","DOI":"10.1016\/j.media.2024.103224"},{"key":"11_CR14","doi-asserted-by":"crossref","unstructured":"Huang, S.C., Shen, L., Lungren, M.P., Yeung, S.: Gloria: a multimodal global-local representation learning framework for label-efficient medical image recognition. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 3942\u20133951 (2021)","DOI":"10.1109\/ICCV48922.2021.00391"},{"issue":"5","key":"11_CR15","doi-asserted-by":"publisher","first-page":"949","DOI":"10.1109\/TBME.2017.2676129","volume":"65","author":"X Huang","year":"2017","unstructured":"Huang, X., et al.: Identification of ultrasonic echolucent carotid plaques using discrete fr\u00e9chet distance between bimodal gamma distributions. IEEE Trans. Biomed. Eng. 65(5), 949\u2013955 (2017)","journal-title":"IEEE Trans. Biomed. Eng."},{"key":"11_CR16","doi-asserted-by":"crossref","unstructured":"Ibragimov, B., Mello-Thoms, C.: The use of machine learning in eye tracking studies in medical imaging: a review. IEEE J. Biomed. Health Inf. (2024)","DOI":"10.1109\/JBHI.2024.3371893"},{"key":"11_CR17","doi-asserted-by":"crossref","unstructured":"Johnson, A.E., et al.: Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports. Sci. Data 6(1), 317 (2019)","DOI":"10.1038\/s41597-019-0322-0"},{"key":"11_CR18","doi-asserted-by":"crossref","unstructured":"Kakogeorgiou, I., et al.: What to hide from your students: attention-guided masked image modeling. In: European Conference on Computer Vision, pp. 300\u2013318. Springer (2022)","DOI":"10.1007\/978-3-031-20056-4_18"},{"issue":"1","key":"11_CR19","doi-asserted-by":"publisher","first-page":"92","DOI":"10.1038\/s41597-021-00863-5","volume":"8","author":"A Karargyris","year":"2021","unstructured":"Karargyris, A., et al.: Creation and validation of a chest x-ray dataset with eye-tracking and report dictation for ai development. Sci. Data 8(1), 92 (2021)","journal-title":"Sci. Data"},{"key":"11_CR20","doi-asserted-by":"crossref","unstructured":"Kong, Y., et al.: Gaze-detr: using expert gaze to reduce false positives in vulvovaginal candidiasis screening. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 133\u2013143. Springer (2024)","DOI":"10.1007\/978-3-031-72083-3_13"},{"issue":"1","key":"11_CR21","doi-asserted-by":"publisher","first-page":"196","DOI":"10.1109\/TBME.2014.2344660","volume":"62","author":"C Li","year":"2014","unstructured":"Li, C., Wang, X., Eberl, S., Fulham, M., Yin, Y., Feng, D.D.: Supervised variational model with statistical inference and its application in medical image segmentation. IEEE Trans. Biomed. Eng. 62(1), 196\u2013207 (2014)","journal-title":"IEEE Trans. Biomed. Eng."},{"issue":"5","key":"11_CR22","doi-asserted-by":"publisher","first-page":"1336","DOI":"10.1109\/JBHI.2021.3058293","volume":"25","author":"J Li","year":"2021","unstructured":"Li, J., et al.: Multiscale attention guided network for covid-19 diagnosis using chest x-ray images. IEEE J. Biomed. Health Inform. 25(5), 1336\u20131346 (2021)","journal-title":"IEEE J. Biomed. Health Inform."},{"key":"11_CR23","doi-asserted-by":"crossref","unstructured":"Men, Q., Teng, C., Drukker, L., Papageorghiou, A.T., Noble, J.A.: Multimodal-guidenet: gaze-probe bidirectional guidance in obstetric ultrasound scanning. In: International Conference on Medical Image Computing and Computer-Assisted Intervention, pp. 94\u2013103. Springer (2022)","DOI":"10.1007\/978-3-031-16449-1_10"},{"issue":"285\u2013296","key":"11_CR24","first-page":"23","volume":"11","author":"N Otsu","year":"1975","unstructured":"Otsu, N., et al.: A threshold selection method from gray-level histograms. Automatica 11(285\u2013296), 23\u201327 (1975)","journal-title":"Automatica"},{"issue":"10","key":"11_CR25","doi-asserted-by":"publisher","first-page":"2698","DOI":"10.1109\/TMI.2020.3042773","volume":"40","author":"X Ouyang","year":"2020","unstructured":"Ouyang, X., et al.: Learning hierarchical attention for weakly-supervised chest x-ray abnormality localization and diagnosis. IEEE Trans. Med. Imaging 40(10), 2698\u20132710 (2020)","journal-title":"IEEE Trans. Med. Imaging"},{"issue":"1","key":"11_CR26","doi-asserted-by":"publisher","first-page":"26","DOI":"10.1186\/s41747-024-00428-2","volume":"8","author":"F Prinzi","year":"2024","unstructured":"Prinzi, F., Currieri, T., Gaglio, S., Vitabile, S.: Shallow and deep learning classifiers in medical image analysis. Eur.Radiol. Exp. 8(1), 26 (2024)","journal-title":"Eur.Radiol. Exp."},{"key":"11_CR27","unstructured":"Ren, S., Wei, F., Albanie, S., Zhang, Z., Hu, H.: Deepmim: deep supervision for masked image modeling. arXiv preprint arXiv:2303.08817 (2023)"},{"issue":"5","key":"11_CR28","doi-asserted-by":"publisher","first-page":"2063","DOI":"10.1002\/mp.12837","volume":"45","author":"X Ren","year":"2018","unstructured":"Ren, X., et al.: Interleaved 3d-cnn s for joint segmentation of small-volume structures in head and neck ct images. Med. Phys. 45(5), 2063\u20132075 (2018)","journal-title":"Med. Phys."},{"key":"11_CR29","doi-asserted-by":"crossref","unstructured":"Shih, G., et\u00a0al.: Augmenting the national institutes of health chest radiograph dataset with expert annotations of possible pneumonia. Radiol. Artif. Intell. 1(1), e180041 (2019)","DOI":"10.1148\/ryai.2019180041"},{"issue":"5","key":"11_CR30","doi-asserted-by":"publisher","first-page":"1285","DOI":"10.1109\/TMI.2016.2528162","volume":"35","author":"HC Shin","year":"2016","unstructured":"Shin, H.C., et al.: Deep convolutional neural networks for computer-aided detection: cnn architectures, dataset characteristics and transfer learning. IEEE Trans. Med. Imaging 35(5), 1285\u20131298 (2016)","journal-title":"IEEE Trans. Med. Imaging"},{"key":"11_CR31","unstructured":"Siegel, A.F.: Practical Business Statistics. Academic Press (2016)"},{"key":"11_CR32","first-page":"33536","volume":"35","author":"F Wang","year":"2022","unstructured":"Wang, F., Zhou, Y., Wang, S., Vardhanabhuti, V., Yu, L.: Multi-granularity cross-modal alignment for generalized medical visual representation learning. Adv. Neural. Inf. Process. Syst. 35, 33536\u201333549 (2022)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"11_CR33","doi-asserted-by":"crossref","unstructured":"Wang, H., Song, K., Fan, J., Wang, Y., Xie, J., Zhang, Z.: Hard patches mining for masked image modeling. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10375\u201310385 (2023)","DOI":"10.1109\/CVPR52729.2023.01000"},{"key":"11_CR34","doi-asserted-by":"crossref","unstructured":"Wang, H., Tang, Y., Wang, Y., Guo, J., Deng, Z.H., Han, K.: Masked image modeling with local multi-scale reconstruction. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 2122\u20132131 (2023)","DOI":"10.1109\/CVPR52729.2023.00211"},{"issue":"7","key":"11_CR35","doi-asserted-by":"publisher","first-page":"1688","DOI":"10.1109\/TMI.2022.3146973","volume":"41","author":"S Wang","year":"2022","unstructured":"Wang, S., Ouyang, X., Liu, T., Wang, Q., Shen, D.: Follow my eye: using gaze to supervise computer-aided diagnosis. IEEE Trans. Med. Imaging 41(7), 1688\u20131698 (2022)","journal-title":"IEEE Trans. Med. Imaging"},{"key":"11_CR36","doi-asserted-by":"crossref","unstructured":"Wang, X., Peng, Y., Lu, L., Lu, Z., Bagheri, M., Summers, R.M.: Chestx-ray: hospital-scale chest x-ray database and benchmarks on weakly supervised classification and localization of common thorax diseases. In: Deep Learning and Convolutional Neural Networks for Medical Imaging and Clinical Informatics, pp. 369\u2013392 (2019)","DOI":"10.1007\/978-3-030-13969-8_18"},{"key":"11_CR37","doi-asserted-by":"crossref","unstructured":"Wei, C., Fan, H., Xie, S., Wu, C.Y., Yuille, A., Feichtenhofer, C.: Masked feature prediction for self-supervised visual pre-training. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 14668\u201314678 (2022)","DOI":"10.1109\/CVPR52688.2022.01426"},{"key":"11_CR38","unstructured":"Wu, Q., Ye, H., Gu, Y., Zhang, H., Wang, L., He, D.: Denoising masked autoencoders help robust classification. In: The Eleventh International Conference on Learning Representations (2023), https:\/\/openreview.net\/forum?id=zDjtZZBZtqK"},{"key":"11_CR39","doi-asserted-by":"crossref","unstructured":"Xue, H., et al.: Stare at what you see: Masked image modeling without reconstruction. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 22732\u201322741 (2023)","DOI":"10.1109\/CVPR52729.2023.02177"},{"key":"11_CR40","unstructured":"Yosinski, J., Clune, J., Bengio, Y., Lipson, H.: How transferable are features in deep neural networks? In: Ghahramani, Z., Welling, M., Cortes, C., Lawrence, N., Weinberger, K. (eds.) Advances in Neural Information Processing Systems 27 (NIPS \u201914), pp. 3320\u20133328. Curran Associates, Inc. (2014)"},{"key":"11_CR41","doi-asserted-by":"crossref","unstructured":"Zhao, Z., Wang, S., Wang, Q., Shen, D.: Mining gaze for contrastive learning toward computer-assisted diagnosis. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.\u00a038, pp. 7543\u20137551 (2024)","DOI":"10.1609\/aaai.v38i7.28586"}],"container-title":["Lecture Notes in Computer Science","Information Processing in Medical Imaging"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-031-96625-5_11","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,4,29]],"date-time":"2026-04-29T13:23:35Z","timestamp":1777469015000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-031-96625-5_11"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,8,7]]},"ISBN":["9783031966248","9783031966255"],"references-count":41,"URL":"https:\/\/doi.org\/10.1007\/978-3-031-96625-5_11","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,8,7]]},"assertion":[{"value":"7 August 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"IPMI","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Information Processing in Medical Imaging","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Kos","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Greece","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"25 May 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"30 May 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"29","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"ipmi2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/ipmi2025.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}