{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,10]],"date-time":"2026-07-10T15:14:59Z","timestamp":1783696499617,"version":"3.55.0"},"reference-count":50,"publisher":"Elsevier BV","issue":"7","license":[{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/tdm\/userlicense\/1.0\/"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.elsevier.com\/legal\/tdmrep-license"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-017"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-012"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2026,11,1]],"date-time":"2026-11-01T00:00:00Z","timestamp":1793491200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-004"}],"funder":[{"DOI":"10.13039\/501100011996","name":"Dalian Maritime University","doi-asserted-by":"publisher","id":[{"id":"10.13039\/501100011996","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62572089"],"award-info":[{"award-number":["62572089"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62372077"],"award-info":[{"award-number":["62372077"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["elsevier.com","sciencedirect.com"],"crossmark-restriction":true},"short-container-title":["Information Processing &amp; Management"],"published-print":{"date-parts":[[2026,11]]},"DOI":"10.1016\/j.ipm.2026.104863","type":"journal-article","created":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T05:08:46Z","timestamp":1777525726000},"page":"104863","update-policy":"https:\/\/doi.org\/10.1016\/elsevier_cm_policy","source":"Crossref","is-referenced-by-count":0,"special_numbering":"PB","title":["Latent diffusion-augmented cross-modal representation learning for radiology report generation"],"prefix":"10.1016","volume":"63","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-2569-8967","authenticated-orcid":false,"given":"Xiaodi","family":"Hou","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaobo","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Simiao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Mingyu","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0872-7688","authenticated-orcid":false,"given":"Hongfei","family":"Lin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-5843-4675","authenticated-orcid":false,"given":"Yijia","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"78","reference":[{"key":"10.1016\/j.ipm.2026.104863_b1","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"14194","article-title":"Instance-level expert knowledge and aggregate discriminative attention for radiology report generation","author":"Bu","year":"2024"},{"issue":"1","key":"10.1016\/j.ipm.2026.104863_b2","doi-asserted-by":"crossref","DOI":"10.1016\/j.ipm.2024.103934","article-title":"A hybrid feature fusion deep learning framework for multi-source medical image analysis","volume":"62","author":"Cao","year":"2025","journal-title":"Information Processing & Management"},{"key":"10.1016\/j.ipm.2026.104863_b3","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"277","article-title":"MMTN: multi-modal memory transformer network for image-report consistent medical report generation","volume":"vol. 37","author":"Cao","year":"2023"},{"key":"10.1016\/j.ipm.2026.104863_b4","series-title":"Proceedings of the 59th annual meeting of the association for computational linguistics and the 11th international joint conference on natural language processing (volume 1: long papers)","first-page":"5904","article-title":"Cross-modal memory networks for radiology report generation","author":"Chen","year":"2021"},{"key":"10.1016\/j.ipm.2026.104863_b5","series-title":"Proceedings of the 2020 conference on empirical methods in natural language processing","first-page":"1439","article-title":"Generating radiology reports via memory-driven transformer","author":"Chen","year":"2020"},{"key":"10.1016\/j.ipm.2026.104863_b6","unstructured":"Denkowski, M., & Lavie, A. (2011). Meteor 1.3: Automatic metric for reliable optimization and evaluation of machine translation systems. In Proceedings of the sixth workshop on statistical machine translation (pp. 85\u201391)."},{"key":"10.1016\/j.ipm.2026.104863_b7","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102540","article-title":"FDiff-Fusion: Denoising diffusion fusion network based on fuzzy learning for 3D medical image segmentation","volume":"112","author":"Ding","year":"2024","journal-title":"Information Fusion"},{"key":"10.1016\/j.ipm.2026.104863_b8","unstructured":"Ho, J., Jain, A., & Abbeel, P. (2020). Denoising diffusion probabilistic models. In Proceedings of the 34th international conference on neural information processing systems."},{"key":"10.1016\/j.ipm.2026.104863_b9","article-title":"Recalibrated cross-modal alignment network for radiology report generation with weakly supervised contrastive learning","author":"Hou","year":"2025","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.ipm.2026.104863_b10","series-title":"Proceedings of the thirty-fourth international joint conference on artificial intelligence","first-page":"7410","article-title":"RRG-Mamba: Efficient radiology report generation with state space model","author":"Hou","year":"2025"},{"key":"10.1016\/j.ipm.2026.104863_b11","article-title":"MambaGen: efficient visual representation learning for automatic radiology report generation","author":"Hou","year":"2025","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.ipm.2026.104863_b12","doi-asserted-by":"crossref","DOI":"10.1016\/j.jbi.2023.104496","article-title":"MKCL: Medical knowledge with contrastive learning model for radiology report generation","volume":"146","author":"Hou","year":"2023","journal-title":"Journal of Biomedical Informatics"},{"key":"10.1016\/j.ipm.2026.104863_b13","series-title":"International symposium on bioinformatics research and applications","first-page":"107","article-title":"Radiology report generation via visual recalibration and context gating-aware","author":"Hou","year":"2023"},{"key":"10.1016\/j.ipm.2026.104863_b14","doi-asserted-by":"crossref","first-page":"557","DOI":"10.1109\/TMM.2024.3521728","article-title":"Knowledge-guided cross-modal alignment and progressive fusion for chest X-Ray report generation","volume":"27","author":"Huang","year":"2025","journal-title":"IEEE Transactions on Multimedia"},{"key":"10.1016\/j.ipm.2026.104863_b15","unstructured":"Huang, X., Han, Y., Li, R., Wu, P., Zhang, K., et al. (2025). CmEAA: Cross-modal enhancement and alignment adapter for radiology report generation. In Proceedings of the 31st international conference on computational linguistics (pp. 8546\u20138556)."},{"key":"10.1016\/j.ipm.2026.104863_b16","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"19809","article-title":"Kiut: Knowledge-injected u-transformer for radiology report generation","author":"Huang","year":"2023"},{"key":"10.1016\/j.ipm.2026.104863_b17","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"2607","article-title":"Promptmrg: Diagnosis-driven prompts for medical report generation","volume":"vol. 38","author":"Jin","year":"2024"},{"key":"10.1016\/j.ipm.2026.104863_b18","series-title":"Proceedings of the 56th annual meeting of the association for computational linguistics, ACL 2018, Melbourne, Australia, July 15-20, 2018, volume 1: long papers","first-page":"2577","article-title":"On the automatic generation of medical imaging reports","author":"Jing","year":"2018"},{"issue":"1","key":"10.1016\/j.ipm.2026.104863_b19","doi-asserted-by":"crossref","first-page":"317","DOI":"10.1038\/s41597-019-0322-0","article-title":"MIMIC-CXR, a de-identified publicly available database of chest radiographs with free-text reports","volume":"6","author":"Johnson","year":"2019","journal-title":"Scientific Data"},{"issue":"1","key":"10.1016\/j.ipm.2026.104863_b20","doi-asserted-by":"crossref","first-page":"7303","DOI":"10.1038\/s41598-023-34341-2","article-title":"Denoising diffusion probabilistic models for 3D medical image generation","volume":"13","author":"Khader","year":"2023","journal-title":"Scientific Reports"},{"key":"10.1016\/j.ipm.2026.104863_b21","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"20656","article-title":"Cross-modal clinical graph transformer for ophthalmic report generation","author":"Li","year":"2022"},{"issue":"12","key":"10.1016\/j.ipm.2026.104863_b22","doi-asserted-by":"crossref","first-page":"4253","DOI":"10.1109\/TMI.2024.3421599","article-title":"An organ-aware diagnosis framework for radiology report generation","volume":"43","author":"Li","year":"2024","journal-title":"IEEE Transactions on Medical Imaging"},{"key":"10.1016\/j.ipm.2026.104863_b23","series-title":"Proceedings of the 32nd ACM international conference on multimedia","first-page":"4967","article-title":"Divide and conquer: Isolating normal-abnormal attributes in knowledge graph-enhanced radiology report generation","author":"Liang","year":"2024"},{"key":"10.1016\/j.ipm.2026.104863_b24","series-title":"Text summarization branches out","first-page":"74","article-title":"Rouge: A package for automatic evaluation of summaries","author":"Lin","year":"2004"},{"issue":"7","key":"10.1016\/j.ipm.2026.104863_b25","doi-asserted-by":"crossref","first-page":"2657","DOI":"10.1109\/TMI.2024.3372638","article-title":"Multi-grained radiology report generation with sentence-level image-language contrastive learning","volume":"43","author":"Liu","year":"2024","journal-title":"IEEE Transactions on Medical Imaging"},{"key":"10.1016\/j.ipm.2026.104863_b26","series-title":"Proceedings of the 32nd ACM international conference on multimedia","first-page":"8721","article-title":"In-context learning for zero-shot medical report generation","author":"Liu","year":"2024"},{"key":"10.1016\/j.ipm.2026.104863_b27","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"18635","article-title":"Bootstrapping large language models for radiology report generation","volume":"vol. 38","author":"Liu","year":"2024"},{"issue":"12","key":"10.1016\/j.ipm.2026.104863_b28","doi-asserted-by":"crossref","first-page":"4211","DOI":"10.1109\/TMI.2024.3416190","article-title":"PhraseAug: An augmented medical report generation model with phrasebook","volume":"43","author":"Mei","year":"2024","journal-title":"IEEE Transactions on Medical Imaging"},{"key":"10.1016\/j.ipm.2026.104863_b29","series-title":"Proceedings of the 40th annual meeting of the association for computational linguistics","first-page":"311","article-title":"Bleu: a method for automatic evaluation of machine translation","author":"Papineni","year":"2002"},{"key":"10.1016\/j.ipm.2026.104863_b30","series-title":"Proceedings of the AAAI conference on artificial intelligence","first-page":"4776","article-title":"Automatic radiology reports generation via memory alignment network","volume":"vol. 38","author":"Shen","year":"2024"},{"key":"10.1016\/j.ipm.2026.104863_b31","series-title":"Proceedings of the IEEE conference on computer vision and pattern recognition","first-page":"2497","article-title":"Learning to read chest x-rays: Recurrent neural cascade model for automated image annotation","author":"Shin","year":"2016"},{"key":"10.1016\/j.ipm.2026.104863_b32","series-title":"Proceedings of the 2020 conference on empirical methods in natural language processing","article-title":"CheXbert: combining automatic labelers and expert annotations for accurate radiology report labeling using BERT","author":"Smit","year":"2020"},{"key":"10.1016\/j.ipm.2026.104863_b33","doi-asserted-by":"crossref","DOI":"10.1016\/j.engappai.2026.114437","article-title":"Mixture of experts for radiology report generation","volume":"173","author":"Song","year":"2026","journal-title":"Engineering Applications of Artificial Intelligence"},{"key":"10.1016\/j.ipm.2026.104863_b34","series-title":"Score-based generative modeling through stochastic differential equations","author":"Song","year":"2020"},{"key":"10.1016\/j.ipm.2026.104863_b35","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2024.103413","article-title":"Dual-modality visual feature flow for medical report generation","volume":"101","author":"Tang","year":"2025","journal-title":"Medical Image Analysis"},{"key":"10.1016\/j.ipm.2026.104863_b36","doi-asserted-by":"crossref","DOI":"10.1109\/JBHI.2024.3393018","article-title":"Memory-based cross-modal semantic alignment network for radiology report generation","author":"Tao","year":"2024","journal-title":"IEEE Journal of Biomedical and Health Informatics"},{"key":"10.1016\/j.ipm.2026.104863_b37","doi-asserted-by":"crossref","unstructured":"Tian, Y., Xia, F., & Song, Y. (2024). Diffusion Networks with Task-Specific Noise Control for Radiology Report Generation. In Proceedings of the 32nd ACM international conference on multimedia (pp. 1771\u20131780).","DOI":"10.1145\/3664647.3681476"},{"key":"10.1016\/j.ipm.2026.104863_b38","doi-asserted-by":"crossref","unstructured":"Vedantam, R., Lawrence Zitnick, C., & Parikh, D. (2015). Cider: Consensus-based image description evaluation. In Proceedings of the IEEE conference on computer vision and pattern recognition (pp. 4566\u20134575).","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"10.1016\/j.ipm.2026.104863_b39","article-title":"CAMANet: class activation map guided attention network for radiology report generation","author":"Wang","year":"2024","journal-title":"IEEE Journal of Biomedical and Health Informatics"},{"key":"10.1016\/j.ipm.2026.104863_b40","series-title":"Proceedings of the IEEE\/CVF conference on computer vision and pattern recognition","first-page":"11558","article-title":"Metransformer: Radiology report generation by transformer with multiple learnable expert tokens","author":"Wang","year":"2023"},{"key":"10.1016\/j.ipm.2026.104863_b41","doi-asserted-by":"crossref","DOI":"10.1016\/j.eswa.2023.121260","article-title":"Generating radiology reports via auxiliary signal guidance and a memory-driven network","volume":"237","author":"Xue","year":"2024","journal-title":"Expert Systems with Applications"},{"key":"10.1016\/j.ipm.2026.104863_b42","series-title":"Medical image computing and computer assisted intervention\u2013mICCAI 2018: 21st international conference, Granada, Spain, September 16-20, 2018, proceedings, part i","first-page":"457","article-title":"Multimodal recurrent model with attention for automated radiology report generation","author":"Xue","year":"2018"},{"key":"10.1016\/j.ipm.2026.104863_b43","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102639","article-title":"LFDT-fusion: a latent feature-guided diffusion transformer model for general image fusion","volume":"113","author":"Yang","year":"2025","journal-title":"Information Fusion"},{"key":"10.1016\/j.ipm.2026.104863_b44","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2023.102798","article-title":"Radiology report generation with a learned knowledge base and multi-modal alignment","volume":"86","author":"Yang","year":"2023","journal-title":"Medical Image Analysis"},{"key":"10.1016\/j.ipm.2026.104863_b45","doi-asserted-by":"crossref","DOI":"10.1016\/j.media.2022.102510","article-title":"Knowledge matters: Chest radiology report generation with general and specific knowledge","volume":"80","author":"Yang","year":"2022","journal-title":"Medical Image Analysis"},{"issue":"4","key":"10.1016\/j.ipm.2026.104863_b46","doi-asserted-by":"crossref","first-page":"2152","DOI":"10.1109\/JBHI.2024.3350077","article-title":"TSGET: Two-stage global enhanced transformer for automatic radiology report generation","volume":"28","author":"Yi","year":"2024","journal-title":"IEEE Journal of Biomedical and Health Informatics"},{"key":"10.1016\/j.ipm.2026.104863_b47","doi-asserted-by":"crossref","DOI":"10.1016\/j.inffus.2024.102450","article-title":"Diff-IF: Multi-modality image fusion via diffusion model with fusion knowledge prior","volume":"110","author":"Yi","year":"2024","journal-title":"Information Fusion"},{"key":"10.1016\/j.ipm.2026.104863_b48","doi-asserted-by":"crossref","first-page":"904","DOI":"10.1109\/TMM.2023.3273390","article-title":"Semi-supervised medical report generation via graph-guided hybrid feature consistency","volume":"26","author":"Zhang","year":"2024","journal-title":"IEEE Transactions on Multimedia"},{"issue":"12","key":"10.1016\/j.ipm.2026.104863_b49","doi-asserted-by":"crossref","first-page":"4470","DOI":"10.1109\/TMI.2024.3424505","article-title":"Attribute prototype-guided iterative scene graph for explainable radiology report generation","volume":"43","author":"Zhang","year":"2024","journal-title":"IEEE Transactions on Medical Imaging"},{"issue":"3","key":"10.1016\/j.ipm.2026.104863_b50","doi-asserted-by":"crossref","first-page":"1505","DOI":"10.1109\/TMI.2024.3507076","article-title":"Topicwise separable sentence retrieval for medical report generation","volume":"44","author":"Zhao","year":"2025","journal-title":"IEEE Transactions on Medical Imaging"}],"container-title":["Information Processing &amp; Management"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0306457326002542?httpAccept=text\/xml","content-type":"text\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/api.elsevier.com\/content\/article\/PII:S0306457326002542?httpAccept=text\/plain","content-type":"text\/plain","content-version":"vor","intended-application":"text-mining"}],"deposited":{"date-parts":[[2026,7,10]],"date-time":"2026-07-10T14:40:38Z","timestamp":1783694438000},"score":1,"resource":{"primary":{"URL":"https:\/\/linkinghub.elsevier.com\/retrieve\/pii\/S0306457326002542"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,11]]},"references-count":50,"journal-issue":{"issue":"7","published-print":{"date-parts":[[2026,11]]}},"alternative-id":["S0306457326002542"],"URL":"https:\/\/doi.org\/10.1016\/j.ipm.2026.104863","relation":{},"ISSN":["0306-4573"],"issn-type":[{"value":"0306-4573","type":"print"}],"subject":[],"published":{"date-parts":[[2026,11]]},"assertion":[{"value":"Elsevier","name":"publisher","label":"This article is maintained by"},{"value":"Latent diffusion-augmented cross-modal representation learning for radiology report generation","name":"articletitle","label":"Article Title"},{"value":"Information Processing & Management","name":"journaltitle","label":"Journal Title"},{"value":"https:\/\/doi.org\/10.1016\/j.ipm.2026.104863","name":"articlelink","label":"CrossRef DOI link to publisher maintained version"},{"value":"article","name":"content_type","label":"Content Type"},{"value":"\u00a9 2026 Elsevier Ltd. All rights are reserved, including those for text and data mining, AI training, and similar technologies.","name":"copyright","label":"Copyright"}],"article-number":"104863"}}