{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T18:19:51Z","timestamp":1774462791491,"version":"3.50.1"},"reference-count":49,"publisher":"Springer Science and Business Media LLC","issue":"4","license":[{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,3,1]],"date-time":"2026-03-01T00:00:00Z","timestamp":1772323200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"funder":[{"name":"National Natural Science Foundation of China under Grant","award":["62302338"],"award-info":[{"award-number":["62302338"]}]},{"name":"Brain-Gain Plan of New Chongqing Foundation under Grant","award":["CSTB2024YCJH-KYXM0108"],"award-info":[{"award-number":["CSTB2024YCJH-KYXM0108"]}]},{"name":"Natural Science Foundation of Chongqing under Grant","award":["CSTB2025NSCQ-GPX1037"],"award-info":[{"award-number":["CSTB2025NSCQ-GPX1037"]}]},{"name":"Science and Technology Research Program of Chongqing Municipal Education Commission under Grant","award":["KJQN202500532"],"award-info":[{"award-number":["KJQN202500532"]}]},{"name":"Chongqing Normal University Foundation under Grant","award":["24XLB018"],"award-info":[{"award-number":["24XLB018"]}]},{"name":"Natural Science Foundation Innovation and Development Joint Fund Project of Chongqing under Grant","award":["CSTB2023NSCQ-LZX0148"],"award-info":[{"award-number":["CSTB2023NSCQ-LZX0148"]}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Vis Comput"],"published-print":{"date-parts":[[2026,3]]},"DOI":"10.1007\/s00371-026-04384-3","type":"journal-article","created":{"date-parts":[[2026,3,3]],"date-time":"2026-03-03T19:02:47Z","timestamp":1772564567000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Enhanced radiology report generation via comprehensive sequence rearrangement and multi-scale cross-region attention"],"prefix":"10.1007","volume":"42","author":[{"given":"Yan","family":"Deng","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qibing","family":"Qin","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jianming","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dengwei","family":"Yan","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenfeng","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jing","family":"Qiao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2026,3,3]]},"reference":[{"issue":"9","key":"4384_CR1","doi-asserted-by":"publisher","first-page":"2519","DOI":"10.1109\/TBME.2023.3252889","volume":"70","author":"L Rettenberger","year":"2023","unstructured":"Rettenberger, L., Schilling, M., Elser, S., B\u00f6hland, M., Reischl, M.: Self-supervised learning for annotation efficient biomedical image segmentation. IEEE Trans. Biomed. Eng. 70(9), 2519\u20132528 (2023)","journal-title":"IEEE Trans. Biomed. Eng."},{"issue":"9","key":"4384_CR2","doi-asserted-by":"publisher","first-page":"2636","DOI":"10.1109\/TBME.2023.3260739","volume":"70","author":"R Deng","year":"2023","unstructured":"Deng, R., Liu, Q., Cui, C., Yao, T., Long, J., Asad, Z., Womick, R.M., Zhu, Z., Fogo, A.B., Zhao, S.: Omni-seg: a scale-aware dynamic network for renal pathological image segmentation. IEEE Trans. Biomed. Eng. 70(9), 2636\u20132644 (2023)","journal-title":"IEEE Trans. Biomed. Eng."},{"issue":"5","key":"4384_CR3","doi-asserted-by":"publisher","first-page":"1338","DOI":"10.1109\/TBME.2019.2936460","volume":"67","author":"S Xia","year":"2019","unstructured":"Xia, S., Zhu, H., Liu, X., Gong, M., Huang, X., Xu, L., Zhang, H., Guo, J.: Vessel segmentation of x-ray coronary angiographic image sequence. IEEE Trans. Biomed. Eng. 67(5), 1338\u20131348 (2019)","journal-title":"IEEE Trans. Biomed. Eng."},{"issue":"3","key":"4384_CR4","doi-asserted-by":"publisher","first-page":"1173","DOI":"10.1109\/TBME.2021.3117407","volume":"69","author":"H Guan","year":"2021","unstructured":"Guan, H., Liu, M.: Domain adaptation for medical image analysis: a survey. IEEE Trans. Biomed. Eng. 69(3), 1173\u20131185 (2021)","journal-title":"IEEE Trans. Biomed. Eng."},{"key":"4384_CR5","doi-asserted-by":"crossref","unstructured":"Anderson, P., He, X., Buehler, C., Teney, D., Johnson, M., Gould, S., Zhang, L.: Bottom-up and top-down attention for image captioning and visual question answering. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 6077\u20136086 (2018)","DOI":"10.1109\/CVPR.2018.00636"},{"key":"4384_CR6","doi-asserted-by":"crossref","unstructured":"Cornia, M., Stefanini, M., Baraldi, L., Cucchiara, R.: Meshed-memory transformer for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10578\u201310587 (2020)","DOI":"10.1109\/CVPR42600.2020.01059"},{"key":"4384_CR7","doi-asserted-by":"crossref","unstructured":"Hirota, Y., Nakashima, Y., Garcia, N.: Quantifying societal bias amplification in image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13450\u201313459 (2022)","DOI":"10.1109\/CVPR52688.2022.01309"},{"key":"4384_CR8","doi-asserted-by":"crossref","unstructured":"Hu, X., Gan, Z., Wang, J., Yang, Z., Liu, Z., Lu, Y., Wang, L.: Scaling up vision-language pre-training for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 17980\u201317989 (2022)","DOI":"10.1109\/CVPR52688.2022.01745"},{"key":"4384_CR9","doi-asserted-by":"crossref","unstructured":"Kuo, C.-W., Kira, Z.: Beyond a pre-trained object detector: cross-modal textual and visual context for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 17969\u201317979 (2022)","DOI":"10.1109\/CVPR52688.2022.01744"},{"key":"4384_CR10","unstructured":"Xu, K., Ba, J., Kiros, R., Cho, K., Courville, A., Salakhudinov, R., Zemel, R., Bengio, Y.: Show, attend and tell: neural image caption generation with visual attention. In: International Conference on Machine Learning, PMLR. pp. 2048\u20132057 (2015)"},{"key":"4384_CR11","doi-asserted-by":"crossref","unstructured":"Wang, W., Chen, Z., Hu, H.: Hierarchical attention network for image captioning. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.33, pp. 8957\u20138964 (2019)","DOI":"10.1609\/aaai.v33i01.33018957"},{"key":"4384_CR12","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 770\u2013778 (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"4384_CR13","first-page":"5998","volume":"30","author":"A Vaswani","year":"2017","unstructured":"Vaswani, A., Shazeer, N., Parmar, N., Uszkoreit, J., Jones, L., Gomez, A.N., Kaiser, \u0141, Polosukhin, I.: Attention is all you need. Adv. Neural. Inf. Process. Syst. 30, 5998\u20136008 (2017)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"4384_CR14","doi-asserted-by":"crossref","unstructured":"Senior, H., Slabaugh, G., Yuan, S., Rossi, L.: Graph neural networks in vision-language image understanding: a survey. Vis. Comput. 41(1), 491\u2013516 (2025)","DOI":"10.1007\/s00371-024-03343-0"},{"key":"4384_CR15","doi-asserted-by":"crossref","unstructured":"Li, H., Ren, Z., Zhu, G., Liang, Y., Cui, H., Wang, C., Wang, J.: Enhancing medical image segmentation with MA-UNet: a multi-scale attention framework. The Visual Computer, 1\u201318 (2025)","DOI":"10.1007\/s00371-024-03774-9"},{"key":"4384_CR16","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., Erhan, D.: Show and tell: a neural image caption generator. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 3156\u20133164 (2015)","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"4384_CR17","doi-asserted-by":"crossref","unstructured":"Lu, J., Xiong, C., Parikh, D., Socher, R.: Knowing when to look: adaptive attention via a visual sentinel for image captioning. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 375\u2013383 (2017)","DOI":"10.1109\/CVPR.2017.345"},{"key":"4384_CR18","doi-asserted-by":"crossref","unstructured":"Pan, Y., Yao, T., Li, Y., Mei, T.: X-linear attention networks for image captioning. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 10971\u201310980 (2020)","DOI":"10.1109\/CVPR42600.2020.01098"},{"key":"4384_CR19","doi-asserted-by":"publisher","first-page":"2966","DOI":"10.1109\/TMM.2022.3154149","volume":"25","author":"D Wang","year":"2022","unstructured":"Wang, D., Hu, Z., Zhou, Y., Hong, R., Wang, M.: A text-guided generation and refinement model for image captioning. IEEE Trans. Multimedia 25, 2966\u20132977 (2022)","journal-title":"IEEE Trans. Multimedia"},{"key":"4384_CR20","doi-asserted-by":"crossref","unstructured":"Rotstein, N., Bensaid, D., Brody, S., Ganz, R., Kimmel, R.: Fusecap: leveraging large language models for enriched fused image captions. In: Proceedings of the IEEE\/CVF Winter Conference on Applications of Computer Vision, pp. 5689\u20135700 (2024)","DOI":"10.1109\/WACV57701.2024.00559"},{"key":"4384_CR21","doi-asserted-by":"crossref","unstructured":"Ma, F., Zhou, Y., Rao, F., Zhang, Y., Sun, X.: Image captioning with multi-context synthetic data. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol. 38, pp. 4089\u20134097 (2024)","DOI":"10.1609\/aaai.v38i5.28203"},{"key":"4384_CR22","unstructured":"Chen, Z., Shen, Y., Song, Y., Wan, X.: Cross-modal memory networks for radiology report generation. arXiv preprint arXiv:2204.13258 (2022)"},{"key":"4384_CR23","doi-asserted-by":"crossref","unstructured":"Qin, H., Song, Y.: Reinforced cross-modal alignment for radiology report generation. In: Findings of the Association for Computational Linguistics: ACL 2022, pp. 448\u2013458 (2022)","DOI":"10.18653\/v1\/2022.findings-acl.38"},{"key":"4384_CR24","doi-asserted-by":"crossref","unstructured":"Wang, J., Bhalerao, A., He, Y.: Cross-modal prototype driven network for radiology report generation. In: European Conference on Computer Vision. Springer, pp. 563\u2013579 (2022)","DOI":"10.1007\/978-3-031-19833-5_33"},{"issue":"11","key":"4384_CR25","doi-asserted-by":"publisher","first-page":"8113","DOI":"10.1007\/s00371-023-03226-w","volume":"40","author":"S Yang","year":"2024","unstructured":"Yang, S., Jin, Y., Lei, J., Zhang, S.: Multi-directional guidance network for fine-grained visual classification. Vis. Comput. 40(11), 8113\u20138124 (2024)","journal-title":"Vis. Comput."},{"key":"4384_CR26","first-page":"16266","volume":"34","author":"F Liu","year":"2021","unstructured":"Liu, F., You, C., Wu, X., Ge, S., Sun, X.: Auto-encoding knowledge graph for unsupervised medical report generation. Adv. Neural. Inf. Process. Syst. 34, 16266\u201316279 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"4384_CR27","doi-asserted-by":"publisher","DOI":"10.1016\/j.media.2022.102510","volume":"80","author":"S Yang","year":"2022","unstructured":"Yang, S., Wu, X., Ge, S., Zhou, S.K., Xiao, L.: Knowledge matters: chest radiology report generation with general and specific knowledge. Med. Image Anal. 80, 102510 (2022)","journal-title":"Med. Image Anal."},{"key":"4384_CR28","doi-asserted-by":"crossref","unstructured":"Huang, Z., Zhang, X., Zhang, S.: Kiut: Knowledge-injected u-transformer for radiology report generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 19809\u201319818 (2023)","DOI":"10.1109\/CVPR52729.2023.01897"},{"key":"4384_CR29","doi-asserted-by":"crossref","unstructured":"Liu, F., Wu, X., Ge, S., Fan, W., Zou, Y.: Exploring and distilling posterior and prior knowledge for radiology report generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 13753\u201313762 (2021)","DOI":"10.1109\/CVPR46437.2021.01354"},{"key":"4384_CR30","doi-asserted-by":"publisher","DOI":"10.1016\/j.media.2023.102798","volume":"86","author":"S Yang","year":"2023","unstructured":"Yang, S., Wu, X., Ge, S., Zheng, Z., Zhou, S.K., Xiao, L.: Radiology report generation with a learned knowledge base and multi-modal alignment. Med. Image Anal. 86, 102798 (2023)","journal-title":"Med. Image Anal."},{"key":"4384_CR31","doi-asserted-by":"crossref","unstructured":"Tanida, T., M\u00fcller, P., Kaissis, G., Rueckert, D.: Interactive and explainable region-guided radiology report generation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, pp. 7433\u20137442 (2023)","DOI":"10.1109\/CVPR52729.2023.00718"},{"key":"4384_CR32","doi-asserted-by":"crossref","unstructured":"Liu, F., Yin, C., Wu, X., Ge, S., Zou, Y., Zhang, P., Sun, X.: Contrastive attention for automatic chest x-ray report generation. arXiv preprint arXiv:2106.06965 (2021)","DOI":"10.18653\/v1\/2021.findings-acl.23"},{"key":"4384_CR33","doi-asserted-by":"crossref","unstructured":"Zhang, K., Jiang, H., Zhang, J., Huang, Q., Fan, J., Yu, J., Han, W.: Semi-supervised medical report generation via graph-guided hybrid feature consistency. IEEE Trans. Multimedia 26, 904\u2013915 (2023)","DOI":"10.1109\/TMM.2023.3273390"},{"key":"4384_CR34","doi-asserted-by":"crossref","unstructured":"Shen, H., Pei, M., Liu, J., Tian, Z.: Automatic radiology reports generation via memory alignment network. In: Proceedings of the AAAI Conference on Artificial Intelligence, vol.38, pp. 4776\u20134783 (2024)","DOI":"10.1609\/aaai.v38i5.28279"},{"key":"4384_CR35","unstructured":"Gu, A., Dao, T.: Mamba: Linear-time sequence modeling with selective state spaces. In: First Conference on Language Modeling (2024)"},{"key":"4384_CR36","unstructured":"Li, C., Ye, Q., Zhao, X., Yang, Y., Hu, X., Wu, H.-Y., Qin, J.: Costal cartilage segmentation with topology guided deformable mamba: Method and benchmark. arXiv preprint arXiv:2404.03207 (2024)"},{"key":"4384_CR37","unstructured":"Ma, J., Li, F., Wang, B.: U-mamba: Enhancing long-range dependency for biomedical image segmentation. arXiv preprint arXiv:2401.04722 (2024)"},{"key":"4384_CR38","unstructured":"Wang, H., Chen, J., Liu, Z., Chen, H.: nnmamba: 3d biomedical image segmentation, classification and landmark detection with state space model. arXiv preprint arXiv:2402.03526 (2024)"},{"key":"4384_CR39","doi-asserted-by":"crossref","unstructured":"Liu, J., Yang, H., Zhou, H.-Y., Xi, Y., Yu, L., Yu, Y., Yu, Y., Wang, L.: Swin-umamba: Adapting mamba-based vision foundation models for medical image segmentation. arXiv preprint arXiv:2403.09337 (2024)","DOI":"10.1109\/TMI.2024.3508698"},{"key":"4384_CR40","doi-asserted-by":"crossref","unstructured":"Chen, C.-F.R., Fan, Q., Panda, R.: Crossvit: cross-attention multi-scale vision transformer for image classification. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, pp. 357\u2013366 (2021)","DOI":"10.1109\/ICCV48922.2021.00041"},{"issue":"1","key":"4384_CR41","volume":"17","author":"Y Pan","year":"2024","unstructured":"Pan, Y., Liu, L.-J., Yang, X.-B., Peng, W., Huang, Q.-S.: Chest radiology report generation based on cross-modal multi-scale feature fusion. J. Radiat. Res. Appl. Sci. 17(1), 100823 (2024)","journal-title":"J. Radiat. Res. Appl. Sci."},{"key":"4384_CR42","doi-asserted-by":"crossref","unstructured":"Li, J., Su, T., Zhao, B., Lv, F., Wang, Q., Navab, N., Hu, Y., Jiang, Z.: Ultrasound report generation with cross-modality feature alignment via unsupervised guidance. IEEE Transactions on Medical Imaging (2024)","DOI":"10.1109\/TMI.2024.3424978"},{"issue":"12","key":"4384_CR43","doi-asserted-by":"publisher","first-page":"4211","DOI":"10.1109\/TMI.2024.3416190","volume":"43","author":"X Mei","year":"2024","unstructured":"Mei, X., Yang, L., Gao, D., Cai, X., Han, J., Liu, T.: Phraseaug: an augmented medical report generation model with phrasebook. IEEE Trans. Med. Imaging 43(12), 4211\u20134223 (2024)","journal-title":"IEEE Trans. Med. Imaging"},{"issue":"2","key":"4384_CR44","doi-asserted-by":"publisher","first-page":"304","DOI":"10.1093\/jamia\/ocv080","volume":"23","author":"D Demner-Fushman","year":"2016","unstructured":"Demner-Fushman, D., Kohli, M.D., Rosenman, M.B., Shooshan, S.E., Rodriguez, L., Antani, S., Thoma, G.R., McDonald, C.J.: Preparing a collection of radiology examinations for distribution and retrieval. J. Am. Med. Inform. Assoc. 23(2), 304\u2013310 (2016)","journal-title":"J. Am. Med. Inform. Assoc."},{"key":"4384_CR45","doi-asserted-by":"crossref","unstructured":"Johnson, A.E., Pollard, T.J., Greenbaum, N.R., Lungren, M.P., Deng, C.-y., Peng, Y., Lu, Z., Mark, R.G., Berkowitz, S.J., Horng, S.: Mimic-cxr-jpg, a large publicly available database of labeled chest radiographs. arXiv preprint arXiv:1901.07042 (2019)","DOI":"10.1038\/s41597-019-0322-0"},{"key":"4384_CR46","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., Zhu, W.-J.: Bleu: a method for automatic evaluation of machine translation. In: Proceedings of the 40th Annual Meeting of the Association for Computational Linguistics, pp. 311\u2013318 (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"4384_CR47","unstructured":"Banerjee, S., Lavie, A.: Meteor: An automatic metric for mt evaluation with improved correlation with human judgments. In: Proceedings of the Acl Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation And\/or Summarization, pp. 65\u201372 (2005)"},{"key":"4384_CR48","unstructured":"Chin-Yew, L.: Rouge: A package for automatic evaluation of summaries. In: Proceedings of the Workshop on Text Summarization Branches Out, 2004 (2004)"},{"key":"4384_CR49","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)"}],"container-title":["The Visual Computer"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-026-04384-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00371-026-04384-3","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00371-026-04384-3.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,3,25]],"date-time":"2026-03-25T16:21:57Z","timestamp":1774455717000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00371-026-04384-3"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,3]]},"references-count":49,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2026,3]]}},"alternative-id":["4384"],"URL":"https:\/\/doi.org\/10.1007\/s00371-026-04384-3","relation":{},"ISSN":["0178-2789","1432-2315"],"issn-type":[{"value":"0178-2789","type":"print"},{"value":"1432-2315","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,3]]},"assertion":[{"value":"19 June 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"25 January 2026","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 March 2026","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare no conflict of interest.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}},{"value":"All datasets used in this paper are public datasets, which can be downloaded through public channels upon request.","order":3,"name":"Ethics","group":{"name":"EthicsHeading","label":"Ethical and informed consent for data used"}}],"article-number":"191"}}