{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,26]],"date-time":"2026-06-26T02:01:43Z","timestamp":1782439303733,"version":"3.54.5"},"reference-count":44,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2025,12,23]],"date-time":"2025-12-23T00:00:00Z","timestamp":1766448000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,12,23]],"date-time":"2025-12-23T00:00:00Z","timestamp":1766448000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Multimedia Systems"],"published-print":{"date-parts":[[2026,2]]},"DOI":"10.1007\/s00530-025-02103-x","type":"journal-article","created":{"date-parts":[[2025,12,23]],"date-time":"2025-12-23T13:06:54Z","timestamp":1766495214000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":1,"title":["A hybrid transformer architecture with Mamba for medical image report generation"],"prefix":"10.1007","volume":"32","author":[{"given":"Ruipeng","family":"Yang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fang","family":"Li","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,12,23]]},"reference":[{"key":"2103_CR1","doi-asserted-by":"publisher","unstructured":"Shin, H. -C., Roberts, K., Lu, L., Demner-Fushman, D., Yao, J., Summers, R. M.: Learning to read chest X-rays: recurrent neural cascade model for automated image annotation. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, pp. 2497\u20132506, https:\/\/doi.org\/10.1109\/CVPR.2016.274 (2016)","DOI":"10.1109\/CVPR.2016.274"},{"key":"2103_CR2","doi-asserted-by":"publisher","unstructured":"Arya, N., Gupta, K., Saha, S.: SARS-CoV-2 detection: radiology based multi-modal multi-task framework. In: 2023 45th Annual International Conference of the IEEE Engineering in Medicine and Biology Society (EMBC), Sydney, Australia, pp. 1\u20134, https:\/\/doi.org\/10.1109\/EMBC40787.2023. (2023)","DOI":"10.1109\/EMBC40787.2023"},{"key":"2103_CR3","doi-asserted-by":"publisher","unstructured":"Zhang, Z., Xie, Y., Xing, F., McGough, M., Yang, L.: MDNet: a semantically and visually interpretable medical image diagnosis network. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honolulu, HI, USA, pp. 3549\u20133557, https:\/\/doi.org\/10.1109\/CVPR.2017.378. (2017)","DOI":"10.1109\/CVPR.2017.378"},{"issue":"1","key":"2103_CR4","first-page":"253","volume":"26","author":"M Li","year":"2023","unstructured":"Li, M., et al.: Auxiliary signal-guided knowledge encoder-decoder for medical report generation. W. W. W. 26(1), 253\u2013270 (2023)","journal-title":"W. W. W."},{"key":"2103_CR5","doi-asserted-by":"publisher","unstructured":"Lu, J., Xiong, C., Parikh, D., Socher, R.: Knowing when to look: adaptive attention via a visual sentinel for image captioning. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honolulu, HI, USA, pp. 3242\u20133250, https:\/\/doi.org\/10.1109\/CVPR.2017.345. (2017)","DOI":"10.1109\/CVPR.2017.345"},{"key":"2103_CR6","doi-asserted-by":"publisher","unstructured":"Zhou, Y., Wang, M., Liu, D., Hu, Z., Zhang, H.: More grounded image captioning by distilling image-text matching model. In: 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Seattle, WA, USA, pp. 4776\u20134785, https:\/\/doi.org\/10.1109\/CVPR42600.2020.00483. (2020)","DOI":"10.1109\/CVPR42600.2020.00483"},{"key":"2103_CR7","doi-asserted-by":"crossref","unstructured":"Chen, Z., Song, Y., Chang, T.-H., Wan, X.: Generating radiology reports via memory-driven transformer. In: Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP), pp. 1439\u20131449, Online. Association for Computational Linguistics (2020)","DOI":"10.18653\/v1\/2020.emnlp-main.112"},{"key":"2103_CR8","doi-asserted-by":"crossref","unstructured":"Chen, Z., Shen, Y., Song, Y., Wan, X.: Cross-modal memory networks for radiology report generation. In: Proceedings of the 59th Annual Meeting of the Association for Computational Linguistics and the 11th International Joint Conference on Natural Language Processing (Volume 1: Long Papers), pp. 5904\u20135914, Online. Association for Computational Linguistics (2021)","DOI":"10.18653\/v1\/2021.acl-long.459"},{"key":"2103_CR9","doi-asserted-by":"crossref","unstructured":"Jing, B., Xie, P., Xing, E.: On the automatic generation of medical imaging reports. In: Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 2577\u20132586, Melbourne, Australia. Association for Computational Linguistics (2018)","DOI":"10.18653\/v1\/P18-1240"},{"key":"2103_CR10","unstructured":"Ashish, V., et al.: Attention is all you need. Adv. Neural Inform. Process. Syst. 30 (2017)"},{"key":"2103_CR11","doi-asserted-by":"publisher","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. In: 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, pp. 770\u2013778, https:\/\/doi.org\/10.1109\/CVPR.2016.90. (2016)","DOI":"10.1109\/CVPR.2016.90"},{"key":"2103_CR12","unstructured":"Cetin, E., et al.: An evolved universal transformer memory. arxiv preprint arxiv:2410.13166 (2024)"},{"key":"2103_CR13","unstructured":"Gu, A., Dao, T.: Mamba: linear-time sequence modeling with selective state spaces. arxiv preprint arxiv:2312.00752 (2023)"},{"key":"2103_CR14","unstructured":"Dao, T., Gu, A.: Transformers are ssms: Generalized models and efficient algorithms through structured state space duality. arxiv preprint arxiv:2405.21060 (2024)"},{"key":"2103_CR15","unstructured":"Schmidt, R.M.: Recurrent neural networks (rnns): a gentle introduction and overview. arxiv preprint arxiv:1912.05911 (2019)"},{"key":"2103_CR16","doi-asserted-by":"publisher","unstructured":"Sun, Y., Lee, Y. Z., Woodard, G. A., Zhu, H., Lian, C., Liu, M.: R2Gen-Mamba: a selective state space model for radiology report generation. In: 2025 IEEE 22nd International Symposium on Biomedical Imaging (ISBI), Houston, TX, USA, pp. 1\u20134, https:\/\/doi.org\/10.1109\/ISBI60581.2025.10980814 (2025)","DOI":"10.1109\/ISBI60581.2025.10980814"},{"issue":"07","key":"2103_CR17","first-page":"12910","volume":"34","author":"Y Zhang","year":"2020","unstructured":"Zhang, Y., et al.: When radiology report generation meets knowledge graph. Proc. AAAI Conf. Artif. Intell. 34(07), 12910\u201312917 (2020)","journal-title":"Proc. AAAI Conf. Artif. Intell."},{"key":"2103_CR18","doi-asserted-by":"crossref","unstructured":"Chen, L., Li, K., Dual-adaptive interactive transformer with textual and visual context for image captioning. Exp. Syst. Appl. 243 122955. ISSN 0957-4174, (2024)","DOI":"10.1016\/j.eswa.2023.122955"},{"key":"2103_CR19","doi-asserted-by":"crossref","unstructured":"Yang, X., Yang, Y., Junsheng, W., Sun, W., Ma, S., Hou, Z., CA-Captioner: A novel concentrated attention for image captioning. Exp. Syst. Appl. 250, 123847. ISSN 0957-4174, (2024)","DOI":"10.1016\/j.eswa.2024.123847"},{"issue":"10","key":"2103_CR20","doi-asserted-by":"publisher","first-page":"2803","DOI":"10.1109\/TMI.2022.3171661","volume":"41","author":"Z Wang","year":"2022","unstructured":"Wang, Z., Han, H., Wang, L., Li, X., Zhou, L.: Automated radiographic report generation purely on transformer: a multicriteria supervised approach. IEEE Trans. Med. Imag. 41(10), 2803\u20132813 (2022). https:\/\/doi.org\/10.1109\/TMI.2022.3171661","journal-title":"IEEE Trans. Med. Imag."},{"key":"2103_CR21","doi-asserted-by":"publisher","unstructured":"Xu, C., Ji, J., Zhang, M., Zhang, X.: Attention-gated LSTM for image captioning. In: 2019 IEEE International Conference on Unmanned Systems and Artificial Intelligence (ICUSAI), Xi\u2019an, China, pp. 172\u2013177, https:\/\/doi.org\/10.1109\/ICUSAI47366.2019.9124779 (2019)","DOI":"10.1109\/ICUSAI47366.2019.9124779"},{"key":"2103_CR22","doi-asserted-by":"publisher","first-page":"7581","DOI":"10.1109\/TMM.2024.3369863","volume":"26","author":"Z Shao","year":"2024","unstructured":"Shao, Z., Han, J., Debattista, K., Pang, Y.: DCMSTRD: end-to-end dense captioning via multi-scale transformer decoding. IEEE Trans. Multimed. 26, 7581\u20137593 (2024). https:\/\/doi.org\/10.1109\/TMM.2024.3369863","journal-title":"IEEE Trans. Multimed."},{"key":"2103_CR23","doi-asserted-by":"publisher","unstructured":"Ke, L., Pei, W., Li, R., Shen, X., Tai, Y. -W.: Reflective decoding network for image captioning. In: 2019 IEEE\/CVF International Conference on Computer Vision (ICCV), Seoul, Korea (South), pp. 8887\u20138896, https:\/\/doi.org\/10.1109\/ICCV.2019.00898 (2019)","DOI":"10.1109\/ICCV.2019.00898"},{"key":"2103_CR24","doi-asserted-by":"publisher","first-page":"48","DOI":"10.1186\/s12938-023-01113-y","volume":"22","author":"T Pang","year":"2023","unstructured":"Pang, T., Li, P., Zhao, L.: A survey on automatic generation of medical imaging reports based on deep learning. Biomed. Eng. Online 22, 48 (2023). https:\/\/doi.org\/10.1186\/s12938-023-01113-y","journal-title":"Biomed. Eng. Online"},{"key":"2103_CR25","doi-asserted-by":"publisher","unstructured":"Jiang, B., Zhang, Z., Lin, D., Tang, J., Luo, B.: Semi-supervised learning with graph learning-convolutional networks. In: 2019 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Long Beach, CA, USA, pp. 11305\u201311312, https:\/\/doi.org\/10.1109\/CVPR.2019.01157 (2019)","DOI":"10.1109\/CVPR.2019.01157"},{"key":"2103_CR26","first-page":"16266","volume":"34","author":"F Liu","year":"2021","unstructured":"Liu, F., You, C., Wu, X., et al.: Auto-encoding knowledge graph for unsupervised medical report generation. Adv. Neural. Inf. Process. Syst. 34, 16266\u201316279 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"2103_CR27","doi-asserted-by":"publisher","unstructured":"Liu, F., Wu, X., Ge, S., Fan, W., Zou, Y.: Exploring and distilling posterior and prior knowledge for radiology report generation. In: 2021 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Nashville, TN, USA, pp. 13748\u201313757, https:\/\/doi.org\/10.1109\/CVPR46437.2021.01354 (2021)","DOI":"10.1109\/CVPR46437.2021.01354"},{"key":"2103_CR28","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2023.121260","volume":"237","author":"Y Xue","year":"2024","unstructured":"Xue, Y., Tan, Y., Tan, L., Qin, J., Xiang, X.: Generating radiology reports via auxiliary signal guidance and a memory-driven network. Exp. Syst. Appl. ISSN 237, 121260 (2024). https:\/\/doi.org\/10.1016\/j.eswa.2023.121260. (https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0957417423017621)","journal-title":"Exp. Syst. Appl. ISSN"},{"issue":"5","key":"2103_CR29","doi-asserted-by":"publisher","first-page":"3079","DOI":"10.1109\/JBHI.2024.3371894","volume":"28","author":"P Divya","year":"2024","unstructured":"Divya, P., Sravani, Y., Vishnu, C., Mohan, C.K., Chen, Y.W.: Memory guided transformer with Spatio-semantic visual extractor for medical report generation. IEEE J. Biomed. Health Inform. 28(5), 3079\u20133089 (2024). https:\/\/doi.org\/10.1109\/JBHI.2024.3371894","journal-title":"IEEE J. Biomed. Health Inform."},{"key":"2103_CR30","doi-asserted-by":"crossref","unstructured":"Zeng, X., Liao, T., Liming, X., Wang, Z.: AERMNet: attention-enhanced relational memory network for medical image report generation. Comput. Methods Progr. Biomed. 244, 107979. ISSN 0169-2607, (2024)","DOI":"10.1016\/j.cmpb.2023.107979"},{"issue":"8","key":"2103_CR31","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997). https:\/\/doi.org\/10.1162\/neco.1997.9.8.1735","journal-title":"Neural Comput."},{"issue":"4","key":"2103_CR32","doi-asserted-by":"publisher","first-page":"2152","DOI":"10.1109\/JBHI.2024.3350077","volume":"28","author":"X Yi","year":"2024","unstructured":"Yi, X., Fu, Y., Liu, R., Zhang, H., Hua, R.: TSGET: two-stage global enhanced transformer for automatic radiology report generation. IEEE J. Biomed. Health Inform. 28(4), 2152\u20132162 (2024). https:\/\/doi.org\/10.1109\/JBHI.2024.3350077","journal-title":"IEEE J. Biomed. Health Inform."},{"key":"2103_CR33","unstructured":"Lieber, O., Lenz, B., Bata, H., et al.: Jamba: a hybrid transformer-mamba language model. arXiv preprint arXiv:2403.19887, (2024)"},{"key":"2103_CR34","doi-asserted-by":"crossref","unstructured":"Hatamizadeh, A., Kautz, J.: Mambavision: a hybrid mamba-transformer vision backbone. In: Proceedings of the Computer Vision and Pattern Recognition Conference. 25261\u201325270 (2025)","DOI":"10.1109\/CVPR52734.2025.02352"},{"key":"2103_CR35","unstructured":"Xu, X., Liang, Y., Huang, B., et al.: Integrating mamba and transformer for long-short range time series forecasting. CoRR, (2024)"},{"key":"2103_CR36","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2025.127419","volume":"279","author":"H Li","year":"2025","unstructured":"Li, H., Liu, S., Wang, H., Jiang, X., Jiu, M., Chen, L., Yang, L., Li, S., Mingliang, X.: RRGMambaFormer: a hybrid Transformer-Mamba architecture for radiology report generation. Exp. Syst. Appl. ISSN 279, 127419 (2025). https:\/\/doi.org\/10.1016\/j.eswa.2025.127419. (https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0957417425010413)","journal-title":"Exp. Syst. Appl. ISSN"},{"key":"2103_CR37","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2024.126170","volume":"267","author":"C Dong","year":"2025","unstructured":"Dong, C., Sun, D., Zhenda, Yu., Luo, B.: Multi-view brain network classification based on adaptive graph isomorphic information bottleneck Mamba. Exp. Syst. Appl. ISSN 267, 126170 (2025). https:\/\/doi.org\/10.1016\/j.eswa.2024.126170. (https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0957417424030379)","journal-title":"Exp. Syst. Appl. ISSN"},{"key":"2103_CR38","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2024.125518","volume":"261","author":"G Li","year":"2025","unstructured":"Li, G., Huang, Q., Wang, W., Liu, L.: Selective and multi-scale fusion Mamba for medical image segmentation. Exp. Syst. Appl. ISSN 261, 125518 (2025). https:\/\/doi.org\/10.1016\/j.eswa.2024.125518. (https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0957417424023856)","journal-title":"Exp. Syst. Appl. ISSN"},{"key":"2103_CR39","doi-asserted-by":"publisher","DOI":"10.1016\/j.eswa.2024.125941","volume":"264","author":"Z Zhang","year":"2025","unstructured":"Zhang, Z., Peng, B., Zhao, T.: An ultra-lightweight network combining Mamba and frequency-domain feature extraction for pavement tiny-crack segmentation. Exp. Syst. Appl. ISSN 264, 125941 (2025). https:\/\/doi.org\/10.1016\/j.eswa.2024.125941. (https:\/\/www.sciencedirect.com\/science\/article\/pii\/S0957417424028082)","journal-title":"Exp. Syst. Appl. ISSN"},{"issue":"2","key":"2103_CR40","doi-asserted-by":"publisher","first-page":"304","DOI":"10.1093\/jamia\/ocv080","volume":"23","author":"D Demner-Fushman","year":"2015","unstructured":"Demner-Fushman, D., Kohli, M.D., Rosenman, M.B., et al.: Preparing a collection of radiology examinations for distribution and retrieval. J. Am. Med. Inform. Assoc. 23(2), 304\u2013310 (2015)","journal-title":"J. Am. Med. Inform. Assoc."},{"key":"2103_CR41","doi-asserted-by":"publisher","unstructured":"Zhang, Z., Chen, P.: Bladder whole slide dataset. figshare. Dataset. (2019). https:\/\/doi.org\/10.6084\/m9.figshare.8116043.v2","DOI":"10.6084\/m9.figshare.8116043.v2"},{"key":"2103_CR42","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., et al.: Bleu: a method for automatic evaluation of machine translation. In: Proceedings of the 40th annual meeting of the Association for Computational Linguistics. 311\u2013318 (2002)","DOI":"10.3115\/1073083.1073135"},{"key":"2103_CR43","unstructured":"Banerjee, S., Lavie, A.: METEOR: an automatic metric for MT evaluation with improved correlation with human judgments. In: Proceedings of the ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation and\/or Summarization. 65\u201372 (2005)"},{"key":"2103_CR44","unstructured":"Lin, C. Y.: Rouge: a package for automatic evaluation of summaries. In: Text Summarization Branches Out. 74\u201381 (2004)"}],"container-title":["Multimedia Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-025-02103-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s00530-025-02103-x","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s00530-025-02103-x.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,2,11]],"date-time":"2026-02-11T04:19:22Z","timestamp":1770783562000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s00530-025-02103-x"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,23]]},"references-count":44,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2026,2]]}},"alternative-id":["2103"],"URL":"https:\/\/doi.org\/10.1007\/s00530-025-02103-x","relation":{},"ISSN":["0942-4962","1432-1882"],"issn-type":[{"value":"0942-4962","type":"print"},{"value":"1432-1882","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,12,23]]},"assertion":[{"value":"4 September 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"17 November 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"23 December 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no conflict of interest to report regarding the present study.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"53"}}