{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,1,30]],"date-time":"2026-01-30T22:05:34Z","timestamp":1769810734746,"version":"3.49.0"},"reference-count":53,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2025,12,29]],"date-time":"2025-12-29T00:00:00Z","timestamp":1766966400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"},{"start":{"date-parts":[[2025,12,29]],"date-time":"2025-12-29T00:00:00Z","timestamp":1766966400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by-nc-nd\/4.0"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Complex Intell. Syst."],"published-print":{"date-parts":[[2026,1]]},"DOI":"10.1007\/s40747-025-02163-6","type":"journal-article","created":{"date-parts":[[2025,12,29]],"date-time":"2025-12-29T13:24:06Z","timestamp":1767014646000},"update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Image captioning for life ecological experiment of China\u2019s space station"],"prefix":"10.1007","volume":"12","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-9362-3447","authenticated-orcid":false,"given":"Yunfei","family":"Liu","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yizhao","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chen","family":"Du","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yunziwei","family":"Deng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Anqi","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yanan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"ShengYang","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2025,12,29]]},"reference":[{"key":"2163_CR1","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show and tell: a neural image caption generator. In: Proceedings of CVPR, pp 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"2163_CR2","doi-asserted-by":"crossref","unstructured":"Karpathy A, Li F-F (2015) Deep visual-semantic alignments for generating image descriptions. In: Proceedings of CVPR, pp 3128\u20133137","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"2163_CR3","unstructured":"Xu K et al (2015) Show, attend and tell: neural image caption generation with visual attention. In: Proceedings of ICML, pp 2048\u20132057"},{"key":"2163_CR4","unstructured":"Sammani F, Elsayed M (2019) Look and modify: modification networks for image captioning. In: Proceedings of BMVC, p 75"},{"issue":"7","key":"2163_CR5","doi-asserted-by":"publisher","first-page":"2631","DOI":"10.1109\/TCYB.2018.2831447","volume":"49","author":"Y Bin","year":"2019","unstructured":"Bin Y, Yang Y, Shen F, Xie N, Shen HT, Li X (2019) Describing video with attention-based bidirectional LSTM. IEEE Trans Cybern 49(7):2631\u20132641. https:\/\/doi.org\/10.1109\/TCYB.2018.2831447","journal-title":"IEEE Trans Cybern"},{"key":"2163_CR6","unstructured":"Yang Z et al (2016) Review networks for caption generation. In: Proceedings of NeurIPS, pp 2361\u20132369"},{"key":"2163_CR7","doi-asserted-by":"crossref","unstructured":"Lu J et al (2017) Knowing when to look: adaptive attention via a visual sentinel for image captioning. In: Proceedings of CVPR, pp 3242\u20133250","DOI":"10.1109\/CVPR.2017.345"},{"key":"2163_CR8","doi-asserted-by":"crossref","unstructured":"Huang L et al (2019) Attention on attention for image captioning. In: Proceedings of ICCV, pp 4633\u20134642","DOI":"10.1109\/ICCV.2019.00473"},{"key":"2163_CR9","unstructured":"Hashimoto TB et al (2018) A retrieve-and-edit framework for predicting structured outputs. In: Proceedings of NeurIPS, pp 10073\u201310083"},{"key":"2163_CR10","doi-asserted-by":"publisher","first-page":"291","DOI":"10.1016\/j.neucom.2018.05.080","volume":"311","author":"S Bai","year":"2018","unstructured":"Bai S, An S (2018) A survey on automatic image caption generation. Neurocomputing 311:291\u2013304","journal-title":"Neurocomputing"},{"key":"2163_CR11","doi-asserted-by":"crossref","unstructured":"Farhadi A et al (2010) Every picture tells a story: generating sentences from images. In: Proceedings of ECCV, pp 15\u201329","DOI":"10.1007\/978-3-642-15561-1_2"},{"key":"2163_CR12","unstructured":"Ordonez V, Kulkarni G, Berg T (2011) Im2Text: describing images using 1 million captioned photographs. In: Proceedings of NeurIPS, pp 1143\u20131151"},{"key":"2163_CR13","unstructured":"Yang Y et al (2011) Corpus-guided sentence generation of natural images. In: Proceedings of EMNLP, pp 444\u2013454"},{"issue":"12","key":"2163_CR14","doi-asserted-by":"publisher","first-page":"2891","DOI":"10.1109\/TPAMI.2012.162","volume":"35","author":"G Kulkarni","year":"2013","unstructured":"Kulkarni G, Premraj V, Ordonez V, Dhar S, Li S, Choi Y, Berg AC, Berg TL (2013) BabyTalk: understanding and generating simple image descriptions. IEEE Trans Pattern Anal Mach Intell 35(12):2891\u20132903. https:\/\/doi.org\/10.1109\/TPAMI.2012.162","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"2163_CR15","doi-asserted-by":"crossref","unstructured":"Anderson P et al (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: Proceedings of CVPR, pp 6077\u20136086","DOI":"10.1109\/CVPR.2018.00636"},{"key":"2163_CR16","doi-asserted-by":"publisher","first-page":"335","DOI":"10.1007\/s00521-015-1846-7","volume":"27","author":"L Bai","year":"2016","unstructured":"Bai L, Li K, Pei J, Jiang S (2016) Main objects interaction activity recognition in real images. Neural Comput Appl 27:335\u2013348","journal-title":"Neural Comput Appl"},{"key":"2163_CR17","doi-asserted-by":"crossref","unstructured":"Rennie SJ et al (2017) Self-critical sequence training for image captioning. In: Proceeding of CVPR, pp 1179\u20131195","DOI":"10.1109\/CVPR.2017.131"},{"key":"2163_CR18","doi-asserted-by":"crossref","unstructured":"Wu Q et al (2016) What value do explicit high level concepts have in vision to language problems? In: Proceedings of CVPR, pp 203\u2013212","DOI":"10.1109\/CVPR.2016.29"},{"key":"2163_CR19","doi-asserted-by":"crossref","unstructured":"You Q et al (2016) Image captioning with semantic attention. In: Proceedings of CVPR, pp 4651\u20134659","DOI":"10.1109\/CVPR.2016.503"},{"key":"2163_CR20","doi-asserted-by":"crossref","unstructured":"Gan Z et al (2017) Semantic compositional networks for visual captioning. In: Proceedings of CVPR, pp 1141\u20131150","DOI":"10.1109\/CVPR.2017.127"},{"key":"2163_CR21","doi-asserted-by":"crossref","unstructured":"Lu J et al (2018) Neural baby talk. In: Proceedings of CVPR, pp 7219\u20137228","DOI":"10.1109\/CVPR.2018.00754"},{"key":"2163_CR22","doi-asserted-by":"crossref","unstructured":"Agrawal H et al (2019) nocaps: novel object captioning at scale. In: Proceedings of ICCV, pp 8947\u20138956","DOI":"10.1109\/ICCV.2019.00904"},{"key":"2163_CR23","doi-asserted-by":"crossref","unstructured":"Li L et al (2019) Relation-aware graph attention network for visual question answering. In: Proceedings of ICCV, pp 10312\u201310321","DOI":"10.1109\/ICCV.2019.01041"},{"key":"2163_CR24","doi-asserted-by":"crossref","unstructured":"Li J et al (2024) EVCap: retrieval-augmented image captioning with external visual-name memory for open-world comprehension. In: Proceedings of CVPR, pp 13733\u201313742","DOI":"10.1109\/CVPR52733.2024.01303"},{"key":"2163_CR25","doi-asserted-by":"publisher","first-page":"107390","DOI":"10.1016\/j.neunet.2025.107390","volume":"187","author":"Q Xu","year":"2025","unstructured":"Xu Q et al (2025) Multi-level semantic-aware transformer for image captioning. Neural Netw 187:107390","journal-title":"Neural Netw"},{"issue":"4","key":"2163_CR26","first-page":"129","volume":"35","author":"Y Xiao","year":"2021","unstructured":"Xiao Y, Jiang A, Wang M, Jie A (2021) Chinese image captioning based on middle-level visual-semantic composite attributes. J Chin Inf Process 35(4):129\u2013138","journal-title":"J Chin Inf Process"},{"issue":"2","key":"2163_CR27","doi-asserted-by":"publisher","first-page":"1247","DOI":"10.1109\/TCYB.2020.2997034","volume":"52","author":"M Liu","year":"2022","unstructured":"Liu M, Hu H, Li L, Yu Y, Guan W (2022) Chinese image caption generation via visual attention and topic modeling. IEEE Trans Cybern 52(2):1247\u20131257. https:\/\/doi.org\/10.1109\/TCYB.2020.2997034","journal-title":"IEEE Trans Cybern"},{"key":"2163_CR28","doi-asserted-by":"publisher","first-page":"9481","DOI":"10.1007\/s00521-022-08072-w","volume":"35","author":"J Zhou","year":"2023","unstructured":"Zhou J et al (2023) Spatial-aware topic-driven based image Chinese caption for disaster news. Neural Comput Appl 35:9481\u20139500","journal-title":"Neural Comput Appl"},{"key":"2163_CR29","doi-asserted-by":"crossref","unstructured":"Wu J et al (2019) Large-scale datasets for going deeper in image understanding. In: Proceedings of ICME, pp 1480\u20131485","DOI":"10.1109\/ICME.2019.00256"},{"key":"2163_CR30","unstructured":"Xie Q et al (2020) Unsupervised data augmentation for consistency training. In: Proceedings of NeurIPS, pp 1\u201313"},{"key":"2163_CR31","unstructured":"Li J, Socher R, Hoi SCH (2020) DivideMix: learning with noisy labels as semi-supervised learning. In: Proceedings of ICLR, pp 1\u201313"},{"key":"2163_CR32","unstructured":"Yang S et al (2022) Image data augmentation for deep learning: a survey. arXiv:2204.08610"},{"issue":"7","key":"2163_CR33","doi-asserted-by":"publisher","first-page":"13001","DOI":"10.1609\/aaai.v34i07.7000","volume":"34","author":"Z Zhong","year":"2020","unstructured":"Zhong Z et al (2020) Random erasing data augmentation. Proc AAAI 34(7):13001\u201313008","journal-title":"Proc AAAI"},{"key":"2163_CR34","doi-asserted-by":"crossref","unstructured":"Yun S et al (2019) CutMix: regularization strategy to train strong classifiers with localizable features. In: Proceedings of ICCV, pp 6022\u20136031","DOI":"10.1109\/ICCV.2019.00612"},{"key":"2163_CR35","doi-asserted-by":"crossref","unstructured":"Cubuk ED et al (2020) RandAugment: practical automated data augmentation with a reduced search space. In: Proceedings of CVPR workshops, pp 3008\u20133017","DOI":"10.1109\/CVPRW50498.2020.00359"},{"key":"2163_CR36","unstructured":"Berthelot D et al (2020) ReMixMatch: semi-supervised learning with distribution matching and augmentation anchoring. In: Proceedings of ICLR, pp 1\u201313"},{"key":"2163_CR37","unstructured":"Sohn K et al (2020) FixMatch: simplifying semi-supervised learning with consistency and confidence. arXiv:2001.07685"},{"key":"2163_CR38","unstructured":"Zhang Y et al (2022) Expanding small-scale datasets with guided imagination. arXiv:2211.13976"},{"key":"2163_CR39","unstructured":"He R et al (2022) Is synthetic data from generative models ready for image recognition? arXiv:2210.07574"},{"key":"2163_CR40","unstructured":"Dunlap L et al (2023) Diversify your vision datasets with automatic diffusion-based augmentation. arXiv:2305.16289"},{"key":"2163_CR41","doi-asserted-by":"crossref","unstructured":"Brooks T, Holynski A, Efros AA (2023) InstructPix2Pix: learning to follow image editing instructions. arXiv:2211.09800","DOI":"10.1109\/CVPR52729.2023.01764"},{"key":"2163_CR42","doi-asserted-by":"crossref","unstructured":"Ruiz N et al (2022) DreamBooth: fine tuning text-to-image diffusion models for subject-driven generation. arXiv:2208.12242","DOI":"10.1109\/CVPR52729.2023.02155"},{"key":"2163_CR43","doi-asserted-by":"publisher","first-page":"853","DOI":"10.1613\/jair.3994","volume":"47","author":"M Hodosh","year":"2013","unstructured":"Hodosh M, Young P, Hockenmaier J (2013) Framing image description as a ranking task: data, models and evaluation metrics. J Artif Intell Res 47:853\u2013899. https:\/\/doi.org\/10.1613\/jair.3994","journal-title":"J Artif Intell Res"},{"key":"2163_CR44","doi-asserted-by":"publisher","first-page":"67","DOI":"10.1162\/tacl_a_00166","volume":"2","author":"P Young","year":"2014","unstructured":"Young P, Lai A, Hodosh M, Hockenmaier J (2014) From image descriptions to visual denotations: new similarity metrics for semantic inference over event descriptions. Trans Assoc Comput Linguist 2:67\u201378. https:\/\/doi.org\/10.1162\/tacl_a_00166","journal-title":"Trans Assoc Comput Linguist"},{"key":"2163_CR45","unstructured":"Chen X et al (2015) Microsoft COCO captions: data collection and evaluation server. arXiv:1504.00325"},{"key":"2163_CR46","doi-asserted-by":"crossref","unstructured":"Vedantam R, Zitnick CL, Parikh D (2015) CIDEr: consensus-based image description evaluation. In: Proceedings of CVPR, pp 4566\u20134575","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"2163_CR47","unstructured":"Ranzato M et al (2016) Sequence level training with recurrent neural networks. In: Proceedings of ICLR, pp 1\u201316"},{"key":"2163_CR48","doi-asserted-by":"crossref","unstructured":"Gu J et al (2018) Stack-captioning: coarse-to-fine learning for image captioning. In: Proceedings of AAAI, pp 6837\u20136844","DOI":"10.1609\/aaai.v32i1.12266"},{"key":"2163_CR49","doi-asserted-by":"crossref","unstructured":"Papineni K et al (2002) BLEU: a method for automatic evaluation of machine translation. In: Proceedings of ACL, pp 311\u2013318","DOI":"10.3115\/1073083.1073135"},{"key":"2163_CR50","unstructured":"Banerjee S, Lavie A (2005) METEOR: an automatic metric for MT evaluation with improved correlation with human judgments. In: Proceedings of ACL workshop, pp 65\u201372"},{"key":"2163_CR51","unstructured":"Flick C (2004) ROUGE: a package for automatic evaluation of summaries. In: Proceedings of workshop text summarization branches out, pp 74\u201381"},{"key":"2163_CR52","doi-asserted-by":"crossref","unstructured":"Anderson P et al (2016) SPICE: semantic propositional image caption evaluation. In: Proceedings of ECCV, pp 382\u2013398","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"2163_CR53","doi-asserted-by":"crossref","unstructured":"Gim\u00e9nez J, M\u00e0rquez L (2007) Linguistic features for automatic evaluation of heterogeneous MT systems. In: Proceedings of ACL workshop, pp 256\u2013264","DOI":"10.3115\/1626355.1626393"}],"container-title":["Complex &amp; Intelligent Systems"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s40747-025-02163-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s40747-025-02163-6","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s40747-025-02163-6.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,1,30]],"date-time":"2026-01-30T11:49:08Z","timestamp":1769773748000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s40747-025-02163-6"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,12,29]]},"references-count":53,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2026,1]]}},"alternative-id":["2163"],"URL":"https:\/\/doi.org\/10.1007\/s40747-025-02163-6","relation":{},"ISSN":["2199-4536","2198-6053"],"issn-type":[{"value":"2199-4536","type":"print"},{"value":"2198-6053","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,12,29]]},"assertion":[{"value":"10 February 2025","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"3 November 2025","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"29 December 2025","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}},{"order":1,"name":"Ethics","group":{"name":"EthicsHeading","label":"Declarations"}},{"value":"The authors declare that they have no known competing financial interests or personal relationships that could have appeared to influence the work reported in this paper.","order":2,"name":"Ethics","group":{"name":"EthicsHeading","label":"Conflict of interest"}}],"article-number":"46"}}