{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,4]],"date-time":"2026-03-04T17:10:44Z","timestamp":1772644244509,"version":"3.50.1"},"reference-count":61,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2020,1,1]],"date-time":"2020-01-01T00:00:00Z","timestamp":1577836800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/creativecommons.org\/licenses\/by\/4.0\/legalcode"}],"funder":[{"DOI":"10.13039\/501100003399","name":"Science and Technology Innovation Action Plan Project of Shanghai Science and Technology Commission","doi-asserted-by":"publisher","award":["18511104202"],"award-info":[{"award-number":["18511104202"]}],"id":[{"id":"10.13039\/501100003399","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Access"],"published-print":{"date-parts":[[2020]]},"DOI":"10.1109\/access.2020.2999568","type":"journal-article","created":{"date-parts":[[2020,6,3]],"date-time":"2020-06-03T20:14:12Z","timestamp":1591215252000},"page":"104543-104554","source":"Crossref","is-referenced-by-count":25,"title":["Cross-Lingual Image Caption Generation Based on Visual Attention Model"],"prefix":"10.1109","volume":"8","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-5860-3440","authenticated-orcid":false,"given":"Bin","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7591-788X","authenticated-orcid":false,"given":"Cungang","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0760-9241","authenticated-orcid":false,"given":"Qian","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-7824-5954","authenticated-orcid":false,"given":"Ying","family":"Su","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8100-9194","authenticated-orcid":false,"given":"Yang","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5429-3177","authenticated-orcid":false,"given":"Yanyan","family":"Xu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P18-1073"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2896494"},{"key":"ref33","article-title":"Improved image captioning via policy gradient optimization of SPIDEr","author":"liu","year":"2016","journal-title":"arXiv 1612 00370"},{"key":"ref32","article-title":"Boosting image captioning with attributes","author":"yao","year":"2016","journal-title":"arXiv 1611 01646"},{"key":"ref31","first-page":"763","article-title":"Neural image caption generation with weighted training and reference","volume":"11","author":"guiguang","year":"2018","journal-title":"Cogn Comput"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.29"},{"key":"ref37","first-page":"1808","article-title":"Learning generative models with visual attention","author":"tang","year":"2014","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.128"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-016-0965-7"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"ref60","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2017.10.018"},{"key":"ref61","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.667"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"ref29","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.111"},{"key":"ref2","first-page":"2048","article-title":"Show, attend and tell: Neural image caption generation with visual attention","volume":"2015","author":"xu","year":"2015","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.503"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/P15-2064"},{"key":"ref22","article-title":"Unifying visual-semantic embeddings with multimodal neural language models","author":"kiros","year":"2014","journal-title":"arXiv 1411 2539"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1007\/s10115-018-1232-8"},{"key":"ref24","first-page":"1292","article-title":"Image description using visual dependency representations","author":"elliott","year":"2013","journal-title":"Proc EMNLP"},{"key":"ref23","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.162"},{"key":"ref26","article-title":"Night time haze and glow removal using deep dilated convolutional network","author":"kuanar","year":"2019","journal-title":"arXiv 1902 00855"},{"key":"ref25","first-page":"3104","article-title":"Sequence to sequence learning with neural networks","author":"sutskever","year":"2014","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1007\/s10994-014-5456-x"},{"key":"ref59","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2018.00260"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298754"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.303"},{"key":"ref56","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123366"},{"key":"ref55","doi-asserted-by":"publisher","DOI":"10.1145\/2911996.2912049"},{"key":"ref54","first-page":"571","article-title":"Project adam: Building an efficient and scalable deep learning training system","author":"chilimbi","year":"2014","journal-title":"Proc USENIX Symp on Operating System Design and Implementation"},{"key":"ref53","first-page":"1504","article-title":"Equilibrated adaptive learning rates for non-convex optimization","author":"dauphin","year":"2015","journal-title":"Proc Int Conf Neural Inf Process"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/BigData.2015.7364091"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2599174"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46454-1_24"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.13053\/cys-18-3-2043"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.2018.8462243"},{"key":"ref13","article-title":"Google&#x2019;s neural machine translation system: Bridging the gap between human and machine translation","author":"wu","year":"2016","journal-title":"arXiv 1609 08144"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2018.2890628"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.345"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1145\/3240508.3240640"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/P16-1168"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123366"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/P15-1041"},{"key":"ref4","first-page":"1143","article-title":"Im2Text: Describing images using 1 million captioned photographs","author":"ordonez","year":"2011","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2018.05.080"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1179"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1613\/jair.3994"},{"key":"ref8","doi-asserted-by":"crossref","first-page":"436","DOI":"10.1038\/nature14539","article-title":"Deep learning","volume":"521","author":"lecun","year":"2015","journal-title":"Nature"},{"key":"ref7","article-title":"Neural machine translation by jointly learning to align and translate","author":"bahdanau","year":"2014","journal-title":"arXiv 1409 0473"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.3115\/1626355.1626389"},{"key":"ref9","first-page":"595","article-title":"Multimodal neural language models","author":"kiros","year":"2014","journal-title":"Proc Int Conf Mach Learn"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2587640"},{"key":"ref45","first-page":"311","article-title":"BLEU: A method for automatic evaluation of machine translation","author":"papineni","year":"2002","journal-title":"Proc 40th Ann Meeting Assoc for Computational Linguistics (ACL 02)"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.131"},{"key":"ref47","first-page":"74","article-title":"ROUGE: A package for automatic evaluation of summaries","author":"lin","year":"2004","journal-title":"Proc Workshop Text Summarization Branches Out"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/ISCIS.2009.5291865"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-41278-3_74"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/j.cie.2017.04.034"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/TCST.2010.2084088"}],"container-title":["IEEE Access"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/6287639\/8948470\/09107263.pdf?arnumber=9107263","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,1,12]],"date-time":"2022-01-12T01:09:37Z","timestamp":1641949777000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9107263\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020]]},"references-count":61,"URL":"https:\/\/doi.org\/10.1109\/access.2020.2999568","relation":{},"ISSN":["2169-3536"],"issn-type":[{"value":"2169-3536","type":"electronic"}],"subject":[],"published":{"date-parts":[[2020]]}}}