{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,10,16]],"date-time":"2025-10-16T10:05:30Z","timestamp":1760609130553,"version":"3.37.3"},"reference-count":42,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2019,1,9]],"date-time":"2019-01-09T00:00:00Z","timestamp":1546992000000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["61673402","61273270"],"award-info":[{"award-number":["61673402","61273270"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["60802069"],"award-info":[{"award-number":["60802069"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Neural Process Lett"],"published-print":{"date-parts":[[2019,8]]},"DOI":"10.1007\/s11063-019-09979-7","type":"journal-article","created":{"date-parts":[[2019,1,9]],"date-time":"2019-01-09T11:05:58Z","timestamp":1547031958000},"page":"431-443","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":7,"title":["Image Caption with Endogenous\u2013Exogenous Attention"],"prefix":"10.1007","volume":"50","author":[{"given":"Teng","family":"Wang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4884-323X","authenticated-orcid":false,"given":"Haifeng","family":"Hu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chen","family":"He","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2019,1,9]]},"reference":[{"key":"9979_CR1","doi-asserted-by":"crossref","unstructured":"Anderson P, He X, Buehler C, Teney D, Johnson M, Gould S, Zhang L (2018) Bottom-up and top-down attention for image captioning and visual question answering. In: CVPR, vol 3, p 6","DOI":"10.1109\/CVPR.2018.00636"},{"key":"9979_CR2","unstructured":"Ankush G, Yashaswi V, Jawahar CV (2012) Choosing linguistics over vision to describe images. In: AAAI"},{"key":"9979_CR3","unstructured":"Ba J, Mnih V, Kavukcuoglu K (2014) Multiple object recognition with visual attention. arXiv preprint \n                    arXiv:1412.7755"},{"key":"9979_CR4","unstructured":"Bahdanau D, Cho K, Bengio Y (2015) Neural machine translation by jointly learning to align and translater. In: ICLR"},{"key":"9979_CR5","doi-asserted-by":"crossref","unstructured":"Chen X, Lawrence\u00a0Zitnick C (2015) Mind\u2019s eye: a recurrent visual representation for image caption generation. In: CVPR, pp 2422\u20132431","DOI":"10.1109\/CVPR.2015.7298856"},{"key":"9979_CR6","doi-asserted-by":"crossref","unstructured":"Devlin J, Cheng H, Fang H, Gupta S, Deng L, He X, Zweig G, Mitchell M (2015) Language models for image captioning: the quirks and what works. arXiv preprint \n                    arXiv:1505.01809","DOI":"10.3115\/v1\/P15-2017"},{"key":"9979_CR7","doi-asserted-by":"crossref","unstructured":"Donahue J, Anne\u00a0Hendricks L, Guadarrama S, Rohrbach M, Venugopalan S, Saenko K, Darrell T (2015) Long-term recurrent convolutional networks for visual recognition and description. In: CVPR, pp 2625\u20132634","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"9979_CR8","doi-asserted-by":"crossref","unstructured":"Farhadi A, Hejrati M, Sadeghi MA, Young P, Rashtchian C, Hockenmaier J, Forsyth D (2010) Every picture tells a story: generating sentences from images. In: ECCV, pp 15\u201329","DOI":"10.1007\/978-3-642-15561-1_2"},{"issue":"12","key":"9979_CR9","doi-asserted-by":"publisher","first-page":"2321","DOI":"10.1109\/TPAMI.2016.2642953","volume":"39","author":"K Fu","year":"2016","unstructured":"Fu K, Jin J, Cui R, Sha F, Zhang C (2016) Aligning where to see and what to tell: image caption with region-based attention and scene-specific contexts. IEEE Trans Pattern Anal Mach Intell 39(12):2321\u20132334","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"9979_CR10","unstructured":"Gregor K, Danihelka I, Graves A, Rezende D, Wierstra D (2015) Draw: a recurrent neural network for image generation. In: ICML, pp 1462\u20131471"},{"key":"9979_CR11","doi-asserted-by":"crossref","unstructured":"Gupta A, Mannem P (2012) From image annotation to image description. In: ICNIP, pp 196\u2013204","DOI":"10.1007\/978-3-642-34500-5_24"},{"key":"9979_CR12","doi-asserted-by":"crossref","unstructured":"He K, Zhang X, Ren S, Sun J (2016) Deep residual learning for image recognition. In: CVPR, pp 770\u2013778","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"9979_CR13","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter S, Schmidhuber J (1997) Long short-term memory. Neural Comput 9(8):1735\u20131780","journal-title":"Neural Comput"},{"issue":"3","key":"9979_CR14","doi-asserted-by":"publisher","first-page":"615","DOI":"10.1080\/713755835","volume":"52","author":"TL Hodgson","year":"1999","unstructured":"Hodgson TL, Muller HJ (1999) Attentional orienting in two-dimensional space. Q J Exp Psychol Sect A 52(3):615\u2013648","journal-title":"Q J Exp Psychol Sect A"},{"issue":"6","key":"9979_CR15","first-page":"3742","volume":"62","author":"C Hong","year":"2015","unstructured":"Hong C, Yu J, Tao D, Wang M (2015) Image-based three-dimensional human pose recovery by multiview locality-sensitive sparse retrieval. IEEE Trans Indust Elect 62(6):3742\u20133751","journal-title":"IEEE Trans Indust Elect"},{"issue":"12","key":"9979_CR16","doi-asserted-by":"publisher","first-page":"5659","DOI":"10.1109\/TIP.2015.2487860","volume":"24","author":"C Hong","year":"2015","unstructured":"Hong C, Yu J, Wan J, Tao D, Wang M (2015) Multimodal deep autoencoder for human pose recovery. IEEE Trans Imag Proc 24(12):5659\u20135670","journal-title":"IEEE Trans Imag Proc"},{"key":"9979_CR17","doi-asserted-by":"crossref","unstructured":"Jia X, Gavves E, Fernando B, Tuytelaars T (2015) Guiding the long-short term memory model for image caption generation. In: ICCV, pp 2407\u20132415","DOI":"10.1109\/ICCV.2015.277"},{"key":"9979_CR18","doi-asserted-by":"crossref","unstructured":"Karpathy A, Fei-Fei L (2015) Deep visual-semantic alignments for generating image descriptions. In: CVPR, pp 3128\u20133137","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"9979_CR19","unstructured":"Kingma DP, Ba J (2015) Adam: a method for stochastic optimization. In: ICLR. \n                    arXiv:1412.6980v9"},{"key":"9979_CR20","doi-asserted-by":"crossref","unstructured":"Kulkarni G, Premraj V, Dhar S, Li S, Choi Y, Berg AC, Berg TL (2011) Baby talk: understanding and generating image descriptions. In: CVPR","DOI":"10.1109\/CVPR.2011.5995466"},{"key":"9979_CR21","first-page":"359","volume":"1","author":"P Kuznetsova","year":"2012","unstructured":"Kuznetsova P, Ordonez V, Berg AC, Berg TL, Choi Y (2012) Collective generation of natural image descriptions. ACL 1:359\u2013368","journal-title":"ACL"},{"issue":"1","key":"9979_CR22","first-page":"351","volume":"2","author":"P Kuznetsova","year":"2014","unstructured":"Kuznetsova P, Ordonez V, Berg T, Choi Y (2014) Treetalk: composition and compression of trees for image descriptions. Trans Assoc Comput Ling 2(1):351\u2013362","journal-title":"Trans Assoc Comput Ling"},{"key":"9979_CR23","unstructured":"Lavie A, Agarwal A (2005) Meteor: an automatic metric for mt evaluation with improved correlation with human judgments. In: EMNLP workshop on statistical machine translation, pp 65\u201372"},{"key":"9979_CR24","unstructured":"Lin CY (2004) Rouge: a package for automatic evaluation of summaries. In: ACL workshop on text summarization branches out, vol 8"},{"key":"9979_CR25","doi-asserted-by":"crossref","unstructured":"Lin TY, Maire M, Belongie S, Hays J, Perona P, Ramanan D, Doll\u00e1r P, Zitnick CL (2014) Microsoft coco: common objects in context. In: ECCV, pp 740\u2013755","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"9979_CR26","unstructured":"Mao J, Xu W, Yang Y, Wang J, Huang Z, Yuille A (2015) Deep captioning with multimodal recurrent neural networks (m-rnn). In: ICLR"},{"key":"9979_CR27","unstructured":"Mitchell M, Han X, Dodge J, Mensch A, Goyal A, Berg A, Yamaguchi K, Berg T, Stratos K, Daum\u00e9\u00a0III H (2012) Midge: generating image descriptions from computer vision detections. In: EACL, pp 747\u2013756"},{"issue":"2","key":"9979_CR28","doi-asserted-by":"publisher","first-page":"315","DOI":"10.1037\/0096-1523.15.2.315","volume":"15","author":"HJ M\u00fcller","year":"1989","unstructured":"M\u00fcller HJ, Rabbitt PM (1989) Reflexive and voluntary orienting of visual attention: time course of activation and resistance to interruption. J Exp Psychol Hum Percept Perform 15(2):315","journal-title":"J Exp Psychol Hum Percept Perform"},{"key":"9979_CR29","unstructured":"Ordonez V, Kulkarni G, Berg TL (2011) Im2text: describing images using 1 million captioned photographs. In: NIPS, pp 1143\u20131151"},{"key":"9979_CR30","unstructured":"Papineni K, Roukos S, Ward T, Zhu WJ (2002) Bleu: a method for automatic evaluation of machine translation. In: AMACL, pp 311\u2013318"},{"key":"9979_CR31","doi-asserted-by":"crossref","unstructured":"Vedantam R, Lawrence\u00a0Zitnick C, Parikh D (2015) Cider: consensus-based image description evaluation. In: CVPR, pp 4566\u20134575","DOI":"10.1109\/CVPR.2015.7299087"},{"key":"9979_CR32","doi-asserted-by":"crossref","unstructured":"Vinyals O, Toshev A, Bengio S, Erhan D (2015) Show and tell: a neural image caption generator. In: CVPR, pp 3156\u20133164","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"9979_CR33","doi-asserted-by":"crossref","unstructured":"Wu Q, Shen C, Liu L, Dick A, van\u00a0den Hengel A (2016) What value do explicit high level concepts have in vision to language problems? In: CVPR, pp 203\u2013212","DOI":"10.1109\/CVPR.2016.29"},{"key":"9979_CR34","unstructured":"Xu K, Ba J, Kiros R, Cho K, Courville A, Salakhudinov R, Zemel R, Bengio Y (2015) Show, attend and tell: neural image caption generation with visual attention. In: ICML, pp 2048\u20132057"},{"key":"9979_CR35","first-page":"106","volume":"2","author":"S Yagcioglu","year":"2015","unstructured":"Yagcioglu S, Erdem E, Erdem A, Cakici R (2015) A distributed representation based query expansion approach for image captioning. ACL-IJCNLP 2:106\u2013111","journal-title":"ACL-IJCNLP"},{"key":"9979_CR36","doi-asserted-by":"crossref","unstructured":"Yao T, Pan Y, Li Y, Qiu Z, Mei T (2017) Boosting image captioning with attributes. In: ICCV, pp 22\u201329","DOI":"10.1109\/ICCV.2017.524"},{"key":"9979_CR37","doi-asserted-by":"crossref","unstructured":"You Q, Jin H, Wang Z, Fang C, Luo J (2016) Image captioning with semantic attention. In: CVPR, pp 4651\u20134659","DOI":"10.1109\/CVPR.2016.503"},{"key":"9979_CR38","first-page":"67","volume":"2","author":"P Young","year":"2014","unstructured":"Young P, Lai A, Hodosh M, Hockenmaier J (2014) From image descriptions to visual denotations: new similarity metrics for semantic inference over event descriptions. Trans Assoc Comput Ling 2:67\u201378","journal-title":"Trans Assoc Comput Ling"},{"issue":"5","key":"9979_CR39","doi-asserted-by":"publisher","first-page":"1317","DOI":"10.1109\/TIFS.2017.2787986","volume":"13","author":"J Yu","year":"2018","unstructured":"Yu J, Kuang Z, Zhang B, Zhang W, Lin D, Fan J (2018) Leveraging content sensitiveness and user trustworthiness to recommend fine-grained privacy settings for social image sharing. IEEE Trans Inf Forensics Secur 13(5):1317\u20131332","journal-title":"IEEE Trans Inf Forensics Secur"},{"issue":"5","key":"9979_CR40","doi-asserted-by":"publisher","first-page":"2019","DOI":"10.1109\/TIP.2014.2311377","volume":"23","author":"J Yu","year":"2014","unstructured":"Yu J, Rui Y, Tao D et al (2014) Click prediction for web image reranking using multimodal sparse coding. IEEE Trans Imag Proc 23(5):2019\u20132032","journal-title":"IEEE Trans Imag Proc"},{"issue":"5","key":"9979_CR41","doi-asserted-by":"publisher","first-page":"1005","DOI":"10.1109\/TIFS.2016.2636090","volume":"12","author":"J Yu","year":"2017","unstructured":"Yu J, Zhang B, Kuang Z, Lin D, Fan J (2017) iprivacy: image privacy protection by identifying sensitive objects via deep multi-task learning. IEEE Trans Inf Forensics Secur 12(5):1005\u20131016","journal-title":"IEEE Trans Inf Forensics Secur"},{"issue":"5","key":"9979_CR42","doi-asserted-by":"publisher","first-page":"2420","DOI":"10.1109\/TIP.2018.2804218","volume":"27","author":"J Zhang","year":"2018","unstructured":"Zhang J, Yu J, Tao D (2018) Local deep-feature alignment for unsupervised dimension reduction. IEEE Trans Imag Proc 27(5):2420\u20132432","journal-title":"IEEE Trans Imag Proc"}],"container-title":["Neural Processing Letters"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-019-09979-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11063-019-09979-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11063-019-09979-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,1,8]],"date-time":"2020-01-08T19:16:11Z","timestamp":1578510971000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11063-019-09979-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,1,9]]},"references-count":42,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2019,8]]}},"alternative-id":["9979"],"URL":"https:\/\/doi.org\/10.1007\/s11063-019-09979-7","relation":{},"ISSN":["1370-4621","1573-773X"],"issn-type":[{"type":"print","value":"1370-4621"},{"type":"electronic","value":"1573-773X"}],"subject":[],"published":{"date-parts":[[2019,1,9]]},"assertion":[{"value":"9 January 2019","order":1,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}