{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,29]],"date-time":"2026-07-29T02:15:04Z","timestamp":1785291304875,"version":"3.55.0"},"reference-count":51,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2015,6]]},"DOI":"10.1109\/cvpr.2015.7298754","type":"proceedings-article","created":{"date-parts":[[2015,10,15]],"date-time":"2015-10-15T22:42:06Z","timestamp":1444948926000},"page":"1473-1482","source":"Crossref","is-referenced-by-count":801,"title":["From captions to visual concepts and back"],"prefix":"10.1109","author":[{"given":"Hao","family":"Fang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Saurabh","family":"Gupta","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Forrest","family":"Iandola","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Rupesh K.","family":"Srivastava","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Li","family":"Deng","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Piotr","family":"Dollar","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jianfeng","family":"Gao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xiaodong","family":"He","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Margaret","family":"Mitchell","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"John C.","family":"Platt","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"C. Lawrence","family":"Zitnick","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Geoffrey","family":"Zweig","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","article-title":"Trainable methods for surface natural language generation","author":"ratnaparkhi","year":"2000","journal-title":"NAACL"},{"key":"ref38","article-title":"Collecting image annotations using Amazon's mechanical turk","author":"rashtchian","year":"2010","journal-title":"NAACL HLT Workshop on Creating Speech and Language Data with Amazon's Mechanical Turk"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1145\/1273496.1273577"},{"key":"ref32","article-title":"Generating image descriptions from computer vision detections","author":"mitchell","year":"2012","journal-title":"EACL"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.1109\/ASRU.2011.6163930"},{"key":"ref30","article-title":"A framework for multiple-instance learning","author":"maron","year":"1998","journal-title":"NIPS"},{"key":"ref37","article-title":"Bleu: a method for automatic evaluation of machine translation","author":"papineni","year":"2002","journal-title":"ACL"},{"key":"ref36","article-title":"Im2text: Describing images using 1 million captioned photographs","author":"ordonez","year":"2011","journal-title":"NIPS"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.3115\/1075096.1075117"},{"key":"ref34","article-title":"A fast and simple algorithm for training neural probabilistic language models","author":"mnih","year":"2012","journal-title":"ICML"},{"key":"ref28","article-title":"Microsoft COCO: Common objects in context","author":"lin","year":"2014","journal-title":"ECCV"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.3115\/1218955.1219032"},{"key":"ref29","article-title":"Explain images with multimodal recurrent neural networks","author":"mao","year":"2014","journal-title":"ar Xiv preprint arXiv 1410 1090"},{"key":"ref2","article-title":"A maximum entropy approach to natural language processing","author":"berger","year":"1996","journal-title":"Computational Linguistics"},{"key":"ref1","article-title":"METEOR: An automatic metric for MT evaluation with improved correlation with human judgments","author":"banerjee","year":"2005","journal-title":"ACL Workshop on Intrinsic and Extrinsic Evaluation Measures for Machine Translation And\/or Summarization"},{"key":"ref20","article-title":"Multimodal neural language models","author":"kiros","year":"2013","journal-title":"NIPS Deep Learning Workshop"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995466"},{"key":"ref21","article-title":"ImageNet classification with deep convolutional neural networks","author":"krizhevsky","year":"2012","journal-title":"NIPS"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP.1993.319225"},{"key":"ref23","article-title":"Collective generation of natural image descriptions","author":"kuznetsova","year":"2012","journal-title":"ACL"},{"key":"ref26","article-title":"Composing simple image descriptions using web-scale n-grams","author":"li","year":"2011","journal-title":"CoNLL"},{"key":"ref25","article-title":"Phrase-based image captioning","author":"lebret","year":"0","journal-title":"arXiv preprint arXiv 1502 04539 2015"},{"key":"ref50","article-title":"Edge boxes: Locating object proposals from edges","author":"zitnick","year":"2014","journal-title":"ECCV"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.387"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/P14-2074"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-009-0275-4"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1016\/S0885-2308(02)00025-6"},{"key":"ref12","article-title":"Every picture tells a story: Generating sentences from images","author":"farhadi","year":"2010","journal-title":"ECCV"},{"key":"ref13","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.81"},{"key":"ref14","article-title":"Using k-poselets for detecting people and localizing their key-points","author":"gkioxari","year":"2014","journal-title":"CVPR"},{"key":"ref15","doi-asserted-by":"crossref","first-page":"853","DOI":"10.1613\/jair.3994","article-title":"Framing image description as a ranking task: Data, models and evaluation metrics","volume":"47","author":"hodosh","year":"2013","journal-title":"JAIR"},{"key":"ref16","article-title":"Learning deep structured semantic models for web search using clickthrough data","author":"huang","year":"2013","journal-title":"CIKM"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654889"},{"key":"ref18","article-title":"Deep visual-semantic alignments for generating image descriptions","author":"karpathy","year":"2015","journal-title":"CVPR"},{"key":"ref19","article-title":"Deep fragment em-beddings for bidirectional image sentence mapping","author":"karpathy","year":"2014","journal-title":"ar Xiv preprint arXiv 1406 5679"},{"key":"ref4","article-title":"Microsoft coco captions: Data collection and evaluation server","author":"chen","year":"2015","journal-title":"arXiv preprint arXiv 1504 00325"},{"key":"ref3","doi-asserted-by":"crossref","DOI":"10.1609\/aaai.v24i1.7519","article-title":"Toward an architecture for never-ending language learning","author":"carlson","year":"2010","journal-title":"AAAI"},{"key":"ref6","article-title":"Mind's eye: A recurrent visual representation for image caption generation","author":"chen","year":"2015","journal-title":"CVPR"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2013.178"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.412"},{"key":"ref7","article-title":"ImageNet: A large-scale hierarchical image database","author":"deng","year":"2009","journal-title":"CVPR"},{"key":"ref49","article-title":"Multiple instance boosting for object detection","author":"zhang","year":"2005","journal-title":"NIPS"},{"key":"ref9","article-title":"Long-term recurrent convolutional networks for visual recognition and description","author":"donahue","year":"2015","journal-title":"CVPR"},{"key":"ref46","article-title":"Show, attend and tell: Neural image caption generation with visual attention","author":"xu","year":"2015","journal-title":"ar Xiv preprint arXiv 1502 07830"},{"key":"ref45","article-title":"Show and tell: A neural image caption generator","author":"vinyals","year":"2015","journal-title":"CVPR"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2010.2050411"},{"key":"ref47","article-title":"Corpus-guided sentence generation of natural images","author":"yang","year":"2011","journal-title":"EMNLP"},{"key":"ref42","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2014","journal-title":"CoRR"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1145\/2661829.2661935"},{"key":"ref44","article-title":"Cider: Consensus-based image description evaluation","author":"vedantam","year":"2014","journal-title":"CoRR"},{"key":"ref43","article-title":"Grounded compositional semantics for finding and describing images with sentences","author":"socher","year":"2013","journal-title":"NIPS Deep Learning Workshop"}],"event":{"name":"2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)","location":"Boston, MA, USA","start":{"date-parts":[[2015,6,7]]},"end":{"date-parts":[[2015,6,12]]}},"container-title":["2015 IEEE Conference on Computer Vision and Pattern Recognition (CVPR)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7293313\/7298593\/07298754.pdf?arnumber=7298754","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,15]],"date-time":"2023-08-15T11:39:09Z","timestamp":1692099549000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/7298754\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,6]]},"references-count":51,"URL":"https:\/\/doi.org\/10.1109\/cvpr.2015.7298754","relation":{},"subject":[],"published":{"date-parts":[[2015,6]]}}}