{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T15:49:10Z","timestamp":1781797750471,"version":"3.54.5"},"reference-count":57,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2015,7,8]],"date-time":"2015-07-08T00:00:00Z","timestamp":1436313600000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2016,8]]},"DOI":"10.1007\/s11263-015-0840-y","type":"journal-article","created":{"date-parts":[[2015,7,7]],"date-time":"2015-07-07T07:16:30Z","timestamp":1436253390000},"page":"46-59","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":62,"title":["Large Scale Retrieval and Generation of Image Descriptions"],"prefix":"10.1007","volume":"119","author":[{"given":"Vicente","family":"Ordonez","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xufeng","family":"Han","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Polina","family":"Kuznetsova","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Girish","family":"Kulkarni","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Margaret","family":"Mitchell","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Kota","family":"Yamaguchi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Karl","family":"Stratos","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Amit","family":"Goyal","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jesse","family":"Dodge","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Alyssa","family":"Mensch","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"suffix":"III","given":"Hal","family":"Daum\u00e9","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Alexander C.","family":"Berg","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yejin","family":"Choi","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Tamara L.","family":"Berg","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2015,7,8]]},"reference":[{"key":"840_CR1","unstructured":"Aker, A., & Gaizauskas, R. (2010). Generating image descriptions using dependency relational patterns. In ACL."},{"key":"840_CR2","first-page":"1107","volume":"3","author":"K Barnard","year":"2003","unstructured":"Barnard, K., Duygulu, P., de Freitas, N., Forsyth, D., Blei, D., & Jordan, M. (2003). Matching words and pictures. Journal of Machine Learning Research, 3, 1107\u20131135.","journal-title":"Journal of Machine Learning Research"},{"key":"840_CR3","unstructured":"Berg, T., Berg, A., Edwards, J., & Forsyth, D. (2004) Who\u2019s in the picture?. In NIPS."},{"key":"840_CR4","unstructured":"Berg, T., Berg, A., Edwards, J., Maire, M., White, R., Learned-Miller, E., Teh, Y., & Forsyth, D. (2004). Names and faces. In CVPR."},{"key":"840_CR5","doi-asserted-by":"crossref","unstructured":"Berg, T.L., Berg, A.C., & Shih, J. (2010). Automatic attribute discovery and characterization from noisy web data. In ECCV.","DOI":"10.1007\/978-3-642-15549-9_48"},{"key":"840_CR6","unstructured":"Brants, T., & Franz., A. (2006). Web 1t 5-gram version 1. In LDC."},{"key":"840_CR7","doi-asserted-by":"crossref","unstructured":"Brin, S., & Page, L. (1998). The anatomy of a large-scale hypertextual web search engine. In WWW.","DOI":"10.1016\/S0169-7552(98)00110-X"},{"key":"840_CR8","doi-asserted-by":"crossref","unstructured":"Chum, O., Philbin, J., & Zisserman, A. (2008). Near duplicate image detection: min-hash and tf-idf weighting. In BMVC.","DOI":"10.5244\/C.22.50"},{"key":"840_CR9","doi-asserted-by":"crossref","unstructured":"Dalal, N., & Triggs, B. (2005). Histograms of oriented gradients for human detection. In CVPR.","DOI":"10.1109\/CVPR.2005.177"},{"key":"840_CR10","doi-asserted-by":"crossref","unstructured":"Deng, J., Berg, A.C., & Fei-Fei, L. (2011). Hierarchical semantic indexing for large scale image retrieval. In CVPR.","DOI":"10.1109\/CVPR.2011.5995516"},{"key":"840_CR11","doi-asserted-by":"crossref","unstructured":"Deng, J., Berg, A.C., Li, K., & Fei-Fei, L. (2010). What does classifying more than 10,000 image categories tell us?. In ECCV.","DOI":"10.1007\/978-3-642-15555-0_6"},{"key":"840_CR12","unstructured":"Deng, J., Krause, J., Berg, A.C., & Fei-Fei, L. (2012). Hedging your bets: Optimizing accuracy-specificity trade-offs in large scale visual recognition. In CVPR."},{"key":"840_CR13","unstructured":"Deng, J., Satheesh, S., Berg, A.C., & Fei-Fei, L. (2011). Fast and balanced: Efficient label tree learning for large scale object recognition. In NIPS."},{"key":"840_CR14","unstructured":"Duygulu, P., Barnard, K., de Freitas, N., & Forsyth, D. (2002). Object recognition as machine translation. In ECCV."},{"key":"840_CR15","doi-asserted-by":"crossref","unstructured":"Farhadi, A., Endres, I., Hoiem, D., & Forsyth, D.A. (2009). Describing objects by their attributes. In CVPR.","DOI":"10.1109\/CVPR.2009.5206772"},{"key":"840_CR16","doi-asserted-by":"crossref","unstructured":"Farhadi, A., Hejrati, M., Sadeghi, A., Young, P., Rashtchian, C., Hockenmaier, J., & Forsyth, D.A. (2010). Every picture tells a story: generating sentences for images. In ECCV.","DOI":"10.1007\/978-3-642-15561-1_2"},{"key":"840_CR17","unstructured":"Felzenszwalb, P.F., Girshick, R.B., McAllester, D. (2011). Discriminatively trained deformable part models, release 4. \n                    http:\/\/people.cs.uchicago.edu\/~pff\/latent-release4\/"},{"key":"840_CR18","unstructured":"Feng, Y., & Lapata, M. (2010). How many words is a picture worth? automatic caption generation for news images. In ACL."},{"key":"840_CR19","unstructured":"Ferrari, V., & Zisserman, A. (2007). Learning visual attributes. In NIPS."},{"key":"840_CR20","doi-asserted-by":"crossref","unstructured":"Guadarrama, S., Krishnamoorthy, N., Malkarnenkar, G., Venugopalan, S., Mooney, R., Darrell, T., & Saenko, K. (2013). Youtube2text: Recognizing and describing arbitrary activities using semantic hierarchies and zero-shot recognition. In ICCV.","DOI":"10.1109\/ICCV.2013.337"},{"key":"840_CR21","doi-asserted-by":"crossref","unstructured":"Hays, J., & Efros, A.A. (2008). im2gps: estimating geographic information from a single image. In CVPR.","DOI":"10.1109\/CVPR.2008.4587784"},{"key":"840_CR22","doi-asserted-by":"crossref","first-page":"853","DOI":"10.1613\/jair.3994","volume":"47","author":"M Hodosh","year":"2013","unstructured":"Hodosh, M., Young, P., & Hockenmaier, J. (2013). Framing image description as a ranking task: Data, models and evaluation metrics. Journal of Artificial Intelligence Research, 47, 853\u2013899.","journal-title":"Journal of Artificial Intelligence Research"},{"key":"840_CR23","doi-asserted-by":"crossref","unstructured":"Hoiem, D., Efros, A.A., & Hebert, M. (2005). Geometric context from a single image. In ICCV.","DOI":"10.1109\/ICCV.2005.107"},{"key":"840_CR24","doi-asserted-by":"crossref","unstructured":"Jing, Y., & Baluja, S. (2008). Pagerank for product image search. In WWW.","DOI":"10.1145\/1367497.1367540"},{"key":"840_CR25","doi-asserted-by":"publisher","first-page":"2891","DOI":"10.1109\/TPAMI.2012.162","volume":"35","author":"G Kulkarni","year":"2013","unstructured":"Kulkarni, G., Premraj, V., Ordonez, V., Dhar, S., Li, S., Choi, Y., et al. (2013). Babytalk: Understanding and generating simple image descriptions. IEEE Transactions on Pattern Analysis and Machine Intelligence, 35, 2891\u20132903.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"840_CR26","doi-asserted-by":"crossref","unstructured":"Kumar, N., Berg, A.C., Belhumeur, P.N., & Nayar, S.K. (2009). Attribute and simile classifiers for face verification. In ICCV.","DOI":"10.1109\/ICCV.2009.5459250"},{"key":"840_CR27","unstructured":"Kuznetsova, P., Ordonez, V., Berg, A., Berg, T.L., & Choi, Y. (2012). Collective generation of natural image descriptions. In ACL."},{"key":"840_CR28","unstructured":"Kuznetsova, P., Ordonez, V., Berg, A.C., Berg, T.L., & Choi, Y. (2013). Generalizing image captions for image-text parallel corpus. In ACL."},{"key":"840_CR29","doi-asserted-by":"crossref","unstructured":"Lampert, C., Nickisch, H., & Harmeling, S. (2009). Learning to detect unseen object classes by between-class attribute transfer. In CVPR.","DOI":"10.1109\/CVPR.2009.5206594"},{"key":"840_CR30","doi-asserted-by":"crossref","unstructured":"Leung, T.K., & Malik, J., (1999). Recognizing surfaces using three-dimensional textons. In ICCV.","DOI":"10.1109\/ICCV.1999.790379"},{"key":"840_CR31","unstructured":"Li, S., Kulkarni, G., Berg, T.L., Berg, A.C., & Choi, Y. (2011). Composing simple image descriptions using web-scale n-grams. In CoNLL."},{"key":"840_CR32","doi-asserted-by":"crossref","unstructured":"Li, W., Xu, W., Wu, M., Yuan, C., & Lu, Q. (2006). Extractive summarization using inter- and intra- event relevance. In International Conference on Computational Linguistics.","DOI":"10.3115\/1220175.1220222"},{"key":"840_CR33","unstructured":"Li, Li-Jia., Su, Hao., Xing, E.P., & Fei-Fei, L. (2010). Object bank: A high-level image representation for scene classification and semantic feature sparsification. In NIPS."},{"key":"840_CR34","unstructured":"Lin, C.Y. (2004). Rouge: A package for automatic evaluation of summaries. In ACL."},{"key":"840_CR35","doi-asserted-by":"publisher","first-page":"91","DOI":"10.1023\/B:VISI.0000029664.99615.94","volume":"60","author":"DG Lowe","year":"2004","unstructured":"Lowe, D. G. (2004). Distinctive image features from scale invariant keypoints. International Journal of Computer Vision, 60, 91\u2013110.","journal-title":"International Journal of Computer Vision"},{"key":"840_CR36","doi-asserted-by":"crossref","unstructured":"Mason, R., & Charniak, E. (2014). Nonparametric method for data-driven image captioning. In ACL.","DOI":"10.3115\/v1\/P14-2097"},{"key":"840_CR37","doi-asserted-by":"crossref","unstructured":"Mihalcea, R. (2005). Language independent extractive summarization. In AAAI.","DOI":"10.3115\/1225753.1225766"},{"key":"840_CR38","unstructured":"Mitchell, M., Dodge, J., Goyal, A., Yamaguchi, K., Sratos, K., Han, X., Mensch, A., Berg, A., Berg, T.L., & Daum\u00e9, III, H. (2012). Midge: Generating image descriptions from computer vision detections. In EACL."},{"key":"840_CR39","doi-asserted-by":"crossref","unstructured":"Nenkova, A., Vanderwende, L., & McKeown, K. (2006). A compositional context sensitive multi-document summarizer: exploring the factors that influence summarization. In SIGIR.","DOI":"10.1145\/1148170.1148269"},{"key":"840_CR40","doi-asserted-by":"publisher","first-page":"145","DOI":"10.1023\/A:1011139631724","volume":"42","author":"A Oliva","year":"2001","unstructured":"Oliva, A., & Torralba, A. (2001). Modeling the shape of the scene: a holistic representation of the spatial envelope. International Journal of Computer Vision, 42, 145\u2013175.","journal-title":"International Journal of Computer Vision"},{"key":"840_CR41","doi-asserted-by":"crossref","unstructured":"Ordonez, V., Deng, J., Choi, Y., Berg, A.C., & Berg, T.L. (2013). From large scale image categorization to entry-level categories. In ICCV.","DOI":"10.1109\/ICCV.2013.344"},{"key":"840_CR42","unstructured":"Ordonez, V., Kulkarni, G., & Berg, T.L. (2011). Im2text: Describing images using 1 million captioned photographs. In NIPS."},{"key":"840_CR43","unstructured":"Papineni, K., Roukos, S., Ward, T., & Zhu, W. jing. (2002). Bleu: A method for automatic evaluation of machine translation. In ACL."},{"key":"840_CR44","doi-asserted-by":"crossref","unstructured":"Petrov, S., Barrett, L., Thibaux, R., & Klein, D. (2006). Learning accurate, compact, and interpretable tree annotation. In COLING\/ACL.","DOI":"10.3115\/1220175.1220230"},{"key":"840_CR45","unstructured":"Petrov, S., & Klein, D. (2007). Improved inference for unlexicalized parsing. In HLT-NAACL."},{"key":"840_CR46","unstructured":"Radev, D.R., & Allison, T. (2004). Mead\u2014A platform for multidocument multilingual text summarization. In LREC."},{"key":"840_CR47","unstructured":"Rashtchian, C., Young, P., Hodosh, M., & Hockenmaier, J. (2010). Collecting image annotations using amazon\u2019s mechanical turk. In NAACL Workshop Creating Speech and Language Data With Amazon\u2019s Mechanical Turk."},{"key":"840_CR48","doi-asserted-by":"crossref","unstructured":"Roelleke, T., & Wang, J. (2008). Tf-idf uncovered: a study of theories and probabilities. In SIGIR.","DOI":"10.1145\/1390334.1390409"},{"key":"840_CR49","doi-asserted-by":"crossref","unstructured":"Sivic, J., & Zisserman, A. (2003). Video google: A text retrieval approach to object matching in videos. In ICCV.","DOI":"10.1109\/ICCV.2003.1238663"},{"key":"840_CR50","unstructured":"Stratos, K., Sood, A., Mensch, A., Han, X., Mitchell, M., Yamaguchi, K., Dodge, J., Goyal, A., Daum\u00e9, III, H., Berg, A., & Berg, T.L. (2012). Understanding and predicting importance in images. In CVPR."},{"key":"840_CR51","doi-asserted-by":"crossref","unstructured":"Tighe, J., & Lazebnik, S. (2010). Superparsing: Scalable nonparametric image parsing with superpixels. In ECCV.","DOI":"10.1007\/978-3-642-15555-0_26"},{"key":"840_CR52","doi-asserted-by":"publisher","first-page":"1958","DOI":"10.1109\/TPAMI.2008.128","volume":"30","author":"A Torralba","year":"2008","unstructured":"Torralba, A., Fergus, R., & Freeman, W. (2008). 80 million tiny images: a large dataset for non-parametric object and scene recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 30, 1958\u20131970.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"840_CR53","doi-asserted-by":"crossref","unstructured":"Wong, K.F., Wu, M., & Li, W. (2008). Extractive summarization using supervised and semi-supervised learning. In COLING.","DOI":"10.3115\/1599081.1599205"},{"key":"840_CR54","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K., Oliva, A., & Torralba, A. (2010). Sun database: Large-scale scene recognition from abbey to zoo. In CVPR.","DOI":"10.1109\/CVPR.2010.5539970"},{"key":"840_CR55","unstructured":"Yang, Y., Teo, C.L., Daum\u00e9, III, H., & Aloimonos, Y. (2011). Corpus-guided sentence generation of natural images. In EMNLP."},{"key":"840_CR56","doi-asserted-by":"crossref","unstructured":"Yao, B., Yang, X., Lin, L., Lee, M. W., & Zhu, S. C. (2010). I2t: Image parsing to text description. Proceedings of the IEEE.","DOI":"10.1109\/JPROC.2010.2050411"},{"key":"840_CR57","doi-asserted-by":"crossref","unstructured":"Young, P., Lai, A., Hodosh, M., & Hockenmaier, J. (2014). From image descriptions to visual denotations: New similarity metrics for semantic inference over event description. Transactions of the Association for Computational Linguistics, 2, 67\u201378.","DOI":"10.1162\/tacl_a_00166"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-015-0840-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-015-0840-y\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-015-0840-y","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-015-0840-y.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,2,17]],"date-time":"2020-02-17T20:12:34Z","timestamp":1581970354000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-015-0840-y"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,7,8]]},"references-count":57,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2016,8]]}},"alternative-id":["840"],"URL":"https:\/\/doi.org\/10.1007\/s11263-015-0840-y","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2015,7,8]]},"assertion":[{"value":"3 June 2013","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"16 June 2015","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"8 July 2015","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}