{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,20]],"date-time":"2026-07-20T10:13:16Z","timestamp":1784542396610,"version":"3.55.0"},"reference-count":64,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2016,10,22]],"date-time":"2016-10-22T00:00:00Z","timestamp":1477094400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2016,10,22]],"date-time":"2016-10-22T00:00:00Z","timestamp":1477094400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"funder":[{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["1053856"],"award-info":[{"award-number":["1053856"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["1205627"],"award-info":[{"award-number":["1205627"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["1405883"],"award-info":[{"award-number":["1405883"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["IIS-1228082"],"award-info":[{"award-number":["IIS-1228082"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000001","name":"National Science Foundation","doi-asserted-by":"publisher","award":["CIF-1302438"],"award-info":[{"award-number":["CIF-1302438"]}],"id":[{"id":"10.13039\/100000001","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100000879","name":"Alfred P. Sloan Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100000879","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/100002414","name":"Xerox Foundation","doi-asserted-by":"publisher","id":[{"id":"10.13039\/100002414","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2017,5]]},"DOI":"10.1007\/s11263-016-0965-7","type":"journal-article","created":{"date-parts":[[2016,10,22]],"date-time":"2016-10-22T05:55:01Z","timestamp":1477115701000},"page":"74-93","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":194,"title":["Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models"],"prefix":"10.1007","volume":"123","author":[{"given":"Bryan A.","family":"Plummer","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Liwei","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chris M.","family":"Cervantes","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Juan C.","family":"Caicedo","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Julia","family":"Hockenmaier","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Svetlana","family":"Lazebnik","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2016,10,22]]},"reference":[{"key":"965_CR1","doi-asserted-by":"crossref","unstructured":"Antol, S., Agrawal, A., Lu, J., Mitchell, M., Batra, D., Zitnick, C.L., & Parikh, D. (2015). Vqa: Visual question answering. In ICCV.","DOI":"10.1109\/ICCV.2015.279"},{"key":"965_CR2","unstructured":"Chen, X. & Zitnick, C. L. (2015). Minds eye: A recurrent visual representation for image caption generation. In CVPR."},{"key":"965_CR3","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.-J., Li, K., & Fei-Fei, L. (2009). Imagenet: A large-scale hierarchical image database. In CVPR.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"965_CR4","doi-asserted-by":"crossref","unstructured":"Devlin, J., Cheng, H., Fang, H., Gupta, S., Deng, L., He, X., Zweig, G., & Mitchell, M. (2015). Language models for image captioning: The quirks and what works. In ACL.","DOI":"10.3115\/v1\/P15-2017"},{"key":"965_CR5","unstructured":"Dodge, J., Goyal, A., Han, X., Mensch, A., Mitchell, M., Stratos, K., Yamaguchi, K., Choi, Y., III, H.\u00a0D., Berg, A.\u00a0C., & Berg, T.\u00a0L. (2012). Detecting visual text. In NAACL."},{"key":"965_CR6","doi-asserted-by":"crossref","unstructured":"Donahue, J., Hendricks, L.\u00a0A., Guadarrama, S., Rohrbach, M., Venugopalan, S., Saenko, K., & Darrell, T. (2015). Long-term recurrent convolutional networks for visual recognition and description. In CVPR.","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"965_CR7","unstructured":"Everingham, M., Van\u00a0Gool, L., Williams, C. K.\u00a0I., Winn, J., & Zisserman, A. (2008). The PASCAL Visual Object Classes Challenge 2008 (VOC2008) Results. http:\/\/www.pascal-network.org\/challenges\/VOC\/voc2008\/workshop\/index.html ."},{"key":"965_CR8","unstructured":"Everingham, M., Van\u00a0Gool, L., Williams, C. K.\u00a0I., Winn, J., & Zisserman, A. (2012). The PASCAL Visual Object Classes Challenge 2012 (VOC2012) Results. http:\/\/www.pascal-network.org\/challenges\/VOC\/voc2012\/workshop\/index.html ."},{"key":"965_CR9","doi-asserted-by":"crossref","unstructured":"Fang, H., Gupta, S., Iandola, F., Srivastava, R., Deng, L., Dollar, P., Gao, J., He, X., Mitchell, M., Platt, J., Zitnick, L., & Zweig, G. (2015). From captions to visual concepts and back. In CVPR.","DOI":"10.1109\/CVPR.2015.7298754"},{"key":"965_CR10","doi-asserted-by":"crossref","unstructured":"Farhadi, A., Hejrati, S., Sadeghi, A., Young, P., Rashtchian, C., Hockenmaier, J., & Forsyth, D.\u00a0A. (2010). Every picture tells a story: Generating sentences from images. In ECCV.","DOI":"10.1007\/978-3-642-15561-1_2"},{"key":"965_CR11","doi-asserted-by":"crossref","unstructured":"Fidler, S., Sharma, A., & Urtasun, R. (2013). A sentence is worth a thousand pixels. In CVPR.","DOI":"10.1109\/CVPR.2013.260"},{"key":"965_CR12","unstructured":"Fukui, A., Park, D.\u00a0H., Yang, D., Rohrbach, A., Darrell, T., & Rohrbach, M. (2016). Multimodal compact bilinear pooling for visual question answering and visual grounding. arXiv:1606.01847 ."},{"key":"965_CR13","unstructured":"Gao, H., Mao, J., Zhou, J., Huang, Z., Wang, L., & Xu, W. (2015). Are you talking to a machine? dataset and methods for multilingual image question answering. In NIPS."},{"key":"965_CR14","doi-asserted-by":"crossref","unstructured":"Girshick, R. (2015). Fast r-cnn. In ICCV.","DOI":"10.1109\/ICCV.2015.169"},{"issue":"2","key":"965_CR15","doi-asserted-by":"publisher","first-page":"210","DOI":"10.1007\/s11263-013-0658-4","volume":"106","author":"Y Gong","year":"2014","unstructured":"Gong, Y., Ke, Q., Isard, M., & Lazebnik, S. (2014a). A multi-view embedding space for modeling internet images, tags, and their semantics. IJCV, 106(2), 210\u2013233.","journal-title":"IJCV"},{"key":"965_CR16","doi-asserted-by":"crossref","unstructured":"Gong, Y., Wang, L., Hodosh, M., Hockenmaier, J., & Lazebnik, S. (2014b). Improving image-sentence embeddings using large weakly annotated photo collections. In ECCV.","DOI":"10.1007\/978-3-319-10593-2_35"},{"key":"965_CR17","unstructured":"Grubinger, M., Clough, P., M\u00fcller, H., & Deselaers, T. (2006). The iapr tc-12 benchmark: A new evaluation resource for visual information systems. In International Workshop OntoImage, pp. 13\u201323."},{"key":"965_CR18","doi-asserted-by":"crossref","unstructured":"Hodosh, M., Young, P., & Hockenmaier, J. (2013). Framing image description as a ranking task: Data, models and evaluation metrics. In JAIR.","DOI":"10.1613\/jair.3994"},{"key":"965_CR19","unstructured":"Hodosh, M., Young, P., Rashtchian, C., and Hockenmaier, J. (2010). Cross-caption coreference resolution for automatic image understanding. In CoNLL, pages 162-171. ACL."},{"key":"965_CR20","doi-asserted-by":"crossref","unstructured":"Hotelling, H. (1936). Relations between two sets of variates. In Biometrika, pp. 321\u2013377.","DOI":"10.1093\/biomet\/28.3-4.321"},{"key":"965_CR21","doi-asserted-by":"crossref","unstructured":"Hu, R., Xu, H., Rohrbach, M., Feng, J., Saenko, K., & Darrell, T. (2016). Natural language object retrieval. In CVPR.","DOI":"10.1109\/CVPR.2016.493"},{"key":"965_CR22","doi-asserted-by":"crossref","unstructured":"Johnson, J., Karpathy, A., & Fei-Fei, L. (2016). Densecap: Fully convolutional localization networks for dense captioning. In CVPR.","DOI":"10.1109\/CVPR.2016.494"},{"key":"965_CR23","doi-asserted-by":"crossref","unstructured":"Johnson, J., Krishna, R., Stark, M., Li, L.-J., Shamma, D.\u00a0A., Bernstein, M., & Fei-Fei, L. (2015). Image retrieval using scene graphs. In CVPR.","DOI":"10.1109\/CVPR.2015.7298990"},{"key":"965_CR24","doi-asserted-by":"crossref","unstructured":"Karpathy, A. & Fei-Fei, L. (2015). Deep visual-semantic alignments for generating image descriptions. In CVPR.","DOI":"10.1109\/CVPR.2015.7298932"},{"key":"965_CR25","unstructured":"Karpathy, A., Joulin, A., & Fei-Fei, L. (2014). Deep fragment embeddings for bidirectional image sentence mapping. In NIPS."},{"key":"965_CR26","doi-asserted-by":"crossref","unstructured":"Kazemzadeh, S., Ordonez, V., Matten, M., & Berg, T. (2014). Referitgame: Referring to objects in photographs of natural scenes. In EMNLP.","DOI":"10.3115\/v1\/D14-1086"},{"key":"965_CR27","unstructured":"Kiros, R., Salakhutdinov, R., & Zemel, R.\u00a0S. (2014). Unifying visual-semantic embeddings with multimodal neural language models. arXiv:1411.2539 ."},{"key":"965_CR28","unstructured":"Klein, B., Lev, G., Sadeh, G., & Wolf, L. (2014). Fisher vectors derived from hybrid gaussian-laplacian mixture models for image annotation. arXiv:1411.7399 ."},{"key":"965_CR29","doi-asserted-by":"crossref","unstructured":"Kong, C., Lin, D., Bansal, M., Urtasun, R., & Fidler, S. (2014). What are you talking about? text-to-image coreference. In CVPR.","DOI":"10.1109\/CVPR.2014.455"},{"key":"965_CR30","unstructured":"Krishna, R., Zhu, Y., Groth, O., Johnson, J., Hata, K., Kravitz, J., Chen, S., Kalantidis, Y., Li, L.-J., Shamma, D.\u00a0A., Bernstein, M., & Fei-Fei, L. (2016). Visual genome: Connecting language and vision using crowdsourced dense image annotations. arXiv:1602.07332 ."},{"key":"965_CR31","doi-asserted-by":"crossref","unstructured":"Kulkarni, G., Premraj, V., Dhar, S., Li, S., Choi, Y., Berg, A.\u00a0C., & Berg, T.\u00a0L. (2011). Baby talk: Understanding and generating image descriptions. In CVPR.","DOI":"10.1109\/CVPR.2011.5995466"},{"key":"965_CR32","unstructured":"Lebret, R., Pinheiro, P.\u00a0O., & Collobert, R. (2015). Phrase-based image captioning. In ICML."},{"key":"965_CR33","doi-asserted-by":"crossref","unstructured":"Lev, G., Sadeh, G., Klein, B., & Wolf, L. (2016). RNN fisher vectors for action recognition and image annotation. In ECCV.","DOI":"10.1007\/978-3-319-46466-4_50"},{"key":"965_CR34","doi-asserted-by":"crossref","unstructured":"Lin, T.-Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C.\u00a0L. (2014). Microsoft COCO: Common objects in context. In ECCV.","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"965_CR35","doi-asserted-by":"crossref","unstructured":"Ma, L., Lu, Z., Shang, L., & Li, H. (2015). Multimodal convolutional neural networks for matching image and sentence. In ICCV.","DOI":"10.1109\/ICCV.2015.301"},{"key":"965_CR36","unstructured":"Malinowski, M. & Fritz, M. (2014). A multi-world approach to question answering about real-world scenes based on uncertain input. In Ghahramani, Z., Welling, M., Cortes, C., Lawrence, N., and Weinberger, K., (eds) NIPS."},{"key":"965_CR37","doi-asserted-by":"crossref","unstructured":"Mao, J., Jonathan, H., Toshev, A., Camburu, O., Yuille, A., & Murphy, K. (2016). Generation and comprehension of unambiguous object descriptions. CVPR.","DOI":"10.1109\/CVPR.2016.9"},{"key":"965_CR38","unstructured":"Mao, J., Xu, W., Yang, Y., Wang, J., & Yuille, A. (2015). Deep captioning with multimodal recurrent neural networks (m-RNN). In ICLR."},{"key":"965_CR39","unstructured":"McCarthy, J.\u00a0F. & Lehnert, W.\u00a0G. (1995). Using decision trees for coreference resolution. http:\/\/arxiv.org\/abs\/cmp-lg\/9505043 ."},{"key":"965_CR40","unstructured":"Mikolov, T., Sutskever, I., Chen, K., Corrado, G.\u00a0S., & Dean, J. (2013). Distributed representations of words and phrases and their compositionality. In NIPS."},{"key":"965_CR41","unstructured":"Ordonez, V., Kulkarni, G., & Berg, T.\u00a0L. (2011). Im2Text: Describing images using 1 million captioned photographs. NIPS."},{"key":"965_CR42","doi-asserted-by":"crossref","unstructured":"Perronnin, F., S\u00e1nchez, J., & Mensink, T. (2010). Improving the Fisher kernel for large-scale image classification. In ECCV.","DOI":"10.1007\/978-3-642-15561-1_11"},{"key":"965_CR43","doi-asserted-by":"crossref","unstructured":"Plummer, B.\u00a0A., Wang, L., Cervantes, C.\u00a0M., Caicedo, J.\u00a0C., Hockenmaier, J., & Lazebnik, S. (2015). Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models. In ICCV.","DOI":"10.1109\/ICCV.2015.303"},{"key":"965_CR44","doi-asserted-by":"crossref","unstructured":"Ramanathan, V., Joulin, A., Liang, P., & Fei-Fei, L. (2014). Linking people in videos with \u201ctheir\u201d names using coreference resolution. In ECCV.","DOI":"10.1007\/978-3-319-10590-1_7"},{"key":"965_CR45","unstructured":"Rashtchian, C., Young, P., Hodosh, M., & Hockenmaier, J. (2010). Collecting image annotations using Amazon\u2019s mechanical turk. In NAACL HLT Workshop on Creating Speech and Language Data with Amazon\u2019s Mechanical Turk, pp. 139-147. ACL."},{"key":"965_CR46","unstructured":"Ren, M., Kiros, R., & Zemel, R. (2015). Exploring models and data for image question answering. In NIPS."},{"key":"965_CR47","doi-asserted-by":"crossref","unstructured":"Rohrbach, A., Rohrbach, M., Hu, R., Darrell, T., & Schiele, B. (2016). Grounding of textual phrases in images by reconstruction. In ECCV.","DOI":"10.1007\/978-3-319-46448-0_49"},{"key":"965_CR48","doi-asserted-by":"crossref","unstructured":"Silberman, N., Hoiem, D., Kohli, P., & Fergus, R. (2012). Indoor segmentation and support inference from RGBD images. In ECCV.","DOI":"10.1007\/978-3-642-33715-4_54"},{"key":"965_CR49","unstructured":"Simonyan, K. & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. arXiv:1409.1556 ."},{"issue":"4","key":"965_CR50","doi-asserted-by":"publisher","first-page":"521","DOI":"10.1162\/089120101753342653","volume":"27","author":"WM Soon","year":"2001","unstructured":"Soon, W. M., Ng, H. T., & Lim, D. C. Y. (2001). A machine learning approach to coreference resolution of noun phrases. Computational Linguistics, 27(4), 521\u2013544.","journal-title":"Computational Linguistics"},{"key":"965_CR51","doi-asserted-by":"crossref","unstructured":"Sorokin, A. & Forsyth, D. (2008). Utility data annotation with Amazon Mechanical Turk. In Internet Vision Workshop.","DOI":"10.1109\/CVPRW.2008.4562953"},{"key":"965_CR52","unstructured":"Su, H., Deng, J., & Fei-Fei, L. (2012). Crowdsourcing annotations for visual object detection. In AAAI Technical Report, 4th Human Computation Workshop."},{"key":"965_CR53","doi-asserted-by":"crossref","unstructured":"Tommasi, T., Mallya, A., Plummer, B.\u00a0A., Lazebnik, S., Berg, A., & Berg., T. (2016). Solving visual madlibs with multiple cues. In BMVC.","DOI":"10.5244\/C.30.77"},{"issue":"2","key":"965_CR54","doi-asserted-by":"publisher","first-page":"154","DOI":"10.1007\/s11263-013-0620-5","volume":"104","author":"J Uijlings","year":"2013","unstructured":"Uijlings, J., van de Sande, K., Gevers, T., & Smeulders, A. (2013). Selective search for object recognition. IJCV, 104(2), 154\u2013171.","journal-title":"IJCV"},{"key":"965_CR55","doi-asserted-by":"crossref","unstructured":"Vinyals, O., Toshev, A., Bengio, S., & Erhan, D. (2015). Show and tell: A neural image caption generator. In CVPR.","DOI":"10.1109\/CVPR.2015.7298935"},{"key":"965_CR56","doi-asserted-by":"crossref","unstructured":"Wang, L., Li, Y., & Lazebnik, S. (2016a). Learning deep structure-preserving image-text embeddings. In CVPR.","DOI":"10.1109\/CVPR.2016.541"},{"key":"965_CR57","doi-asserted-by":"crossref","unstructured":"Wang, M., Azab, M., Kojima, N., Mihalcea, R., & Deng, J. (2016b). Structured matching for phrase localization. In ECCV.","DOI":"10.1007\/978-3-319-46484-8_42"},{"key":"965_CR58","unstructured":"Xu, K., Ba, J., Kiros, R., Courville, A., Salakhutdinov, R., Zemel, R., & Bengio, Y. (2015). Show, attend and tell: Neural image caption generation with visual attention. In ICML."},{"issue":"8","key":"965_CR59","doi-asserted-by":"publisher","first-page":"1485","DOI":"10.1109\/JPROC.2010.2050411","volume":"98","author":"B Yao","year":"2010","unstructured":"Yao, B., Yang, X., Lin, L., Lee, M. W., & Zhu, S.-C. (2010). I2T: Image parsing to text description. Proceedings of the IEEE, 98(8), 1485\u20131508.","journal-title":"Proceedings of the IEEE"},{"key":"965_CR60","doi-asserted-by":"crossref","first-page":"67","DOI":"10.1162\/tacl_a_00166","volume":"2","author":"P Young","year":"2014","unstructured":"Young, P., Lai, A., Hodosh, M., & Hockenmaier, J. (2014). From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions. TACL, 2, 67\u201378.","journal-title":"TACL"},{"key":"965_CR61","unstructured":"Yu, L., Park, E., Berg, A.\u00a0C., & Berg, T.\u00a0L. (2015). Visual Madlibs: Fill in the blank Image Generation and Question Answering. In ICCV."},{"key":"965_CR62","doi-asserted-by":"crossref","unstructured":"Zhang, J., Lin, Z., Brandt, Jonathan, S.\u00a0X., & Sclaroff, S. (2016). Top-down neural attention by excitation backprop. In ECCV.","DOI":"10.1007\/978-3-319-46493-0_33"},{"key":"965_CR63","doi-asserted-by":"crossref","unstructured":"Zitnick, C.\u00a0L. & Doll\u00e1r, P. (2014). Edge boxes: Locating object proposals from edges. In ECCV.","DOI":"10.1007\/978-3-319-10602-1_26"},{"key":"965_CR64","doi-asserted-by":"crossref","unstructured":"Zitnick, C.\u00a0L. & Parikh, D. (2013). Bringing semantics into focus using visual abstraction. In CVPR.","DOI":"10.1109\/CVPR.2013.387"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-016-0965-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-016-0965-7\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-016-0965-7.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2020,9,26]],"date-time":"2020-09-26T21:31:37Z","timestamp":1601155897000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-016-0965-7"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016,10,22]]},"references-count":64,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2017,5]]}},"alternative-id":["965"],"URL":"https:\/\/doi.org\/10.1007\/s11263-016-0965-7","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016,10,22]]},"assertion":[{"value":"7 April 2016","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"7 October 2016","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"22 October 2016","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}