{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,1,19]],"date-time":"2024-01-19T19:00:34Z","timestamp":1705690834076},"reference-count":41,"publisher":"Springer Science and Business Media LLC","issue":"1","license":[{"start":{"date-parts":[[2015,4,8]],"date-time":"2015-04-08T00:00:00Z","timestamp":1428451200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2015,10]]},"DOI":"10.1007\/s11263-015-0815-z","type":"journal-article","created":{"date-parts":[[2015,4,7]],"date-time":"2015-04-07T06:18:48Z","timestamp":1428387528000},"page":"29-43","update-policy":"http:\/\/dx.doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":15,"title":["Predicting Entry-Level Categories"],"prefix":"10.1007","volume":"115","author":[{"given":"Vicente","family":"Ordonez","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Liu","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jia","family":"Deng","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Yejin","family":"Choi","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Alexander C.","family":"Berg","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tamara L.","family":"Berg","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2015,4,8]]},"reference":[{"key":"815_CR1","unstructured":"Barnard, K., & Yanai, K. (2006). Mutual information of words and pictures. In Information Theory and Applications."},{"key":"815_CR2","doi-asserted-by":"crossref","unstructured":"Bird, S. (2006). Nltk: The natural language toolkit. In COLING\/ACL.","DOI":"10.3115\/1225403.1225421"},{"key":"815_CR3","unstructured":"Brants, T., & Franz, A. (2006). Web 1t 5-gram version 1. In Linguistic Data Consortium."},{"key":"815_CR4","doi-asserted-by":"crossref","unstructured":"Chen, X., Shrivastava, A., & Gupta, A. (2013). Extracting visual knowledge from Web Data: NEIL. In ICCV.","DOI":"10.1109\/ICCV.2013.178"},{"key":"815_CR5","doi-asserted-by":"crossref","unstructured":"Dean, T., Ruzon, M. A., Segal, M., Shlens, J., Vijayanarasimhan, S., & Yagnik, J. (2013). Fast, accurate detection of 100,000 object classes on a single machine. In CVPR.","DOI":"10.1109\/CVPR.2013.237"},{"key":"815_CR6","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L-J., Li, K., & Fei-Fei, L. (2009). ImageNet: A large-scale hierarchical image database. In CVPR.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"815_CR7","doi-asserted-by":"crossref","unstructured":"Deng, J., Berg, A. C., Li, K., & Li, F-F. (2010). What does classifying more than 10,000 image categories tell us? In ECCV.","DOI":"10.1007\/978-3-642-15555-0_6"},{"key":"815_CR8","unstructured":"Deng, J., Krause, J., Berg, A. C., & Fei-Fei, L. (2012). Hedging your bets: Optimizing accuracy-specificity trade-offs in large scale visual recognition. In CVPR."},{"key":"815_CR9","doi-asserted-by":"crossref","unstructured":"Divvala, S., Farhadi, A., & Guestrin, C. (2014). Learning everything about anything: Webly-supervised visual concept learning. In CVPR.","DOI":"10.1109\/CVPR.2014.412"},{"key":"815_CR10","unstructured":"Donahue, J., Jia, Y., Vinyals, O., Hoffman, J., Zhang, N., Tzeng, E., & Darrell, T. (2013). Decaf: A deep convolutional activation feature for generic visual recognition. arXiv preprint arXiv:1310.1531 ."},{"key":"815_CR11","doi-asserted-by":"crossref","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","volume":"88","author":"M Everingham","year":"2010","unstructured":"Everingham, M., Van Gool, L., Williams, C. K. I., Winn, J., & Zisserman, A. (2010). The pascal visual object classes (voc) challenge. International Journal of Computer Vision, 88, 303\u2013338.","journal-title":"International Journal of Computer Vision"},{"key":"815_CR12","doi-asserted-by":"crossref","unstructured":"Farhadi, A., Hejrati, M., Sadeghi, M. A., Young, P., Rashtchian, C., Hockenmaier, J., & Forsyth, D. (2010). Every picture tells a story: Generating sentences for images. In ECCV.","DOI":"10.1007\/978-3-642-15561-1_2"},{"key":"815_CR13","doi-asserted-by":"crossref","first-page":"59","DOI":"10.1016\/j.cviu.2005.09.012","volume":"106","author":"L Fei-Fei","year":"2007","unstructured":"Fei-Fei, L., Fergus, R., & Perona, P. (2007). Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories. Computer Vision and Image Understanding, 106, 59\u201370.","journal-title":"Computer Vision and Image Understanding"},{"key":"815_CR14","doi-asserted-by":"crossref","DOI":"10.7551\/mitpress\/7287.001.0001","volume-title":"WordNet: An electronic lexical database","author":"C Fellbaum","year":"1998","unstructured":"Fellbaum, C. (1998). WordNet: An electronic lexical database. Cambridge: MIT Press."},{"key":"815_CR15","doi-asserted-by":"crossref","first-page":"1627","DOI":"10.1109\/TPAMI.2009.167","volume":"32","author":"PF Felzenszwalb","year":"2010","unstructured":"Felzenszwalb, P. F., Girshick, R. B., McAllester, D., & Ramanan, D. (2010). Object detection with discriminatively trained part-based models. IEEE Transactions on Pattern Analysis and Machine Intelligence, 32, 1627\u20131645.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"815_CR16","doi-asserted-by":"crossref","unstructured":"Feng, S., Ravi, S., Kumar, R., Kuznetsova, P., Liu, W., Berg, A. C, Berg, T. L., & Choi, Y. (2015). Refer-to-as relations as semantic knowledge. In AAAI.","DOI":"10.1609\/aaai.v29i1.9489"},{"key":"815_CR17","unstructured":"Gupta, A., Verma, Y., & Jawahar, C. V. (2012). Choosing linguistics over vision to describe images. In AAAI."},{"key":"815_CR18","doi-asserted-by":"crossref","unstructured":"Hodosh, M., Young, P., & Hockenmaier, J. (2013). Framing image description as a ranking task: Data, models and evaluation metrics. Journal of Artificial Intelligence Research, 47(1), 853\u2013899.","DOI":"10.1613\/jair.3994"},{"key":"815_CR19","unstructured":"Jia, Y. (2013). Caffe: An open source convolutional architecture for fast feature embedding. http:\/\/caffe.berkeleyvision.org\/"},{"key":"815_CR20","doi-asserted-by":"crossref","first-page":"243","DOI":"10.1016\/0010-0285(84)90009-4","volume":"16","author":"P Jolicoeur","year":"1984","unstructured":"Jolicoeur, P., Gluck, M. A., & Kosslyn, S. M. (1984). Pictures and names: Making the connection. Cognitive Psychology, 16, 243\u2013275.","journal-title":"Cognitive Psychology"},{"key":"815_CR21","unstructured":"Krizhevsky, A., Sutskever, I., & Hinton, G. (2012). Imagenet classification with deep convolutional neural networks. In NIPS."},{"key":"815_CR22","doi-asserted-by":"crossref","first-page":"2891","DOI":"10.1109\/TPAMI.2012.162","volume":"35","author":"G Kulkarni","year":"2013","unstructured":"Kulkarni, G., Premraj, V., Ordonez, V., Dhar, S., Li, S., Choi, Y., et al. (2013). Babytalk: Understanding and generating simple image descriptions. IEEE Transactions on Pattern Analysis and Machine Intelligence, 35, 2891\u20132903.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"815_CR23","unstructured":"Kuznetsova, P., Ordonez, V., Berg, A., Berg, T. L., & Choi, Y. (2012). Collective generation of natural image descriptions. In ACL."},{"key":"815_CR24","doi-asserted-by":"crossref","first-page":"351","DOI":"10.1162\/tacl_a_00188","volume":"2","author":"P Kuznetsova","year":"2014","unstructured":"Kuznetsova, P., Ordonez, V., Berg, T., & Choi, Y. (2014). Treetalk: Composition and compression of trees for image descriptions. Transactions of the Association for Computational Linguistics, 2, 351\u2013362.","journal-title":"Transactions of the Association for Computational Linguistics"},{"key":"815_CR25","unstructured":"Le, Q. V., Monga, R., Devin, M., Chen, K., Corrado, G. S, Dean, J., & Ng, A. Y. (2012). Building high-level features using large scale unsupervised learning. In ICML."},{"key":"815_CR26","doi-asserted-by":"crossref","unstructured":"Mason, R., & Charniak, E. (2014). Nonparametric method for data-driven image captioning. In ACL.","DOI":"10.3115\/v1\/P14-2097"},{"key":"815_CR27","unstructured":"Mitchell, M., Han, X., Dodge, J., Mensch, A., Goyal, A., Berg, A.,&Daum\u00e9III, H. (2012). Midge: Generating image descriptions from computer vision detections. In EACL."},{"key":"815_CR28","unstructured":"Ordonez, V., Kulkarni, G., & Berg, T. L. (2011). Im2text: Describing images using 1 million captioned photographs. In NIPS."},{"key":"815_CR29","doi-asserted-by":"crossref","unstructured":"Ordonez, V., Deng, J., Choi, Y., Berg, A. C., & Berg, T. L. (2013). From large scale image categorization to entry-level categories. In ICCV.","DOI":"10.1109\/ICCV.2013.344"},{"key":"815_CR30","doi-asserted-by":"crossref","unstructured":"Perronnin, F., Akata, Z., Harchaoui, Z., & Schmid, C. (2012). Towards good practice in large-scale learning for image classification. In CVPR.","DOI":"10.1109\/CVPR.2012.6248090"},{"key":"815_CR31","unstructured":"Platt, J. C. (1999). Probabilistic outputs for support vector machines and comparisons to regularized likelihood methods. In Advances in large margin classifiers."},{"key":"815_CR32","doi-asserted-by":"crossref","unstructured":"Ramnath, K., Baker, S., Vanderwende, L., El-Saban, M., Sinha, S.N., Kannan, A., Hassan, N., Galley, M., Yang, Yi, Ramanan, D., Bergamo, A., & Torresani, L. (2014). Autocaption: Automatic caption generation for personal photos. In WACV.","DOI":"10.1109\/WACV.2014.6835988"},{"key":"815_CR33","first-page":"27","volume-title":"Cognition and categorization","author":"E Rosch","year":"1978","unstructured":"Rosch, E. (1978). Principles of categorization. In E. Rosch & B. B. Lloyd (Eds.), Cognition and categorization (pp. 27\u201348). Hillsdale: Erlbaum."},{"key":"815_CR34","unstructured":"Russakovsky, O., Deng, J., Su, H., Krause, J., Satheesh, S., Ma, S., Huang, Z., Karpathy, A., Khosla, A., Bernstein, M., Berg, A. C., & Fei-Fei, L. (2014). Imagenet large scale visual recognition challenge. arXiv:1409.0575 ."},{"key":"815_CR35","doi-asserted-by":"crossref","first-page":"157","DOI":"10.1007\/s11263-007-0090-8","volume":"77","author":"BC Russell","year":"2008","unstructured":"Russell, B. C., Torralba, A., Murphy, K. P., & Freeman, W. T. (2008). Labelme: A database and web-based tool for image annotation. International Journal of Computer Vision, 77, 157\u2013173.","journal-title":"International Journal of Computer Vision"},{"key":"815_CR36","unstructured":"Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. ArXiv e-prints."},{"key":"815_CR37","unstructured":"Szegedy, C., Liu, W., Jia, Y., Sermanet, P., Reed, S., Anguelov, D., Erhan, D., Vanhoucke, V., & Rabinovich, A. (2014). Going deeper with convolutions. ArXiv e-prints."},{"key":"815_CR38","doi-asserted-by":"crossref","first-page":"1958","DOI":"10.1109\/TPAMI.2008.128","volume":"30","author":"A Torralba","year":"2008","unstructured":"Torralba, A., Fergus, R., & Freeman, W. T. (2008). 80 million tiny images: A large dataset for non-parametric object and scene recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 30, 1958\u20131970.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"815_CR39","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K., Oliva, A., & Torralba, A. (2010). Sun database: Large scale scene recognition from abbey to zoo. In CVPR.","DOI":"10.1109\/CVPR.2010.5539970"},{"key":"815_CR40","doi-asserted-by":"crossref","unstructured":"Yanai, K., & Barnard, K. (2005). Probabilistic web image gathering. In MIR. ACM.","DOI":"10.1145\/1101826.1101838"},{"key":"815_CR41","unstructured":"Yang, Y., Teo, C. L., Daum\u00e9III, H., & Aloimonos, Y. (2011). Corpus-guided sentence generation of natural images. In EMNLP."}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-015-0815-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-015-0815-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-015-0815-z","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,8,9]],"date-time":"2023-08-09T07:24:42Z","timestamp":1691565882000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-015-0815-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2015,4,8]]},"references-count":41,"journal-issue":{"issue":"1","published-print":{"date-parts":[[2015,10]]}},"alternative-id":["815"],"URL":"https:\/\/doi.org\/10.1007\/s11263-015-0815-z","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2015,4,8]]}}}