{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,22]],"date-time":"2026-07-22T03:42:24Z","timestamp":1784691744432,"version":"3.55.0"},"reference-count":52,"publisher":"Springer Science and Business Media LLC","issue":"1-2","license":[{"start":{"date-parts":[[2014,1,18]],"date-time":"2014-01-18T00:00:00Z","timestamp":1390003200000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2014,5]]},"DOI":"10.1007\/s11263-013-0695-z","type":"journal-article","created":{"date-parts":[[2014,1,17]],"date-time":"2014-01-17T04:14:58Z","timestamp":1389932098000},"page":"59-81","source":"Crossref","is-referenced-by-count":316,"title":["The SUN Attribute Database: Beyond Categories for Deeper Scene Understanding"],"prefix":"10.1007","volume":"108","author":[{"given":"Genevieve","family":"Patterson","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chen","family":"Xu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hang","family":"Su","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"James","family":"Hays","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2014,1,18]]},"reference":[{"key":"695_CR1","first-page":"663","volume":"6311","author":"T Berg","year":"2010","unstructured":"Berg, T., Berg, a, & Shih, J. (2010). Automatic attribute discovery and characterization from noisy web data. ECCV, 6311, 663\u2013676.","journal-title":"ECCV"},{"key":"695_CR2","unstructured":"Chen, D., & Dolan, W. (2011). Building a persistent workforce on mechanical turk for multilingual data collection. In The 3rd human computation workshop (HCOMP)."},{"key":"695_CR3","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, LJ., Li, K., & Fei-Fei, L. (2009). ImageNet: A large-scale hierarchical image database. In CVPR.","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"695_CR4","unstructured":"Ehinger, KA., Xiao, J., Torralba, A., & Oliva, A. (2011). Estimating scene typicality from human ratings and image features. In 33rd annual conference of the cognitive science society."},{"key":"695_CR5","doi-asserted-by":"crossref","unstructured":"Eigen, D., & Fergus, R. (2012). Nonparametric image parsing using adaptive neighbor sets. In Computer vision and pattern recognition (CVPR), 2012 IEEE Conference on (pp. 2799\u20132806). doi: 10.1109\/CVPR.2012.6248004 .","DOI":"10.1109\/CVPR.2012.6248004"},{"key":"695_CR6","doi-asserted-by":"crossref","unstructured":"Endres, I., Farhadi, A., Hoiem, D., & Forsyth, D. (2010). The benefits and challenges of collecting richer object annotations. In ACVHL 2010 (in conjunction with CVPR).","DOI":"10.1109\/CVPRW.2010.5543183"},{"key":"695_CR7","doi-asserted-by":"crossref","unstructured":"Farhadi, A., Endres, I., Hoiem, D., & Forsyth, D. (2009). Describing objects by their attributes. In CVPR.","DOI":"10.1109\/CVPR.2009.5206772"},{"key":"695_CR8","doi-asserted-by":"crossref","unstructured":"Farhadi, A., Endres, I., & Hoiem, D. (2010a). Attribute-centric recognition for cross-category generalization. In CVPR.","DOI":"10.1109\/CVPR.2010.5539924"},{"key":"695_CR9","doi-asserted-by":"crossref","unstructured":"Farhadi, A., Hejrati, M., Sadeghi, MA., Young, P., Rashtchian1, C., Hockenmaier, J., & Forsyth, DA. (2010b) Every picture tells a story: Generating sentences from images. In Proc ECCV.","DOI":"10.1007\/978-3-642-15561-1_2"},{"key":"695_CR10","unstructured":"Ferrari, V., & Zisserman, A. (2008). Learning visual attributes. NIPS 2007"},{"key":"695_CR11","doi-asserted-by":"crossref","unstructured":"Gould, S., Fulton, R., & Koller, D. (2009). Decomposing a scene into geometric and semantically consistent regions. In Computer vision, 2009 IEEE 12th International Conference on (pp. 1\u20138). doi: 10.1109\/ICCV.2009.5459211 .","DOI":"10.1109\/ICCV.2009.5459211"},{"issue":"2","key":"695_CR12","doi-asserted-by":"crossref","first-page":"137","DOI":"10.1016\/j.cogpsych.2008.06.001","volume":"58","author":"M Greene","year":"2009","unstructured":"Greene, M., & Oliva, A. (2009). Recognition of natural scenes from global properties: Seeing the forest without representing the trees. Cognitive Psychology, 58(2), 137\u2013176.","journal-title":"Cognitive Psychology"},{"key":"695_CR13","doi-asserted-by":"crossref","unstructured":"He, X., Zemel, R., & Carreira-Perpinan, M. (2004). Multiscale conditional random fields for image labeling. In Computer vision and pattern recognition, 2004. CVPR 2004. Proceedings of the 2004 IEEE computer society conference on (Vol. 2, pp. II-695\u2013II-702). doi: 10.1109\/CVPR.2004.1315232 .","DOI":"10.1109\/CVPR.2004.1315232"},{"key":"695_CR14","unstructured":"Hironobu, YM., Takahashi, H., & Oka, R. (1999). Image-to-word transformation based on dividing and vector quantizing images with words. In Boltzmann machines, neural networks, (pp. 405409)."},{"issue":"1","key":"695_CR15","doi-asserted-by":"crossref","first-page":"151","DOI":"10.1007\/s11263-006-0031-y","volume":"75","author":"D Hoiem","year":"2007","unstructured":"Hoiem, D., Efros, A. A., & Hebert, M. (2007). Recovering surface layout from an image. International Journal of Computer Vision, 75(1), 151\u2013172.","journal-title":"International Journal of Computer Vision"},{"key":"695_CR16","doi-asserted-by":"crossref","unstructured":"Kovashka, A., Parikh, D., & Grauman, K. (2012). Whittlesearch: Image search with relative attribute feedback. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2012.6248026"},{"key":"695_CR17","doi-asserted-by":"crossref","unstructured":"Kulkarni, G., Premraj, V., Ordonez, V., Dhar, S., Li, S., Choi, Y., Berg, AC., & Berg, TL. (2013). Babytalk: Understanding and generating simple image descriptions. In IEEE transactions on pattern analysis and machine intelligence (TPAMI).","DOI":"10.1109\/TPAMI.2012.162"},{"key":"695_CR18","doi-asserted-by":"crossref","unstructured":"Kumar, N., Berg, A., Belhumeur, P., & Nayar, S. (2009). Attribute and simile classifiers for face verification. In ICCV.","DOI":"10.1109\/ICCV.2009.5459250"},{"key":"695_CR19","doi-asserted-by":"crossref","unstructured":"Kumar, N., Berg, AC., Belhumeur, PN., & Nayar, SK. (2011). Describable visual attributes for face verification and image search. In IEEE transactions on pattern analysis and machine intelligence (PAMI).","DOI":"10.1109\/TPAMI.2011.48"},{"key":"695_CR20","doi-asserted-by":"crossref","unstructured":"Ladicky, L., Sturgess, P., Alahari, K., Russell, C., & Torr, PH. (2010). What, where and how many? combining object detectors and crfs. In Computer vision-ECCV 2010, Springer (pp. 424\u2013437).","DOI":"10.1007\/978-3-642-15561-1_31"},{"key":"695_CR21","doi-asserted-by":"crossref","unstructured":"Lampert, CH., Nickisch, H., & Harmeling, S. (2009). Learning to detect unseen object classes by between-class attribute transfer. In CVPR.","DOI":"10.1109\/CVPR.2009.5206594"},{"key":"695_CR22","doi-asserted-by":"crossref","unstructured":"Lasecki, M., White, M., & Bigham, K. (2011). Real-time crowd control of existing interfaces. In UIST.","DOI":"10.1145\/2047196.2047200"},{"key":"695_CR23","doi-asserted-by":"crossref","unstructured":"Lazebnik, S., Schmid, C., & Ponce, J. (2006). Beyond bags of features: Spatial pyramid matching for recognizing natural scene categories. In CVPR.","DOI":"10.1109\/CVPR.2006.68"},{"issue":"12","key":"695_CR24","doi-asserted-by":"crossref","first-page":"2368","DOI":"10.1109\/TPAMI.2011.131","volume":"33","author":"C Liu","year":"2011","unstructured":"Liu, C., Yuen, J., & Torralba, A. (2011a). Nonparametric scene parsing via label transfer. IEEE Transactions on Pattern Analysis and Machine Intelligence, 33(12), 2368\u20132382.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"695_CR25","doi-asserted-by":"crossref","unstructured":"Liu, J., Kuipers, B., & Savarese, S. (2011b). Recognizing human actions by Attributes. In CVPR.","DOI":"10.1109\/CVPR.2011.5995353"},{"issue":"2579\u20132605","key":"695_CR26","first-page":"85","volume":"9","author":"L Maaten Van der","year":"2008","unstructured":"Van der Maaten, L., & Hinton, G. (2008). Visualizing data using t-sne. Journal of Machine Learning Research, 9(2579\u20132605), 85.","journal-title":"Journal of Machine Learning Research"},{"key":"695_CR27","doi-asserted-by":"crossref","unstructured":"Malisiewicz, T., & Efros, AA. (2008). Recognition by association via learning per-exemplar distances. In Computer vision and pattern recognition, 2008. CVPR 2008. IEEE Conference on, IEEE (pp. 1\u20138).","DOI":"10.1109\/CVPR.2008.4587462"},{"issue":"3","key":"695_CR28","doi-asserted-by":"crossref","first-page":"145","DOI":"10.1023\/A:1011139631724","volume":"42","author":"A Oliva","year":"2001","unstructured":"Oliva, A., & Torralba, A. (2001). Modeling the shape of the scene: A holistic representation of the spatial envelope. IJCV, 42(3), 145\u2013175.","journal-title":"IJCV"},{"key":"695_CR29","doi-asserted-by":"crossref","unstructured":"Oliva, A., & Torralba, A. (2002). Scene-centered description from spatial envelope properties. In 2nd Wworkshop on biologically motivated computer vision (BMCV).","DOI":"10.1007\/3-540-36181-2_26"},{"key":"695_CR30","unstructured":"Ordonez, V., Kulkarni, G., & Berg, TL. (2011). Im2text: Describing images using 1 million captioned photographs. In Neural information processing systems (NIPS)."},{"key":"695_CR31","unstructured":"Palatucci, M., Pomerleau, D., Hinton, GE., & Mitchell, TM. (2009). Zero-shot learning with semantic output codes. In Advances in neural information processing systems (pp. 1410\u20131418)."},{"key":"695_CR32","doi-asserted-by":"crossref","unstructured":"Papineni, K., Roukos, S., Ward, T., & Zhu, WJ. (2002). Bleu: A method for automatic evaluation of machine translation. In Proceedings of the 40th annual meeting on association for computational linguistics, association for computational linguistics, Stroudsburg, PA, USA, ACL (pp. 311\u2013318). doi: 10.3115\/1073083.1073135 .","DOI":"10.3115\/1073083.1073135"},{"key":"695_CR33","doi-asserted-by":"crossref","unstructured":"Parikh, D., & Grauman, K. (2011a). Interactively building a discriminative vocabulary of nameable attributes. In CVPR.","DOI":"10.1109\/CVPR.2011.5995451"},{"key":"695_CR34","doi-asserted-by":"crossref","unstructured":"Parikh, D., & Grauman, K. (2011b) Relative attributes. In CCV.","DOI":"10.1109\/ICCV.2011.6126281"},{"key":"695_CR35","doi-asserted-by":"crossref","unstructured":"Patterson, G., & Hays, J. (2012). Sun attribute database: Discovering, annotating, and recognizing scene attributes. In Proceeding of the 25th conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2012.6247998"},{"key":"695_CR36","doi-asserted-by":"crossref","unstructured":"Rabinovich, A., Vedaldi, A., Galleguillos, C., Wiewiora, E., & Belongie, S. (2007). Objects in context. In Computer vision, 2007. ICCV 2007. IEEE 11th international conference on (pp. 1\u20138). doi: 10.1109\/ICCV.2007.4408986 .","DOI":"10.1109\/ICCV.2007.4408986"},{"key":"695_CR37","doi-asserted-by":"crossref","unstructured":"Rohrbach, M., Stark, M., & Schiele, B. (2011). Evaluating knowledge transfer and zero-shot learning in a large-scale setting. In Computer vision and pattern recognition (CVPR), 2011 IEEE conference on IEEE (pp. 1641\u20131648).","DOI":"10.1109\/CVPR.2011.5995627"},{"key":"695_CR38","unstructured":"Russakovsky, O., & Fei-Fei, L. (2010). Attribute learning in largescale datasets. In ECCV 2010 workshop on parts and attributes."},{"issue":"1","key":"695_CR39","doi-asserted-by":"crossref","first-page":"157","DOI":"10.1007\/s11263-007-0090-8","volume":"77","author":"BC Russell","year":"2008","unstructured":"Russell, B. C., Torralba, A., Murphy, K. P., & Freeman, W. T. (2008). Labelme: A database and web-based tool for image annotation. International Journal of Computer Vision, 77(1), 157\u2013173.","journal-title":"International Journal of Computer Vision"},{"key":"695_CR40","doi-asserted-by":"crossref","unstructured":"Sanchez, J., Perronnin, F., Mensink, T., & Verbeek, J. (2013). Image classification with the fisher vector: Theory and practice. International Journal of Computer Vision, 105(3), 222\u2013245.","DOI":"10.1007\/s11263-013-0636-x"},{"key":"695_CR41","doi-asserted-by":"crossref","unstructured":"Scheirer, WJ., Kumar, N., Belhumeur, PN., & Boult, TE. (2012). Multi-attribute spaces: Calibration for attribute fusion and similarity search. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2012.6248021"},{"key":"695_CR42","doi-asserted-by":"crossref","unstructured":"Shotton, J., Winn, J., Rother, C., & Criminisi, A. (2006). Textonboost: Joint appearance, shape and context modeling for multi-class object recognition and segmentation. In Proceedings of the 9th European conference on computer vision. Berlin: Springer, ECCV\u201906 (pp. 1\u201315). doi: 10.1007\/11744023_1 .","DOI":"10.1007\/11744023_1"},{"key":"695_CR43","doi-asserted-by":"crossref","unstructured":"Shotton, J., Johnson, M., & Cipolla, R. (2008). Semantic texton forests for image categorization and segmentation. In Computer vision and pattern recognition, 2008. CVPR 2008. IEEE Conference on (pp. 1\u20138). doi: 10.1109\/CVPR.2008.4587503 .","DOI":"10.1109\/CVPR.2008.4587503"},{"key":"695_CR44","doi-asserted-by":"crossref","unstructured":"Siddiquie, B., Feris, RS., & Davis, LS. (2011). Image ranking and retrieval based on multi-attribute queries. In The IEEE conference on computer vision and pattern recognition (CVPR).","DOI":"10.1109\/CVPR.2011.5995329"},{"key":"695_CR45","unstructured":"Socher, R., Lin, CC., Ng, AY., & Manning, CD. (2011). Parsing natural scenes and natural language with recursive neural networks. In Proceedings of the 26th international conference on machine learning (ICML) Vol. 2, p. 7)."},{"key":"695_CR46","doi-asserted-by":"crossref","unstructured":"Sorokin, A., & Forsyth, D. (2008). Utility data annotation with amazon mechanical turk. In First IEEE workshop on internet vision at CVPR 08.","DOI":"10.1109\/CVPRW.2008.4562953"},{"key":"695_CR47","doi-asserted-by":"crossref","unstructured":"Su, Y., Allan, M., & Jurie, F. (2010). Improving object classification using semantic attributes. In BMVC.","DOI":"10.5244\/C.24.26"},{"key":"695_CR48","doi-asserted-by":"crossref","first-page":"329","DOI":"10.1007\/s11263-012-0574-z","volume":"101","author":"J Tighe","year":"2013","unstructured":"Tighe, J., & Lazebnik, S. (2013). Superparsing. International Journal of Computer Vision, 101, 329\u2013349. doi: 10.1007\/s11263-012-0574-z .","journal-title":"International Journal of Computer Vision"},{"issue":"11","key":"695_CR49","doi-asserted-by":"crossref","first-page":"1958","DOI":"10.1109\/TPAMI.2008.128","volume":"30","author":"A Torralba","year":"2008","unstructured":"Torralba, A., Fergus, R., & Freeman, W. T. (2008a). 80 Million tiny images: A large data set for nonparametric object and scene recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 30(11), 1958\u20131970.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"8","key":"695_CR50","doi-asserted-by":"crossref","first-page":"1371","DOI":"10.1109\/TPAMI.2007.70791","volume":"30","author":"A Torralba","year":"2008","unstructured":"Torralba, A., Fergus, R., & Freeman, W. T. (2008b). 80 Million tiny images: A large dataset for non-parametric object and scene recognition. IEEE Transactions on Pattern Analysis and Machine Intelligence, 30(8), 1371\u20131384.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"695_CR51","doi-asserted-by":"crossref","unstructured":"Xiao, J., Hays, J., Ehinger, K., Oliva, A., & Torralba, A. (2010). SUN database: Large-scale scene recognition from abbey to zoo. In CVPR.","DOI":"10.1109\/CVPR.2010.5539970"},{"key":"695_CR52","doi-asserted-by":"crossref","unstructured":"Yao, B., Jiang, X., Khosla, A., Lin, AL., Guibas, L., & Fei-Fei, L. (2011). Human action recognition by learning bases of action attributes and parts. In ICCV.","DOI":"10.1109\/ICCV.2011.6126386"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-013-0695-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/article\/10.1007\/s11263-013-0695-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-013-0695-z","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2019,8,6]],"date-time":"2019-08-06T14:58:57Z","timestamp":1565103537000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/s11263-013-0695-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2014,1,18]]},"references-count":52,"journal-issue":{"issue":"1-2","published-print":{"date-parts":[[2014,5]]}},"alternative-id":["695"],"URL":"https:\/\/doi.org\/10.1007\/s11263-013-0695-z","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2014,1,18]]}}}