{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,21]],"date-time":"2026-07-21T15:08:15Z","timestamp":1784646495815,"version":"3.55.0"},"publisher-location":"Cham","reference-count":42,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783319464770","type":"print"},{"value":"9783319464787","type":"electronic"}],"license":[{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"tdm","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2016,1,1]],"date-time":"2016-01-01T00:00:00Z","timestamp":1451606400000},"content-version":"vor","delay-in-days":0,"URL":"http:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2016]]},"DOI":"10.1007\/978-3-319-46478-7_34","type":"book-chapter","created":{"date-parts":[[2016,9,15]],"date-time":"2016-09-15T09:48:37Z","timestamp":1473932917000},"page":"549-565","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":511,"title":["What\u2019s the Point: Semantic Segmentation with Point Supervision"],"prefix":"10.1007","author":[{"given":"Amy","family":"Bearman","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Olga","family":"Russakovsky","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Vittorio","family":"Ferrari","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Li","family":"Fei-Fei","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2016,9,16]]},"reference":[{"key":"34_CR1","doi-asserted-by":"crossref","unstructured":"Girshick, R., Donahue, J., Darrell, T., Malik, J.: Rich feature hierarchies for accurate object detection and semantic segmentation. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.81"},{"key":"34_CR2","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1016\/j.cviu.2013.10.013","volume":"120","author":"T Wang","year":"2014","unstructured":"Wang, T., Han, B., Collomosse, J.: TouchCut: fast image and video segmentation using single-touch interaction. Comput. Vis. Image Underst. 120, 14\u201330 (2014)","journal-title":"Comput. Vis. Image Underst."},{"issue":"4\u20135","key":"34_CR3","doi-asserted-by":"publisher","first-page":"507","DOI":"10.1177\/1461445605054404","volume":"7","author":"HH Clark","year":"2005","unstructured":"Clark, H.H.: Coordinating with each other in a material world. Discourse Stud. 7(4\u20135), 507\u2013525 (2005)","journal-title":"Discourse Stud."},{"key":"34_CR4","doi-asserted-by":"crossref","unstructured":"Papandreou, G., Chen, L.C., Murphy, K., Yuille, A.L.: Weakly- and semi-supervised learning of a deep convolutional network for semantic image segmentation. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.203"},{"key":"34_CR5","doi-asserted-by":"crossref","unstructured":"Long, J., Shelhamer, E., Darrell, T.: Fully convolutional networks for semantic segmentation. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298965"},{"key":"34_CR6","doi-asserted-by":"crossref","unstructured":"Pathak, D., Kr\u00e4henb\u00fchl, P., Darrell, T.: Constrained convolutional neural networks for weakly supervised segmentation. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.209"},{"issue":"3","key":"34_CR7","doi-asserted-by":"publisher","first-page":"211","DOI":"10.1007\/s11263-015-0816-y","volume":"115","author":"O Russakovsky","year":"2015","unstructured":"Russakovsky, O., Deng, J., et al.: ImageNet large scale visual recognition challenge. IJCV 115(3), 211\u2013252 (2015)","journal-title":"IJCV"},{"key":"34_CR8","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. In: ICLR (2015)"},{"key":"34_CR9","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1007\/978-3-540-72037-9_1","volume-title":"Pervasive Computing","author":"D Merrill","year":"2007","unstructured":"Merrill, D., Maes, P.: Augmenting looking, pointing and reaching gestures to enhance the searching and browsing of physical objects. In: LaMarca, A., Langheinrich, M., Truong, K.N. (eds.) Pervasive 2007. LNCS, vol. 4480, pp. 1\u201318. Springer, Heidelberg (2007). doi: 10.1007\/978-3-540-72037-9_1"},{"key":"34_CR10","doi-asserted-by":"crossref","unstructured":"Hild, M., Hashimoto, M., Yoshida, K.: Object recognition via recognition of finger pointing actions. In: Image Analysis and Processing, pp. 88\u201393 (2003)","DOI":"10.1109\/ICIAP.2003.1234031"},{"issue":"8","key":"34_CR11","doi-asserted-by":"publisher","first-page":"1915","DOI":"10.1109\/TPAMI.2012.231","volume":"35","author":"C Farabet","year":"2013","unstructured":"Farabet, C., Couprie, C., Najman, L., LeCun, Y.: Learning hierarchical features for scene labeling. TPAMI 35(8), 1915\u20131929 (2013)","journal-title":"TPAMI"},{"key":"34_CR12","doi-asserted-by":"crossref","unstructured":"Gould, S.: Multiclass pixel labeling with non-local matching constraints. In: CVPR (2012)","DOI":"10.1109\/CVPR.2012.6248002"},{"key":"34_CR13","doi-asserted-by":"crossref","unstructured":"Jain, S.D., Grauman, K.: Predicting sufficient annotation strength for interactive foreground segmentation. In: ICCV, December 2013","DOI":"10.1109\/ICCV.2013.166"},{"issue":"3","key":"34_CR14","doi-asserted-by":"publisher","first-page":"328","DOI":"10.1007\/s11263-014-0713-9","volume":"110","author":"M Guillaumin","year":"2014","unstructured":"Guillaumin, M., Kuettel, D., Ferrari, V.: ImageNet auto-annotation with segmentation propagation. IJCV 110(3), 328\u2013348 (2014)","journal-title":"IJCV"},{"key":"34_CR15","doi-asserted-by":"crossref","unstructured":"Rother, C., Kolmogorov, V., Blake, A.: GrabCut: interactive foreground extraction using iterated graph cuts. In: ACM SIGGRAPH (2004)","DOI":"10.1145\/1186562.1015720"},{"key":"34_CR16","doi-asserted-by":"crossref","unstructured":"Lin, T.Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Dollr, P., Zitnick, C.L.: Microsoft COCO: common objects in context. In: ECCV (2014)","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"34_CR17","doi-asserted-by":"crossref","unstructured":"Xu, J., Schwing, A.G., Urtasun, R.: Learning to segment under various forms of weak supervision. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7299002"},{"key":"34_CR18","doi-asserted-by":"crossref","unstructured":"Lin, D., Dai, J., Jia, J., He, K., Sun, J.: ScribbleSup: scribble-supervised convolutional networks for semantic segmentation. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.344"},{"key":"34_CR19","doi-asserted-by":"crossref","unstructured":"Bell, S., Upchurch, P., Snavely, N., Bala, K.: Material recognition in the wild with the materials in context database. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298970"},{"key":"34_CR20","doi-asserted-by":"crossref","unstructured":"Vezhnevets, A., Ferrari, V., Buhmann, J.: Weakly supervised semantic segmentation with a multi-image model. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126299"},{"key":"34_CR21","doi-asserted-by":"crossref","unstructured":"Vezhnevets, A., Ferrari, V., Buhmann, J.: Weakly supervised structured output learning for semantic segmentation. In: CVPR (2012)","DOI":"10.1109\/CVPR.2012.6247757"},{"key":"34_CR22","unstructured":"Song, H.O., Girshick, R., Jegelka, S., Mairal, J., Harchaoui, Z., Darrell, T.: On learning to localize objects with minimal supervision. In: ICML (2014)"},{"key":"34_CR23","unstructured":"Pathak, D., Shelhamer, E., Long, J., Darrell, T.: Fully convolutional multi-class multiple instance learning. In: ICLR (2015)"},{"key":"34_CR24","doi-asserted-by":"crossref","unstructured":"Xu, J., Schwing, A.G., Urtasun, R.: Tell me what you see and i will show you where it is. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.408"},{"key":"34_CR25","doi-asserted-by":"crossref","unstructured":"Pinheiro, P.O., Collobert, R.: From image-level to pixel-level labeling with convolutional networks. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298780"},{"key":"34_CR26","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"361","DOI":"10.1007\/978-3-319-10602-1_24","volume-title":"Computer Vision \u2013 ECCV 2014","author":"DP Papadopoulos","year":"2014","unstructured":"Papadopoulos, D.P., Clarke, A.D.F., Keller, F., Ferrari, V.: Training object class detectors from eye tracking data. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8693, pp. 361\u2013376. Springer, Heidelberg (2014). doi: 10.1007\/978-3-319-10602-1_24"},{"key":"34_CR27","doi-asserted-by":"crossref","unstructured":"Ahmed, E., Cohen, S., Price, B.: Semantic object selection. In: CVPR (2014)","DOI":"10.1109\/CVPR.2014.403"},{"issue":"2","key":"34_CR28","doi-asserted-by":"publisher","first-page":"377","DOI":"10.1177\/0956797613507584","volume":"25","author":"C Firestone","year":"2014","unstructured":"Firestone, C., Scholl, B.J.: Please tap the shape, anywhere you like: shape skeletons in human vision revealed by an exceedingly simple measure. Psychol. Sci. 25(2), 377\u2013386 (2014)","journal-title":"Psychol. Sci."},{"key":"34_CR29","doi-asserted-by":"crossref","unstructured":"Saupp\u00e9, A., Mutlu, B.: Robot deictics: how gesture and context shape referential communication. In: Proceedings of the 2014 ACM\/IEEE International Conference on Human-Robot Interaction (2014)","DOI":"10.1145\/2559636.2559657"},{"issue":"11","key":"34_CR30","doi-asserted-by":"publisher","first-page":"2189","DOI":"10.1109\/TPAMI.2012.28","volume":"34","author":"B Alexe","year":"2012","unstructured":"Alexe, B., Deselares, T., Ferrari, V.: Measuring the objectness of image windows. PAMI 34(11), 2189\u20132202 (2012)","journal-title":"PAMI"},{"key":"34_CR31","doi-asserted-by":"crossref","unstructured":"Carreira, J., Sminchisescu, C.: Constrained parametric min-cuts for automatic object segmentation. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5540063"},{"key":"34_CR32","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"297","DOI":"10.1007\/978-3-319-10584-0_20","volume-title":"Computer Vision \u2013 ECCV 2014","author":"B Hariharan","year":"2014","unstructured":"Hariharan, B., Arbel\u00e1ez, P., Girshick, R., Malik, J.: Simultaneous detection and segmentation. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8695, pp. 297\u2013312. Springer, Heidelberg (2014). doi: 10.1007\/978-3-319-10584-0_20"},{"issue":"2","key":"34_CR33","doi-asserted-by":"publisher","first-page":"303","DOI":"10.1007\/s11263-009-0275-4","volume":"88","author":"M Everingham","year":"2010","unstructured":"Everingham, M., Van Gool, L., Williams, C.K.I., Winn, J., Zisserman, A.: The Pascal visual object classes (VOC) challenge. Int. J. Comput. Vis. 88(2), 303\u2013338 (2010)","journal-title":"Int. J. Comput. Vis."},{"key":"34_CR34","unstructured":"Hong, S., Noh, H., Han, B.: Decoupled deep neural network for semi-supervised semantic segmentation. In: NIPS (2015)"},{"key":"34_CR35","doi-asserted-by":"crossref","unstructured":"Dai, J., He, K., Sun, J.: Boxsup: exploiting bounding boxes to supervise convolutional networks for semantic segmentation. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.191"},{"key":"34_CR36","doi-asserted-by":"crossref","unstructured":"Chai, Y., Lempitsky, V., Zisserman, A.: BiCoS: a bi-level co-segmentation method for image classification. In: CVPR (2011)","DOI":"10.1007\/978-3-642-33718-5_57"},{"key":"34_CR37","doi-asserted-by":"crossref","unstructured":"Joulin, A., Bach, F., Ponce, J.: Discriminative clustering for image co-segmentation. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5539868"},{"key":"34_CR38","unstructured":"Chen, L.C., Papandreou, G., Kokkinos, I., Murphy, K., Yuille, A.L.: Semantic image segmentation with deep convolutional nets and fully connected CRFs. In: ICLR (2015)"},{"key":"34_CR39","doi-asserted-by":"crossref","unstructured":"Noh, H., Hong, S., Han, B.: Learning deconvolution network for semantic segmentation. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.178"},{"key":"34_CR40","doi-asserted-by":"crossref","unstructured":"Hariharan, B., Arbelaez, P., Bourdev, L., Maji, S., Malik, J.: Semantic contours from inverse detectors. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126343"},{"key":"34_CR41","doi-asserted-by":"crossref","unstructured":"Russakovsky, O., Li, L.J., Fei-Fei, L.: Best of both worlds: human-machine collaboration for object annotation. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298824"},{"key":"34_CR42","doi-asserted-by":"crossref","unstructured":"Jia, Y., Shelhamer, E., Donahue, J., Karayev, S., Long, J., Girshick, R., Guadarrama, S., Darrell, T.: Caffe: convolutional architecture for fast feature embedding. In: Proceedings of the ACM International Conference on Multimedia. ACM (2014)","DOI":"10.1145\/2647868.2654889"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2016"],"original-title":[],"language":"en","link":[{"URL":"http:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-319-46478-7_34","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,10]],"date-time":"2025-06-10T19:01:45Z","timestamp":1749582105000},"score":1,"resource":{"primary":{"URL":"http:\/\/link.springer.com\/10.1007\/978-3-319-46478-7_34"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2016]]},"ISBN":["9783319464770","9783319464787"],"references-count":42,"URL":"https:\/\/doi.org\/10.1007\/978-3-319-46478-7_34","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2016]]},"assertion":[{"value":"16 September 2016","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Amsterdam","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"The Netherlands","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2016","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 October 2016","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"16 October 2016","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2016","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.eccv2016.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}