{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:00:32Z","timestamp":1777654832562,"version":"3.51.4"},"reference-count":103,"publisher":"Springer Science and Business Media LLC","issue":"6","license":[{"start":{"date-parts":[[2023,12,26]],"date-time":"2023-12-26T00:00:00Z","timestamp":1703548800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2023,12,26]],"date-time":"2023-12-26T00:00:00Z","timestamp":1703548800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":["Int J Comput Vis"],"published-print":{"date-parts":[[2024,6]]},"DOI":"10.1007\/s11263-023-01962-z","type":"journal-article","created":{"date-parts":[[2023,12,26]],"date-time":"2023-12-26T15:02:26Z","timestamp":1703602946000},"page":"1945-1969","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":19,"title":["Grounded Affordance from Exocentric View"],"prefix":"10.1007","volume":"132","author":[{"given":"Hongchen","family":"Luo","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wei","family":"Zhai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jing","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-2891-4379","authenticated-orcid":false,"given":"Yang","family":"Cao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Dacheng","family":"Tao","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2023,12,26]]},"reference":[{"key":"1962_CR1","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1109\/TPAMI.2020.2986648","volume":"99","author":"A Bandini","year":"2020","unstructured":"Bandini, A., & Zariffa, J. (2020). Analysis of the hands in egocentric vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence, 99, 1\u20131. https:\/\/doi.org\/10.1109\/TPAMI.2020.2986648","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"issue":"6","key":"1962_CR2","doi-asserted-by":"publisher","first-page":"1273","DOI":"10.1109\/TRO.2017.2721939","volume":"33","author":"J Bohg","year":"2017","unstructured":"Bohg, J., Hausman, K., Sankaran, B., Brock, O., Kragic, D., Schaal, S., & Sukhatme, G. S. (2017). Interactive perception: Leveraging action in perception and perception in action. IEEE Transactions on Robotics, 33(6), 1273\u20131291.","journal-title":"IEEE Transactions on Robotics"},{"key":"1962_CR3","unstructured":"Bylinskii, Z., Judd, T., Borji, A., Itti, L., Durand, F., Oliva, A., & Torralba, A. (2015). Mit saliency benchmark."},{"issue":"3","key":"1962_CR4","doi-asserted-by":"publisher","first-page":"740","DOI":"10.1109\/TPAMI.2018.2815601","volume":"41","author":"Z Bylinskii","year":"2018","unstructured":"Bylinskii, Z., Judd, T., Oliva, A., Torralba, A., & Durand, F. (2018). What do different evaluation metrics tell us about saliency models? IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI), 41(3), 740\u2013757.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)"},{"key":"1962_CR5","doi-asserted-by":"crossref","unstructured":"Caron, M., Touvron, H., Misra, I., J\u00e9gou, H., Mairal, J., Bojanowski, P., & Joulin, A. (2021). Emerging properties in self-supervised vision transformers. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, (pp. 9650\u20139660).","DOI":"10.1109\/ICCV48922.2021.00951"},{"key":"1962_CR6","doi-asserted-by":"crossref","unstructured":"Chan, E. R., Nagano, K., Chan, M. A., Bergman, A. W., Park, J. J., Levy, A., Aittala, M., De\u00a0Mello, S., Karras, T., & Wetzstein, G. (2023). Generative novel view synthesis with 3d-aware diffusion models. arXiv preprint arXiv:2304.02602.","DOI":"10.1109\/ICCV51070.2023.00389"},{"key":"1962_CR7","doi-asserted-by":"crossref","unstructured":"Chao, Y. W., Liu, Y., Liu, X., Zeng, H., & Deng, J. (2018). Learning to detect human-object interactions. In: 2018 IEEE Winter Conference on Applications of Computer Vision (WACV), IEEE, (pp. 381\u2013389).","DOI":"10.1109\/WACV.2018.00048"},{"key":"1962_CR8","doi-asserted-by":"crossref","unstructured":"Chen, J., Gao, D., Lin, K. Q., & Shou, M. Z. (2023). Affordance grounding from demonstration video to target image. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, (pp. 6799\u20136808).","DOI":"10.1109\/CVPR52729.2023.00657"},{"issue":"10","key":"1962_CR9","doi-asserted-by":"publisher","first-page":"3632","DOI":"10.1109\/TPAMI.2020.2985395","volume":"43","author":"YC Chen","year":"2020","unstructured":"Chen, Y. C., Lin, Y. Y., Yang, M. H., & Huang, J. B. (2020). Show, match and segment: Joint weakly supervised learning of semantic matching and object co-segmentation. IEEE Transactions on Pattern Analysis and Machine Intelligence, 43(10), 3632\u20133647.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1962_CR10","doi-asserted-by":"crossref","unstructured":"Choi, I., Gallo, O., Troccoli, A., Kim, M. H., & Kautz, J. (2019). Extreme view synthesis. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, (pp. 7781\u20137790).","DOI":"10.1109\/ICCV.2019.00787"},{"key":"1962_CR11","doi-asserted-by":"crossref","unstructured":"Chuang, C. Y., Li, J., Torralba, A., & Fidler, S. (2018). Learning to act properly: Predicting and explaining affordances from images. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 975\u2013983).","DOI":"10.1109\/CVPR.2018.00108"},{"key":"1962_CR12","doi-asserted-by":"crossref","unstructured":"Damen, D., Doughty, H., Farinella, G. M., Fidler, S., Furnari, A., Kazakos, E., Moltisanti, D., Munro, J., Perrett, T., & Price, W., et\u00a0al. (2018). Scaling egocentric vision: The epic-kitchens dataset. In: Proceedings of the European Conference on Computer Vision (ECCV), (pp. 720\u2013736).","DOI":"10.1007\/978-3-030-01225-0_44"},{"key":"1962_CR13","doi-asserted-by":"crossref","unstructured":"Debevec, P., Yu, Y., & Borshukov, G. (1998). Efficient view-dependent image-based rendering with projective texture-mapping. In: Rendering Techniques\u2019 98: Proceedings of the Eurographics Workshop in Vienna, Austria, June 29-July 1, 1998 9, Springer, (pp. 105\u2013116).","DOI":"10.1007\/978-3-7091-6453-2_10"},{"key":"1962_CR14","doi-asserted-by":"crossref","unstructured":"Deng, S., Xu, X., Wu, C., Chen, K., & Jia, K. (2021). 3d affordancenet: A benchmark for visual object affordance understanding. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 1778\u20131787).","DOI":"10.1109\/CVPR46437.2021.00182"},{"key":"1962_CR15","doi-asserted-by":"crossref","unstructured":"Do, T. T., Nguyen, A., & Reid, I. (2018). Affordancenet: An end-to-end deep learning approach for object affordance detection. In: 2018 IEEE International Conference on Robotics and Automation (ICRA), IEEE, (pp. 5882\u20135889).","DOI":"10.1109\/ICRA.2018.8460902"},{"key":"1962_CR16","doi-asserted-by":"crossref","unstructured":"Fan, C., Lee, J., Xu, M., Singh, K.K., & Yong, J. L. (2017). Identifying first-person camera wearers in third-person videos. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2017.503"},{"issue":"8","key":"1962_CR17","first-page":"4339","volume":"44","author":"DP Fan","year":"2021","unstructured":"Fan, D. P., Li, T., Lin, Z., Ji, G. P., Zhang, D., Cheng, M. M., Fu, H., & Shen, J. (2021). Re-thinking co-salient object detection. IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(8), 4339\u20134354.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1962_CR18","doi-asserted-by":"crossref","unstructured":"Fang, K., Wu, T. L., Yang, D., Savarese, S., & Lim, J. J. (2018). Demo2vec: Reasoning object affordances from online videos. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 2139\u20132147).","DOI":"10.1109\/CVPR.2018.00228"},{"key":"1962_CR19","unstructured":"Fouhey, D. F., Wang, X., & Gupta, A. (2015). In defense of the direct perception of affordances. arXiv preprint arXiv:1505.01085."},{"key":"1962_CR20","doi-asserted-by":"crossref","unstructured":"Gao, W., Wan, F., Pan, X., Peng, Z., Tian, Q., Han, Z., Zhou, B., & Ye, Q. (2021). Ts-cam: Token semantic coupled attention map for weakly supervised object localization. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV), (pp. 2886\u20132895).","DOI":"10.1109\/ICCV48922.2021.00288"},{"key":"1962_CR21","unstructured":"Geng, Z., Guo, M. H., Chen, H., Li, X., Wei, K., & Lin, Z. (2021). Is attention better than matrix decomposition? arXiv preprint arXiv:2109.04553."},{"key":"1962_CR22","volume-title":"The Theory of Affordances","author":"JJ Gibson","year":"1977","unstructured":"Gibson, J. J. (1977). The Theory of Affordances. Hilldale."},{"key":"1962_CR23","doi-asserted-by":"crossref","unstructured":"Grabner, H., Gall, J., & Van\u00a0Gool, L. (2011). What makes a chair a chair? In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), IEEE, (pp. 1529\u20131536).","DOI":"10.1109\/CVPR.2011.5995327"},{"key":"1962_CR24","unstructured":"Grauman, K., Westbury, A., Byrne, E., Chavis, Z., Furnari, A., Girdhar, R., Hamburger, J., Jiang, H., Liu, M., & Liu, X., et\u00a0al. (2022). Ego4d: Around the world in 3,000 hours of egocentric video. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 18995\u201319012)."},{"key":"1962_CR25","unstructured":"Hadjivelichkov, D., Zwane, S., Agapito, L., Deisenroth, M. P., & Kanoulas, D. (2023). One-shot transfer of affordance regions? affcorrs! In: Conference on Robot Learning, PMLR, (pp. 550\u2013560)."},{"key":"1962_CR26","unstructured":"Hassanin, M., Khan, S., & Tahtali, M. (2018). Visual affordance and function understanding: A survey. arXiv."},{"issue":"3","key":"1962_CR27","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/3446370","volume":"54","author":"M Hassanin","year":"2021","unstructured":"Hassanin, M., Khan, S., & Tahtali, M. (2021). Visual affordance and function understanding: A survey. ACM Computing Surveys (CSUR), 54(3), 1\u201335.","journal-title":"ACM Computing Surveys (CSUR)"},{"key":"1962_CR28","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., & Sun, J. (2016). Deep residual learning for image recognition. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 770\u2013778).","DOI":"10.1109\/CVPR.2016.90"},{"key":"1962_CR29","unstructured":"Hinton, G., Vinyals, O., & Dean, J. (2015). Distilling the knowledge in a neural network. arXiv preprint arXiv:1503.02531."},{"key":"1962_CR30","doi-asserted-by":"crossref","unstructured":"Ho, H. I., Chiu, W. C., & Wang, Y. C. F. (2018). Summarizing first-person videos from third persons\u2019 points of view. In: Proceedings of the European Conference on Computer Vision (ECCV), (pp. 70\u201385).","DOI":"10.1007\/978-3-030-01267-0_5"},{"key":"1962_CR31","doi-asserted-by":"crossref","unstructured":"Huang, Y., Cai, M., Li, Z., & Sato, Y. (2018). Predicting gaze in egocentric video by learning task-dependent attention transition. In: Proceedings of the European Conference on Computer Vision (ECCV), (pp. 754\u2013769).","DOI":"10.1007\/978-3-030-01225-0_46"},{"key":"1962_CR32","unstructured":"Judd, T., Durand, F., & Torralba, A. (2012). A benchmark of computational models of saliency to predict human fixations."},{"key":"1962_CR33","doi-asserted-by":"crossref","unstructured":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A. C., & Lo, W. Y., et\u00a0al. (2023). Segment anything. arXiv preprint arXiv:2304.02643.","DOI":"10.1109\/ICCV51070.2023.00371"},{"issue":"1","key":"1962_CR34","doi-asserted-by":"publisher","first-page":"81","DOI":"10.1016\/j.cviu.2010.08.002","volume":"115","author":"H Kjellstr\u00f6m","year":"2011","unstructured":"Kjellstr\u00f6m, H., Romero, J., & Kragi\u0107, D. (2011). Visual object-action recognition: Inferring object affordances from human demonstration. Computer Vision and Image Understanding, 115(1), 81\u201390.","journal-title":"Computer Vision and Image Understanding"},{"issue":"3","key":"1962_CR35","doi-asserted-by":"publisher","first-page":"455","DOI":"10.1137\/07070111X","volume":"51","author":"TG Kolda","year":"2009","unstructured":"Kolda, T. G., & Bader, B. W. (2009). Tensor decompositions and applications. SIAM Review, 51(3), 455\u2013500.","journal-title":"SIAM Review"},{"key":"1962_CR36","doi-asserted-by":"crossref","unstructured":"Koppula, H. S., & Saxena, A. (2014). Physically grounded spatio-temporal object affordances. In: European Conference on Computer Vision (ECCV), Springer, (pp. 831\u2013847).","DOI":"10.1007\/978-3-319-10578-9_54"},{"issue":"8","key":"1962_CR37","doi-asserted-by":"publisher","first-page":"951","DOI":"10.1177\/0278364913478446","volume":"32","author":"HS Koppula","year":"2013","unstructured":"Koppula, H. S., Gupta, R., & Saxena, A. (2013). Learning human activities and object affordances from rgb-d videos. The International Journal of Robotics Research, 32(8), 951\u2013970.","journal-title":"The International Journal of Robotics Research"},{"key":"1962_CR38","doi-asserted-by":"crossref","unstructured":"K\u00fcmmerer, M., Wallis, T. S., & Bethge, M. (2016). Deepgaze ii: Reading fixations from deep features trained on object recognition. arXiv preprint arXiv:1610.01563.","DOI":"10.1167\/17.10.1147"},{"key":"1962_CR39","doi-asserted-by":"crossref","unstructured":"Lakani, S. R., Rodr\u00edguez-S\u00e1nchez, A. J., & Piater, J. (2017). Can affordances guide object decomposition into semantically meaningful parts? In: 2017 IEEE Winter Conference on Applications of Computer Vision (WACV), IEEE, (pp. 82\u201390).","DOI":"10.1109\/WACV.2017.17"},{"issue":"4","key":"1962_CR40","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1145\/2897824.2925927","volume":"35","author":"M Lau","year":"2016","unstructured":"Lau, M., Dev, K., Shi, W., Dorsey, J., & Rushmeier, H. (2016). Tactile mesh saliency. ACM Transactions on Graphics (TOG), 35(4), 1\u201311.","journal-title":"ACM Transactions on Graphics (TOG)"},{"key":"1962_CR41","unstructured":"Lee, D. D., & Seung, H. S. (2000). Algorithms for non-negative matrix factorization. In: NIPS."},{"key":"1962_CR42","doi-asserted-by":"crossref","unstructured":"Li, B., Sun, Z., Li, Q., Wu, Y., & Hu, A. (2019). Group-wise deep object co-segmentation with co-attention recurrent neural network. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, (pp. 8519\u20138528).","DOI":"10.1109\/ICCV.2019.00861"},{"key":"1962_CR43","doi-asserted-by":"crossref","unstructured":"Li, G., Jampani, V., Sun, D., & Sevilla-Lara, L. (2023a). Locate: Localize and transfer object parts for weakly supervised affordance grounding. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, (pp. 10922\u201310931).","DOI":"10.1109\/CVPR52729.2023.01051"},{"key":"1962_CR44","doi-asserted-by":"crossref","unstructured":"Li, J., Liu, K., & Wu, J. (2023b). Ego-body pose estimation via ego-head pose estimation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, (pp. 17142\u201317151).","DOI":"10.1109\/CVPR52729.2023.01644"},{"key":"1962_CR45","doi-asserted-by":"crossref","unstructured":"Li, Y., Nagarajan, T., Xiong, B., & Grauman, K. (2021). Ego-exo: Transferring visual representations from third-person to first-person videos. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 6943\u20136953).","DOI":"10.1109\/CVPR46437.2021.00687"},{"key":"1962_CR46","doi-asserted-by":"crossref","unstructured":"Lin, T. Y., Maire, M., Belongie, S., Hays, J., Perona, P., Ramanan, D., Doll\u00e1r, P., & Zitnick, C. L. (2014). Microsoft coco: Common objects in context. In: Proceedings of the European Conference on Computer Vision (ECCV), Springer, (pp. 740\u2013755).","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"1962_CR47","doi-asserted-by":"crossref","unstructured":"Liu, S., Tripathi, S., Majumdar, S., & Wang, X. (2022). Joint hand motion and interaction hotspots prediction from egocentric videos. arXiv preprint arXiv:2204.01696.","DOI":"10.1109\/CVPR52688.2022.00328"},{"key":"1962_CR48","doi-asserted-by":"crossref","unstructured":"Liu, Z., Lin, Y., Cao, Y., Hu, H., Wei, Y., Zhang, Z., Lin, S., & Guo, B. (2021). Swin transformer: Hierarchical vision transformer using shifted windows. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, (pp. 10012\u201310022).","DOI":"10.1109\/ICCV48922.2021.00986"},{"key":"1962_CR49","doi-asserted-by":"crossref","unstructured":"Lu, J., Zhou, Z., Zhu, X., Xu, H., & Zhang, L. (2022a). Learning ego 3d representation as ray tracing. arXiv preprint arXiv:2206.04042.","DOI":"10.1007\/978-3-031-19809-0_8"},{"key":"1962_CR50","doi-asserted-by":"crossref","unstructured":"Lu, L., Zhai, W., Luo, H., Kang, Y., & Cao, Y. (2022b). Phrase-based affordance detection via cyclic bilateral interaction. arXiv preprint arXiv:2202.12076.","DOI":"10.1109\/TAI.2022.3199190"},{"key":"1962_CR51","unstructured":"Luo, H., Zhai, W., Zhang, J., Cao, Y., & Tao, D. (2021a). Learning visual affordance grounding from demonstration videos. arXiv preprint arXiv:2108.05675."},{"key":"1962_CR52","doi-asserted-by":"crossref","unstructured":"Luo, H., Zhai, W., Zhang, J., Cao, Y., & Tao, D. (2021b). One-shot affordance detection. arXiv preprint arXiv:2106.14747.","DOI":"10.24963\/ijcai.2021\/124"},{"key":"1962_CR53","doi-asserted-by":"crossref","unstructured":"Luo, H., Zhai, W., Zhang, J., Cao, Y., & Tao, D. (2022). Learning affordance grounding from exocentric images. arXiv preprint arXiv:2203.09905.","DOI":"10.1109\/CVPR52688.2022.00229"},{"key":"1962_CR54","unstructured":"Lv, Y., Zhang, J., Dai, Y., Li, A., Barnes, N., & Fan, D. P. (2022). Towards deeper understanding of camouflaged object detection. arXiv preprint arXiv:2205.11333."},{"key":"1962_CR55","doi-asserted-by":"crossref","unstructured":"Mai, J., Yang, M., & Luo, W. (2020). Erasing integrated learning: A simple yet effective approach for weakly supervised object localization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 8766\u20138775).","DOI":"10.1109\/CVPR42600.2020.00879"},{"key":"1962_CR56","doi-asserted-by":"crossref","unstructured":"Mandikal, P., & Grauman, K. (2021). Learning dexterous grasping with object-centric visual affordances. In: 2021 IEEE International Conference on Robotics and Automation (ICRA), IEEE, (pp. 6169\u20136176).","DOI":"10.1109\/ICRA48506.2021.9561802"},{"key":"1962_CR57","doi-asserted-by":"publisher","first-page":"128","DOI":"10.1016\/j.cogsys.2018.12.010","volume":"54","author":"J Mi","year":"2019","unstructured":"Mi, J., Tang, S., Deng, Z., Goerner, M., & Zhang, J. (2019). Object affordance based multimodal fusion for natural human-robot interaction. Cognitive Systems Research, 54, 128\u2013137.","journal-title":"Cognitive Systems Research"},{"key":"1962_CR58","doi-asserted-by":"publisher","first-page":"26","DOI":"10.3389\/fnbot.2020.00026","volume":"14","author":"J Mi","year":"2020","unstructured":"Mi, J., Liang, H., Katsakis, N., Tang, S., Li, Q., Zhang, C., & Zhang, J. (2020). Intention-related natural language grounding via object affordance detection and intention semantic extraction. Frontiers in Neurorobotics, 14, 26.","journal-title":"Frontiers in Neurorobotics"},{"key":"1962_CR59","doi-asserted-by":"crossref","unstructured":"Myers, A., Teo, C. L., Ferm\u00fcller, C., & Aloimonos, Y. (2015). Affordance detection of tool parts from geometric features. In: 2015 IEEE International Conference on Robotics and Automation (ICRA), IEEE, (pp. 1374\u20131381).","DOI":"10.1109\/ICRA.2015.7139369"},{"key":"1962_CR60","first-page":"2005","volume":"33","author":"T Nagarajan","year":"2020","unstructured":"Nagarajan, T., & Grauman, K. (2020). Learning affordance landscapes for interaction exploration in 3d environments. Advances in Neural Information Processing Systems, 33, 2005\u20132015.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"1962_CR61","doi-asserted-by":"crossref","unstructured":"Nagarajan, T., Feichtenhofer, C., & Grauman, K. (2019). Grounded human-object interaction hotspots from video. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision (ICCV), (pp. 8688\u20138697).","DOI":"10.1109\/ICCV.2019.00878"},{"key":"1962_CR62","doi-asserted-by":"crossref","unstructured":"Nguyen, A., Kanoulas, D., Caldwell, D. G., & Tsagarakis, N. G. (2016). Detecting object affordances with convolutional neural networks. In: 2016 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), IEEE, (pp. 2765\u20132770).","DOI":"10.1109\/IROS.2016.7759429"},{"key":"1962_CR63","doi-asserted-by":"crossref","unstructured":"Nguyen, A., Kanoulas, D., Caldwell, D. G., & Tsagarakis, N. G. (2017). Object-based affordances detection with convolutional neural networks and dense conditional random fields. In: 2017 IEEE\/RSJ International Conference on Intelligent Robots and Systems (IROS), IEEE, (pp. 5908\u20135915).","DOI":"10.1109\/IROS.2017.8206484"},{"key":"1962_CR64","doi-asserted-by":"crossref","unstructured":"Pan, X., Gao, Y., Lin, Z., Tang, F., Dong, W., Yuan, H., Huang, F., & Xu, C. (2021). Unveiling the potential of structure preserving for weakly supervised object localization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 11642\u201311651).","DOI":"10.1109\/CVPR46437.2021.01147"},{"key":"1962_CR65","doi-asserted-by":"crossref","unstructured":"Pei, G., Shen, F., Yao, Y., Xie, G. S., Tang, Z., & Tang, J. (2022). Hierarchical feature alignment network for unsupervised video object segmentation. In: European Conference on Computer Vision, Springer, (pp. 596\u2013613).","DOI":"10.1007\/978-3-031-19830-4_34"},{"issue":"18","key":"1962_CR66","doi-asserted-by":"publisher","first-page":"2397","DOI":"10.1016\/j.visres.2005.03.019","volume":"45","author":"RJ Peters","year":"2005","unstructured":"Peters, R. J., Iyer, A., Itti, L., & Koch, C. (2005). Components of bottom-up gaze allocation in natural images. Vision Research, 45(18), 2397\u20132416.","journal-title":"Vision Research"},{"key":"1962_CR67","doi-asserted-by":"crossref","unstructured":"Quan, R., Han, J., Zhang, D., & Nie, F. (2016). Object co-segmentation via graph optimized-flexible manifold ranking. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, (pp. 687\u2013695).","DOI":"10.1109\/CVPR.2016.81"},{"key":"1962_CR68","unstructured":"Ramesh, A., Dhariwal, P., Nichol, A., Chu, C., & Chen, M. (2022). Hierarchical text-conditional image generation with clip latents. arXiv preprint arXiv:2204.06125."},{"key":"1962_CR69","doi-asserted-by":"crossref","unstructured":"Regmi, K., & Shah, M. (2019). Bridging the domain gap for ground-to-aerial image matching. In: Proceedings of the IEEE International Conference on Computer Vision (ICCV), (pp. 470\u2013479).","DOI":"10.1109\/ICCV.2019.00056"},{"key":"1962_CR70","doi-asserted-by":"crossref","unstructured":"Ren, S., Liu, W., Liu, Y., Chen, H., Han, G., & He, S. (2021). Reciprocal transformations for unsupervised video object segmentation. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, (pp. 15455\u201315464).","DOI":"10.1109\/CVPR46437.2021.01520"},{"key":"1962_CR71","doi-asserted-by":"publisher","first-page":"169","DOI":"10.1146\/annurev.neuro.27.070203.144230","volume":"27","author":"G Rizzolatti","year":"2004","unstructured":"Rizzolatti, G., & Craighero, L. (2004). The mirror-neuron system. Annual Review of Neuroscience, 27, 169\u2013192.","journal-title":"Annual Review of Neuroscience"},{"key":"1962_CR72","doi-asserted-by":"crossref","unstructured":"Sawatzky, J., & Gall, J. (2017). Adaptive binarization for weakly supervised affordance segmentation. In: Proceedings of the IEEE International Conference on Computer Vision Workshops, (pp. 1383\u20131391).","DOI":"10.1109\/CVPR.2017.552"},{"key":"1962_CR73","doi-asserted-by":"crossref","unstructured":"Sawatzky, J., Srikantha, A., & Gall, J. (2017). Weakly supervised affordance detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR.2017.552"},{"key":"1962_CR74","unstructured":"Shen, Y., Song, K., Tan, X., Li, D., Lu, W., & Zhuang, Y. (2023). Hugginggpt: Solving ai tasks with chatgpt and its friends in huggingface. arXiv preprint arXiv:2303.17580."},{"key":"1962_CR75","doi-asserted-by":"crossref","unstructured":"Sigurdsson, G. A., Gupta, A., Schmid, C., Farhadi, A., & Alahari, K. (2018). Actor and observer: Joint modeling of first and third-person videos. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 7396\u20137404).","DOI":"10.1109\/CVPR.2018.00772"},{"key":"1962_CR76","unstructured":"Simonyan, K., & Zisserman, A. (2014). Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556."},{"key":"1962_CR77","unstructured":"Soomro, K., Zamir, A. R., & Shah, M. (2012). Ucf101: A dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:1212.0402."},{"key":"1962_CR78","doi-asserted-by":"crossref","unstructured":"Soran, B., Farhadi, A., & Shapiro, L. (2014). Action recognition in the presence of one egocentric and multiple static cameras. In: Asian Conference on Computer Vision, Springer, (pp. 178\u2013193).","DOI":"10.1007\/978-3-319-16814-2_12"},{"key":"1962_CR79","unstructured":"Srikantha, A., & Gall, J. (2016). Weakly supervised learning of affordances. arXiv preprint arXiv:1605.02964."},{"key":"1962_CR80","doi-asserted-by":"crossref","unstructured":"Stark, M., Lies, P., Zillich, M., Wyatt, J., & Schiele, B. (2008). Functional object class detection based on learned affordance cues. In: International Conference on Computer Vision Systems, Springer, (pp. 435\u2013444).","DOI":"10.1007\/978-3-540-79547-6_42"},{"issue":"1","key":"1962_CR81","doi-asserted-by":"publisher","first-page":"11","DOI":"10.1007\/BF00130487","volume":"7","author":"MJ Swain","year":"1991","unstructured":"Swain, M. J., & Ballard, D. H. (1991). Color indexing. International Journal of Computer Vision (IJCV), 7(1), 11\u201332.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"1962_CR82","doi-asserted-by":"crossref","unstructured":"Tang, Y., Tian, Y., Lu, J., Feng, J., & Zhou, J. (2017). Action recognition in rgb-d egocentric videos. In: 2017 IEEE International Conference on Image Processing (ICIP), IEEE, (pp. 3410\u20133414).","DOI":"10.1109\/ICIP.2017.8296915"},{"key":"1962_CR83","doi-asserted-by":"crossref","unstructured":"Wang, J., Liu, L., Xu, W., Sarkar, K., & Theobalt, C. (2021). Estimating egocentric 3d human pose in global space. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, (pp. 11500\u201311509).","DOI":"10.1109\/ICCV48922.2021.01130"},{"key":"1962_CR84","doi-asserted-by":"crossref","unstructured":"Wen, Y., Singh, K. K., Anderson, M., Jan, W. P., & Lee, Y. J. (2021). Seeing the unseen: Predicting the first-person camera wearer\u2019s location and pose in third-person scenes. In: Proceedings of the IEEE\/CVF International Conference on Computer Vision, (pp. 3446\u20133455).","DOI":"10.1109\/ICCVW54120.2021.00384"},{"key":"1962_CR85","doi-asserted-by":"crossref","unstructured":"Wiles, O., Gkioxari, G., Szeliski, R., & Johnson, J. (2020). Synsin: End-to-end view synthesis from a single image. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition, (pp. 7467\u20137477).","DOI":"10.1109\/CVPR42600.2020.00749"},{"key":"1962_CR86","doi-asserted-by":"crossref","unstructured":"Wong, B., Chen, J., Wu, Y., Lei, S. W., Mao, D., Gao, D., & Shou, M. Z. (2022). Assistq: Affordance-centric question-driven task completion for egocentric assistant. In: European Conference on Computer Vision, Springer, (pp. 485\u2013501).","DOI":"10.1007\/978-3-031-20059-5_28"},{"key":"1962_CR87","doi-asserted-by":"crossref","unstructured":"Wu, P., Zhai, W., & Cao, Y. (2021). Background activation suppression for weakly supervised object localization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR52688.2022.01385"},{"issue":"1","key":"1962_CR88","doi-asserted-by":"publisher","first-page":"135","DOI":"10.1109\/JAS.2021.1004255","volume":"9","author":"Y Yang","year":"2021","unstructured":"Yang, Y., Ni, Z., Gao, M., Zhang, J., & Tao, D. (2021). Collaborative pushing and grasping of tightly stacked objects via deep reinforcement learning. IEEE\/CAA Journal of Automatica Sinica, 9(1), 135\u2013145.","journal-title":"IEEE\/CAA Journal of Automatica Sinica"},{"key":"1962_CR89","doi-asserted-by":"crossref","unstructured":"Yang, Y., Zhai, W., Luo, H., Cao, Y., Luo, J., & Zha, Z. J. (2023). Grounding 3d object affordance from 2d interactions in images. arXiv preprint arXiv:2303.10437.","DOI":"10.1109\/ICCV51070.2023.01001"},{"key":"1962_CR90","doi-asserted-by":"crossref","unstructured":"Yuan, Z. H., Lu, T., & Wu, Y., et\u00a0al. (2017). Deep-dense conditional random fields for object co-segmentation. In: IJCAI, vol\u00a01, p\u00a02.","DOI":"10.24963\/ijcai.2017\/471"},{"key":"1962_CR91","first-page":"17030","volume":"35","author":"W Zhai","year":"2022","unstructured":"Zhai, W., Cao, Y., Zhang, J., & Zha, Z. J. (2022a). Exploring figure-ground assignment mechanism in perceptual organization. Advances in Neural Information Processing Systems, 35, 17030\u201317042.","journal-title":"Advances in Neural Information Processing Systems"},{"issue":"10","key":"1962_CR92","doi-asserted-by":"publisher","first-page":"2472","DOI":"10.1007\/s11263-022-01642-4","volume":"130","author":"W Zhai","year":"2022","unstructured":"Zhai, W., Luo, H., Zhang, J., Cao, Y., & Tao, D. (2022). One-shot object affordance detection in the wild. International Journal of Computer Vision (IJCV), 130(10), 2472\u2013500.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"1962_CR93","doi-asserted-by":"publisher","first-page":"403","DOI":"10.1109\/TPAMI.2023.3325230","volume":"46","author":"W Zhai","year":"2023","unstructured":"Zhai, W., Cao, Y., Zhang, J., Xie, H., Tao, D., & Zha, Z. J. (2023). On exploring multiplicity of primitives and attributes for texture recognition in the wild. IEEE Transactions on Pattern Analysis and Machine Intelligence, 46, 403\u2013420.","journal-title":"IEEE Transactions on Pattern Analysis and Machine Intelligence"},{"key":"1962_CR94","doi-asserted-by":"crossref","unstructured":"Zhai, W., Wu, P., Zhu, K., Cao, Y., Wu, F., & Zha, Z. J. (2023b). Background activation suppression for weakly supervised object localization and semantic segmentation. International Journal of Computer Vision (pp. 1\u201326).","DOI":"10.1007\/s11263-023-01919-2"},{"issue":"10","key":"1962_CR95","doi-asserted-by":"publisher","first-page":"7789","DOI":"10.1109\/JIOT.2020.3039359","volume":"8","author":"J Zhang","year":"2020","unstructured":"Zhang, J., & Tao, D. (2020). Empowering things with intelligence: A survey of the progress, challenges, and opportunities in artificial intelligence of things. IEEE Internet of Things Journal, 8(10), 7789\u20137817.","journal-title":"IEEE Internet of Things Journal"},{"key":"1962_CR96","doi-asserted-by":"crossref","unstructured":"Zhang, K., Li, T., Shen, S., Liu, B., Chen, J., & Liu, Q. (2020a). Adaptive graph convolutional network with attention graph clustering for co-saliency detection. In: Proceedings of the IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR).","DOI":"10.1109\/CVPR42600.2020.00907"},{"key":"1962_CR97","doi-asserted-by":"crossref","unstructured":"Zhang, L., Zhou, S., Stent, S., & Shi, J. (2022). Fine-grained egocentric hand-object segmentation: Dataset, model, and applications. In: European Conference on Computer Vision, Springer, (pp. 127\u2013145).","DOI":"10.1007\/978-3-031-19818-2_8"},{"key":"1962_CR98","first-page":"6959","volume":"33","author":"Q Zhang","year":"2020","unstructured":"Zhang, Q., Cong, R., Hou, J., Li, C., & Zhao, Y. (2020b). Coadnet: Collaborative aggregation-and-distribution networks for co-salient object detection. Advances in Neural Information Processing Systems, 33, 6959\u20136970.","journal-title":"Advances in Neural Information Processing Systems"},{"key":"1962_CR99","first-page":"1","volume":"12","author":"Q Zhang","year":"2023","unstructured":"Zhang, Q., Xu, Y., Zhang, J., & Tao, D. (2023). Vitaev2: Vision transformer advanced by exploring inductive bias for image recognition and beyond. International Journal of Computer Vision (IJCV), 12, 1\u201322.","journal-title":"International Journal of Computer Vision (IJCV)"},{"key":"1962_CR100","doi-asserted-by":"crossref","unstructured":"Zhang, Z., Jin, W., Xu, J., & Cheng, M.M. (2020c). Gradient-induced co-saliency detection. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XII 16, Springer, (pp. 455\u2013472).","DOI":"10.1007\/978-3-030-58610-2_27"},{"issue":"18","key":"1962_CR101","doi-asserted-by":"publisher","first-page":"14321","DOI":"10.1007\/s00521-019-04336-0","volume":"32","author":"X Zhao","year":"2020","unstructured":"Zhao, X., Cao, Y., & Kang, Y. (2020). Object affordance detection with relationship-aware network. Neural Computing and Applications, 32(18), 14321\u201314333.","journal-title":"Neural Computing and Applications"},{"key":"1962_CR102","doi-asserted-by":"crossref","unstructured":"Zhen, M., Li, S., Zhou, L., Shang, J., Feng, H., Fang, T., & Quan, L. (2020). Learning discriminative feature with crf for unsupervised video object segmentation. In: Computer Vision\u2013ECCV 2020: 16th European Conference, Glasgow, UK, August 23\u201328, 2020, Proceedings, Part XXVII 16, Springer, (pp. 445\u2013462).","DOI":"10.1007\/978-3-030-58583-9_27"},{"key":"1962_CR103","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., & Torralba, A. (2016). Learning deep features for discriminative localization. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), (pp. 2921\u20132929).","DOI":"10.1109\/CVPR.2016.319"}],"container-title":["International Journal of Computer Vision"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01962-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/article\/10.1007\/s11263-023-01962-z\/fulltext.html","content-type":"text\/html","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/s11263-023-01962-z.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2024,5,31]],"date-time":"2024-05-31T06:08:15Z","timestamp":1717135695000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/s11263-023-01962-z"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2023,12,26]]},"references-count":103,"journal-issue":{"issue":"6","published-print":{"date-parts":[[2024,6]]}},"alternative-id":["1962"],"URL":"https:\/\/doi.org\/10.1007\/s11263-023-01962-z","relation":{},"ISSN":["0920-5691","1573-1405"],"issn-type":[{"value":"0920-5691","type":"print"},{"value":"1573-1405","type":"electronic"}],"subject":[],"published":{"date-parts":[[2023,12,26]]},"assertion":[{"value":"25 May 2023","order":1,"name":"received","label":"Received","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"13 November 2023","order":2,"name":"accepted","label":"Accepted","group":{"name":"ArticleHistory","label":"Article History"}},{"value":"26 December 2023","order":3,"name":"first_online","label":"First Online","group":{"name":"ArticleHistory","label":"Article History"}}]}}