{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,2]],"date-time":"2026-06-02T08:44:16Z","timestamp":1780389856659,"version":"3.54.1"},"publisher-location":"Cham","reference-count":55,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030012489","type":"print"},{"value":"9783030012496","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018]]},"DOI":"10.1007\/978-3-030-01249-6_4","type":"book-chapter","created":{"date-parts":[[2018,10,5]],"date-time":"2018-10-05T15:35:46Z","timestamp":1538753746000},"page":"52-68","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":85,"title":["Pairwise Body-Part Attention for Recognizing Human-Object Interactions"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-0758-0293","authenticated-orcid":false,"given":"Hao-Shu","family":"Fang","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jinkun","family":"Cao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yu-Wing","family":"Tai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4023-9257","authenticated-orcid":false,"given":"Cewu","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2018,10,6]]},"reference":[{"issue":"10","key":"4_CR1","doi-asserted-by":"publisher","first-page":"1229","DOI":"10.1177\/0278364911410459","volume":"30","author":"EE Aksoy","year":"2011","unstructured":"Aksoy, E.E., Abramov, A., D\u00f6rr, J., Ning, K., Dellen, B., W\u00f6rg\u00f6tter, F.: Learning the semantics of object-action relations by observation. Int. J. Rob. Res. 30(10), 1229\u20131249 (2011)","journal-title":"Int. J. Rob. Res."},{"key":"4_CR2","doi-asserted-by":"crossref","unstructured":"Andriluka, M., Pishchulin, L., Gehler, P., Schiele, B.: 2D human pose estimation: new benchmark and state of the art analysis. In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR), June 2014","DOI":"10.1109\/CVPR.2014.471"},{"key":"4_CR3","unstructured":"Ba, J., Mnih, V., Kavukcuoglu, K.: Multiple object recognition with visual attention. arXiv preprint arXiv:1412.7755 (2014)"},{"issue":"2","key":"4_CR4","doi-asserted-by":"publisher","first-page":"195","DOI":"10.1007\/s10339-017-0792-y","volume":"18","author":"TW Boyer","year":"2017","unstructured":"Boyer, T.W., Maouene, J., Sethuraman, N.: Attention to body-parts varies with visual preference and verb-effector associations. Cogn. Process. 18(2), 195\u2013203 (2017)","journal-title":"Cogn. Process."},{"key":"4_CR5","doi-asserted-by":"crossref","unstructured":"Chao, Y.W., Wang, Z., He, Y., Wang, J., Deng, J.: Hico: a benchmark for recognizing human-object interactions in images. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.122"},{"key":"4_CR6","doi-asserted-by":"crossref","unstructured":"Delaitre, V., Laptev, I., Sivic, J.: Recognizing human actions in still images: a study of bag-of-features and part-based representations. In: BMVC (2010)","DOI":"10.5244\/C.24.97"},{"issue":"8","key":"4_CR7","doi-asserted-by":"publisher","first-page":"2151","DOI":"10.1162\/NECO_a_00312","volume":"24","author":"M Denil","year":"2012","unstructured":"Denil, M., Bazzani, L., Larochelle, H., de Freitas, N.: Learning where to attend with deep architectures for image tracking. Neural Comput. 24(8), 2151\u20132184 (2012)","journal-title":"Neural Comput."},{"key":"4_CR8","doi-asserted-by":"crossref","unstructured":"Desai, C., Ramanan, D., Fowlkes, C.: Discriminative models for static human-object interactions. In: CVPR\u2019w (2010)","DOI":"10.1109\/CVPRW.2010.5543176"},{"key":"4_CR9","doi-asserted-by":"crossref","unstructured":"Fang, H.S., Xie, S., Tai, Y.W., Lu, C.: RMPE: regional multi-person pose estimation. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.256"},{"key":"4_CR10","unstructured":"Girdhar, R., Ramanan, D.: Attentional pooling for action recognition. In: NIPS (2017)"},{"key":"4_CR11","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., Girshick, R., Malik, J.: Actions and attributes from wholes and parts. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.284"},{"key":"4_CR12","unstructured":"Gkioxari, G., Hariharan, B., Girshick, R., Malik, J.: R-CNNs for pose estimation and action detection. arXiv preprint arXiv:1406.5212 (2014)"},{"key":"4_CR13","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., Girshick, R., Doll\u00e1r, P., He, K.: Detecting and recognizing human-object intaractions. arXiv preprint arXiv:1704.07333 (2017)","DOI":"10.1109\/CVPR.2018.00872"},{"key":"4_CR14","doi-asserted-by":"crossref","unstructured":"Gkioxari, G., Girshick, R., Malik, J.: Contextual action recognition with R* CNN. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.129"},{"issue":"10","key":"4_CR15","doi-asserted-by":"publisher","first-page":"1915","DOI":"10.1109\/TPAMI.2011.272","volume":"34","author":"S Goferman","year":"2012","unstructured":"Goferman, S., Zelnik-Manor, L., Tal, A.: Context-aware saliency detection. TPAMI 34(10), 1915\u20131926 (2012)","journal-title":"TPAMI"},{"key":"4_CR16","unstructured":"Han, D., Bo, L., Sminchisescu, C.: Selection and context for action recognition. In: ICCV (2009)"},{"key":"4_CR17","doi-asserted-by":"crossref","unstructured":"He, K., Zhang, X., Ren, S., Sun, J.: Deep residual learning for image recognition. arXiv preprint arXiv:1512.03385 (2015)","DOI":"10.1109\/CVPR.2016.90"},{"issue":"8","key":"4_CR18","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"key":"4_CR19","doi-asserted-by":"crossref","unstructured":"Hou, X., Zhang, L.: Saliency detection: a spectral residual approach. In: CVPR (2007)","DOI":"10.1109\/CVPR.2007.383267"},{"key":"4_CR20","doi-asserted-by":"crossref","unstructured":"Hu, J.F., Zheng, W.S., Lai, J., Gong, S., Xiang, T.: Recognising human-object interaction via exemplar based modelling. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.390"},{"key":"4_CR21","doi-asserted-by":"crossref","unstructured":"Ikizler, N., Cinbis, R.G., Pehlivan, S., Duygulu, P.: Recognizing actions from still images. In: ICPR (2008)","DOI":"10.1109\/ICPR.2008.4761663"},{"issue":"11","key":"4_CR22","doi-asserted-by":"publisher","first-page":"1254","DOI":"10.1109\/34.730558","volume":"20","author":"L Itti","year":"1998","unstructured":"Itti, L., Koch, C., Niebur, E.: A model of saliency-based visual attention for rapid scene analysis. TPAMI 20(11), 1254\u20131259 (1998)","journal-title":"TPAMI"},{"key":"4_CR23","doi-asserted-by":"crossref","unstructured":"Jia, Y., et al.: Caffe: convolutional architecture for fast feature embedding. arXiv preprint arXiv:1408.5093 (2014)","DOI":"10.1145\/2647868.2654889"},{"issue":"3","key":"4_CR24","doi-asserted-by":"publisher","first-page":"205","DOI":"10.1007\/s11263-013-0633-0","volume":"105","author":"FS Khan","year":"2013","unstructured":"Khan, F.S., Anwer, R.M., van de Weijer, J., Bagdanov, A.D., Lopez, A.M., Felsberg, M.: Coloring action recognition in still images. IJCV 105(3), 205\u2013221 (2013)","journal-title":"IJCV"},{"key":"4_CR25","unstructured":"Larochelle, H., Hinton, G.E.: Learning to combine foveal glimpses with a third-order Boltzmann machine. In: NIPS (2010)"},{"key":"4_CR26","doi-asserted-by":"crossref","unstructured":"Liu, J., Kuipers, B., Savarese, S.: Recognizing human actions by attributes. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995353"},{"key":"4_CR27","doi-asserted-by":"crossref","unstructured":"Liu, J., Wang, G., Hu, P., Duan, L.Y., Kot, A.C.: Global context-aware attention LSTM networks for 3D action recognition. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.391"},{"key":"4_CR28","doi-asserted-by":"crossref","unstructured":"Maji, S., Bourdev, L., Malik, J.: Action recognition from a distributed representation of pose and appearance. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995631"},{"key":"4_CR29","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"414","DOI":"10.1007\/978-3-319-46448-0_25","volume-title":"Computer Vision \u2013 ECCV 2016","author":"A Mallya","year":"2016","unstructured":"Mallya, A., Lazebnik, S.: Learning models for actions and person-object interactions with transfer to question answering. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9905, pp. 414\u2013428. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46448-0_25"},{"key":"4_CR30","unstructured":"Maron, O., Lozano-P\u00e9rez, T.: A framework for multiple-instance learning (1998)"},{"key":"4_CR31","unstructured":"Mnih, V., Heess, N., Graves, A., et al.: Recurrent models of visual attention. In: NIPS (2014)"},{"issue":"3","key":"4_CR32","doi-asserted-by":"publisher","first-page":"601","DOI":"10.1109\/TPAMI.2011.158","volume":"34","author":"A Prest","year":"2012","unstructured":"Prest, A., Schmid, C., Ferrari, V.: Weakly supervised learning of interactions between humans and objects. TPAMI 34(3), 601\u2013614 (2012)","journal-title":"TPAMI"},{"key":"4_CR33","doi-asserted-by":"crossref","unstructured":"Ramanathan, V., et al.: Learning semantic relationships for better action retrieval in images. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298713"},{"key":"4_CR34","unstructured":"Ren, S., He, K., Girshick, R., Sun, J.: Faster R-CNN: towards real-time object detection with region proposal networks. In: NIPS (2015)"},{"issue":"3","key":"4_CR35","doi-asserted-by":"publisher","first-page":"322","DOI":"10.1080\/13506280600590434","volume":"15","author":"T Ro","year":"2007","unstructured":"Ro, T., Friggel, A., Lavie, N.: Attentional biases for faces and body parts. Vis. Cogn. 15(3), 322\u2013348 (2007)","journal-title":"Vis. Cogn."},{"key":"4_CR36","doi-asserted-by":"crossref","unstructured":"Sharma, G., Jurie, F., Schmid, C.: Expanded parts model for human attribute and action recognition in still images. In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.90"},{"key":"4_CR37","unstructured":"Sharma, S., Kiros, R., Salakhutdinov, R.: Action recognition using visual attention (2015)"},{"key":"4_CR38","doi-asserted-by":"crossref","unstructured":"Shih, K.J., Singh, S., Hoiem, D.: Where to look: focus regions for visual question answering. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.499"},{"key":"4_CR39","doi-asserted-by":"crossref","unstructured":"Song, S., Lan, C., Xing, J., Zeng, W., Liu, J.: An end-to-end spatio-temporal attention model for human action recognition from skeleton data. In: AAAI (2017)","DOI":"10.1609\/aaai.v31i1.11212"},{"key":"4_CR40","doi-asserted-by":"crossref","unstructured":"Thurau, C., Hlav\u00e1c, V.: Pose primitive based human action recognition in videos or still images. In: CVPR (2008)","DOI":"10.1109\/CVPR.2008.4587721"},{"key":"4_CR41","doi-asserted-by":"crossref","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Liu, C.L.: Action recognition by dense trajectories. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"4_CR42","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C.: Action recognition with improved trajectories. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"4_CR43","unstructured":"Wang, Y., Jiang, H., Drew, M.S., Li, Z.N., Mori, G.: Unsupervised discovery of action classes. In: CVPR (2006)"},{"issue":"2","key":"4_CR44","doi-asserted-by":"publisher","first-page":"117","DOI":"10.1109\/TAMD.2012.2232291","volume":"5","author":"F W\u00f6rg\u00f6tter","year":"2013","unstructured":"W\u00f6rg\u00f6tter, F., Aksoy, E.E., Kr\u00fcger, N., Piater, J., Ude, A., Tamosiunaite, M.: A simple ontology of manipulation actions based on hand-object relations. IEEE Trans. Auton. Mental Dev. 5(2), 117\u2013134 (2013)","journal-title":"IEEE Trans. Auton. Mental Dev."},{"key":"4_CR45","unstructured":"Xiao, T., Xu, Y., Yang, K., Zhang, J., Peng, Y., Zhang, Z.: The application of two-level attention models in deep convolutional neural network for fine-grained image classification. In: CVPR (2015)"},{"key":"4_CR46","unstructured":"Xu, K., et al.: Show, attend and tell: Neural image caption generation with visual attention. In: ICML, vol. 14 (2015)"},{"key":"4_CR47","doi-asserted-by":"crossref","unstructured":"Yang, W., Wang, Y., Mori, G.: Recognizing human actions from still images with latent poses. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5539879"},{"key":"4_CR48","doi-asserted-by":"crossref","unstructured":"Yang, Y., Fermuller, C., Aloimonos, Y.: Detection of manipulation action consequences (MAC). In: CVPR (2013)","DOI":"10.1109\/CVPR.2013.331"},{"key":"4_CR49","doi-asserted-by":"crossref","unstructured":"Yang, Z., He, X., Gao, J., Deng, L., Smola, A.: Stacked attention networks for image question answering. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.10"},{"key":"4_CR50","doi-asserted-by":"crossref","unstructured":"Yao, B., Fei-Fei, L.: Grouplet: a structured image representation for recognizing human and object interactions. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5540234"},{"key":"4_CR51","doi-asserted-by":"crossref","unstructured":"Yao, B., Fei-Fei, L.: Modeling mutual context of object and human pose in human-object interaction activities. In: CVPR (2010)","DOI":"10.1109\/CVPR.2010.5540235"},{"key":"4_CR52","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"173","DOI":"10.1007\/978-3-642-33765-9_13","volume-title":"Computer Vision \u2013 ECCV 2012","author":"B Yao","year":"2012","unstructured":"Yao, B., Fei-Fei, L.: Action recognition with exemplar based 2.5D graph matching. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012. LNCS, vol. 7575, pp. 173\u2013186. Springer, Heidelberg (2012). https:\/\/doi.org\/10.1007\/978-3-642-33765-9_13"},{"key":"4_CR53","doi-asserted-by":"crossref","unstructured":"Yao, B., Jiang, X., Khosla, A., Lin, A.L., Guibas, L., Fei-Fei, L.: Human action recognition by learning bases of action attributes and parts. In: ICCV (2011)","DOI":"10.1109\/ICCV.2011.6126386"},{"key":"4_CR54","doi-asserted-by":"crossref","unstructured":"Yao, B., Khosla, A., Fei-Fei, L.: Combining randomization and discrimination for fine-grained image categorization. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995368"},{"key":"4_CR55","doi-asserted-by":"crossref","unstructured":"You, Q., Jin, H., Wang, Z., Fang, C., Luo, J.: Image captioning with semantic attention. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.503"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-01249-6_4","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,10,5]],"date-time":"2022-10-05T00:47:38Z","timestamp":1664930858000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-01249-6_4"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018]]},"ISBN":["9783030012489","9783030012496"],"references-count":55,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-01249-6_4","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018]]},"assertion":[{"value":"6 October 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}