{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,1]],"date-time":"2026-05-01T17:03:08Z","timestamp":1777654988542,"version":"3.51.4"},"publisher-location":"Cham","reference-count":41,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030012243","type":"print"},{"value":"9783030012250","type":"electronic"}],"license":[{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"},{"start":{"date-parts":[[2018,1,1]],"date-time":"2018-01-01T00:00:00Z","timestamp":1514764800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springer.com\/tdm"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2018]]},"DOI":"10.1007\/978-3-030-01225-0_46","type":"book-chapter","created":{"date-parts":[[2018,10,8]],"date-time":"2018-10-08T08:39:54Z","timestamp":1538987994000},"page":"789-804","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":88,"title":["Predicting Gaze in Egocentric Video by Learning Task-Dependent Attention Transition"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-8067-6227","authenticated-orcid":false,"given":"Yifei","family":"Huang","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6688-3710","authenticated-orcid":false,"given":"Minjie","family":"Cai","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Zhenqiang","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-0097-4537","authenticated-orcid":false,"given":"Yoichi","family":"Sato","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2018,10,6]]},"reference":[{"issue":"5","key":"46_CR1","doi-asserted-by":"publisher","first-page":"744","DOI":"10.1109\/TCSVT.2015.2409731","volume":"25","author":"A Betancourt","year":"2015","unstructured":"Betancourt, A., Morerio, P., Regazzoni, C.S., Rauterberg, M.: The evolution of first person vision methods: a survey. IEEE Trans. Circ. Syst. Video Technol. 25(5), 744\u2013760 (2015)","journal-title":"IEEE Trans. Circ. Syst. Video Technol."},{"issue":"1","key":"46_CR2","doi-asserted-by":"publisher","first-page":"185","DOI":"10.1109\/TPAMI.2012.89","volume":"35","author":"A Borji","year":"2013","unstructured":"Borji, A., Itti, L.: State-of-the-art in visual attention modeling. IEEE Trans. Pattern Anal. Mach. Intell. 35(1), 185\u2013207 (2013)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"46_CR3","doi-asserted-by":"crossref","unstructured":"Borji, A., Tavakoli, H.R., Sihite, D.N., Itti, L.: Analysis of scores, datasets, and models in visual saliency prediction. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.118"},{"key":"46_CR4","unstructured":"Cai, M., Kitani, K.M., Sato, Y.: A scalable approach for understanding the visual structures of hand grasps. In: ICRA (2015)"},{"key":"46_CR5","unstructured":"Cai, M., Kitani, K.M., Sato, Y.: Understanding hand-object manipulation with grasp types and object attributes. In: Robotics: Science and Systems (2016)"},{"issue":"4","key":"46_CR6","doi-asserted-by":"publisher","first-page":"524","DOI":"10.1109\/THMS.2017.2681423","volume":"47","author":"M Cai","year":"2017","unstructured":"Cai, M., Kitani, K.M., Sato, Y.: An ego-vision system for hand grasp analysis. IEEE Trans. Hum. Mach. Syst. 47(4), 524\u2013535 (2017)","journal-title":"IEEE Trans. Hum. Mach. Syst."},{"issue":"99","key":"46_CR7","first-page":"1","volume":"PP","author":"M Cai","year":"2018","unstructured":"Cai, M., Lu, F., Gao, Y.: Desktop action recognition from first-person point-of-view. IEEE Trans. Cybern. PP(99), 1\u201313 (2018)","journal-title":"IEEE Trans. Cybern."},{"key":"46_CR8","doi-asserted-by":"crossref","unstructured":"Cao, C., et al.: Look and think twice: capturing top-down visual attention with feedback convolutional neural networks. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.338"},{"key":"46_CR9","doi-asserted-by":"crossref","unstructured":"Chen, L., et al.: SCA-CNN: spatial and channel-wise attention in convolutional networks for image captioning. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.667"},{"key":"46_CR10","doi-asserted-by":"crossref","unstructured":"Deng, J., Dong, W., Socher, R., Li, L.J., Li, K., Fei-Fei, L.: Imagenet: a large-scale hierarchical image database. In: CVPR (2009)","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"46_CR11","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"314","DOI":"10.1007\/978-3-642-33718-5_23","volume-title":"Computer Vision \u2013 ECCV 2012","author":"A Fathi","year":"2012","unstructured":"Fathi, A., Li, Y., Rehg, J.M.: Learning to recognize daily actions using gaze. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012. LNCS, vol. 7572, pp. 314\u2013327. Springer, Heidelberg (2012). https:\/\/doi.org\/10.1007\/978-3-642-33718-5_23"},{"key":"46_CR12","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., Zisserman, A.: Convolutional two-stream network fusion for video action recognition. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.213"},{"key":"46_CR13","doi-asserted-by":"crossref","unstructured":"Harel, J., Koch, C., Perona, P.: Graph-based visual saliency. In: NIPS (2007)","DOI":"10.7551\/mitpress\/7503.003.0073"},{"issue":"8","key":"46_CR14","doi-asserted-by":"publisher","first-page":"1735","DOI":"10.1162\/neco.1997.9.8.1735","volume":"9","author":"S Hochreiter","year":"1997","unstructured":"Hochreiter, S., Schmidhuber, J.: Long short-term memory. Neural Comput. 9(8), 1735\u20131780 (1997)","journal-title":"Neural Comput."},{"issue":"1","key":"46_CR15","doi-asserted-by":"publisher","first-page":"194","DOI":"10.1109\/TPAMI.2011.146","volume":"34","author":"X Hou","year":"2012","unstructured":"Hou, X., Harel, J., Koch, C.: Image signature: highlighting sparse salient regions. IEEE Trans. Pattern Anal. Mach. Intell. 34(1), 194\u2013201 (2012)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"46_CR16","doi-asserted-by":"crossref","unstructured":"Huang, X., Shen, C., Boix, X., Zhao, Q.: SALICON: reducing the semantic gap in saliency prediction by adapting deep neural networks. In: ICCV (2015)","DOI":"10.1109\/ICCV.2015.38"},{"key":"46_CR17","doi-asserted-by":"crossref","unstructured":"Huang, Y., Cai, M., Kera, H., Yonetani, R., Higuchi, K., Sato, Y.: Temporal localization and spatial segmentation of joint attention in multiple first-person videos. In: ICCV Workshop (2017)","DOI":"10.1109\/ICCVW.2017.273"},{"issue":"10\u201312","key":"46_CR18","doi-asserted-by":"publisher","first-page":"1489","DOI":"10.1016\/S0042-6989(99)00163-7","volume":"40","author":"L Itti","year":"2000","unstructured":"Itti, L., Koch, C.: A saliency-based search mechanism for overt and covert shifts of visual attention. Vis. Res. 40(10\u201312), 1489\u20131506 (2000)","journal-title":"Vis. Res."},{"issue":"11","key":"46_CR19","doi-asserted-by":"publisher","first-page":"1254","DOI":"10.1109\/34.730558","volume":"20","author":"L Itti","year":"1998","unstructured":"Itti, L., Koch, C., Niebur, E.: A model of saliency-based visual attention for rapid scene analysis. IEEE Trans. Pattern Anal. Mach. Intell. 20(11), 1254\u20131259 (1998)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"46_CR20","unstructured":"Kingma, D.P., Ba, J.: Adam: a method for stochastic optimization. arXiv preprint arXiv:1412.6980 (2014)"},{"key":"46_CR21","doi-asserted-by":"crossref","unstructured":"Kitani, K.M., Okabe, T., Sato, Y., Sugimoto, A.: Fast unsupervised ego-action learning for first-person sports videos. In: CVPR (2011)","DOI":"10.1109\/CVPR.2011.5995406"},{"key":"46_CR22","doi-asserted-by":"crossref","unstructured":"Kuen, J., Wang, Z., Wang, G.: Recurrent attentional networks for saliency detection. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.399"},{"issue":"2","key":"46_CR23","doi-asserted-by":"publisher","first-page":"151","DOI":"10.1007\/s00221-004-1951-9","volume":"159","author":"MF Land","year":"2004","unstructured":"Land, M.F.: The coordination of rotations of the eyes, head and trunk in saccadic turns produced in natural situations. Exp. Brain Res. 159(2), 151\u2013160 (2004)","journal-title":"Exp. Brain Res."},{"key":"46_CR24","doi-asserted-by":"crossref","unstructured":"Li, Y., Fathi, A., Rehg, J.M.: Learning to predict gaze in egocentric video. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.399"},{"key":"46_CR25","unstructured":"Lin, Y., Kong, S., Wang, D., Zhuang, Y.: Saliency detection within a deep convolutional architecture. In: AAAI Workshops (2014)"},{"key":"46_CR26","doi-asserted-by":"crossref","unstructured":"Pan, J., Sayrol, E., Giro-i Nieto, X., McGuinness, K., O\u2019Connor, N.E.: Shallow and deep convolutional networks for saliency prediction. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.71"},{"issue":"1","key":"46_CR27","doi-asserted-by":"publisher","first-page":"107","DOI":"10.1016\/S0042-6989(01)00250-4","volume":"42","author":"D Parkhurst","year":"2002","unstructured":"Parkhurst, D., Law, K., Niebur, E.: Modeling the role of salience in the allocation of overt visual attention. Vis. Res. 42(1), 107\u2013123 (2002)","journal-title":"Vis. Res."},{"key":"46_CR28","unstructured":"Paszke, A., et al.: Automatic differentiation in PyTorch (2017)"},{"key":"46_CR29","doi-asserted-by":"crossref","unstructured":"Ramanishka, V., Das, A., Zhang, J., Saenko, K.: Top-down visual saliency guided by captions. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.334"},{"key":"46_CR30","doi-asserted-by":"crossref","unstructured":"Riche, N., Duvinage, M., Mancas, M., Gosselin, B., Dutoit, T.: Saliency and human fixations: state-of-the-art and study of comparison metrics. In: ICCV (2013)","DOI":"10.1109\/ICCV.2013.147"},{"key":"46_CR31","unstructured":"Simonyan, K., Vedaldi, A., Zisserman, A.: Deep inside convolutional networks: visualising image classification models and saliency maps. arXiv preprint arXiv:1312.6034 (2013)"},{"key":"46_CR32","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: NIPS (2014)"},{"key":"46_CR33","unstructured":"Simonyan, K., Zisserman, A.: Very deep convolutional networks for large-scale image recognition. arXiv preprint arXiv:1409.1556 (2014)"},{"issue":"2","key":"46_CR34","doi-asserted-by":"publisher","first-page":"329","DOI":"10.1109\/TPAMI.2012.101","volume":"35","author":"Y Sugano","year":"2013","unstructured":"Sugano, Y., Matsushita, Y., Sato, Y.: Appearance-based gaze estimation using visual saliency. IEEE Trans. Pattern Anal. Mach. Intell. 35(2), 329\u2013341 (2013)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"issue":"1","key":"46_CR35","doi-asserted-by":"publisher","first-page":"97","DOI":"10.1016\/0010-0285(80)90005-5","volume":"12","author":"AM Treisman","year":"1980","unstructured":"Treisman, A.M., Gelade, G.: A feature-integration theory of attention. Cogn. Psychol. 12(1), 97\u2013136 (1980)","journal-title":"Cogn. Psychol."},{"key":"46_CR36","doi-asserted-by":"crossref","unstructured":"Xu, J., Mukherjee, L., Li, Y., Warner, J., Rehg, J.M., Singh, V.: Gaze-enabled egocentric video summarization via constrained submodular maximization. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298836"},{"key":"46_CR37","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"420","DOI":"10.1007\/978-3-642-22822-3_42","volume-title":"Computer Vision \u2013 ACCV 2010 Workshops","author":"K Yamada","year":"2011","unstructured":"Yamada, K., Sugano, Y., Okabe, T., Sato, Y., Sugimoto, A., Hiraki, K.: Can saliency map models predict human egocentric visual attention? In: Koch, R., Huang, F. (eds.) ACCV 2010. LNCS, vol. 6468, pp. 420\u2013429. Springer, Heidelberg (2011). https:\/\/doi.org\/10.1007\/978-3-642-22822-3_42"},{"key":"46_CR38","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"277","DOI":"10.1007\/978-3-642-25367-6_25","volume-title":"Advances in Image and Video Technology","author":"K Yamada","year":"2011","unstructured":"Yamada, K., Sugano, Y., Okabe, T., Sato, Y., Sugimoto, A., Hiraki, K.: Attention prediction in egocentric video using motion and visual saliency. In: Ho, Y.-S. (ed.) PSIVT 2011. LNCS, vol. 7087, pp. 277\u2013288. Springer, Heidelberg (2011). https:\/\/doi.org\/10.1007\/978-3-642-25367-6_25"},{"key":"46_CR39","doi-asserted-by":"crossref","unstructured":"Zhang, M., Teck Ma, K., Hwee Lim, J., Zhao, Q., Feng, J.: Deep future gaze: gaze anticipation on egocentric videos using adversarial networks. In: CVPR (2017)","DOI":"10.1109\/CVPR.2017.377"},{"key":"46_CR40","doi-asserted-by":"crossref","unstructured":"Zhao, R., Ouyang, W., Li, H., Wang, X.: Saliency detection by multi-context deep learning. In: CVPR (2015)","DOI":"10.1109\/CVPR.2015.7298731"},{"key":"46_CR41","doi-asserted-by":"crossref","unstructured":"Zhou, B., Khosla, A., Lapedriza, A., Oliva, A., Torralba, A.: Learning deep features for discriminative localization. In: CVPR (2016)","DOI":"10.1109\/CVPR.2016.319"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-01225-0_46","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,9,5]],"date-time":"2023-09-05T19:09:22Z","timestamp":1693940962000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-01225-0_46"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018]]},"ISBN":["9783030012243","9783030012250"],"references-count":41,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-01225-0_46","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018]]},"assertion":[{"value":"6 October 2018","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}