{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,4,30]],"date-time":"2026-04-30T16:51:46Z","timestamp":1777567906120,"version":"3.51.4"},"publisher-location":"Cham","reference-count":39,"publisher":"Springer International Publishing","isbn-type":[{"value":"9783030110208","type":"print"},{"value":"9783030110215","type":"electronic"}],"license":[{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2019,1,1]],"date-time":"2019-01-01T00:00:00Z","timestamp":1546300800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2019]]},"DOI":"10.1007\/978-3-030-11021-5_24","type":"book-chapter","created":{"date-parts":[[2019,1,24]],"date-time":"2019-01-24T04:26:13Z","timestamp":1548303973000},"page":"389-405","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":30,"title":["Leveraging Uncertainty to Rethink Loss Functions and Evaluation Measures for Egocentric Action Anticipation"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0000-0001-6911-0302","authenticated-orcid":false,"given":"Antonino","family":"Furnari","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6127-2470","authenticated-orcid":false,"given":"Sebastiano","family":"Battiato","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-6034-0432","authenticated-orcid":false,"given":"Giovanni Maria","family":"Farinella","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"297","published-online":{"date-parts":[[2019,1,23]]},"reference":[{"key":"24_CR1","doi-asserted-by":"crossref","unstructured":"Abu Farha, Y., Richard, A., Gall, J.: When will you do what?-anticipating temporal occurrences of activities. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 5343\u20135352 (2018)","DOI":"10.1109\/CVPR.2018.00560"},{"key":"24_CR2","doi-asserted-by":"crossref","unstructured":"Aliakbarian, M.S., Saleh, F.S., Salzmann, M., Fernando, B., Petersson, L., Andersson, L.: Encouraging LSTMs to anticipate actions very early. In: IEEE International Conference on Computer Vision (ICCV), vol. 1 (2017)","DOI":"10.1109\/ICCV.2017.39"},{"key":"24_CR3","unstructured":"Berrada, L., Zisserman, A., Kumar, M.P.: Smooth loss functions for deep top-k classification. In: International Conference on Learning Representations (2018)"},{"key":"24_CR4","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"346","DOI":"10.1007\/978-3-319-54193-8_22","volume-title":"Computer Vision \u2013 ACCV 2016","author":"SZ Bokhari","year":"2017","unstructured":"Bokhari, S.Z., Kitani, K.M.: Long-term activity forecasting using first-person vision. In: Lai, S.-H., Lepetit, V., Nishino, K., Sato, Y. (eds.) ACCV 2016. LNCS, vol. 10115, pp. 346\u2013360. Springer, Cham (2017). https:\/\/doi.org\/10.1007\/978-3-319-54193-8_22"},{"key":"24_CR5","doi-asserted-by":"crossref","unstructured":"Carreira, J., Zisserman, A.: Quo vadis, action recognition? A new model and the kinetics dataset. In: 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. 4724\u20134733 (2017)","DOI":"10.1109\/CVPR.2017.502"},{"key":"24_CR6","doi-asserted-by":"publisher","first-page":"753","DOI":"10.1007\/978-3-030-01225-0_44","volume-title":"Computer Vision \u2013 ECCV 2018","author":"Dima Damen","year":"2018","unstructured":"Damen, D., et al.: Scaling egocentric vision: the \n\n                      \n                    \n dataset. In: Ferrari, V., Hebert, M., Sminchisescu, C., Weiss, Y. (eds.) ECCV 2018. LNCS, vol. 11208, pp. 753\u2013771. Springer, Cham (2018). https:\/\/doi.org\/10.1007\/978-3-030-01225-0_44"},{"key":"24_CR7","unstructured":"Fan, C., Lee, J., Ryoo, M.S.: Forecasting hand and object locations in future frames. CoRR abs\/1705.07328 (2017). http:\/\/arxiv.org\/abs\/1705.07328"},{"key":"24_CR8","doi-asserted-by":"crossref","unstructured":"Fathi, A., Farhadi, A., Rehg, J.M.: Understanding egocentric activities. In: International Conference on Computer Vision, pp. 407\u2013414 (2011)","DOI":"10.1109\/ICCV.2011.6126269"},{"key":"24_CR9","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"314","DOI":"10.1007\/978-3-642-33718-5_23","volume-title":"Computer Vision \u2013 ECCV 2012","author":"A Fathi","year":"2012","unstructured":"Fathi, A., Li, Y., Rehg, J.M.: Learning to recognize daily actions using gaze. In: Fitzgibbon, A., Lazebnik, S., Perona, P., Sato, Y., Schmid, C. (eds.) ECCV 2012. LNCS, vol. 7572, pp. 314\u2013327. Springer, Heidelberg (2012). https:\/\/doi.org\/10.1007\/978-3-642-33718-5_23"},{"key":"24_CR10","doi-asserted-by":"crossref","unstructured":"Feichtenhofer, C., Pinz, A., Zisserman, A.: Convolutional two-stream network fusion for video action recognition. In: Computer Vision and Pattern Recognition, pp. 1933\u20131941 (2016)","DOI":"10.1109\/CVPR.2016.213"},{"key":"24_CR11","doi-asserted-by":"publisher","first-page":"401","DOI":"10.1016\/j.jvcir.2017.10.004","volume":"49","author":"A Furnari","year":"2017","unstructured":"Furnari, A., Battiato, S., Grauman, K., Farinella, G.M.: Next-active-object prediction from egocentric videos. J. Vis. Commun. Image Represent. 49, 401\u2013411 (2017). https:\/\/doi.org\/10.1016\/j.jvcir.2017.10.004","journal-title":"J. Vis. Commun. Image Represent."},{"key":"24_CR12","doi-asserted-by":"crossref","unstructured":"Gao, J., Yang, Z., Nevatia, R.: RED: reinforced encoder-decoder networks for action anticipation. In: British Machine Vision Conference (2017)","DOI":"10.5244\/C.31.92"},{"key":"24_CR13","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"489","DOI":"10.1007\/978-3-319-10584-0_32","volume-title":"Computer Vision \u2013 ECCV 2014","author":"D-A Huang","year":"2014","unstructured":"Huang, D.-A., Kitani, K.M.: Action-reaction: forecasting the dynamics of human interaction. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8695, pp. 489\u2013504. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10584-0_32"},{"key":"24_CR14","doi-asserted-by":"crossref","unstructured":"Jain, A., Koppula, H.S., Raghavan, B., Soh, S., Saxena, A.: Car that knows before you do: Anticipating maneuvers via learning temporal driving models. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 3182\u20133190 (2015)","DOI":"10.1109\/ICCV.2015.364"},{"issue":"8","key":"24_CR15","doi-asserted-by":"publisher","first-page":"2442","DOI":"10.1109\/JPROC.2012.2200554","volume":"100","author":"T Kanade","year":"2012","unstructured":"Kanade, T., Hebert, M.: First-person vision. Proc. IEEE 100(8), 2442\u20132453 (2012). https:\/\/doi.org\/10.1109\/JPROC.2012.2200554","journal-title":"Proc. IEEE"},{"key":"24_CR16","doi-asserted-by":"crossref","unstructured":"Karpathy, A., Toderici, G., Shetty, S., Leung, T., Sukthankar, R., Fei-Fei, L.: Large-scale video classification with convolutional neural networks. In: Computer Vision and Pattern Recognition, pp. 1725\u20131732 (2014)","DOI":"10.1109\/CVPR.2014.223"},{"issue":"1","key":"24_CR17","doi-asserted-by":"publisher","first-page":"14","DOI":"10.1109\/TPAMI.2015.2430335","volume":"38","author":"HS Koppula","year":"2016","unstructured":"Koppula, H.S., Saxena, A.: Anticipating human activities using object affordances for reactive robotic response. IEEE Trans. Pattern Anal. Mach. Intell. 38(1), 14\u201329 (2016). https:\/\/doi.org\/10.1109\/TPAMI.2015.2430335","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"24_CR18","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"689","DOI":"10.1007\/978-3-319-10578-9_45","volume-title":"Computer Vision \u2013 ECCV 2014","author":"T Lan","year":"2014","unstructured":"Lan, T., Chen, T.-C., Savarese, S.: A hierarchical representation for future action prediction. In: Fleet, D., Pajdla, T., Schiele, B., Tuytelaars, T. (eds.) ECCV 2014. LNCS, vol. 8691, pp. 689\u2013704. Springer, Cham (2014). https:\/\/doi.org\/10.1007\/978-3-319-10578-9_45"},{"issue":"7","key":"24_CR19","doi-asserted-by":"publisher","first-page":"1533","DOI":"10.1109\/TPAMI.2017.2751607","volume":"40","author":"M Lapin","year":"2017","unstructured":"Lapin, M., Hein, M., Schiele, B.: Analysis and optimization of loss functions for multiclass, top-k, and multilabel classification. IEEE Trans. Pattern Anal. Mach. Intell. 40(7), 1533\u20131554 (2017)","journal-title":"IEEE Trans. Pattern Anal. Mach. Intell."},{"key":"24_CR20","doi-asserted-by":"crossref","unstructured":"Li, Y., Ye, Z., Rehg, J.M.: Delving into egocentric actions. In: Computer Vision and Pattern Recognition, pp. 287\u2013295 (2015)","DOI":"10.1109\/CVPR.2015.7298625"},{"key":"24_CR21","doi-asserted-by":"crossref","unstructured":"Ma, M., Fan, H., Kitani, K.M.: Going deeper into first-person activity recognition. In: Computer Vision and Pattern Recognition, pp. 1894\u20131903 (2016)","DOI":"10.1109\/CVPR.2016.209"},{"key":"24_CR22","doi-asserted-by":"crossref","unstructured":"Ma, S., Sigal, L., Sclaroff, S.: Learning activity progression in lSTMs for activity detection and early detection. In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp. 1942\u20131950 (2016)","DOI":"10.1109\/CVPR.2016.214"},{"key":"24_CR23","doi-asserted-by":"crossref","unstructured":"Mahmud, T., Hasan, M., Roy-Chowdhury, A.K.: Joint prediction of activity labels and starting times in untrimmed videos. In: 2017 IEEE International Conference on Computer Vision (ICCV), pp. 5784\u20135793 (2017)","DOI":"10.1109\/ICCV.2017.616"},{"key":"24_CR24","doi-asserted-by":"publisher","first-page":"4697","DOI":"10.1109\/CVPR.2016.508","volume":"2016","author":"HS Park","year":"2016","unstructured":"Park, H.S., Hwang, J.J., Niu, Y., Shi, J.: Egocentric future localization. CVPR 2016, 4697\u20134705 (2016). https:\/\/doi.org\/10.1109\/CVPR.2016.508","journal-title":"CVPR"},{"key":"24_CR25","doi-asserted-by":"crossref","unstructured":"Rhinehart, N., Kitani, K.M.: First-person activity forecasting with online inverse reinforcement learning. In: ICCV (2017)","DOI":"10.1109\/ICCV.2017.399"},{"key":"24_CR26","doi-asserted-by":"publisher","unstructured":"Ryoo, M.S., Fuchs, T.J., Xia, L., Aggarwal, J.K., Matthies, L.: Robot-centric activity prediction from first-person videos: what will they do to me? In: IEEE International Conference on Human-Robot Interaction, pp. 295\u2013302 (2015). https:\/\/doi.org\/10.1145\/2696454.2696462","DOI":"10.1145\/2696454.2696462"},{"key":"24_CR27","unstructured":"Simonyan, K., Zisserman, A.: Two-stream convolutional networks for action recognition in videos. In: Advances in Neural Information Processing Systems, pp. 568\u2013576 (2014)"},{"key":"24_CR28","doi-asserted-by":"publisher","unstructured":"Singh, K.K., Fatahalian, K., Efros, A.A.: Krishnacam: Using a longitudinal, single-person, egocentric dataset for scene understanding tasks. In: IEEE Winter Conference on Applications of Computer Vision (2016). https:\/\/doi.org\/10.1109\/WACV.2016.7477717","DOI":"10.1109\/WACV.2016.7477717"},{"key":"24_CR29","doi-asserted-by":"publisher","unstructured":"Soran, B., Farhadi, A., Shapiro, L.: Generating notifications for missing actions: don\u2019t forget to turn the lights off! In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4669\u20134677 (2016). https:\/\/doi.org\/10.1109\/ICCV.2015.530","DOI":"10.1109\/ICCV.2015.530"},{"key":"24_CR30","doi-asserted-by":"crossref","unstructured":"Spriggs, E.H., De La Torre, F., Hebert, M.: Temporal segmentation and activity classification from first-person sensing. In: Computer Vision and Pattern Recognition Workshops, pp. 17\u201324 (2009)","DOI":"10.1109\/CVPRW.2009.5204354"},{"key":"24_CR31","doi-asserted-by":"crossref","unstructured":"Vondrick, C., Pirsiavash, H., Torralba, A.: Anticipating visual representations from unlabeled video. In: IEEE Conference on Computer Vision and Pattern Recognition, pp. 98\u2013106 (2016)","DOI":"10.1109\/CVPR.2016.18"},{"key":"24_CR32","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"835","DOI":"10.1007\/978-3-319-46478-7_51","volume-title":"Computer Vision \u2013 ECCV 2016","author":"J Walker","year":"2016","unstructured":"Walker, J., Doersch, C., Gupta, A., Hebert, M.: An uncertain future: forecasting from static images using variational autoencoders. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9911, pp. 835\u2013851. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46478-7_51"},{"issue":"1","key":"24_CR33","doi-asserted-by":"publisher","first-page":"60","DOI":"10.1007\/s11263-012-0594-8","volume":"103","author":"H Wang","year":"2013","unstructured":"Wang, H., Kl\u00e4ser, A., Schmid, C., Liu, C.L.: Dense trajectories and motion boundary descriptors for action recognition. Int. J. Comput. Vis. 103(1), 60\u201379 (2013)","journal-title":"Int. J. Comput. Vis."},{"key":"24_CR34","doi-asserted-by":"crossref","unstructured":"Wang, H., Schmid, C.: Action recognition with improved trajectories. In: International Conference on Computer Vision, pp. 3551\u20133558 (2013)","DOI":"10.1109\/ICCV.2013.441"},{"key":"24_CR35","series-title":"Lecture Notes in Computer Science","doi-asserted-by":"publisher","first-page":"20","DOI":"10.1007\/978-3-319-46484-8_2","volume-title":"Computer Vision \u2013 ECCV 2016","author":"L Wang","year":"2016","unstructured":"Wang, L., et al.: Temporal segment networks: towards good practices for deep action recognition. In: Leibe, B., Matas, J., Sebe, N., Welling, M. (eds.) ECCV 2016. LNCS, vol. 9912, pp. 20\u201336. Springer, Cham (2016). https:\/\/doi.org\/10.1007\/978-3-319-46484-8_2"},{"key":"24_CR36","unstructured":"Yu, H.F., Jain, P., Kar, P., Dhillon, I.: Large-scale multi-label learning with missing labels. In: International Conference on Machine Learning, pp. 593\u2013601 (2014)"},{"key":"24_CR37","doi-asserted-by":"crossref","unstructured":"Zhang, M., Ma, K.T., Lim, J.H., Zhao, Q., Feng, J.: Deep future gaze: gaze anticipation on egocentric videos using adversarial networks. In: Conference on Computer Vision and Pattern Recognition, pp. 4372\u20134381 (2017)","DOI":"10.1109\/CVPR.2017.377"},{"issue":"8","key":"24_CR38","doi-asserted-by":"publisher","first-page":"1819","DOI":"10.1109\/TKDE.2013.39","volume":"26","author":"ML Zhang","year":"2014","unstructured":"Zhang, M.L., Zhou, Z.H.: A review on multi-label learning algorithms. IEEE Trans. Knowl. Data Eng. 26(8), 1819\u20131837 (2014)","journal-title":"IEEE Trans. Knowl. Data Eng."},{"key":"24_CR39","doi-asserted-by":"publisher","unstructured":"Zhou, Y., Berg, T.L.: Temporal perception and prediction in ego-centric video. In: Proceedings of the IEEE International Conference on Computer Vision, pp. 4498\u20134506 (2016). https:\/\/doi.org\/10.1109\/ICCV.2015.511","DOI":"10.1109\/ICCV.2015.511"}],"container-title":["Lecture Notes in Computer Science","Computer Vision \u2013 ECCV 2018 Workshops"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-3-030-11021-5_24","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2023,1,22]],"date-time":"2023-01-22T01:16:06Z","timestamp":1674350166000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-3-030-11021-5_24"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019]]},"ISBN":["9783030110208","9783030110215"],"references-count":39,"URL":"https:\/\/doi.org\/10.1007\/978-3-030-11021-5_24","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2019]]},"assertion":[{"value":"23 January 2019","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ECCV","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"European Conference on Computer Vision","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Munich","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Germany","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2018","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"8 September 2018","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14 September 2018","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"15","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"eccv2018","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"https:\/\/eccv2018.org\/","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"This content has been made available to all.","name":"free","label":"Free to read"}]}}