{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,25]],"date-time":"2026-07-25T01:42:57Z","timestamp":1784943777964,"version":"3.55.0"},"reference-count":58,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","license":[{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"},{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-029"},{"start":{"date-parts":[[2021,1,1]],"date-time":"2021-01-01T00:00:00Z","timestamp":1609459200000},"content-version":"stm-asf","delay-in-days":0,"URL":"https:\/\/doi.org\/10.15223\/policy-037"}],"funder":[{"name":"ARC Discovery Project","award":["DP200100938"],"award-info":[{"award-number":["DP200100938"]}]}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. on Image Process."],"published-print":{"date-parts":[[2021]]},"DOI":"10.1109\/tip.2020.3040521","type":"journal-article","created":{"date-parts":[[2020,12,3]],"date-time":"2020-12-03T20:54:38Z","timestamp":1607028878000},"page":"1143-1152","source":"Crossref","is-referenced-by-count":63,"title":["Learning to Anticipate Egocentric Actions by Imagination"],"prefix":"10.1109","volume":"30","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-1680-8253","authenticated-orcid":false,"given":"Yu","family":"Wu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4093-7557","authenticated-orcid":false,"given":"Linchao","family":"Zhu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-6206-7911","authenticated-orcid":false,"given":"Xiaohan","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-0512-880X","authenticated-orcid":false,"given":"Yi","family":"Yang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-2139-8807","authenticated-orcid":false,"given":"Fei","family":"Wu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.399"},{"key":"ref38","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.326"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2937757"},{"key":"ref32","first-page":"1","article-title":"Leveraging uncertainty to rethink loss functions and evaluation measures for egocentric action anticipation","author":"furnari","year":"2018","journal-title":"Proc ECCV-W"},{"key":"ref31","doi-asserted-by":"publisher","DOI":"10.5244\/C.31.92"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2020.3021497"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.616"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1016\/j.jvcir.2017.10.004"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.362"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00560"},{"key":"ref28","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00587"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2018.2834873"},{"key":"ref29","first-page":"1","article-title":"Eidetic 3D LSTM: A model for video prediction and beyond","author":"wang","year":"2018","journal-title":"Proc ICLR"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00038"},{"key":"ref1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01219-9_26"},{"key":"ref20","article-title":"Attention is all we need: Nailing down object-centric attention for egocentric activity recognition","author":"sudhakaran","year":"2018","journal-title":"Proc BMVC"},{"key":"ref22","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.39"},{"key":"ref21","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2020.3015894"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46454-1_17"},{"key":"ref23","article-title":"Am I done? predicting action progress in videos","author":"becattini","year":"2017","journal-title":"Proc BMVC"},{"key":"ref26","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.214"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/WACV.2018.00173"},{"key":"ref50","doi-asserted-by":"publisher","DOI":"10.1162\/neco.1997.9.8.1735"},{"key":"ref51","first-page":"297","article-title":"Noise-contrastive estimation: A new estimation principle for unnormalized statistical models","author":"gutmann","year":"2010","journal-title":"Proc AISTATS"},{"key":"ref58","doi-asserted-by":"publisher","DOI":"10.1109\/ICRA.2016.7487478"},{"key":"ref57","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.18"},{"key":"ref56","first-page":"1","article-title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","author":"ioffe","year":"2015","journal-title":"Proc ICML"},{"key":"ref55","article-title":"Automatic differentiation in PyTorch","author":"paszke","year":"2017","journal-title":"Proc NeurIPS Workshops"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2015.2430335"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2891895"},{"key":"ref52","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00393"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00566"},{"key":"ref11","first-page":"1","article-title":"Action anticipation by predicting future dynamic images","author":"rodriguez","year":"2018","journal-title":"Proc ECCV-W"},{"key":"ref40","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2613686"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_38"},{"key":"ref13","first-page":"568","article-title":"Two-stream convolutional networks for action recognition in videos","author":"simonyan","year":"2014","journal-title":"Proc NIPS"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"ref16","article-title":"YouTube-8M: A large-scale video classification benchmark","author":"abu-el-haija","year":"2016","journal-title":"arXiv 1609 08675"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.147"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00559"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01019"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00635"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2019.00351"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/TCSVT.2018.2875441"},{"key":"ref5","first-page":"720","article-title":"Scaling egocentric vision: The epic-kitchens dataset","author":"damen","year":"2018","journal-title":"Proc ECCV"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01240-3_36"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00684"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR42600.2020.00975"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01249-6_19"},{"key":"ref46","first-page":"1","article-title":"A simple framework for contrastive learning of visual representations","author":"chen","year":"2020","journal-title":"Proc ICLR"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW.2019.00151"},{"key":"ref48","article-title":"Representation learning with contrastive predictive coding","author":"van den oord","year":"2018","journal-title":"arXiv 1807 03748"},{"key":"ref47","first-page":"1","article-title":"Memory-augmented dense predictive coding for video representation learning","author":"han","year":"2020","journal-title":"Proc ECCV"},{"key":"ref42","first-page":"163","article-title":"Ego-topo: Environment affordances from egocentric video","author":"nagarajan","year":"2020","journal-title":"Proc IEEE\/CVF Conf Comput Vis Pattern Recognit (CVPR)"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58517-4_10"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2020.07.135"},{"key":"ref43","article-title":"Egocentric object manipulation graphs","author":"dessalene","year":"2020","journal-title":"arXiv 2006 03201"}],"container-title":["IEEE Transactions on Image Processing"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/83\/9263394\/09280353.pdf?arnumber=9280353","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,5,10]],"date-time":"2022-05-10T14:50:02Z","timestamp":1652194202000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/9280353\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021]]},"references-count":58,"URL":"https:\/\/doi.org\/10.1109\/tip.2020.3040521","relation":{},"ISSN":["1057-7149","1941-0042"],"issn-type":[{"value":"1057-7149","type":"print"},{"value":"1941-0042","type":"electronic"}],"subject":[],"published":{"date-parts":[[2021]]}}}