{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2024,10,30]],"date-time":"2024-10-30T00:56:58Z","timestamp":1730249818824,"version":"3.28.0"},"reference-count":22,"publisher":"IEEE","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2017,7]]},"DOI":"10.1109\/icme.2017.8019335","type":"proceedings-article","created":{"date-parts":[[2017,9,6]],"date-time":"2017-09-06T21:03:50Z","timestamp":1504731830000},"page":"619-624","source":"Crossref","is-referenced-by-count":3,"title":["A joint model for action localization and classification in untrimmed video with visual attention"],"prefix":"10.1109","author":[{"given":"Weimian","family":"Li","sequence":"first","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Wenmin","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiongtao","family":"Chen","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Jinzhuo","family":"Wang","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Ge","family":"Li","sequence":"additional","affiliation":[],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"263","reference":[{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-005-1838-7"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.1109\/VSPETS.2005.1570899"},{"key":"ref13","first-page":"650","article-title":"An efficient dense and scale-invariant spatio-temporal interest point detector","author":"willems","year":"2008","journal-title":"European Conference on Computer Vision"},{"key":"ref14","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2008.4587756"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.5244\/C.22.99"},{"key":"ref16","first-page":"124","article-title":"Evaluation of local spatiotemporal features for action recognition","author":"wang","year":"2009","journal-title":"BMVC 2009-British Machine Vision Conference"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2012.59"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"ref19","first-page":"568","article-title":"Two-stream convolutional networks for action recognition in videos","author":"simonyan","year":"2014","journal-title":"Advances in neural information processing systems"},{"key":"ref4","first-page":"2204","article-title":"Recur-rent models of visual attention","author":"mnih","year":"2014","journal-title":"Advances in neural information processing systems"},{"journal-title":"Untrimmed video classification for activity detection submission to activitynet challenge","year":"2016","author":"singh","key":"ref3"},{"journal-title":"Attention for fine-grained categorization","year":"2014","author":"sermanet","key":"ref6"},{"journal-title":"Multiple object recognition with visual attention","year":"2014","author":"ba","key":"ref5"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1007\/BF00992696"},{"key":"ref7","first-page":"5","volume":"2","author":"kelvin","year":"2015","journal-title":"Show attend and tell Neural image caption generation with visual attention"},{"key":"ref2","first-page":"2","article-title":"Action recognition and detection by combining motion and appearance features","volume":"1","author":"wang","year":"2014","journal-title":"THUMOS14 Action Recognition Challenge"},{"key":"ref1","first-page":"6","article-title":"Fast saliency based pooling of fisher encoded dense trajectories","volume":"1","author":"karaman","year":"2014","journal-title":"ECCV THUMOS Workshop"},{"journal-title":"End-to-end learning of action detection from frame glimpses in videos","year":"2015","author":"yeung","key":"ref9"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299059"},{"journal-title":"Action recognition using visual attention","year":"2015","author":"sharma","key":"ref22"},{"key":"ref21","first-page":"811","article-title":"Deep alternative neural network: Exploring contexts as early as possible for action recognition","author":"wang","year":"2016","journal-title":"Advances in neural information processing systems"}],"event":{"name":"2017 IEEE International Conference on Multimedia and Expo (ICME)","start":{"date-parts":[[2017,7,10]]},"location":"Hong Kong, Hong Kong","end":{"date-parts":[[2017,7,14]]}},"container-title":["2017 IEEE International Conference on Multimedia and Expo (ICME)"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/8014303\/8019290\/08019335.pdf?arnumber=8019335","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2017,10,2]],"date-time":"2017-10-02T23:15:42Z","timestamp":1506986142000},"score":1,"resource":{"primary":{"URL":"http:\/\/ieeexplore.ieee.org\/document\/8019335\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2017,7]]},"references-count":22,"URL":"https:\/\/doi.org\/10.1109\/icme.2017.8019335","relation":{},"subject":[],"published":{"date-parts":[[2017,7]]}}}