{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,18]],"date-time":"2026-06-18T15:46:19Z","timestamp":1781797579686,"version":"3.54.5"},"reference-count":56,"publisher":"Institute of Electrical and Electronics Engineers (IEEE)","issue":"4","license":[{"start":{"date-parts":[[2018,12,1]],"date-time":"2018-12-01T00:00:00Z","timestamp":1543622400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/ieeexplore.ieee.org\/Xplorehelp\/downloads\/license-information\/IEEE.html"}],"content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["IEEE Trans. Cogn. Dev. Syst."],"published-print":{"date-parts":[[2018,12]]},"DOI":"10.1109\/tcds.2017.2783944","type":"journal-article","created":{"date-parts":[[2017,12,15]],"date-time":"2017-12-15T22:24:13Z","timestamp":1513376653000},"page":"1116-1125","source":"Crossref","is-referenced-by-count":63,"title":["Multibranch Attention Networks for Action Recognition in Still Images"],"prefix":"10.1109","volume":"10","author":[{"ORCID":"https:\/\/orcid.org\/0000-0003-1411-5952","authenticated-orcid":false,"given":"Shiyang","family":"Yan","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jeremy S.","family":"Smith","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Wenjin","family":"Lu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bailing","family":"Zhang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"263","reference":[{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.81"},{"key":"ref38","article-title":"Regularized max pooling for image categorization","author":"hoai","year":"2014","journal-title":"Proc Brit Mach Vis Conf"},{"key":"ref33","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.169"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2011.6126386"},{"key":"ref31","first-page":"1","article-title":"Very deep convolutional networks for large-scale image recognition","author":"simonyan","year":"2015","journal-title":"Int Conf on Learning Representations"},{"key":"ref30","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-009-0275-4"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.222"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.1145\/2647868.2654889"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.1007\/3-540-45631-7_39"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-015-0816-y"},{"key":"ref28","article-title":"Network in network","author":"lin","year":"2014","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.319"},{"key":"ref29","first-page":"52.1","article-title":"Attention networks for weakly supervised object localization","author":"teh","year":"2016","journal-title":"Proc Brit Mach Vis Conf (BMVC)"},{"key":"ref2","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995407"},{"key":"ref1","first-page":"568","article-title":"Two-stream convolutional networks for action recognition in videos","author":"simonyan","year":"2014","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref20","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2009.83"},{"key":"ref22","article-title":"Multiple object recognition with visual attention","author":"ba","year":"2014","journal-title":"arXiv preprint arXiv 1412 7755"},{"key":"ref21","first-page":"2204","article-title":"Recurrent models of visual attention","author":"mnih","year":"2014","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-540-79547-6_7"},{"key":"ref23","article-title":"Video description generation incorporating spatio-temporal features and a soft-attention mechanism","author":"yao","year":"2015","journal-title":"arXiv preprint arXiv 1502 01710"},{"key":"ref26","doi-asserted-by":"crossref","first-page":"353","DOI":"10.1109\/TPAMI.2010.70","article-title":"Learning to detect a salient object","volume":"33","author":"liu","year":"2011","journal-title":"IEEE Trans Pattern Anal Mach Intell"},{"key":"ref25","doi-asserted-by":"publisher","DOI":"10.1109\/34.730558"},{"key":"ref50","first-page":"414","article-title":"Learning models for actions and person-object interactions with transfer to question answering","author":"mallya","year":"2016","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref51","author":"ge","year":"1978","journal-title":"Statistics for Experimenters"},{"key":"ref56","author":"wilcox","year":"1996","journal-title":"Statistics for the Social Sciences"},{"key":"ref55","first-page":"623","article-title":"A comparison of statistical significance tests for information retrieval evaluation","author":"smucker","year":"2007","journal-title":"Proc 16th ACM Conf Inf Knowl Manage"},{"key":"ref54","doi-asserted-by":"publisher","DOI":"10.1177\/1536867X0700700307"},{"key":"ref53","author":"fisher","year":"1937","journal-title":"The Design of Experiments"},{"key":"ref52","volume":"139","author":"cohen","year":"1995","journal-title":"Empirical Methods for Artificial Intelligence"},{"key":"ref10","article-title":"Neural machine translation by jointly learning to align and translate","author":"bahdanau","year":"2015","journal-title":"Proc Int Conf Learn Represent"},{"key":"ref11","first-page":"2048","article-title":"Show, attend and tell: Neural image caption generation with visual attention","author":"xu","year":"2015","journal-title":"Proc ICML"},{"key":"ref40","first-page":"1378","article-title":"Object bank: A high-level image representation for scene classification & semantic feature sparsification","author":"li","year":"2010","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref12","article-title":"Action recognition using visual attention","author":"sharma","year":"2016","journal-title":"Proc Workshop Int Conf Learn Represent"},{"key":"ref13","first-page":"2017","article-title":"Spatial transformer networks","author":"jaderberg","year":"2015","journal-title":"Proc Adv Neural Inf Process Syst"},{"key":"ref14","article-title":"Advances in human action recognition: A survey","author":"cheng","year":"2015","journal-title":"ArXiv preprint arXiv 1501 05964"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.284"},{"key":"ref16","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2011.5995631"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.1109\/CVPRW.2010.5543176"},{"key":"ref18","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.129"},{"key":"ref19","doi-asserted-by":"publisher","DOI":"10.5244\/C.24.97"},{"key":"ref4","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5540234"},{"key":"ref3","first-page":"50","article-title":"Discriminative orderlet mining for real-time recognition of human-object interaction","author":"yu","year":"2014","journal-title":"Proc Asian Conf Comput Vis"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5540235"},{"key":"ref5","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2008.4587721"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2009.5459303"},{"key":"ref7","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5539906"},{"key":"ref49","first-page":"740","article-title":"Microsoft COCO: Common objects in context","author":"lin","year":"2014","journal-title":"Proc Eur Conf Comput Vis"},{"key":"ref9","doi-asserted-by":"publisher","DOI":"10.1037\/0096-1523.35.1.50"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.1016\/j.image.2017.03.010"},{"key":"ref45","doi-asserted-by":"publisher","DOI":"10.1016\/j.patrec.2016.08.020"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.122"},{"key":"ref47","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2016.2605305"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2013.90"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5540018"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2015.2465147"},{"key":"ref43","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.387"}],"container-title":["IEEE Transactions on Cognitive and Developmental Systems"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx7\/7274989\/8567843\/08214269.pdf?arnumber=8214269","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2022,1,29]],"date-time":"2022-01-29T00:14:13Z","timestamp":1643415253000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/8214269\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2018,12]]},"references-count":56,"journal-issue":{"issue":"4"},"URL":"https:\/\/doi.org\/10.1109\/tcds.2017.2783944","relation":{},"ISSN":["2379-8920","2379-8939"],"issn-type":[{"value":"2379-8920","type":"print"},{"value":"2379-8939","type":"electronic"}],"subject":[],"published":{"date-parts":[[2018,12]]}}}