{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,11,12]],"date-time":"2025-11-12T14:03:29Z","timestamp":1762956209826,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":40,"publisher":"ACM","license":[{"start":{"date-parts":[[2019,10,15]],"date-time":"2019-10-15T00:00:00Z","timestamp":1571097600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"DOI":"10.13039\/501100000923","name":"Australian Research Council","doi-asserted-by":"publisher","award":["LP170100416, LP180100114"],"award-info":[{"award-number":["LP170100416, LP180100114"]}],"id":[{"id":"10.13039\/501100000923","id-type":"DOI","asserted-by":"publisher"}]},{"DOI":"10.13039\/501100012659","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["U1736117"],"award-info":[{"award-number":["U1736117"]}],"id":[{"id":"10.13039\/501100012659","id-type":"DOI","asserted-by":"publisher"}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2019,10,15]]},"DOI":"10.1145\/3343031.3350916","type":"proceedings-article","created":{"date-parts":[[2019,10,21]],"date-time":"2019-10-21T16:32:26Z","timestamp":1571675546000},"page":"583-591","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":8,"title":["Action Recognition with Bootstrapping based Long-range Temporal Context Attention"],"prefix":"10.1145","author":[{"given":"Ziming","family":"Liu","sequence":"first","affiliation":[{"name":"Beijing Institute of Technology, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Guangyu","family":"Gao","sequence":"additional","affiliation":[{"name":"Beijing Institute of Technology, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"A. K.","family":"Qin","sequence":"additional","affiliation":[{"name":"Swinburne University of Technology, Melbourne, Australia"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Tong","family":"Wu","sequence":"additional","affiliation":[{"name":"Beijing Institute of Technology, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chi Harold","family":"Liu","sequence":"additional","affiliation":[{"name":"Beijing Institute of Technology, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2019,10,15]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Multiple object recognition with visual attention. arXiv preprint arXiv:1412.7755","author":"Ba Jimmy","year":"2014","unstructured":"Jimmy Ba , Volodymyr Mnih , and Koray Kavukcuoglu . 2014. Multiple object recognition with visual attention. arXiv preprint arXiv:1412.7755 ( 2014 ). Jimmy Ba, Volodymyr Mnih, and Koray Kavukcuoglu. 2014. Multiple object recognition with visual attention. arXiv preprint arXiv:1412.7755 (2014)."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"crossref","unstructured":"Joao Carreira and Andrew Zisserman. 2017. Quo Vadis Action Recognition? A New Model and the Kinetics Dataset. (2017).  Joao Carreira and Andrew Zisserman. 2017. Quo Vadis Action Recognition? A New Model and the Kinetics Dataset. (2017).","DOI":"10.1109\/CVPR.2017.502"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"crossref","unstructured":"Mircea Cimpoi Subhransu Maji Andrea Vedaldi Mircea Cimpoi Subhransu Maji and Andrea Vedaldi. 2015. Deep filter banks for texture recognition and segmentation. In Computer Vision & Pattern Recognition .  Mircea Cimpoi Subhransu Maji Andrea Vedaldi Mircea Cimpoi Subhransu Maji and Andrea Vedaldi. 2015. Deep filter banks for texture recognition and segmentation. In Computer Vision & Pattern Recognition .","DOI":"10.1109\/CVPR.2015.7299007"},{"key":"e_1_3_2_1_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298878"},{"key":"e_1_3_2_1_6_1","volume-title":"IEEE International Conference on Computer Vision. 4489--4497","author":"Du Tran","year":"2015","unstructured":"Tran Du , Lubomir Bourdev , Rob Fergus , Lorenzo Torresani , and Manohar Paluri . 2015 . Learning Spatiotemporal Features with 3D Convolutional Networks . In IEEE International Conference on Computer Vision. 4489--4497 . Tran Du, Lubomir Bourdev, Rob Fergus, Lorenzo Torresani, and Manohar Paluri. 2015. Learning Spatiotemporal Features with 3D Convolutional Networks. In IEEE International Conference on Computer Vision. 4489--4497."},{"key":"e_1_3_2_1_7_1","volume-title":"RPAN: An End-to-End Recurrent Pose-Attention Network for Action Recognition in Videos. In IEEE International Conference on Computer Vision. 3725--3734","author":"Du Wenbin","year":"2017","unstructured":"Wenbin Du , Yali Wang , and Qiao Yu . 2017 . RPAN: An End-to-End Recurrent Pose-Attention Network for Action Recognition in Videos. In IEEE International Conference on Computer Vision. 3725--3734 . Wenbin Du, Yali Wang, and Qiao Yu. 2017. RPAN: An End-to-End Recurrent Pose-Attention Network for Action Recognition in Videos. In IEEE International Conference on Computer Vision. 3725--3734."},{"key":"e_1_3_2_1_8_1","first-page":"257","article-title":"Adaptive Subgradient Methods for Online Learning and Stochastic Optimization","volume":"12","author":"Duchi John","year":"2011","unstructured":"John Duchi , Elad Hazan , and Yoram Singer . 2011 . Adaptive Subgradient Methods for Online Learning and Stochastic Optimization . Journal of Machine Learning Research , Vol. 12 , 7 (2011), 257 -- 269 . John Duchi, Elad Hazan, and Yoram Singer. 2011. Adaptive Subgradient Methods for Online Learning and Stochastic Optimization. Journal of Machine Learning Research , Vol. 12, 7 (2011), 257--269.","journal-title":"Journal of Machine Learning Research"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1214\/aos\/1176344552"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.81"},{"key":"e_1_3_2_1_11_1","first-page":"1080","article-title":"Contextual Action Recognition with R*CNN","volume":"40","author":"Gkioxari Georgia","year":"2015","unstructured":"Georgia Gkioxari , Ross Girshick , and Jitendra Malik . 2015 . Contextual Action Recognition with R*CNN . International Journal of Cancer Journal International Du Cancer , Vol. 40 , 1 (2015), 1080 -- 1088 . Georgia Gkioxari, Ross Girshick, and Jitendra Malik. 2015. Contextual Action Recognition with R*CNN. International Journal of Cancer Journal International Du Cancer , Vol. 40, 1 (2015), 1080--1088.","journal-title":"International Journal of Cancer Journal International Du Cancer"},{"key":"e_1_3_2_1_12_1","doi-asserted-by":"crossref","unstructured":"Yunchao Gong Liwei Wang Ruiqi Guo and Svetlana Lazebnik. 2014. Multi-scale Orderless Pooling of Deep Convolutional Activation Features. (2014).  Yunchao Gong Liwei Wang Ruiqi Guo and Svetlana Lazebnik. 2014. Multi-scale Orderless Pooling of Deep Convolutional Activation Features. (2014).","DOI":"10.1007\/978-3-319-10584-0_26"},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"crossref","unstructured":"Hu Han Jiayuan Gu Zhang Zheng Jifeng Dai and Yichen Wei. 2017. Relation Networks for Object Detection. (2017).  Hu Han Jiayuan Gu Zhang Zheng Jifeng Dai and Yichen Wei. 2017. Relation Networks for Object Detection. (2017).","DOI":"10.1109\/CVPR.2018.00378"},{"key":"e_1_3_2_1_14_1","volume-title":"Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet. computer vision and pattern recognition","author":"Hara Kensho","year":"2018","unstructured":"Kensho Hara , Hirokatsu Kataoka , and Yutaka Satoh . 2018. Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet. computer vision and pattern recognition ( 2018 ), 6546--6555. Kensho Hara, Hirokatsu Kataoka, and Yutaka Satoh. 2018. Can Spatiotemporal 3D CNNs Retrace the History of 2D CNNs and ImageNet. computer vision and pattern recognition (2018), 6546--6555."},{"key":"e_1_3_2_1_15_1","volume-title":"Deep Residual Learning for Image Recognition. computer vision and pattern recognition","author":"He Kaiming","year":"2016","unstructured":"Kaiming He , Xiangyu Zhang , Shaoqing Ren , and Jian Sun . 2016. Deep Residual Learning for Image Recognition. computer vision and pattern recognition ( 2016 ), 770--778. Kaiming He, Xiangyu Zhang, Shaoqing Ren, and Jian Sun. 2016. Deep Residual Learning for Image Recognition. computer vision and pattern recognition (2016), 770--778."},{"key":"e_1_3_2_1_16_1","volume-title":"Rao Muhammad Anwer, Andrew D. Bagdanov, Michael Felsberg, and Jorma Laaksonen.","author":"Khan Fahad Shahbaz","year":"2016","unstructured":"Fahad Shahbaz Khan , Van De Weijer Joost , Rao Muhammad Anwer, Andrew D. Bagdanov, Michael Felsberg, and Jorma Laaksonen. 2016 . Scale Coding Bag of Deep Features for Human Attribute and Action Recognition . (2016). Fahad Shahbaz Khan, Van De Weijer Joost, Rao Muhammad Anwer, Andrew D. Bagdanov, Michael Felsberg, and Jorma Laaksonen. 2016. Scale Coding Bag of Deep Features for Human Attribute and Action Recognition. (2016)."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.cviu.2017.10.011"},{"key":"e_1_3_2_1_18_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2016.7553002"},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2017.2751966"},{"key":"e_1_3_2_1_20_1","volume-title":"SGDR: Stochastic Gradient Descent with Warm Restarts.","author":"Loshchilov Ilya","year":"2016","unstructured":"Ilya Loshchilov and Frank Hutter . 2016 . SGDR: Stochastic Gradient Descent with Warm Restarts. (2016). Ilya Loshchilov and Frank Hutter. 2016. SGDR: Stochastic Gradient Descent with Warm Restarts. (2016)."},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"publisher","DOI":"10.1145\/2089094.2089107"},{"key":"e_1_3_2_1_22_1","volume-title":"et almbox","author":"Mnih Volodymyr","year":"2014","unstructured":"Volodymyr Mnih , Nicolas Heess , Alex Graves , et almbox . 2014 . Recurrent models of visual attention. In Advances in neural information processing systems. 2204--2212. Volodymyr Mnih, Nicolas Heess, Alex Graves, et almbox. 2014. Recurrent models of visual attention. In Advances in neural information processing systems. 2204--2212."},{"key":"e_1_3_2_1_23_1","volume-title":"Action recognition using visual attention. arXiv preprint arXiv:1511.04119","author":"Sharma Shikhar","year":"2015","unstructured":"Shikhar Sharma , Ryan Kiros , and Ruslan Salakhutdinov . 2015. Action recognition using visual attention. arXiv preprint arXiv:1511.04119 ( 2015 ). Shikhar Sharma, Ryan Kiros, and Ruslan Salakhutdinov. 2015. Action recognition using visual attention. arXiv preprint arXiv:1511.04119 (2015)."},{"key":"e_1_3_2_1_24_1","unstructured":"Karen Simonyan and Andrew Zisserman. 2014. Two-Stream Convolutional Networks for Action Recognition in Videos. (2014).  Karen Simonyan and Andrew Zisserman. 2014. Two-Stream Convolutional Networks for Action Recognition in Videos. (2014)."},{"key":"e_1_3_2_1_25_1","volume-title":"Amir Roshan Zamir, and Mubarak Shah","author":"Soomro Khurram","year":"2012","unstructured":"Khurram Soomro , Amir Roshan Zamir, and Mubarak Shah . 2012 . UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild. Computer Science ( 2012). Khurram Soomro, Amir Roshan Zamir, and Mubarak Shah. 2012. UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild. Computer Science (2012)."},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"e_1_3_2_1_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2712608"},{"key":"e_1_3_2_1_28_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention Is All You Need. (2017).  Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N. Gomez Lukasz Kaiser and Illia Polosukhin. 2017. Attention Is All You Need. (2017)."},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-012-0594-8"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"e_1_3_2_1_31_1","volume-title":"Temporal Segment Networks: Towards Good Practices for Deep Action Recognition. In European Conference on Computer Vision. 20--36","author":"Wang Limin","year":"2016","unstructured":"Limin Wang , Yuanjun Xiong , Wang Zhe , Qiao Yu , Dahua Lin , Xiaoou Tang , and Luc Van Gool . 2016 b. Temporal Segment Networks: Towards Good Practices for Deep Action Recognition. In European Conference on Computer Vision. 20--36 . Limin Wang, Yuanjun Xiong, Wang Zhe, Qiao Yu, Dahua Lin, Xiaoou Tang, and Luc Van Gool. 2016b. Temporal Segment Networks: Towards Good Practices for Deep Action Recognition. In European Conference on Computer Vision. 20--36."},{"key":"e_1_3_2_1_32_1","doi-asserted-by":"crossref","unstructured":"Xiaolong Wang Ross Girshick Abhinav Gupta and Kaiming He. 2017. Non-local Neural Networks. (2017).  Xiaolong Wang Ross Girshick Abhinav Gupta and Kaiming He. 2017. Non-local Neural Networks. (2017).","DOI":"10.1109\/CVPR.2018.00813"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"crossref","unstructured":"Xiaolong Wang and Abhinav Gupta. 2018. Videos as Space-Time Region Graphs. (2018).  Xiaolong Wang and Abhinav Gupta. 2018. Videos as Space-Time Region Graphs. (2018).","DOI":"10.1007\/978-3-030-01228-1_25"},{"key":"e_1_3_2_1_34_1","volume-title":"Shift: A Zero FLOP, Zero Parameter Alternative to Spatial Convolutions.","author":"Wu Bichen","year":"2017","unstructured":"Bichen Wu , Alvin Wan , Xiangyu Yue , Peter Jin , Sicheng Zhao , Noah Golmant , Amir Gholaminejad , Joseph Gonzalez , and Kurt Keutzer . 2017 . Shift: A Zero FLOP, Zero Parameter Alternative to Spatial Convolutions. (2017). Bichen Wu, Alvin Wan, Xiangyu Yue, Peter Jin, Sicheng Zhao, Noah Golmant, Amir Gholaminejad, Joseph Gonzalez, and Kurt Keutzer. 2017. Shift: A Zero FLOP, Zero Parameter Alternative to Spatial Convolutions. (2017)."},{"key":"e_1_3_2_1_35_1","volume-title":"Zhuowen Tu, and Kaiming He.","author":"Xie Saining","year":"2016","unstructured":"Saining Xie , Ross Girshick , Piotr Dollar , Zhuowen Tu, and Kaiming He. 2016 . Aggregated Residual Transformations for Deep Neural Networks . (2016). Saining Xie, Ross Girshick, Piotr Dollar, Zhuowen Tu, and Kaiming He. 2016. Aggregated Residual Transformations for Deep Neural Networks. (2016)."},{"key":"e_1_3_2_1_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2011.6126386"},{"key":"e_1_3_2_1_37_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7299101"},{"key":"e_1_3_2_1_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.367"},{"key":"e_1_3_2_1_39_1","volume-title":"Shih En Wei, and Yaser Sheikh","author":"Zhe Cao","year":"2016","unstructured":"Cao Zhe , Tomas Simon , Shih En Wei, and Yaser Sheikh . 2016 . Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields. (2016). Cao Zhe, Tomas Simon, Shih En Wei, and Yaser Sheikh. 2016. Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields. (2016)."},{"key":"e_1_3_2_1_40_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01246-5_49"}],"event":{"name":"MM '19: The 27th ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Nice France","acronym":"MM '19"},"container-title":["Proceedings of the 27th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3343031.3350916","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3343031.3350916","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T23:13:17Z","timestamp":1750201997000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3343031.3350916"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2019,10,15]]},"references-count":40,"alternative-id":["10.1145\/3343031.3350916","10.1145\/3343031"],"URL":"https:\/\/doi.org\/10.1145\/3343031.3350916","relation":{},"subject":[],"published":{"date-parts":[[2019,10,15]]},"assertion":[{"value":"2019-10-15","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}