{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,9]],"date-time":"2026-06-09T06:28:56Z","timestamp":1780986536471,"version":"3.54.1"},"publisher-location":"New York, NY, USA","reference-count":35,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3475374","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T22:11:38Z","timestamp":1634595098000},"page":"2158-2166","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":5,"title":["LSTC: Boosting Atomic Action Detection with Long-Short-Term Context"],"prefix":"10.1145","author":[{"given":"Yuxi","family":"Li","sequence":"first","affiliation":[{"name":"Tencent Youtu Lab, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Boshen","family":"Zhang","sequence":"additional","affiliation":[{"name":"Tencent Youtu Lab, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jian","family":"Li","sequence":"additional","affiliation":[{"name":"Tencent Youtu Lab, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yabiao","family":"Wang","sequence":"additional","affiliation":[{"name":"Tencent Youtu Lab, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Weiyao","family":"Lin","sequence":"additional","affiliation":[{"name":"Shanghai Jiao Tong University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Chengjie","family":"Wang","sequence":"additional","affiliation":[{"name":"Tencent Youtu Lab, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jilin","family":"Li","sequence":"additional","affiliation":[{"name":"Tencent Youtu Lab, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Feiyue","family":"Huang","sequence":"additional","affiliation":[{"name":"Tencent Youtu Lab, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"key":"e_1_3_2_1_1_1","volume-title":"Neural Probabilistic Language Models","author":"Bengio Y.","unstructured":"Y. Bengio , R\u00e9jean Ducharme , Pascal Vincent , and Christian Jauvin . 2006. Neural Probabilistic Language Models . Vol. 3 . 137--186. Y. Bengio, R\u00e9jean Ducharme, Pascal Vincent, and Christian Jauvin. 2006. Neural Probabilistic Language Models. Vol. 3. 137--186."},{"key":"e_1_3_2_1_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"e_1_3_2_1_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206848"},{"key":"e_1_3_2_1_4_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In ACL.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In ACL. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In ACL."},{"key":"e_1_3_2_1_5_1","doi-asserted-by":"publisher","DOI":"10.1007\/s11263-014-0733-5"},{"key":"e_1_3_2_1_6_1","unstructured":"Haoqi Fan Yanghao Li Bo Xiong Wan-Yen Lo and Christoph Feichtenhofer. 2020. PySlowFast. https:\/\/github.com\/facebookresearch\/slowfast.  Haoqi Fan Yanghao Li Bo Xiong Wan-Yen Lo and Christoph Feichtenhofer. 2020. PySlowFast. https:\/\/github.com\/facebookresearch\/slowfast."},{"key":"e_1_3_2_1_7_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00630"},{"key":"e_1_3_2_1_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00033"},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.5555\/3294771.3294775"},{"key":"e_1_3_2_1_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00633"},{"key":"e_1_3_2_1_11_1","volume-title":"Network Decoupling: From Regular Convolution to Separable Depthwise Convolution. In BMVC.","author":"Guo Jianbo","year":"2018","unstructured":"Jianbo Guo , Yuxi Li , Jianguo Li , and Weiyao Lin . 2018 . Network Decoupling: From Regular Convolution to Separable Depthwise Convolution. In BMVC. Jianbo Guo, Yuxi Li, Jianguo Li, and Weiyao Lin. 2018. Network Decoupling: From Regular Convolution to Separable Depthwise Convolution. In BMVC."},{"key":"e_1_3_2_1_12_1","volume-title":"Mask R-CNN. In Proceedings of the IEEE International Conference on Computer Vision (ICCV).","author":"He Kaiming","year":"2017","unstructured":"Kaiming He , Georgia Gkioxari , Piotr Dollar , and Ross Girshick . 2017 . Mask R-CNN. In Proceedings of the IEEE International Conference on Computer Vision (ICCV). Kaiming He, Georgia Gkioxari, Piotr Dollar, and Ross Girshick. 2017. Mask R-CNN. In Proceedings of the IEEE International Conference on Computer Vision (ICCV)."},{"key":"e_1_3_2_1_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.106"},{"key":"e_1_3_2_1_15_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-10602-1_48"},{"key":"e_1_3_2_1_16_1","volume-title":"Human in Events: A Large-Scale Benchmark for Human-centric Video Analysis in Complex Events. arxiv","author":"Lin Weiyao","year":"2005","unstructured":"Weiyao Lin , Huabin Liu , Shizhan Liu , Yuxi Li , Guo-Jun Qi , Rui Qian , Tao Wang , Nicu Sebe , Ning Xu , Hongkai Xiong , and Mubarak Shah . 2020. Human in Events: A Large-Scale Benchmark for Human-centric Video Analysis in Complex Events. arxiv : 2005 .04490 [cs.CV] Weiyao Lin, Huabin Liu, Shizhan Liu, Yuxi Li, Guo-Jun Qi, Rui Qian, Tao Wang, Nicu Sebe, Ning Xu, Hongkai Xiong, and Mubarak Shah. 2020. Human in Events: A Large-Scale Benchmark for Human-centric Video Analysis in Complex Events. arxiv: 2005.04490 [cs.CV]"},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2009.5206557"},{"key":"e_1_3_2_1_18_1","unstructured":"S. W. Oh J. Y. Lee N. Xu and S. J. Kim. 2020. Space-time Memory Networks for Video Object Segmentation with User Guidance. IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI) (2020) 1--1.  S. W. Oh J. Y. Lee N. Xu and S. J. Kim. 2020. Space-time Memory Networks for Video Object Segmentation with User Guidance. IEEE Transactions on Pattern Analysis and Machine Intelligence (PAMI) (2020) 1--1."},{"key":"e_1_3_2_1_19_1","doi-asserted-by":"publisher","DOI":"10.3115\/v1\/D14-1162"},{"key":"e_1_3_2_1_20_1","doi-asserted-by":"publisher","DOI":"10.5555\/2969239.2969250"},{"key":"e_1_3_2_1_21_1","volume-title":"Action recognition using visual attention. arXiv preprint arXiv:1511.04119","author":"Sharma Shikhar","year":"2015","unstructured":"Shikhar Sharma , Ryan Kiros , and Ruslan Salakhutdinov . 2015. Action recognition using visual attention. arXiv preprint arXiv:1511.04119 ( 2015 ). Shikhar Sharma, Ryan Kiros, and Ruslan Salakhutdinov. 2015. Action recognition using visual attention. arXiv preprint arXiv:1511.04119 (2015)."},{"key":"e_1_3_2_1_22_1","doi-asserted-by":"publisher","DOI":"10.5555\/2968826.2968890"},{"key":"e_1_3_2_1_23_1","volume-title":"Amir Roshan Zamir, and Mubarak Shah","author":"Soomro Khurram","year":"2012","unstructured":"Khurram Soomro , Amir Roshan Zamir, and Mubarak Shah . 2012 . UCF101: A dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:1212.0402 (2012). Khurram Soomro, Amir Roshan Zamir, and Mubarak Shah. 2012. UCF101: A dataset of 101 human actions classes from videos in the wild. arXiv preprint arXiv:1212.0402 (2012)."},{"key":"e_1_3_2_1_24_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01252-6_20"},{"key":"e_1_3_2_1_25_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"e_1_3_2_1_26_1","doi-asserted-by":"publisher","DOI":"10.5555\/3295222.3295349"},{"key":"e_1_3_2_1_27_1","volume-title":"Video Modeling With Correlation Networks. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR).","author":"Wang Heng","year":"2020","unstructured":"Heng Wang , Du Tran , Lorenzo Torresani , and Matt Feiszli . 2020 . Video Modeling With Correlation Networks. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Heng Wang, Du Tran, Lorenzo Torresani, and Matt Feiszli. 2020. Video Modeling With Correlation Networks. In IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)."},{"key":"e_1_3_2_1_28_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2018.00813"},{"key":"e_1_3_2_1_30_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00037"},{"key":"e_1_3_2_1_31_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58595-2_27"},{"key":"e_1_3_2_1_32_1","volume-title":"Kristen Grauman, Jitendra Malik, and Christoph Feichtenhofer.","author":"Xiao Fanyi","year":"2020","unstructured":"Fanyi Xiao , Yong Jae Lee , Kristen Grauman, Jitendra Malik, and Christoph Feichtenhofer. 2020 . Audiovisual SlowFast Networks for Video Recognition . arxiv: 2001.08740 [cs.CV] Fanyi Xiao, Yong Jae Lee, Kristen Grauman, Jitendra Malik, and Christoph Feichtenhofer. 2020. Audiovisual SlowFast Networks for Video Recognition. arxiv: 2001.08740 [cs.CV]"},{"key":"e_1_3_2_1_33_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01267-0_19"},{"key":"e_1_3_2_1_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2010.5540235"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.01021"}],"event":{"name":"MM '21: ACM Multimedia Conference","location":"Virtual Event China","acronym":"MM '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475374","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3475374","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:49:19Z","timestamp":1750193359000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475374"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":35,"alternative-id":["10.1145\/3474085.3475374","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3475374","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}