{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,23]],"date-time":"2025-08-23T05:21:35Z","timestamp":1755926495712,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":47,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"National Key R&D Program of China","award":["2018AAA0102003 2018YFE0118400"],"award-info":[{"award-number":["2018AAA0102003 2018YFE0118400"]}]},{"name":"National Natural Science Foundation of China","award":["61976069 6165020","61672497 61620106009 61836002 61931008 U1636214"],"award-info":[{"award-number":["61976069 6165020","61672497 61620106009 61836002 61931008 U1636214"]}]},{"name":"Key Research Program of Frontier Sciences CAS","award":["QYZDJ-SSW-SYS013"],"award-info":[{"award-number":["QYZDJ-SSW-SYS013"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413618","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T13:12:00Z","timestamp":1602508320000},"page":"3798-3806","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":10,"title":["Modeling Temporal Concept Receptive Field Dynamically for Untrimmed Video Analysis"],"prefix":"10.1145","author":[{"given":"Zhaobo","family":"Qi","sequence":"first","affiliation":[{"name":"University of Chinese Academy of Sciences &amp; Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuhui","family":"Wang","sequence":"additional","affiliation":[{"name":"Key Lab of Intell. Info. Process., Inst. of Comput. Tech., Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chi","family":"Su","sequence":"additional","affiliation":[{"name":"Kingsoft Cloud, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Su","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Weigang","family":"Zhang","sequence":"additional","affiliation":[{"name":"Harbin Institute of Technology, Weihai, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qingming","family":"Huang","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences &amp; Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.287"},{"key":"e_1_3_2_2_2_1","unstructured":"Egor Burkov and Victor Lempitsky. 2018. Deep Neural Networks with Box Convolutions. (2018) 6211--6221.  Egor Burkov and Victor Lempitsky. 2018. Deep Neural Networks with Box Convolutions. (2018) 6211--6221."},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1145\/2733373.2806218"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.208"},{"key":"e_1_3_2_2_7_1","volume-title":"Semantic pooling for complex event analysis in untrimmed videos","author":"Chang Xiaojun","year":"2017","unstructured":"Xiaojun Chang , Yao-Liang Yu , Yi Yang , and Eric P Xing . 2017. Semantic pooling for complex event analysis in untrimmed videos . IEEE transactions on pattern analysis and machine intelligence 39, 8 ( 2017 ), 1617--1632. Xiaojun Chang, Yao-Liang Yu, Yi Yang, and Eric P Xing. 2017. Semantic pooling for complex event analysis in untrimmed videos. IEEE transactions on pattern analysis and machine intelligence 39, 8 (2017), 1617--1632."},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"publisher","DOI":"10.1145\/2578726.2578729"},{"key":"e_1_3_2_2_9_1","volume-title":"Dynamic Convolution: Attention over Convolution Kernels. arXiv: Computer Vision and Pattern Recognition","author":"Chen Yinpeng","year":"2019","unstructured":"Yinpeng Chen , Xiyang Dai , Mengchen Liu , Dongdong Chen , Lu Yuan , and Zicheng Liu . 2019 . Dynamic Convolution: Attention over Convolution Kernels. arXiv: Computer Vision and Pattern Recognition (2019). Yinpeng Chen, Xiyang Dai, Mengchen Liu, Dongdong Chen, Lu Yuan, and Zicheng Liu. 2019. Dynamic Convolution: Attention over Convolution Kernels. arXiv: Computer Vision and Pattern Recognition (2019)."},{"key":"e_1_3_2_2_10_1","unstructured":"Bert De Brabandere Xu Jia Tinne Tuytelaars and Luc Van Gool. 2016. Dynamic filter networks. (2016) 667--675.  Bert De Brabandere Xu Jia Tinne Tuytelaars and Luc Van Gool. 2016. Dynamic filter networks. (2016) 667--675."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.86"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00630"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.213"},{"key":"e_1_3_2_2_14_1","volume-title":"Listen to Look: Action Recognition by Previewing Audio. arXiv: Computer Vision and Pattern Recognition","author":"Gao Ruohan","year":"2019","unstructured":"Ruohan Gao , Taehyun Oh , Kristen Grauman , and Lorenzo Torresani . 2019. Listen to Look: Action Recognition by Previewing Audio. arXiv: Computer Vision and Pattern Recognition ( 2019 ). Ruohan Gao, Taehyun Oh, Kristen Grauman, and Lorenzo Torresani. 2019. Listen to Look: Action Recognition by Previewing Audio. arXiv: Computer Vision and Pattern Recognition (2019)."},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_2_16_1","unstructured":"Dang Ha The Hien. [n.d.]. A Guide to Receptive Field Arithmetic for Convolutional Neural Networks. https:\/\/syncedreview.com\/2017\/05\/11\/a-guide-toreceptive-field-arithmetic-for-convolutional-neural-networks\/.  Dang Ha The Hien. [n.d.]. A Guide to Receptive Field Arithmetic for Convolutional Neural Networks. https:\/\/syncedreview.com\/2017\/05\/11\/a-guide-toreceptive-field-arithmetic-for-convolutional-neural-networks\/."},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2012.2188038"},{"key":"e_1_3_2_2_18_1","volume-title":"Exploiting feature and class relationships in video categorization with regularized deep neural networks","author":"Jiang Yu-Gang","year":"2018","unstructured":"Yu-Gang Jiang , Zuxuan Wu , Jun Wang , Xiangyang Xue , and Shih-Fu Chang . 2018. Exploiting feature and class relationships in video categorization with regularized deep neural networks . IEEE transactions on pattern analysis and machine intelligence 40, 2 ( 2018 ), 352--364. Yu-Gang Jiang, Zuxuan Wu, Jun Wang, Xiangyang Xue, and Shih-Fu Chang. 2018. Exploiting feature and class relationships in video categorization with regularized deep neural networks. IEEE transactions on pattern analysis and machine intelligence 40, 2 (2018), 352--364."},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_24"},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.223"},{"key":"e_1_3_2_2_21_1","unstructured":"Will Kay Joao Carreira Karen Simonyan Brian Zhang Chloe Hillier Sudheendra Vijayanarasimhan Fabio Viola Tim Green Trevor Back Paul Natsev etal 2017. The kinetics human action video dataset. arXiv preprint arXiv:1705.06950 (2017).  Will Kay Joao Carreira Karen Simonyan Brian Zhang Chloe Hillier Sudheendra Vijayanarasimhan Fabio Viola Tim Green Trevor Back Paul Natsev et al. 2017. The kinetics human action video dataset. arXiv preprint arXiv:1705.06950 (2017)."},{"key":"e_1_3_2_2_22_1","volume-title":"Journal of Machine Learning Research","author":"Kloft Marius","year":"2011","unstructured":"Marius Kloft , Ulf Brefeld , S\u00f6ren Sonnenburg , and Alexander Zien . 2011 . Lp-norm multiple kernel learning . Journal of Machine Learning Research 12, Mar (2011), 953--997. Marius Kloft, Ulf Brefeld, S\u00f6ren Sonnenburg, and Alexander Zien. 2011. Lp-norm multiple kernel learning. Journal of Machine Learning Research 12, Mar (2011), 953--997."},{"key":"e_1_3_2_2_23_1","unstructured":"Xiang Li Wenhai Wang Xiaolin Hu and Jian Yang. 2019. Selective Kernel Networks. (2019) 510--519.  Xiang Li Wenhai Wang Xiaolin Hu and Jian Yang. 2019. Selective Kernel Networks. (2019) 510--519."},{"key":"e_1_3_2_2_24_1","volume-title":"ScaleAware Trident Networks for Object Detection. arXiv: Computer Vision and Pattern Recognition","author":"Li Yanghao","year":"2019","unstructured":"Yanghao Li , Yuntao Chen , Naiyan Wang , and Zhaoxiang Zhang . 2019. ScaleAware Trident Networks for Object Detection. arXiv: Computer Vision and Pattern Recognition ( 2019 ). Yanghao Li, Yuntao Chen, Naiyan Wang, and Zhaoxiang Zhang. 2019. ScaleAware Trident Networks for Object Detection. arXiv: Computer Vision and Pattern Recognition (2019)."},{"key":"e_1_3_2_2_25_1","volume-title":"Time-aware Large Kernel Convolutions. arXiv: Learning","author":"Lioutas Vasileios","year":"2020","unstructured":"Vasileios Lioutas and Yuhong Guo . 2020. Time-aware Large Kernel Convolutions. arXiv: Learning ( 2020 ). Vasileios Lioutas and Yuhong Guo. 2020. Time-aware Large Kernel Convolutions. arXiv: Learning (2020)."},{"key":"e_1_3_2_2_26_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12319"},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.590"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"crossref","unstructured":"Olga Russakovsky Jia Deng Hao Su Jonathan Krause Sanjeev Satheesh Sean Ma Zhiheng Huang Andrej Karpathy Aditya Khosla Michael Bernstein etal 2015. Imagenet large scale visual recognition challenge. International journal of computer vision 115 3 (2015) 211--252.  Olga Russakovsky Jia Deng Hao Su Jonathan Krause Sanjeev Satheesh Sean Ma Zhiheng Huang Andrej Karpathy Aditya Khosla Michael Bernstein et al. 2015. Imagenet large scale visual recognition challenge. International journal of computer vision 115 3 (2015) 211--252.","DOI":"10.1007\/s11263-015-0816-y"},{"key":"e_1_3_2_2_29_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2003.1221649"},{"key":"e_1_3_2_2_30_1","unstructured":"Nitish Srivastava and Ruslan R Salakhutdinov. 2012. Multimodal learning with deep boltzmann machines. In Advances in neural information processing systems. 2222--2230.  Nitish Srivastava and Ruslan R Salakhutdinov. 2012. Multimodal learning with deep boltzmann machines. In Advances in neural information processing systems. 2222--2230."},{"key":"e_1_3_2_2_31_1","unstructured":"Christian Szegedy Sergey Ioffe Vincent Vanhoucke and Alexander A Alemi. 2016. Inception-v4 Inception-ResNet and the Impact of Residual Connections on Learning. (2016) 4278--4284.  Christian Szegedy Sergey Ioffe Vincent Vanhoucke and Alexander A Alemi. 2016. Inception-v4 Inception-ResNet and the Impact of Residual Connections on Learning. (2016) 4278--4284."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"crossref","unstructured":"Christian Szegedy Vincent Vanhoucke Sergey Ioffe Jonathon Shlens and Zbigniew Wojna. 2016. Rethinking the Inception Architecture for Computer Vision. (2016) 2818--2826.  Christian Szegedy Vincent Vanhoucke Sergey Ioffe Jonathon Shlens and Zbigniew Wojna. 2016. Rethinking the Inception Architecture for Computer Vision. (2016) 2818--2826.","DOI":"10.1109\/CVPR.2016.308"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00632"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.339"},{"key":"e_1_3_2_2_37_1","volume-title":"Lite Eval: A Coarse-to-Fine Framework for Resource Efficient Video Recognition. In Advances in Neural Information Processing Systems. 7778--7787.","author":"Wu Zuxuan","year":"2019","unstructured":"Zuxuan Wu , Caiming Xiong , Yu-Gang Jiang , and Larry S Davis . 2019 . Lite Eval: A Coarse-to-Fine Framework for Resource Efficient Video Recognition. In Advances in Neural Information Processing Systems. 7778--7787. Zuxuan Wu, Caiming Xiong, Yu-Gang Jiang, and Larry S Davis. 2019. Lite Eval: A Coarse-to-Fine Framework for Resource Efficient Video Recognition. In Advances in Neural Information Processing Systems. 7778--7787."},{"key":"e_1_3_2_2_38_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00137"},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.20"},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"publisher","DOI":"10.5555\/2888116.2888249"},{"key":"e_1_3_2_2_41_1","volume-title":"CondConv: Conditionally Parameterized Convolutions for Efficient Inference. arXiv: Computer Vision and Pattern Recognition","author":"Yang Brandon","year":"2019","unstructured":"Brandon Yang , Gabriel Bender , Quoc V Le , and Jiquan Ngiam . 2019. CondConv: Conditionally Parameterized Convolutions for Efficient Inference. arXiv: Computer Vision and Pattern Recognition ( 2019 ). Brandon Yang, Gabriel Bender, Quoc V Le, and Jiquan Ngiam. 2019. CondConv: Conditionally Parameterized Convolutions for Efficient Inference. arXiv: Computer Vision and Pattern Recognition (2019)."},{"key":"e_1_3_2_2_42_1","doi-asserted-by":"publisher","DOI":"10.1145\/2733373.2806221"},{"key":"e_1_3_2_2_43_1","unstructured":"Fisher Yu and Vladlen Koltun. 2016. Multi-Scale Context Aggregation by Dilated Convolutions. (2016).  Fisher Yu and Vladlen Koltun. 2016. Multi-Scale Context Aggregation by Dilated Convolutions. (2016)."},{"key":"e_1_3_2_2_44_1","volume-title":"Exploiting Mid-Level Semantics for Large-Scale Complex Video Classification","author":"Zhang Ji","year":"2019","unstructured":"Ji Zhang , Kuizhi Mei , Yu Zheng , and Jianping Fan . 2019. Exploiting Mid-Level Semantics for Large-Scale Complex Video Classification . IEEE Transactions on Multimedia ( 2019 ). Ji Zhang, Kuizhi Mei, Yu Zheng, and Jianping Fan. 2019. Exploiting Mid-Level Semantics for Large-Scale Complex Video Classification. IEEE Transactions on Multimedia (2019)."},{"key":"e_1_3_2_2_45_1","volume-title":"Accelerating Large-Kernel Convolution Using Summed-Area Tables. arXiv: Learning","author":"Zhang Linguang","year":"2019","unstructured":"Linguang Zhang , Maciej Halber , and Szymon Rusinkiewicz . 2019. Accelerating Large-Kernel Convolution Using Summed-Area Tables. arXiv: Learning ( 2019 ). Linguang Zhang, Maciej Halber, and Szymon Rusinkiewicz. 2019. Accelerating Large-Kernel Convolution Using Summed-Area Tables. arXiv: Learning (2019)."},{"key":"e_1_3_2_2_46_1","first-page":"6","article-title":"Visual Content Recognition by Exploiting Semantic Feature Map with Attention and Multi-task Learning","volume":"15","author":"Zhao Rui-Wei","year":"2019","unstructured":"Rui-Wei Zhao , Qi Zhang , Zuxuan Wu , Jianguo Li , and Yu-Gang Jiang . 2019 . Visual Content Recognition by Exploiting Semantic Feature Map with Attention and Multi-task Learning . ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM) 15 , 1s (2019), 6 . Rui-Wei Zhao, Qi Zhang, Zuxuan Wu, Jianguo Li, and Yu-Gang Jiang. 2019. Visual Content Recognition by Exploiting Semantic Feature Map with Attention and Multi-task Learning. ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM) 15, 1s (2019), 6.","journal-title":"ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)"},{"key":"e_1_3_2_2_47_1","volume-title":"Places: A 10 million image database for scene recognition","author":"Zhou Bolei","year":"2018","unstructured":"Bolei Zhou , Agata Lapedriza , Aditya Khosla , Aude Oliva , and Antonio Torralba . 2018 . Places: A 10 million image database for scene recognition . IEEE transactions on pattern analysis and machine intelligence 40, 6 (2018), 1452--1464. Bolei Zhou, Agata Lapedriza, Aditya Khosla, Aude Oliva, and Antonio Torralba. 2018. Places: A 10 million image database for scene recognition. IEEE transactions on pattern analysis and machine intelligence 40, 6 (2018), 1452--1464."}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","sponsor":["SIGMM ACM Special Interest Group on Multimedia"],"location":"Seattle WA USA","acronym":"MM '20"},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413618","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413618","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:47:15Z","timestamp":1750193235000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413618"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":47,"alternative-id":["10.1145\/3394171.3413618","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413618","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}