{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,3,3]],"date-time":"2026-03-03T16:04:48Z","timestamp":1772553888876,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":48,"publisher":"ACM","license":[{"start":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T00:00:00Z","timestamp":1602460800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"National Key R&D Program of China","award":["2018AAA0102003"],"award-info":[{"award-number":["2018AAA0102003"]}]},{"name":"National Natural Science Foundation of China","award":["61672497 61620106009 61836002 61931008 61472389 U1636214"],"award-info":[{"award-number":["61672497 61620106009 61836002 61931008 61472389 U1636214"]}]},{"name":"Key Research Program of Frontier Sciences CAS","award":["QYZDJ-SSW-SYS013"],"award-info":[{"award-number":["QYZDJ-SSW-SYS013"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2020,10,12]]},"DOI":"10.1145\/3394171.3413954","type":"proceedings-article","created":{"date-parts":[[2020,10,12]],"date-time":"2020-10-12T12:26:18Z","timestamp":1602505578000},"page":"3857-3865","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":10,"title":["Towards More Explainability: Concept Knowledge Mining Network for Event Recognition"],"prefix":"10.1145","author":[{"given":"Zhaobo","family":"Qi","sequence":"first","affiliation":[{"name":"University of Chinese Academy of Sciences &amp; Inst. of Comput. Tech., Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Shuhui","family":"Wang","sequence":"additional","affiliation":[{"name":"Inst. of Comput. Tech., Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Chi","family":"Su","sequence":"additional","affiliation":[{"name":"Kingsoft Cloud, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Li","family":"Su","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qingming","family":"Huang","sequence":"additional","affiliation":[{"name":"University of Chinese Academy of Sciences &amp; Inst. of Comput. Tech., Chinese Academy of Sciences, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qi","family":"Tian","sequence":"additional","affiliation":[{"name":"Cloud BU, Huawei Technologies, Shenzhen, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2020,10,12]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.287"},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2015.7298698"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.502"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1145\/2733373.2806218"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.208"},{"key":"e_1_3_2_2_6_1","volume-title":"Semantic pooling for complex event analysis in untrimmed videos","author":"Chang Xiaojun","year":"2017","unstructured":"Xiaojun Chang , Yao-Liang Yu , Yi Yang , and Eric P Xing . 2017. Semantic pooling for complex event analysis in untrimmed videos . IEEE transactions on pattern analysis and machine intelligence 39, 8 ( 2017 ), 1617--1632. Xiaojun Chang, Yao-Liang Yu, Yi Yang, and Eric P Xing. 2017. Semantic pooling for complex event analysis in untrimmed videos. IEEE transactions on pattern analysis and machine intelligence 39, 8 (2017), 1617--1632."},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"publisher","DOI":"10.1145\/2578726.2578729"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2017.2699184"},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.86"},{"key":"e_1_3_2_2_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2019.00630"},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.213"},{"key":"e_1_3_2_2_12_1","volume-title":"Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach.","author":"Fukui Akira","year":"2016","unstructured":"Akira Fukui , Dong Huk Park , Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach. 2016 . Multimodal compact bilinear pooling for visual question answering and visual grounding. arXiv preprint arXiv:1606.01847 (2016). Akira Fukui, Dong Huk Park, Daylen Yang, Anna Rohrbach, Trevor Darrell, and Marcus Rohrbach. 2016. Multimodal compact bilinear pooling for visual question answering and visual grounding. arXiv preprint arXiv:1606.01847 (2016)."},{"key":"e_1_3_2_2_13_1","volume-title":"Listen to Look: Action Recognition by Previewing Audio. arXiv: Computer Vision and Pattern Recognition","author":"Gao Ruohan","year":"2019","unstructured":"Ruohan Gao , Taehyun Oh , Kristen Grauman , and Lorenzo Torresani . 2019. Listen to Look: Action Recognition by Previewing Audio. arXiv: Computer Vision and Pattern Recognition ( 2019 ). Ruohan Gao, Taehyun Oh, Kristen Grauman, and Lorenzo Torresani. 2019. Listen to Look: Action Recognition by Previewing Audio. arXiv: Computer Vision and Pattern Recognition (2019)."},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.90"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-642-33765-9_31"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2012.2188038"},{"key":"e_1_3_2_2_17_1","volume-title":"Exploiting feature and class relationships in video categorization with regularized deep neural networks","author":"Jiang Yu-Gang","year":"2018","unstructured":"Yu-Gang Jiang , Zuxuan Wu , Jun Wang , Xiangyang Xue , and Shih-Fu Chang . 2018. Exploiting feature and class relationships in video categorization with regularized deep neural networks . IEEE transactions on pattern analysis and machine intelligence 40, 2 ( 2018 ), 352--364. Yu-Gang Jiang, Zuxuan Wu, Jun Wang, Xiangyang Xue, and Shih-Fu Chang. 2018. Exploiting feature and class relationships in video categorization with regularized deep neural networks. IEEE transactions on pattern analysis and machine intelligence 40, 2 (2018), 352--364."},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01264-9_24"},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.223"},{"key":"e_1_3_2_2_20_1","unstructured":"Will Kay Joao Carreira Karen Simonyan Brian Zhang Chloe Hillier Sudheendra Vijayanarasimhan Fabio Viola Tim Green Trevor Back Paul Natsev etal 2017. The kinetics human action video dataset. arXiv preprint arXiv:1705.06950 (2017).  Will Kay Joao Carreira Karen Simonyan Brian Zhang Chloe Hillier Sudheendra Vijayanarasimhan Fabio Viola Tim Green Trevor Back Paul Natsev et al. 2017. The kinetics human action video dataset. arXiv preprint arXiv:1705.06950 (2017)."},{"key":"e_1_3_2_2_21_1","volume-title":"Journal of Machine Learning Research","author":"Kloft Marius","year":"2011","unstructured":"Marius Kloft , Ulf Brefeld , S\u00f6ren Sonnenburg , and Alexander Zien . 2011 . Lp-norm multiple kernel learning . Journal of Machine Learning Research 12, Mar (2011), 953--997. Marius Kloft, Ulf Brefeld, S\u00f6ren Sonnenburg, and Alexander Zien. 2011. Lp-norm multiple kernel learning. Journal of Machine Learning Research 12, Mar (2011), 953--997."},{"key":"e_1_3_2_2_22_1","unstructured":"Tsung Yu Lin Aruni Roychowdhury and Subhransu Maji. 2015. Bilinear CNN Models for Fine-grained Visual Recognition. (2015).  Tsung Yu Lin Aruni Roychowdhury and Subhransu Maji. 2015. Bilinear CNN Models for Fine-grained Visual Recognition. (2015)."},{"key":"e_1_3_2_2_23_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v32i1.12319"},{"key":"e_1_3_2_2_24_1","volume-title":"Hierarchical coattention for visual question answering. Advances in Neural Information Processing Systems (NIPS) 2","author":"Lu Jiasen","year":"2016","unstructured":"Jiasen Lu , Jianwei Yang , Dhruv Batra , and Devi Parikh . 2016. Hierarchical coattention for visual question answering. Advances in Neural Information Processing Systems (NIPS) 2 ( 2016 ). Jiasen Lu, Jianwei Yang, Dhruv Batra, and Devi Parikh. 2016. Hierarchical coattention for visual question answering. Advances in Neural Information Processing Systems (NIPS) 2 (2016)."},{"key":"e_1_3_2_2_25_1","volume-title":"The TRECVID MED 2013 evaluation. https:\/\/www.nist.gov\/itl\/iad\/mig\/med-2013-evaluation.","author":"NIST.","year":"2013","unstructured":"NIST. 2013 . The TRECVID MED 2013 evaluation. https:\/\/www.nist.gov\/itl\/iad\/mig\/med-2013-evaluation. NIST. 2013. The TRECVID MED 2013 evaluation. https:\/\/www.nist.gov\/itl\/iad\/mig\/med-2013-evaluation."},{"key":"e_1_3_2_2_26_1","volume-title":"The TRECVID MED 2014 evaluation. https:\/\/www.nist.gov\/itl\/iad\/mig\/med-2014-evaluation.","author":"NIST.","year":"2014","unstructured":"NIST. 2014 . The TRECVID MED 2014 evaluation. https:\/\/www.nist.gov\/itl\/iad\/mig\/med-2014-evaluation. NIST. 2014. The TRECVID MED 2014 evaluation. https:\/\/www.nist.gov\/itl\/iad\/mig\/med-2014-evaluation."},{"key":"e_1_3_2_2_27_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2017.435"},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.590"},{"key":"e_1_3_2_2_29_1","doi-asserted-by":"crossref","unstructured":"Olga Russakovsky Jia Deng Hao Su Jonathan Krause Sanjeev Satheesh Sean Ma Zhiheng Huang Andrej Karpathy Aditya Khosla Michael Bernstein etal 2015. Imagenet large scale visual recognition challenge. International journal of computer vision 115 3 (2015) 211--252.  Olga Russakovsky Jia Deng Hao Su Jonathan Krause Sanjeev Satheesh Sean Ma Zhiheng Huang Andrej Karpathy Aditya Khosla Michael Bernstein et al. 2015. Imagenet large scale visual recognition challenge. International journal of computer vision 115 3 (2015) 211--252.","DOI":"10.1007\/s11263-015-0816-y"},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.518"},{"key":"e_1_3_2_2_31_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICME.2003.1221649"},{"key":"e_1_3_2_2_32_1","unstructured":"Nitish Srivastava and Ruslan R Salakhutdinov. 2012. Multimodal learning with deep boltzmann machines. In Advances in neural information processing systems. 2222--2230.  Nitish Srivastava and Ruslan R Salakhutdinov. 2012. Multimodal learning with deep boltzmann machines. In Advances in neural information processing systems. 2222--2230."},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.329"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2015.510"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-46484-8_2"},{"key":"e_1_3_2_2_36_1","volume-title":"Temporal segment networks for action recognition in videos","author":"Wang Limin","year":"2018","unstructured":"Limin Wang , Yuanjun Xiong , Zhe Wang , Yu Qiao , Dahua Lin , Xiaoou Tang , and Luc Van Gool . 2018. Temporal segment networks for action recognition in videos . IEEE transactions on pattern analysis and machine intelligence ( 2018 ). Limin Wang, Yuanjun Xiong, Zhe Wang, Yu Qiao, Dahua Lin, Xiaoou Tang, and Luc Van Gool. 2018. Temporal segment networks for action recognition in videos. IEEE transactions on pattern analysis and machine intelligence (2018)."},{"key":"e_1_3_2_2_37_1","volume-title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 7794--7803","author":"Girshick Ross","year":"2018","unstructured":"XiaolongWang, Ross Girshick , Abhinav Gupta , and Kaiming He . 2018 . Non-local neural networks . In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 7794--7803 . XiaolongWang, Ross Girshick, Abhinav Gupta, and Kaiming He. 2018. Non-local neural networks. In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition. 7794--7803."},{"key":"e_1_3_2_2_38_1","volume-title":"Proceedings of the IEEE International Conference on Computer Vision. 6222--6231","author":"He Dongliang","year":"2019","unstructured":"WenhaoWu, Dongliang He , Xiao Tan , Shifeng Chen , and ShileiWen. 2019 . Multi-Agent Reinforcement Learning Based Frame Sampling for Effective Untrimmed Video Recognition . In Proceedings of the IEEE International Conference on Computer Vision. 6222--6231 . WenhaoWu, Dongliang He, Xiao Tan, Shifeng Chen, and ShileiWen. 2019. Multi-Agent Reinforcement Learning Based Frame Sampling for Effective Untrimmed Video Recognition. In Proceedings of the IEEE International Conference on Computer Vision. 6222--6231."},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2016.339"},{"key":"e_1_3_2_2_40_1","unstructured":"ZuxuanWu Caiming Xiong Yu-Gang Jiang and Larry S Davis. 2019. LiteEval: A Coarse-to-Fine Framework for Resource Efficient Video Recognition. In Advances in Neural Information Processing Systems. 7778--7787.  ZuxuanWu Caiming Xiong Yu-Gang Jiang and Larry S Davis. 2019. LiteEval: A Coarse-to-Fine Framework for Resource Efficient Video Recognition. In Advances in Neural Information Processing Systems. 7778--7787."},{"key":"e_1_3_2_2_41_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2019.00137"},{"key":"e_1_3_2_2_42_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR.2014.20"},{"key":"e_1_3_2_2_43_1","doi-asserted-by":"publisher","DOI":"10.5555\/2888116.2888249"},{"key":"e_1_3_2_2_44_1","doi-asserted-by":"publisher","DOI":"10.1145\/2733373.2806221"},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV.2017.202"},{"key":"e_1_3_2_2_46_1","first-page":"6","article-title":"Visual Content Recognition by Exploiting Semantic Feature Map with Attention and Multi-task Learning","volume":"15","author":"Zhao Rui-Wei","year":"2019","unstructured":"Rui-Wei Zhao , Qi Zhang , ZuxuanWu, Jianguo Li , and Yu-Gang Jiang . 2019 . Visual Content Recognition by Exploiting Semantic Feature Map with Attention and Multi-task Learning . ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM) 15 , 1s (2019), 6 . Rui-Wei Zhao, Qi Zhang, ZuxuanWu, Jianguo Li, and Yu-Gang Jiang. 2019. Visual Content Recognition by Exploiting Semantic Feature Map with Attention and Multi-task Learning. ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM) 15, 1s (2019), 6.","journal-title":"ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)"},{"key":"e_1_3_2_2_47_1","volume-title":"Places: A 10 million image database for scene recognition","author":"Zhou Bolei","year":"2018","unstructured":"Bolei Zhou , Agata Lapedriza , Aditya Khosla , Aude Oliva , and Antonio Torralba . 2018 . Places: A 10 million image database for scene recognition . IEEE transactions on pattern analysis and machine intelligence 40, 6 (2018), 1452--1464. Bolei Zhou, Agata Lapedriza, Aditya Khosla, Aude Oliva, and Antonio Torralba. 2018. Places: A 10 million image database for scene recognition. IEEE transactions on pattern analysis and machine intelligence 40, 6 (2018), 1452--1464."},{"key":"e_1_3_2_2_48_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-01228-1_9"}],"event":{"name":"MM '20: The 28th ACM International Conference on Multimedia","location":"Seattle WA USA","acronym":"MM '20","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 28th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413954","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3394171.3413954","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T21:32:07Z","timestamp":1750195927000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3394171.3413954"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2020,10,12]]},"references-count":48,"alternative-id":["10.1145\/3394171.3413954","10.1145\/3394171"],"URL":"https:\/\/doi.org\/10.1145\/3394171.3413954","relation":{},"subject":[],"published":{"date-parts":[[2020,10,12]]},"assertion":[{"value":"2020-10-12","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}