{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,30]],"date-time":"2026-06-30T16:17:55Z","timestamp":1782836275683,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":45,"publisher":"ACM","license":[{"start":{"date-parts":[[2021,10,17]],"date-time":"2021-10-17T00:00:00Z","timestamp":1634428800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"The Shanghai Pujiang Program","award":["20PJ1401900"],"award-info":[{"award-number":["20PJ1401900"]}]},{"name":"The National Key Research and Development Program of China","award":["2018YFB1402600"],"award-info":[{"award-number":["2018YFB1402600"]}]},{"name":"The National Natural Science Foundation of China","award":["62072116"],"award-info":[{"award-number":["62072116"]}]},{"name":"The Natural Science Foundation of Hunan Province","award":["2020JJ4219"],"award-info":[{"award-number":["2020JJ4219"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2021,10,17]]},"DOI":"10.1145\/3474085.3475241","type":"proceedings-article","created":{"date-parts":[[2021,10,18]],"date-time":"2021-10-18T21:45:34Z","timestamp":1634593534000},"page":"3826-3834","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":45,"title":["Fine-grained Cross-modal Alignment Network for Text-Video Retrieval"],"prefix":"10.1145","author":[{"given":"Ning","family":"Han","sequence":"first","affiliation":[{"name":"Hunan University, Changsha, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jingjing","family":"Chen","sequence":"additional","affiliation":[{"name":"Fudan University, Shanghai, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guangyi","family":"Xiao","sequence":"additional","affiliation":[{"name":"Hunan University, Changsha, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hao","family":"Zhang","sequence":"additional","affiliation":[{"name":"City University of Hong Kong, Hong Kong, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yawen","family":"Zeng","sequence":"additional","affiliation":[{"name":"Hunan University, Changsha, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Hao","family":"Chen","sequence":"additional","affiliation":[{"name":"Hunan University, Changsha, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2021,10,17]]},"reference":[{"key":"e_1_3_2_2_1_1","unstructured":"Galen Andrew Raman Arora Jeff Bilmes and Karen Livescu. 2013. Deep canonical correlation analysis. In ICML. 1247--1255. Galen Andrew Raman Arora Jeff Bilmes and Karen Livescu. 2013. Deep canonical correlation analysis. In ICML. 1247--1255."},{"key":"e_1_3_2_2_2_1","volume-title":"Graph convolutional matrix completion. arXiv preprint arXiv:1706.02263","author":"van den Berg Rianne","year":"2017","unstructured":"Rianne van den Berg , Thomas N Kipf , and Max Welling . 2017. Graph convolutional matrix completion. arXiv preprint arXiv:1706.02263 ( 2017 ). Rianne van den Berg, Thomas N Kipf, and Max Welling. 2017. Graph convolutional matrix completion. arXiv preprint arXiv:1706.02263 (2017)."},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1080\/03610927408827101"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"crossref","unstructured":"Joao Carreira and Andrew Zisserman. 2017. Quo vadis action recognition? a new model and the kinetics dataset. In CVPR. 6299--6308. Joao Carreira and Andrew Zisserman. 2017. Quo vadis action recognition? a new model and the kinetics dataset. In CVPR. 6299--6308.","DOI":"10.1109\/CVPR.2017.502"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"crossref","unstructured":"Jingjing Chen and Chong-Wah Ngo. 2016. Deep-based ingredient recognition for cooking recipe retrieval. In ACM MM. 32--41. Jingjing Chen and Chong-Wah Ngo. 2016. Deep-based ingredient recognition for cooking recipe retrieval. In ACM MM. 32--41.","DOI":"10.1145\/2964284.2964315"},{"key":"e_1_3_2_2_6_1","doi-asserted-by":"crossref","unstructured":"Jing-Jing Chen Chong-Wah Ngo Fu-Li Feng and Tat-Seng Chua. 2018. Deep understanding of cooking procedure for cross-modal recipe retrieval. In ACM MM. 1020--1028. Jing-Jing Chen Chong-Wah Ngo Fu-Li Feng and Tat-Seng Chua. 2018. Deep understanding of cooking procedure for cross-modal recipe retrieval. In ACM MM. 1020--1028.","DOI":"10.1145\/3240508.3240627"},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"crossref","unstructured":"Shizhe Chen Yida Zhao Qin Jin and Qi Wu. 2020. Fine-grained Video-Text Retrieval with Hierarchical Graph Reasoning. In CVPR. 10638--10647. Shizhe Chen Yida Zhao Qin Jin and Qi Wu. 2020. Fine-grained Video-Text Retrieval with Hierarchical Graph Reasoning. In CVPR. 10638--10647.","DOI":"10.1109\/CVPR42600.2020.01065"},{"key":"e_1_3_2_2_8_1","volume-title":"Bert: Pre-training of deep bidirectional transformers for language understanding. In NAACL. 4171--4186.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . Bert: Pre-training of deep bidirectional transformers for language understanding. In NAACL. 4171--4186. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. Bert: Pre-training of deep bidirectional transformers for language understanding. In NAACL. 4171--4186."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"crossref","unstructured":"Jianfeng Dong Xirong Li Chaoxi Xu Shouling Ji Yuan He Gang Yang and Xun Wang. 2019. Dual encoding for zero-example video retrieval. In CVPR. 9346--9355. Jianfeng Dong Xirong Li Chaoxi Xu Shouling Ji Yuan He Gang Yang and Xun Wang. 2019. Dual encoding for zero-example video retrieval. In CVPR. 9346--9355.","DOI":"10.1109\/CVPR.2019.00957"},{"key":"e_1_3_2_2_10_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2021.3059295"},{"key":"e_1_3_2_2_11_1","volume-title":"Jamie Ryan Kiros, and Sanja Fidler","author":"Faghri Fartash","year":"2017","unstructured":"Fartash Faghri , David J Fleet , Jamie Ryan Kiros, and Sanja Fidler . 2017 . Vse+: Improving visual-semantic embeddings with hard negatives. arXiv preprint arXiv:1707.05612 (2017). Fartash Faghri, David J Fleet, Jamie Ryan Kiros, and Sanja Fidler. 2017. Vse+: Improving visual-semantic embeddings with hard negatives. arXiv preprint arXiv:1707.05612 (2017)."},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"crossref","unstructured":"Valentin Gabeur Chen Sun Karteek Alahari and Cordelia Schmid. 2020. Multi-modal transformer for video retrieval. In ECCV. 214--229. Valentin Gabeur Chen Sun Karteek Alahari and Cordelia Schmid. 2020. Multi-modal transformer for video retrieval. In ECCV. 214--229.","DOI":"10.1007\/978-3-030-58548-8_13"},{"key":"e_1_3_2_2_13_1","volume-title":"Coot: Cooperative hierarchical transformer for video-text representation learning. In NeurIPS .","author":"Ging Simon","year":"2020","unstructured":"Simon Ging , Mohammadreza Zolfaghari , Hamed Pirsiavash , and Thomas Brox . 2020 . Coot: Cooperative hierarchical transformer for video-text representation learning. In NeurIPS . Simon Ging, Mohammadreza Zolfaghari, Hamed Pirsiavash, and Thomas Brox. 2020. Coot: Cooperative hierarchical transformer for video-text representation learning. In NeurIPS ."},{"key":"e_1_3_2_2_14_1","volume-title":"Adam: A method for stochastic optimization. In ICLR .","author":"Kingma Diederik P","year":"2015","unstructured":"Diederik P Kingma and Jimmy Ba . 2015 . Adam: A method for stochastic optimization. In ICLR . Diederik P Kingma and Jimmy Ba. 2015. Adam: A method for stochastic optimization. In ICLR ."},{"key":"e_1_3_2_2_15_1","volume-title":"Variational graph auto-encoders. arXiv preprint arXiv:1611.07308","author":"Kipf Thomas N","year":"2016","unstructured":"Thomas N Kipf and Max Welling . 2016. Variational graph auto-encoders. arXiv preprint arXiv:1611.07308 ( 2016 ). Thomas N Kipf and Max Welling. 2016. Variational graph auto-encoders. arXiv preprint arXiv:1611.07308 (2016)."},{"key":"e_1_3_2_2_16_1","unstructured":"Thomas N Kipf and Max Welling. 2017. Semi-supervised classification with graph convolutional networks. In ICLR . Thomas N Kipf and Max Welling. 2017. Semi-supervised classification with graph convolutional networks. In ICLR ."},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"crossref","unstructured":"Benjamin Klein Guy Lev Gil Sadeh and Lior Wolf. 2015. Associating neural word embeddings with deep image representations using fisher vectors. In CVPR. 4437--4446. Benjamin Klein Guy Lev Gil Sadeh and Lior Wolf. 2015. Associating neural word embeddings with deep image representations using fisher vectors. In CVPR. 4437--4446.","DOI":"10.1109\/CVPR.2015.7299073"},{"key":"e_1_3_2_2_18_1","doi-asserted-by":"crossref","unstructured":"Anna Kukleva Hilde Kuehne Fadime Sener and Jurgen Gall. 2019. Unsupervised learning of action classes with continuous temporal embedding. In CVPR. 12066--12074. Anna Kukleva Hilde Kuehne Fadime Sener and Jurgen Gall. 2019. Unsupervised learning of action classes with continuous temporal embedding. In CVPR. 12066--12074.","DOI":"10.1109\/CVPR.2019.01234"},{"key":"e_1_3_2_2_19_1","unstructured":"Kuang-Huei Lee Xi Chen Gang Hua Houdong Hu and Xiaodong He. 2018. Stacked cross attention for image-text matching. In ECCV. 201--216. Kuang-Huei Lee Xi Chen Gang Hua Houdong Hu and Xiaodong He. 2018. Stacked cross attention for image-text matching. In ECCV. 201--216."},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"crossref","unstructured":"Meng Liu Xiang Wang Liqiang Nie Xiangnan He Baoquan Chen and Tat-Seng Chua. 2018. Attentive moment retrieval in videos. In ACM SIGIR. 15--24. Meng Liu Xiang Wang Liqiang Nie Xiangnan He Baoquan Chen and Tat-Seng Chua. 2018. Attentive moment retrieval in videos. In ACM SIGIR. 15--24.","DOI":"10.1145\/3209978.3210003"},{"key":"e_1_3_2_2_21_1","volume-title":"2019 a. Use what you have: Video retrieval using representations from collaborative experts. arXiv preprint arXiv:1907.13487","author":"Liu Yang","year":"2019","unstructured":"Yang Liu , Samuel Albanie , Arsha Nagrani , and Andrew Zisserman . 2019 a. Use what you have: Video retrieval using representations from collaborative experts. arXiv preprint arXiv:1907.13487 ( 2019 ). Yang Liu, Samuel Albanie, Arsha Nagrani, and Andrew Zisserman. 2019 a. Use what you have: Video retrieval using representations from collaborative experts. arXiv preprint arXiv:1907.13487 (2019)."},{"key":"e_1_3_2_2_22_1","unstructured":"Zhenguang Liu Haoming Chen Runyang Feng Shuang Wu Shouling Ji Bailin Yang and Xun Wang. 2021. Deep Dual Consecutive Network for Human Pose Estimation. In CVPR. 525--534. Zhenguang Liu Haoming Chen Runyang Feng Shuang Wu Shouling Ji Bailin Yang and Xun Wang. 2021. Deep Dual Consecutive Network for Human Pose Estimation. In CVPR. 525--534."},{"key":"e_1_3_2_2_23_1","unstructured":"Zhenguang Liu Shuang Wu Shuyuan Jin Qi Liu Shijian Lu Roger Zimmermann and Li Cheng. 2019 b. Towards natural and accurate future motion prediction of humans and animals. In CVPR. 10004--10012. Zhenguang Liu Shuang Wu Shuyuan Jin Qi Liu Shijian Lu Roger Zimmermann and Li Cheng. 2019 b. Towards natural and accurate future motion prediction of humans and animals. In CVPR. 10004--10012."},{"key":"e_1_3_2_2_24_1","volume-title":"Univilm: A unified video and language pre-training model for multimodal understanding and generation. arXiv preprint arXiv:2002.06353","author":"Luo Huaishao","year":"2020","unstructured":"Huaishao Luo , Lei Ji , Botian Shi , Haoyang Huang , Nan Duan , Tianrui Li , Xilin Chen , and Ming Zhou . 2020 . Univilm: A unified video and language pre-training model for multimodal understanding and generation. arXiv preprint arXiv:2002.06353 (2020). Huaishao Luo, Lei Ji, Botian Shi, Haoyang Huang, Nan Duan, Tianrui Li, Xilin Chen, and Ming Zhou. 2020. Univilm: A unified video and language pre-training model for multimodal understanding and generation. arXiv preprint arXiv:2002.06353 (2020)."},{"key":"e_1_3_2_2_25_1","volume-title":"Proceedings of the fifth Berkeley symposium on mathematical statistics and probability","volume":"1","author":"James","unstructured":"James MacQueen et al. 1967. Some methods for classification and analysis of multivariate observations . In Proceedings of the fifth Berkeley symposium on mathematical statistics and probability , Vol. 1 . 281--297. James MacQueen et al. 1967. Some methods for classification and analysis of multivariate observations. In Proceedings of the fifth Berkeley symposium on mathematical statistics and probability, Vol. 1. 281--297."},{"key":"e_1_3_2_2_26_1","volume-title":"Steven Bethard, and David McClosky.","author":"Manning Christopher D","year":"2014","unstructured":"Christopher D Manning , Mihai Surdeanu , John Bauer , Jenny Rose Finkel , Steven Bethard, and David McClosky. 2014 . The Stanford CoreNLP natural language processing toolkit. In ACL. 55--60. Christopher D Manning, Mihai Surdeanu, John Bauer, Jenny Rose Finkel, Steven Bethard, and David McClosky. 2014. The Stanford CoreNLP natural language processing toolkit. In ACL. 55--60."},{"key":"e_1_3_2_2_27_1","volume-title":"Fine-grained visual textual alignment for cross-modal retrieval using transformer encoders. arXiv preprint arXiv:2008.05231","author":"Messina Nicola","year":"2020","unstructured":"Nicola Messina , Giuseppe Amato , Andrea Esuli , Fabrizio Falchi , Claudio Gennaro , and St\u00e9phane Marchand-Maillet . 2020. Fine-grained visual textual alignment for cross-modal retrieval using transformer encoders. arXiv preprint arXiv:2008.05231 ( 2020 ). Nicola Messina, Giuseppe Amato, Andrea Esuli, Fabrizio Falchi, Claudio Gennaro, and St\u00e9phane Marchand-Maillet. 2020. Fine-grained visual textual alignment for cross-modal retrieval using transformer encoders. arXiv preprint arXiv:2008.05231 (2020)."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"crossref","unstructured":"Antoine Miech Jean-Baptiste Alayrac Lucas Smaira Ivan Laptev Josef Sivic and Andrew Zisserman. 2020. End-to-End Learning of Visual Representations From Uncurated Instructional Videos. In CVPR. 9876--9886. Antoine Miech Jean-Baptiste Alayrac Lucas Smaira Ivan Laptev Josef Sivic and Andrew Zisserman. 2020. End-to-End Learning of Visual Representations From Uncurated Instructional Videos. In CVPR. 9876--9886.","DOI":"10.1109\/CVPR42600.2020.00990"},{"key":"e_1_3_2_2_29_1","volume-title":"Learning a text-video embedding from incomplete and heterogeneous data. CoRR","author":"Miech Antoine","year":"2018","unstructured":"Antoine Miech , Ivan Laptev , and Josef Sivic . 2018. Learning a text-video embedding from incomplete and heterogeneous data. CoRR , Vol. abs\/ 1804 .02516 ( 2018 ). http:\/\/arxiv.org\/abs\/1804.02516 Antoine Miech, Ivan Laptev, and Josef Sivic. 2018. Learning a text-video embedding from incomplete and heterogeneous data. CoRR, Vol. abs\/1804.02516 (2018). http:\/\/arxiv.org\/abs\/1804.02516"},{"key":"e_1_3_2_2_30_1","doi-asserted-by":"crossref","unstructured":"Antoine Miech Dimitri Zhukov Jean-Baptiste Alayrac Makarand Tapaswi Ivan Laptev and Josef Sivic. 2019. HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips. In ICCV. 2630--2640. Antoine Miech Dimitri Zhukov Jean-Baptiste Alayrac Makarand Tapaswi Ivan Laptev and Josef Sivic. 2019. HowTo100M: Learning a Text-Video Embedding by Watching Hundred Million Narrated Video Clips. In ICCV. 2630--2640.","DOI":"10.1109\/ICCV.2019.00272"},{"key":"e_1_3_2_2_31_1","unstructured":"Niluthpol Chowdhury Mithun Juncheng Li Florian Metze and Amit K Roy-Chowdhury. 2018. Learning joint embedding with multimodal cues for cross-modal video-text retrieval. In ICMR. 19--27. Niluthpol Chowdhury Mithun Juncheng Li Florian Metze and Amit K Roy-Chowdhury. 2018. Learning joint embedding with multimodal cues for cross-modal video-text retrieval. In ICMR. 19--27."},{"key":"e_1_3_2_2_32_1","unstructured":"Mandela Patrick Po-Yao Huang Yuki Asano Florian Metze Alexander G Hauptmann Joao F. Henriques and Andrea Vedaldi. 2021. Support-set bottlenecks for video-text representation learning. In ICLR . Mandela Patrick Po-Yao Huang Yuki Asano Florian Metze Alexander G Hauptmann Joao F. Henriques and Andrea Vedaldi. 2021. Support-set bottlenecks for video-text representation learning. In ICLR ."},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"publisher","DOI":"10.1109\/TIP.2019.2952085"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"crossref","unstructured":"Yale Song and Mohammad Soleymani. 2019. Polysemous visual-semantic embedding for cross-modal retrieval. In CVPR. 1979--1988. Yale Song and Mohammad Soleymani. 2019. Polysemous visual-semantic embedding for cross-modal retrieval. In CVPR. 1979--1988.","DOI":"10.1109\/CVPR.2019.00208"},{"key":"e_1_3_2_2_35_1","doi-asserted-by":"crossref","unstructured":"Xiaolong Wang and Abhinav Gupta. 2018. Videos as space-time region graphs. In ECCV. 399--417. Xiaolong Wang and Abhinav Gupta. 2018. Videos as space-time region graphs. In ECCV. 399--417.","DOI":"10.1007\/978-3-030-01228-1_25"},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"crossref","unstructured":"Xin Wang Jiawei Wu Junkun Chen Lei Li Yuan-Fang Wang and William Yang Wang. 2019. VaTeX: A Large-Scale High-Quality Multilingual Dataset for Video-and-Language Research. In ICCV. 4581--4591. Xin Wang Jiawei Wu Junkun Chen Lei Li Yuan-Fang Wang and William Yang Wang. 2019. VaTeX: A Large-Scale High-Quality Multilingual Dataset for Video-and-Language Research. In ICCV. 4581--4591.","DOI":"10.1109\/ICCV.2019.00468"},{"key":"e_1_3_2_2_37_1","doi-asserted-by":"crossref","unstructured":"Michael Wray Diane Larlus Gabriela Csurka and Dima Damen. 2019. Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings. In ICCV. 450--459. Michael Wray Diane Larlus Gabriela Csurka and Dima Damen. 2019. Fine-Grained Action Retrieval Through Multiple Parts-of-Speech Embeddings. In ICCV. 450--459.","DOI":"10.1109\/ICCV.2019.00054"},{"key":"e_1_3_2_2_38_1","volume-title":"Msr-vtt: A large video description dataset for bridging video and language. In CVPR. 5288--5296.","author":"Xu Jun","year":"2016","unstructured":"Jun Xu , Tao Mei , Ting Yao , and Yong Rui . 2016 . Msr-vtt: A large video description dataset for bridging video and language. In CVPR. 5288--5296. Jun Xu, Tao Mei, Ting Yao, and Yong Rui. 2016. Msr-vtt: A large video description dataset for bridging video and language. In CVPR. 5288--5296."},{"key":"e_1_3_2_2_39_1","doi-asserted-by":"crossref","unstructured":"Xun Yang Jianfeng Dong Yixin Cao Xun Wang Meng Wang and Tat-Seng Chua. 2020. Tree-Augmented Cross-Modal Encoding for Complex-Query Video Retrieval. In ACM SIGIR. 1339--1348. Xun Yang Jianfeng Dong Yixin Cao Xun Wang Meng Wang and Tat-Seng Chua. 2020. Tree-Augmented Cross-Modal Encoding for Complex-Query Video Retrieval. In ACM SIGIR. 1339--1348.","DOI":"10.1145\/3397271.3401151"},{"key":"e_1_3_2_2_40_1","doi-asserted-by":"crossref","unstructured":"Youngjae Yu Jongseok Kim and Gunhee Kim. 2018. A Joint Sequence Fusion Model for Video Question Answering and Retrieval. In ECCV. 487--503. Youngjae Yu Jongseok Kim and Gunhee Kim. 2018. A Joint Sequence Fusion Model for Video Question Answering and Retrieval. In ECCV. 487--503.","DOI":"10.1007\/978-3-030-01234-2_29"},{"key":"e_1_3_2_2_41_1","unstructured":"Youngjae Yu Hyungjin Ko Jongwook Choi and Gunhee Kim. 2017. End-to-end concept word detection for video captioning retrieval and question answering. In CVPR. 3165--3173. Youngjae Yu Hyungjin Ko Jongwook Choi and Gunhee Kim. 2017. End-to-end concept word detection for video captioning retrieval and question answering. In CVPR. 3165--3173."},{"key":"e_1_3_2_2_42_1","doi-asserted-by":"crossref","unstructured":"Yitian Yuan Tao Mei and Wenwu Zhu. 2019. To find where you talk: Temporal sentence localization in video with attention based location regression. In AAAI. 9159--9166. Yitian Yuan Tao Mei and Wenwu Zhu. 2019. To find where you talk: Temporal sentence localization in video with attention based location regression. In AAAI. 9159--9166.","DOI":"10.1609\/aaai.v33i01.33019159"},{"key":"e_1_3_2_2_43_1","unstructured":"Luowei Zhou Nathan Louis and Jason J Corso. 2018. Weakly-Supervised Video Object Grounding from Text by Loss Weighting and Object Interaction. In BMVC. 50. Luowei Zhou Nathan Louis and Jason J Corso. 2018. Weakly-Supervised Video Object Grounding from Text by Loss Weighting and Object Interaction. In BMVC. 50."},{"key":"e_1_3_2_2_44_1","volume-title":"Actbert: Learning global-local video-text representations. In CVPR. 8746--8755.","author":"Zhu Linchao","year":"2020","unstructured":"Linchao Zhu and Yi Yang . 2020 . Actbert: Learning global-local video-text representations. In CVPR. 8746--8755. Linchao Zhu and Yi Yang. 2020. Actbert: Learning global-local video-text representations. In CVPR. 8746--8755."},{"key":"e_1_3_2_2_45_1","doi-asserted-by":"crossref","unstructured":"Yuan Zhuang Zhenguang Liu Peng Qian Qi Liu Xiang Wang and Qinming He. 2020. Smart Contract Vulnerability Detection using Graph Neural Network. In IJCAI. 3283--3290. Yuan Zhuang Zhenguang Liu Peng Qian Qi Liu Xiang Wang and Qinming He. 2020. Smart Contract Vulnerability Detection using Graph Neural Network. In IJCAI. 3283--3290.","DOI":"10.24963\/ijcai.2020\/454"}],"event":{"name":"MM '21: ACM Multimedia Conference","location":"Virtual Event China","acronym":"MM '21","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 29th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475241","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3474085.3475241","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T20:48:16Z","timestamp":1750193296000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3474085.3475241"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2021,10,17]]},"references-count":45,"alternative-id":["10.1145\/3474085.3475241","10.1145\/3474085"],"URL":"https:\/\/doi.org\/10.1145\/3474085.3475241","relation":{},"subject":[],"published":{"date-parts":[[2021,10,17]]},"assertion":[{"value":"2021-10-17","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}