{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,6,16]],"date-time":"2026-06-16T04:36:25Z","timestamp":1781584585732,"version":"3.54.5"},"publisher-location":"New York, NY, USA","reference-count":36,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T00:00:00Z","timestamp":1665360000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"Beijing Natural Science Foundation","award":["4202033"],"award-info":[{"award-number":["4202033"]}]},{"DOI":"10.13039\/501100001809","name":"National Natural Science Foundation of China","doi-asserted-by":"publisher","award":["62172420, 62072463"],"award-info":[{"award-number":["62172420, 62072463"]}],"id":[{"id":"10.13039\/501100001809","id-type":"DOI","asserted-by":"publisher"}]},{"name":"Public Computing Cloud, Renmin University of China"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,10,10]]},"DOI":"10.1145\/3503161.3547968","type":"proceedings-article","created":{"date-parts":[[2022,10,10]],"date-time":"2022-10-10T15:42:46Z","timestamp":1665416566000},"page":"434-443","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":12,"title":["Learn to Understand Negation in Video Retrieval"],"prefix":"10.1145","author":[{"given":"Ziyue","family":"Wang","sequence":"first","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Aozhu","family":"Chen","sequence":"additional","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Fan","family":"Hu","sequence":"additional","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Xirong","family":"Li","sequence":"additional","affiliation":[{"name":"Renmin University of China, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2022,10,10]]},"reference":[{"key":"e_1_3_2_2_1_1","volume-title":"TRECVID Workshop.","author":"Awad George","year":"2021","unstructured":"George Awad , Asad A. Butt , Keith Curtis , Jonathan Fiscus , Afzal Godil , Yooyoung Lee , Andrew Delgado , Jesse Zhang , Eliot Godard , Baptiste Chocot , Lukas Diduch , Jeffrey Liu , Yvette Graham , Gareth J. F. Jones , , and Georges Qu\u00e9not . 2021 . Evaluating Multiple Video Understanding and Retrieval Tasks at TRECVID 2021 . In TRECVID Workshop. George Awad, Asad A. Butt, Keith Curtis, Jonathan Fiscus, Afzal Godil, Yooyoung Lee, Andrew Delgado, Jesse Zhang, Eliot Godard, Baptiste Chocot, Lukas Diduch, Jeffrey Liu, Yvette Graham, Gareth J. F. Jones, , and Georges Qu\u00e9not. 2021. Evaluating Multiple Video Understanding and Retrieval Tasks at TRECVID 2021. In TRECVID Workshop."},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCVW54120.2021.00262"},{"key":"e_1_3_2_2_3_1","unstructured":"David Chen and William Dolan. 2011. Collecting Highly Parallel Data for Paraphrase Evaluation. In CVPR.  David Chen and William Dolan. 2011. Collecting Highly Parallel Data for Paraphrase Evaluation. In CVPR."},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"crossref","unstructured":"Shizhe Chen Yida Zhao Qin Jin and Qi Wu. 2020. Fine-Grained Video-Text Retrieval With Hierarchical Graph Reasoning. In CVPR.  Shizhe Chen Yida Zhao Qin Jin and Qi Wu. 2020. Fine-Grained Video-Text Retrieval With Hierarchical Graph Reasoning. In CVPR.","DOI":"10.1109\/CVPR42600.2020.01065"},{"key":"e_1_3_2_2_5_1","volume-title":"TRECVID Workshop.","author":"Cooper Matthew","year":"2005","unstructured":"Matthew Cooper , John Adcock , Robert Chen , and Hanning Zhou . 2005 . FXPAL at TRECVID 2005 . In TRECVID Workshop. Matthew Cooper, John Adcock, Robert Chen, and Hanning Zhou. 2005. FXPAL at TRECVID 2005. In TRECVID Workshop."},{"key":"e_1_3_2_2_6_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT."},{"key":"e_1_3_2_2_7_1","first-page":"4065","article-title":"Dual Encoding for Video Retrieval by Text","volume":"44","author":"Dong Jianfeng","year":"2021","unstructured":"Jianfeng Dong , Xirong Li , Chaoxi Xu , Xun Yang , Gang Yang , and Xun Wang . 2021 . Dual Encoding for Video Retrieval by Text . TPAMI 44 , 8 (2021), 4065 -- 4080 . Jianfeng Dong, Xirong Li, Chaoxi Xu, Xun Yang, Gang Yang, and Xun Wang. 2021. Dual Encoding for Video Retrieval by Text. TPAMI 44, 8 (2021), 4065--4080.","journal-title":"TPAMI"},{"key":"e_1_3_2_2_8_1","volume-title":"MDMMT: Multidomain Multimodal Transformer for Video Retrieval. In CVPR Workshop on HVU.","author":"Dzabraev Maksim","year":"2021","unstructured":"Maksim Dzabraev , Maksim Kalashnikov , Stepan Komkov , and Aleksandr Petiushko . 2021 . MDMMT: Multidomain Multimodal Transformer for Video Retrieval. In CVPR Workshop on HVU. Maksim Dzabraev, Maksim Kalashnikov, Stepan Komkov, and Aleksandr Petiushko. 2021. MDMMT: Multidomain Multimodal Transformer for Video Retrieval. In CVPR Workshop on HVU."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00298"},{"key":"e_1_3_2_2_10_1","volume-title":"Jamie Ryan Kiros, and Sanja Fidler","author":"Faghri Fartash","year":"2018","unstructured":"Fartash Faghri , David J. Fleet , Jamie Ryan Kiros, and Sanja Fidler . 2018 . VSE : Improving Visual-Semantic Embeddings with Hard Negatives. In BMVC. Fartash Faghri, David J. Fleet, Jamie Ryan Kiros, and Sanja Fidler. 2018. VSE: Improving Visual-Semantic Embeddings with Hard Negatives. In BMVC."},{"key":"e_1_3_2_2_11_1","volume-title":"CLIP2Video: Mastering Video-Text Retrieval via Image CLIP. arXiv preprint arXiv:2106.11097","author":"Fang Han","year":"2021","unstructured":"Han Fang , Pengfei Xiong , Luhui Xu , and Yu Chen . 2021. CLIP2Video: Mastering Video-Text Retrieval via Image CLIP. arXiv preprint arXiv:2106.11097 ( 2021 ). Han Fang, Pengfei Xiong, Luhui Xu, and Yu Chen. 2021. CLIP2Video: Mastering Video-Text Retrieval via Image CLIP. arXiv preprint arXiv:2106.11097 (2021)."},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"crossref","unstructured":"Valentin Gabeur Chen Sun Karteek Alahari and Cordelia Schmid. 2020. Multi- Modal Transformer for Video Retrieval. In ECCV.  Valentin Gabeur Chen Sun Karteek Alahari and Cordelia Schmid. 2020. Multi- Modal Transformer for Video Retrieval. In ECCV.","DOI":"10.1007\/978-3-030-58548-8_13"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"crossref","unstructured":"Ning Han Jingjing Chen Guangyi Xiao Hao Zhang Yawen Zeng and Hao Chen. 2021. Fine-grained Cross-modal Alignment Network for Text-Video Retrieval. In ACMMM.  Ning Han Jingjing Chen Guangyi Xiao Hao Zhang Yawen Zeng and Hao Chen. 2021. Fine-grained Cross-modal Alignment Network for Text-Video Retrieval. In ACMMM.","DOI":"10.1145\/3474085.3475241"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"crossref","unstructured":"Arian Hosseini Siva Reddy Dzmitry Bahdanau R Devon Hjelm Alessandro Sordoni and Aaron Courville. 2021. Understanding by Understanding Not: Modeling Negation in Language Models. In NAACL.  Arian Hosseini Siva Reddy Dzmitry Bahdanau R Devon Hjelm Alessandro Sordoni and Aaron Courville. 2021. Understanding by Understanding Not: Modeling Negation in Language Models. In NAACL.","DOI":"10.18653\/v1\/2021.naacl-main.102"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"crossref","unstructured":"Fan Hu Aozhu Chen ZiyueWang Fangming Zhou Jianfeng Dong and Xirong Li. 2022. Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval. In ECCV.  Fan Hu Aozhu Chen ZiyueWang Fangming Zhou Jianfeng Dong and Xirong Li. 2022. Lightweight Attentional Feature Fusion: A New Baseline for Text-to-Video Retrieval. In ECCV.","DOI":"10.1007\/978-3-031-19781-9_26"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2016.2598339"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"crossref","unstructured":"Nora Kassner and Hinrich Sch\u00fctze. 2020. Negated and Misprimed Probes for Pretrained Language Models: Birds Can Talk But Cannot Fly. In ACL.  Nora Kassner and Hinrich Sch\u00fctze. 2020. Negated and Misprimed Probes for Pretrained Language Models: Birds Can Talk But Cannot Fly. In ACL.","DOI":"10.18653\/v1\/2020.acl-main.698"},{"key":"e_1_3_2_2_18_1","volume-title":"Sawant","author":"Khandelwal Aditya","year":"2020","unstructured":"Aditya Khandelwal and Suraj T . Sawant . 2020 . NegBERT: A Transfer Learning Approach for Negation Detection and Scope Resolution. In LREC. Aditya Khandelwal and Suraj T. Sawant. 2020. NegBERT: A Transfer Learning Approach for Negation Detection and Scope Resolution. In LREC."},{"key":"e_1_3_2_2_19_1","unstructured":"Xirong Li Chaoxi Xu Gang Yang Zhineng Chen and Jianfeng Dong. 2019. W2VV: Fully Deep Learning for Ad-hoc Video Search. In ACMMM.  Xirong Li Chaoxi Xu Gang Yang Zhineng Chen and Jianfeng Dong. 2019. W2VV: Fully Deep Learning for Ad-hoc Video Search. In ACMMM."},{"key":"e_1_3_2_2_20_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2020.3042067"},{"key":"e_1_3_2_2_21_1","unstructured":"Xirong Li Yang Zhou Jie Wang Hailan Lin Jianchun Zhao Dayong Ding Weihong Yu and Youxin Chen. 2021. Multi-Modal Multi-Instance Learning for Retinal Disease Recognition. In ACMMM.  Xirong Li Yang Zhou Jie Wang Hailan Lin Jianchun Zhao Dayong Ding Weihong Yu and Youxin Chen. 2021. Multi-Modal Multi-Instance Learning for Retinal Disease Recognition. In ACMMM."},{"key":"e_1_3_2_2_22_1","unstructured":"Tsung-Yi Lin Michael Maire Serge J. Belongie James Hays Pietro Perona Deva Ramanan Piotr Doll\u00e1r and C. Lawrence Zitnick. 2014. Microsoft COCO: Common Objects in Context. In ECCV.  Tsung-Yi Lin Michael Maire Serge J. Belongie James Hays Pietro Perona Deva Ramanan Piotr Doll\u00e1r and C. Lawrence Zitnick. 2014. Microsoft COCO: Common Objects in Context. In ECCV."},{"key":"e_1_3_2_2_23_1","unstructured":"Yang Liu Samuel Albanie Arsha Nagrani and Andrew Zisserman. 2019. Use What You Have: Video Retrieval Using Representations from Collaborative Experts. In BMVC.  Yang Liu Samuel Albanie Arsha Nagrani and Andrew Zisserman. 2019. Use What You Have: Video Retrieval Using Representations from Collaborative Experts. In BMVC."},{"key":"e_1_3_2_2_24_1","doi-asserted-by":"crossref","unstructured":"Jakub Loko Tom\u00e1 Souek Patrik Vesel\u00fd Frantiek Mejzl\u00edk Jiaqi Ji Chaoxi Xu and Xirong Li. 2020. A W2VV Case Study with Automated and Interactive Text-to-Video Retrieval. In ACMMM.  Jakub Loko Tom\u00e1 Souek Patrik Vesel\u00fd Frantiek Mejzl\u00edk Jiaqi Ji Chaoxi Xu and Xirong Li. 2020. A W2VV Case Study with Automated and Interactive Text-to-Video Retrieval. In ACMMM.","DOI":"10.1145\/3394171.3414002"},{"key":"e_1_3_2_2_25_1","volume-title":"CLIP4Clip: An empirical study of clip for end to end video clip retrieval. arXiv preprint arXiv:2104.08860","author":"Luo Huaishao","year":"2021","unstructured":"Huaishao Luo , Lei Ji , Ming Zhong , Yang Chen , Wen Lei , Nan Duan , and Tianrui Li. 2021. CLIP4Clip: An empirical study of clip for end to end video clip retrieval. arXiv preprint arXiv:2104.08860 ( 2021 ). Huaishao Luo, Lei Ji, Ming Zhong, Yang Chen, Wen Lei, Nan Duan, and Tianrui Li. 2021. CLIP4Clip: An empirical study of clip for end to end video clip retrieval. arXiv preprint arXiv:2104.08860 (2021)."},{"key":"e_1_3_2_2_26_1","unstructured":"Niluthpol Chowdhury Mithun Juncheng Li Florian Metze and Amit K Roy- Chowdhury. 2018. Learning joint embedding with multimodal cues for crossmodal video-text retrieval. In ICMR.  Niluthpol Chowdhury Mithun Juncheng Li Florian Metze and Amit K Roy- Chowdhury. 2018. Learning joint embedding with multimodal cues for crossmodal video-text retrieval. In ICMR."},{"key":"e_1_3_2_2_27_1","volume-title":"PyTorch: An Imperative Style","author":"Paszke Adam","unstructured":"Adam Paszke , Sam Gross , Francisco Massa , Adam Lerer , James Bradbury , Gregory Chanan , Trevor Killeen , Zeming Lin , Natalia Gimelshein , Luca Antiga , Alban Desmaison , Andreas K\u00f6pf , Edward Yang , Zachary DeVito , Martin Raison , Alykhan Tejani , Sasank Chilamkurthy , Benoit Steiner , Lu Fang , Junjie Bai , and Soumith Chintala . 2019. PyTorch: An Imperative Style , High-Performance Deep Learning Library . In NeurIPS. Adam Paszke, Sam Gross, Francisco Massa, Adam Lerer, James Bradbury, Gregory Chanan, Trevor Killeen, Zeming Lin, Natalia Gimelshein, Luca Antiga, Alban Desmaison, Andreas K\u00f6pf, Edward Yang, Zachary DeVito, Martin Raison, Alykhan Tejani, Sasank Chilamkurthy, Benoit Steiner, Lu Fang, Junjie Bai, and Soumith Chintala. 2019. PyTorch: An Imperative Style, High-Performance Deep Learning Library. In NeurIPS."},{"key":"e_1_3_2_2_28_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford , Jong Wook Kim , Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021 . Learning Transferable Visual Models from Natural Language Supervision. In ICML. Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models from Natural Language Supervision. In ICML."},{"key":"e_1_3_2_2_29_1","volume-title":"VATEX: A Large-Scale, High-Quality Multilingual Dataset for Videoand- Language Research. In ICCV.","author":"Wang Xin","year":"2019","unstructured":"Xin Wang , Jiawei Wu , Junkun Chen , Lei Li , Yuan-Fang Wang , and William Yang Wang . 2019 . VATEX: A Large-Scale, High-Quality Multilingual Dataset for Videoand- Language Research. In ICCV. Xin Wang, Jiawei Wu, Junkun Chen, Lei Li, Yuan-Fang Wang, and William Yang Wang. 2019. VATEX: A Large-Scale, High-Quality Multilingual Dataset for Videoand- Language Research. In ICCV."},{"key":"e_1_3_2_2_30_1","unstructured":"Jiaxin Wu and Chong-Wah Ngo. 2020. Interpretable Embedding for Ad-Hoc Video Search. In ACMMM.  Jiaxin Wu and Chong-Wah Ngo. 2020. Interpretable Embedding for Ad-Hoc Video Search. In ACMMM."},{"key":"e_1_3_2_2_31_1","unstructured":"Peng Wu Xiangteng He Mingqian Tang Yiliang Lv and Jing Liu. 2021. HANet: Hierarchical Alignment Networks for Video-Text Retrieval. In ACMMM.  Peng Wu Xiangteng He Mingqian Tang Yiliang Lv and Jing Liu. 2021. HANet: Hierarchical Alignment Networks for Video-Text Retrieval. In ACMMM."},{"key":"e_1_3_2_2_32_1","doi-asserted-by":"crossref","unstructured":"Jun Xu Tao Mei Ting Yao and Yong Rui. 2016. MSR-VTT: A Large Video Description Dataset for Bridging Video And Language. In CVPR.  Jun Xu Tao Mei Ting Yao and Yong Rui. 2016. MSR-VTT: A Large Video Description Dataset for Bridging Video And Language. In CVPR.","DOI":"10.1109\/CVPR.2016.571"},{"key":"e_1_3_2_2_33_1","doi-asserted-by":"crossref","unstructured":"Xun Yang Jianfeng Dong Yixin Cao Xun Wang Meng Wang and Tat-Seng Chua. 2020. Tree-Augmented Cross-Modal Encoding for Complex-Query Video Retrieval. In SIGIR.  Xun Yang Jianfeng Dong Yixin Cao Xun Wang Meng Wang and Tat-Seng Chua. 2020. Tree-Augmented Cross-Modal Encoding for Complex-Query Video Retrieval. In SIGIR.","DOI":"10.1145\/3397271.3401151"},{"key":"e_1_3_2_2_34_1","doi-asserted-by":"publisher","DOI":"10.1162\/tacl_a_00166"},{"key":"e_1_3_2_2_35_1","unstructured":"Youngjae Yu Jongseok Kim and Gunhee Kim. 2018. A Joint Sequence Fusion Model for Video Question Answering and Retrieval. In ECCV.  Youngjae Yu Jongseok Kim and Gunhee Kim. 2018. A Joint Sequence Fusion Model for Video Question Answering and Retrieval. In ECCV."},{"key":"e_1_3_2_2_36_1","doi-asserted-by":"crossref","unstructured":"Pengpeng Zeng Lianli Gao Xinyu Lyu Shuaiqi Jing and Jingkuan Song. 2021. Conceptual and Syntactical Cross-modal Alignment with Cross-level Consistency for Image-Text Matching. In ACMMM.  Pengpeng Zeng Lianli Gao Xinyu Lyu Shuaiqi Jing and Jingkuan Song. 2021. Conceptual and Syntactical Cross-modal Alignment with Cross-level Consistency for Image-Text Matching. In ACMMM.","DOI":"10.1145\/3474085.3475380"}],"event":{"name":"MM '22: The 30th ACM International Conference on Multimedia","location":"Lisboa Portugal","acronym":"MM '22","sponsor":["SIGMM ACM Special Interest Group on Multimedia"]},"container-title":["Proceedings of the 30th ACM International Conference on Multimedia"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3547968","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3503161.3547968","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T19:00:31Z","timestamp":1750186831000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3503161.3547968"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,10,10]]},"references-count":36,"alternative-id":["10.1145\/3503161.3547968","10.1145\/3503161"],"URL":"https:\/\/doi.org\/10.1145\/3503161.3547968","relation":{},"subject":[],"published":{"date-parts":[[2022,10,10]]},"assertion":[{"value":"2022-10-10","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}