{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,2,20]],"date-time":"2026-02-20T09:36:12Z","timestamp":1771580172577,"version":"3.50.1"},"publisher-location":"New York, NY, USA","reference-count":28,"publisher":"ACM","license":[{"start":{"date-parts":[[2022,7,6]],"date-time":"2022-07-06T00:00:00Z","timestamp":1657065600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2022,7,6]]},"DOI":"10.1145\/3477495.3531899","type":"proceedings-article","created":{"date-parts":[[2022,7,7]],"date-time":"2022-07-07T15:12:13Z","timestamp":1657206733000},"page":"2578-2582","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":8,"title":["Modality-Balanced Embedding for Video Retrieval"],"prefix":"10.1145","author":[{"given":"Xun","family":"Wang","sequence":"first","affiliation":[{"name":"Kuaishou, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Bingqing","family":"Ke","sequence":"additional","affiliation":[{"name":"Kuaishou, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xuanping","family":"Li","sequence":"additional","affiliation":[{"name":"Kuaishou, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Fangyu","family":"Liu","sequence":"additional","affiliation":[{"name":"University of Cambridge, Cambridge, United Kingdom"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Mingyu","family":"Zhang","sequence":"additional","affiliation":[{"name":"Kuaishou, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Xiao","family":"Liang","sequence":"additional","affiliation":[{"name":"Kuaishou, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Qiushi","family":"Xiao","sequence":"additional","affiliation":[{"name":"Kuaishou, Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2022,7,7]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1109\/TPAMI.2013.50"},{"key":"e_1_3_2_2_2_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL. 4171--4186.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin , Ming-Wei Chang , Kenton Lee , and Kristina Toutanova . 2019 . BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL. 4171--4186. Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL. 4171--4186."},{"key":"e_1_3_2_2_3_1","volume-title":"Fatos T Yarman Vural, and Kyunghyun Cho","author":"Firat Orhan","year":"2016","unstructured":"Orhan Firat , Baskaran Sankaran , Yaser Al-Onaizan , Fatos T Yarman Vural, and Kyunghyun Cho . 2016 . Zero-Resource Translation with Multi-Lingual Neural Machine Translation. In EMNLP . 268--277. Orhan Firat, Baskaran Sankaran, Yaser Al-Onaizan, Fatos T Yarman Vural, and Kyunghyun Cho. 2016. Zero-Resource Translation with Multi-Lingual Neural Machine Translation. In EMNLP . 268--277."},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"crossref","unstructured":"Valentin Gabeur Chen Sun Karteek Alahari and Cordelia Schmid. 2020. Multi-modal Transformer for Video Retrieval. In ECCV .  Valentin Gabeur Chen Sun Karteek Alahari and Cordelia Schmid. 2020. Multi-modal Transformer for Video Retrieval. In ECCV .","DOI":"10.1007\/978-3-030-58548-8_13"},{"key":"e_1_3_2_2_5_1","volume-title":"Realm: retrieval-augmented language model pre-training. arXiv preprint arXiv:2002.08909","author":"Guu Kelvin","year":"2020","unstructured":"Kelvin Guu , Kenton Lee , Zora Tung , Panupong Pasupat , and Ming-Wei Chang . 2020. Realm: retrieval-augmented language model pre-training. arXiv preprint arXiv:2002.08909 ( 2020 ). Kelvin Guu, Kenton Lee, Zora Tung, Panupong Pasupat, and Ming-Wei Chang. 2020. Realm: retrieval-augmented language model pre-training. arXiv preprint arXiv:2002.08909 (2020)."},{"key":"e_1_3_2_2_6_1","unstructured":"Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR. 770--778.  Kaiming He Xiangyu Zhang Shaoqing Ren and Jian Sun. 2016. Deep residual learning for image recognition. In CVPR. 770--778."},{"key":"e_1_3_2_2_7_1","doi-asserted-by":"crossref","unstructured":"Jui-Ting Huang Ashish Sharma Shuying Sun Li Xia David Zhang Philip Pronin Janani Padmanabhan Giuseppe Ottaviano and Linjun Yang. 2020 a. Embedding-based retrieval in facebook search. In KDD. 2553--2561.  Jui-Ting Huang Ashish Sharma Shuying Sun Li Xia David Zhang Philip Pronin Janani Padmanabhan Giuseppe Ottaviano and Linjun Yang. 2020 a. Embedding-based retrieval in facebook search. In KDD. 2553--2561.","DOI":"10.1145\/3394486.3403305"},{"key":"e_1_3_2_2_8_1","doi-asserted-by":"crossref","unstructured":"Po-Sen Huang X. He Jianfeng Gao L. Deng A. Acero and Larry Heck. 2013. Learning deep structured semantic models for web search using clickthrough data. In CIKM .  Po-Sen Huang X. He Jianfeng Gao L. Deng A. Acero and Larry Heck. 2013. Learning deep structured semantic models for web search using clickthrough data. In CIKM .","DOI":"10.1145\/2505515.2505665"},{"key":"e_1_3_2_2_9_1","volume-title":"2020 b. Pixel-bert: Aligning image pixels with text by deep multi-modal transformers. arXiv preprint arXiv:2004.00849","author":"Huang Zhicheng","year":"2020","unstructured":"Zhicheng Huang , Zhaoyang Zeng , Bei Liu , Dongmei Fu , and Jianlong Fu . 2020 b. Pixel-bert: Aligning image pixels with text by deep multi-modal transformers. arXiv preprint arXiv:2004.00849 ( 2020 ). Zhicheng Huang, Zhaoyang Zeng, Bei Liu, Dongmei Fu, and Jianlong Fu. 2020 b. Pixel-bert: Aligning image pixels with text by deep multi-modal transformers. arXiv preprint arXiv:2004.00849 (2020)."},{"key":"e_1_3_2_2_10_1","volume-title":"Sewon Min, Ledell Wu, Sergey Edunov, Danqi Chen, and Wen-tau Yih.","author":"Karpukhin Vladimir","year":"2020","unstructured":"Vladimir Karpukhin , Barlas Oug uz , Sewon Min, Ledell Wu, Sergey Edunov, Danqi Chen, and Wen-tau Yih. 2020 . Dense passage retrieval for open-domain question answering. EMNLP ( 2020). Vladimir Karpukhin, Barlas Oug uz, Sewon Min, Ledell Wu, Sergey Edunov, Danqi Chen, and Wen-tau Yih. 2020. Dense passage retrieval for open-domain question answering. EMNLP (2020)."},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3397271.3401075"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1609\/aaai.v34i05.6320"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.1145\/3338501.3357369"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"crossref","unstructured":"Jie Lei Linjie Li Luowei Zhou Zhe Gan Tamara L Berg Mohit Bansal and Jingjing Liu. 2021. Less is more: Clipbert for video-and-language learning via sparse sampling. In CVPR . 7331--7341.  Jie Lei Linjie Li Luowei Zhou Zhe Gan Tamara L Berg Mohit Bansal and Jingjing Liu. 2021. Less is more: Clipbert for video-and-language learning via sparse sampling. In CVPR . 7331--7341.","DOI":"10.1109\/CVPR46437.2021.00725"},{"key":"e_1_3_2_2_15_1","volume-title":"Embedding-based Product Retrieval in Taobao Search. KDD","author":"Li Sen","year":"2021","unstructured":"Sen Li , Fuyu Lv , Taiwei Jin , Guli Lin , Keping Yang , Xiaoyi Zeng , Xiao-Ming Wu , and Qianli Ma. 2021. Embedding-based Product Retrieval in Taobao Search. KDD ( 2021 ). Sen Li, Fuyu Lv, Taiwei Jin, Guli Lin, Keping Yang, Xiaoyi Zeng, Xiao-Ming Wu, and Qianli Ma. 2021. Embedding-based Product Retrieval in Taobao Search. KDD (2021)."},{"key":"e_1_3_2_2_16_1","volume-title":"2021 a. Hit: Hierarchical transformer with momentum contrast for video-text retrieval. ICCV","author":"Liu Song","year":"2021","unstructured":"Song Liu , Haoqi Fan , Shengsheng Qian , Yiru Chen , Wenkui Ding , and Zhongyuan Wang . 2021 a. Hit: Hierarchical transformer with momentum contrast for video-text retrieval. ICCV ( 2021 ). Song Liu, Haoqi Fan, Shengsheng Qian, Yiru Chen, Wenkui Ding, and Zhongyuan Wang. 2021 a. Hit: Hierarchical transformer with momentum contrast for video-text retrieval. ICCV (2021)."},{"key":"e_1_3_2_2_17_1","volume-title":"2021 b. Pre-trained Language Model for Web-scale Retrieval in Baidu Search. KDD","author":"Liu Yiding","year":"2021","unstructured":"Yiding Liu , Guan Huang , Weixue Lu , Suqi Cheng , Daiting Shi , Shuaiqiang Wang , Zhicong Cheng , and Dawei Yin . 2021 b. Pre-trained Language Model for Web-scale Retrieval in Baidu Search. KDD ( 2021 ). Yiding Liu, Guan Huang, Weixue Lu, Suqi Cheng, Daiting Shi, Shuaiqiang Wang, Zhicong Cheng, and Dawei Yin. 2021 b. Pre-trained Language Model for Web-scale Retrieval in Baidu Search. KDD (2021)."},{"key":"e_1_3_2_2_18_1","volume-title":"Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692","author":"Liu Yinhan","year":"2019","unstructured":"Yinhan Liu , Myle Ott , Naman Goyal , Jingfei Du , Mandar Joshi , Danqi Chen , Omer Levy , Mike Lewis , Luke Zettlemoyer , and Veselin Stoyanov . 2019 . Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692 (2019). Yinhan Liu, Myle Ott, Naman Goyal, Jingfei Du, Mandar Joshi, Danqi Chen, Omer Levy, Mike Lewis, Luke Zettlemoyer, and Veselin Stoyanov. 2019. Roberta: A robustly optimized bert pretraining approach. arXiv preprint arXiv:1907.11692 (2019)."},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"crossref","unstructured":"Yiqun Liu Kaushik Rangadurai Yunzhong He Siddarth Malreddy Xunlong Gui Xiaoyi Liu and Fedor Borisyuk. 2021 c. Que2Search: Fast and Accurate Query and Document Understanding for Search at Facebook. In KDD . 3376--3384.  Yiqun Liu Kaushik Rangadurai Yunzhong He Siddarth Malreddy Xunlong Gui Xiaoyi Liu and Fedor Borisyuk. 2021 c. Que2Search: Fast and Accurate Query and Document Understanding for Search at Facebook. In KDD . 3376--3384.","DOI":"10.1145\/3447548.3467127"},{"key":"e_1_3_2_2_20_1","unstructured":"Aleksander Madry Aleksandar Makelov Ludwig Schmidt Dimitris Tsipras and Adrian Vladu. 2018. Towards Deep Learning Models Resistant to Adversarial Attacks. In ICLR .  Aleksander Madry Aleksandar Makelov Ludwig Schmidt Dimitris Tsipras and Adrian Vladu. 2018. Towards Deep Learning Models Resistant to Adversarial Attacks. In ICLR ."},{"key":"e_1_3_2_2_21_1","unstructured":"Leigang Qu Meng Liu Jianlong Wu Zan Gao and Liqiang Nie. 2021. Dynamic Modality Interaction Modeling for Image-Text Retrieval. In SIGIR . 1104--1113.  Leigang Qu Meng Liu Jianlong Wu Zan Gao and Liqiang Nie. 2021. Dynamic Modality Interaction Modeling for Image-Text Retrieval. In SIGIR . 1104--1113."},{"key":"e_1_3_2_2_22_1","volume-title":"Carl Vondrick, Kevin Murphy, and Cordelia Schmid.","author":"Sun Chen","year":"2019","unstructured":"Chen Sun , Austin Myers , Carl Vondrick, Kevin Murphy, and Cordelia Schmid. 2019 . Videobert : A joint model for video and language representation learning. In ICCV . 7464--7473. Chen Sun, Austin Myers, Carl Vondrick, Kevin Murphy, and Cordelia Schmid. 2019. Videobert: A joint model for video and language representation learning. In ICCV . 7464--7473."},{"key":"e_1_3_2_2_23_1","unstructured":"Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is All You Need. In NeurIPS. 5998--6008.  Ashish Vaswani Noam Shazeer Niki Parmar Jakob Uszkoreit Llion Jones Aidan N Gomez \u0141ukasz Kaiser and Illia Polosukhin. 2017. Attention is All You Need. In NeurIPS. 5998--6008."},{"key":"e_1_3_2_2_24_1","unstructured":"Yingce Xia Xu Tan Fei Tian Tao Qin Nenghai Yu and Tie-Yan Liu. 2018. Model-level dual learning. In ICML. PMLR 5383--5392.  Yingce Xia Xu Tan Fei Tian Tao Qin Nenghai Yu and Tie-Yan Liu. 2018. Model-level dual learning. In ICML. PMLR 5383--5392."},{"key":"e_1_3_2_2_25_1","volume-title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding. EMNLP","author":"Xu Hu","year":"2021","unstructured":"Hu Xu , Gargi Ghosh , Po-Yao Huang , Dmytro Okhonko , Armen Aghajanyan , Florian Metze , Luke Zettlemoyer , and Christoph Feichtenhofer . 2021 . Videoclip: Contrastive pre-training for zero-shot video-text understanding. EMNLP (2021). Hu Xu, Gargi Ghosh, Po-Yao Huang, Dmytro Okhonko, Armen Aghajanyan, Florian Metze, Luke Zettlemoyer, and Christoph Feichtenhofer. 2021. Videoclip: Contrastive pre-training for zero-shot video-text understanding. EMNLP (2021)."},{"key":"e_1_3_2_2_26_1","volume-title":"Optimizing Dense Retrieval Model Training with Hard Negatives. SIGIR","author":"Zhan Jingtao","year":"2021","unstructured":"Jingtao Zhan , Jiaxin Mao , Yiqun Liu , Jiafeng Guo , Min Zhang , and Shaoping Ma. 2021. Optimizing Dense Retrieval Model Training with Hard Negatives. SIGIR ( 2021 ). Jingtao Zhan, Jiaxin Mao, Yiqun Liu, Jiafeng Guo, Min Zhang, and Shaoping Ma. 2021. Optimizing Dense Retrieval Model Training with Hard Negatives. SIGIR (2021)."},{"key":"e_1_3_2_2_27_1","volume-title":"RepBERT: Contextualized Text Embeddings for First-Stage Retrieval. arXiv preprint arXiv:2006.15498","author":"Zhan Jingtao","year":"2020","unstructured":"Jingtao Zhan , Jiaxin Mao , Yiqun Liu , Min Zhang , and Shaoping Ma. 2020. RepBERT: Contextualized Text Embeddings for First-Stage Retrieval. arXiv preprint arXiv:2006.15498 ( 2020 ). Jingtao Zhan, Jiaxin Mao, Yiqun Liu, Min Zhang, and Shaoping Ma. 2020. RepBERT: Contextualized Text Embeddings for First-Stage Retrieval. arXiv preprint arXiv:2006.15498 (2020)."},{"key":"e_1_3_2_2_28_1","doi-asserted-by":"crossref","unstructured":"Han Zhang Songlin Wang Kang Zhang Zhiling Tang Yunjiang Jiang Yun Xiao Weipeng Yan and Wen-Yun Yang. 2020. Towards personalized and semantic retrieval: An end-to-end solution for e-commerce search via embedding learning. In SIGIR. 2407--2416.  Han Zhang Songlin Wang Kang Zhang Zhiling Tang Yunjiang Jiang Yun Xiao Weipeng Yan and Wen-Yun Yang. 2020. Towards personalized and semantic retrieval: An end-to-end solution for e-commerce search via embedding learning. In SIGIR. 2407--2416.","DOI":"10.1145\/3397271.3401446"}],"event":{"name":"SIGIR '22: The 45th International ACM SIGIR Conference on Research and Development in Information Retrieval","location":"Madrid Spain","acronym":"SIGIR '22","sponsor":["SIGIR ACM Special Interest Group on Information Retrieval"]},"container-title":["Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3477495.3531899","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3477495.3531899","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,17]],"date-time":"2025-06-17T18:10:27Z","timestamp":1750183827000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3477495.3531899"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2022,7,6]]},"references-count":28,"alternative-id":["10.1145\/3477495.3531899","10.1145\/3477495"],"URL":"https:\/\/doi.org\/10.1145\/3477495.3531899","relation":{},"subject":[],"published":{"date-parts":[[2022,7,6]]},"assertion":[{"value":"2022-07-07","order":2,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}