{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T05:03:35Z","timestamp":1750309415255,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":48,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,10,21]],"date-time":"2024-10-21T00:00:00Z","timestamp":1729468800000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,10,21]]},"DOI":"10.1145\/3627673.3680014","type":"proceedings-article","created":{"date-parts":[[2024,10,20]],"date-time":"2024-10-20T19:34:11Z","timestamp":1729452851000},"page":"5102-5110","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Scaling Vison-Language Foundation Model to 12 Billion Parameters in Baidu Dynamic Image Advertising"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0000-0253-5488","authenticated-orcid":false,"given":"Xinyu","family":"Zhao","sequence":"first","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0000-3053-3965","authenticated-orcid":false,"given":"Kang","family":"Zhao","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-0863-2539","authenticated-orcid":false,"given":"Zhipeng","family":"Jin","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5077-4782","authenticated-orcid":false,"given":"Yi","family":"Yang","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-5481-4512","authenticated-orcid":false,"given":"Wen","family":"Tao","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0006-8069-2845","authenticated-orcid":false,"given":"Xiaodong","family":"Chen","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-6516-1139","authenticated-orcid":false,"given":"Cong","family":"Han","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-7346-5258","authenticated-orcid":false,"given":"Shuanglong","family":"Li","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-7305-8940","authenticated-orcid":false,"given":"Lin","family":"Liu","sequence":"additional","affiliation":[{"name":"Baidu Search Ads, Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2024,10,21]]},"reference":[{"key":"e_1_3_2_1_1_1","doi-asserted-by":"publisher","DOI":"10.1145\/1526709.1526742"},{"key":"e_1_3_2_1_2_1","volume-title":"Shiori Sagawa, Jenia Jitsev, Simon Kornblith, Pang Wei Koh, Gabriel Ilharco, Mitchell Wortsman, and Ludwig Schmidt.","author":"Awadalla Anas","year":"2023","unstructured":"Anas Awadalla, Irena Gao, Josh Gardner, Jack Hessel, Yusuf Hanafy, Wanrong Zhu, Kalyani Marathe, Yonatan Bitton, Samir Yitzhak Gadre, Shiori Sagawa, Jenia Jitsev, Simon Kornblith, Pang Wei Koh, Gabriel Ilharco, Mitchell Wortsman, and Ludwig Schmidt. 2023. OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models. ArXiv, Vol. abs\/2308.01390 (2023)."},{"key":"e_1_3_2_1_3_1","volume-title":"UNITER: UNiversal Image-TExt Representation Learning. In European Conf. on Computer Vision.","author":"Chen Yen-Chun","year":"2019","unstructured":"Yen-Chun Chen, Linjie Li, Licheng Yu, Ahmed El Kholy, Faisal Ahmed, Zhe Gan, Yu Cheng, and Jingjing Liu. 2019. UNITER: UNiversal Image-TExt Representation Learning. In European Conf. on Computer Vision."},{"key":"e_1_3_2_1_4_1","volume-title":"AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities. ArXiv","author":"Chen Zhongzhi","year":"2022","unstructured":"Zhongzhi Chen, Guangyi Liu, Bo Zhang, Fulong Ye, Qinghong Yang, and Ledell Yu Wu. 2022. AltCLIP: Altering the Language Encoder in CLIP for Extended Language Capabilities. ArXiv, Vol. abs\/2211.06679 (2022)."},{"key":"e_1_3_2_1_5_1","volume-title":"Reproducible Scaling Laws for Contrastive Language-Image Learning. 2023 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR)","author":"Cherti Mehdi","year":"2022","unstructured":"Mehdi Cherti, Romain Beaumont, Ross Wightman, Mitchell Wortsman, Gabriel Ilharco, Cade Gordon, Christoph Schuhmann, Ludwig Schmidt, and Jenia Jitsev. 2022. Reproducible Scaling Laws for Contrastive Language-Image Learning. 2023 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR) (2022), 2818--2829."},{"key":"e_1_3_2_1_6_1","article-title":"PaLM: Scaling Language Modeling with Pathways","volume":"24","author":"Chowdhery Aakanksha","year":"2022","unstructured":"Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, Maarten Bosma, Gaurav Mishra, Adam Roberts, Paul Barham, Hyung Won Chung, Charles Sutton, Sebastian Gehrmann, Parker Schuh, Kensen Shi, Sasha Tsvyashchenko, Joshua Maynez, Abhishek Rao, Parker Barnes, Yi Tay, Noam M. Shazeer, Vinodkumar Prabhakaran, Emily Reif, Nan Du, Benton C. Hutchinson, Reiner Pope, James Bradbury, Jacob Austin, Michael Isard, Guy Gur-Ari, Pengcheng Yin, Toju Duke, Anselm Levskaya, Sanjay Ghemawat, Sunipa Dev, Henryk Michalewski, Xavier Garc\u00eda, Vedant Misra, Kevin Robinson, Liam Fedus, Denny Zhou, Daphne Ippolito, David Luan, Hyeontaek Lim, Barret Zoph, Alexander Spiridonov, Ryan Sepassi, David Dohan, Shivani Agrawal, Mark Omernick, Andrew M. Dai, Thanumalayan Sankaranarayana Pillai, Marie Pellat, Aitor Lewkowycz, Erica Moreira, Rewon Child, Oleksandr Polozov, Katherine Lee, Zongwei Zhou, Xuezhi Wang, Brennan Saeta, Mark D\u00edaz, Orhan Firat, Michele Catasta, Jason Wei, Kathleen S. Meier-Hellstern, Douglas Eck, Jeff Dean, Slav Petrov, and Noah Fiedel. 2022. PaLM: Scaling Language Modeling with Pathways. J. Mach. Learn. Res., Vol. 24 (2022), 240:1--240:113.","journal-title":"J. Mach. Learn. Res."},{"key":"e_1_3_2_1_7_1","volume-title":"2020 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition Workshops (CVPRW)","author":"Cubuk Ekin Dogus","year":"2019","unstructured":"Ekin Dogus Cubuk, Barret Zoph, Jonathon Shlens, and Quoc V. Le. 2019. Randaugment: Practical automated data augmentation with a reduced search space. 2020 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition Workshops (CVPRW) (2019), 3008--3017."},{"key":"e_1_3_2_1_8_1","volume-title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. ArXiv","author":"Dao Tri","year":"2022","unstructured":"Tri Dao, Daniel Y. Fu, Stefano Ermon, Atri Rudra, and Christopher R'e. 2022. FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness. ArXiv, Vol. abs\/2205.14135 (2022)."},{"key":"e_1_3_2_1_9_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In North American","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In North American Chapter of the Association for Computational Linguistics."},{"key":"e_1_3_2_1_10_1","volume-title":"Down the Rabbit Hole: Detecting Online Extremism, Radicalisation, and Politicised Hate Speech. Comput. Surveys","author":"Govers Jarod","year":"2023","unstructured":"Jarod Govers, Philip G. Feldman, Aaron Dant, and Panos Patros. 2023. Down the Rabbit Hole: Detecting Online Extremism, Radicalisation, and Politicised Hate Speech. Comput. Surveys (2023)."},{"key":"e_1_3_2_1_11_1","volume-title":"Wukong 100 Million Large-scale Chinese Cross-modal Pre-training Dataset and A Foundation Framework. ArXiv","author":"Gu Jiaxi","year":"2022","unstructured":"Jiaxi Gu, Xiaojun Meng, Guansong Lu, Lu Hou, Minzhe Niu, Hang Xu, Xiaodan Liang, Wei Zhang, Xin Jiang, and Chunjing Xu. 2022. Wukong 100 Million Large-scale Chinese Cross-modal Pre-training Dataset and A Foundation Framework. ArXiv, Vol. abs\/2202.06767 (2022)."},{"key":"e_1_3_2_1_12_1","volume-title":"Scaling Up Vision-Language Pretraining for Image Captioning. 2022 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR)","author":"Hu Xiaowei","year":"2021","unstructured":"Xiaowei Hu, Zhe Gan, Jianfeng Wang, Zhengyuan Yang, Zicheng Liu, Yumao Lu, and Lijuan Wang. 2021. Scaling Up Vision-Language Pretraining for Image Captioning. 2022 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR) (2021), 17959--17968."},{"key":"e_1_3_2_1_13_1","unstructured":"Chao Jia Yinfei Yang Ye Xia Yi-Ting Chen Zarana Parekh Hieu Pham Quoc V. Le Yun-Hsuan Sung Zhen Li and Tom Duerig. 2021. Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision. In Int'l Conf. on Machine Learning."},{"key":"e_1_3_2_1_14_1","volume-title":"Learning Instance-Level Representation for Large-Scale Multi-Modal Pretraining in E-Commerce. 2023 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR)","author":"Jin Yang","year":"2023","unstructured":"Yang Jin, Yongzhi Li, Zehuan Yuan, and Yadong Mu. 2023. Learning Instance-Level Representation for Large-Scale Multi-Modal Pretraining in E-Commerce. 2023 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR) (2023), 11060--11069."},{"key":"e_1_3_2_1_15_1","unstructured":"Wonjae Kim Bokyung Son and Ildoo Kim. 2021. ViLT: Vision-and-Language Transformer Without Convolution or Region Supervision. In Int'l Conf. on Machine Learning."},{"key":"e_1_3_2_1_16_1","volume-title":"Hate-CLIPper: Multimodal Hateful Meme Classification based on Cross-modal Interaction of CLIP Features. ArXiv","author":"Kumar Gokul Karthik","year":"2022","unstructured":"Gokul Karthik Kumar and Karthik Nandakumar. 2022. Hate-CLIPper: Multimodal Hateful Meme Classification based on Cross-modal Interaction of CLIP Features. ArXiv, Vol. abs\/2210.05916 (2022)."},{"key":"e_1_3_2_1_17_1","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123366"},{"key":"e_1_3_2_1_18_1","volume-title":"Multimodal Foundation Models: From Specialists to General-Purpose Assistants. ArXiv","author":"Li Chunyuan","year":"2023","unstructured":"Chunyuan Li, Zhe Gan, Zhengyuan Yang, Jianwei Yang, Linjie Li, Lijuan Wang, and Jianfeng Gao. 2023. Multimodal Foundation Models: From Specialists to General-Purpose Assistants. ArXiv, Vol. abs\/2309.10020 (2023)."},{"key":"e_1_3_2_1_19_1","volume-title":"AAAI Conf. on Artificial Intelligence.","author":"Li Gen","year":"2019","unstructured":"Gen Li, Nan Duan, Yuejian Fang, Daxin Jiang, and Ming Zhou. 2019. Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training. In AAAI Conf. on Artificial Intelligence."},{"key":"e_1_3_2_1_20_1","volume-title":"Hoi","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven C. H. Hoi. 2023. BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models. ArXiv, Vol. abs\/2301.12597 (2023)."},{"key":"e_1_3_2_1_21_1","volume-title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In Int'l Conf. on Machine Learning. PMLR, 12888--12900.","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. 2022. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In Int'l Conf. on Machine Learning. PMLR, 12888--12900."},{"key":"e_1_3_2_1_22_1","volume-title":"Shafiq R. Joty, Caiming Xiong, and Steven C. H. Hoi.","author":"Li Junnan","year":"2021","unstructured":"Junnan Li, Ramprasaath R. Selvaraju, Akhilesh Deepak Gotmare, Shafiq R. Joty, Caiming Xiong, and Steven C. H. Hoi. 2021. Align before Fuse: Vision and Language Representation Learning with Momentum Distillation. In Neural Information Processing Systems."},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2896494"},{"key":"e_1_3_2_1_24_1","volume-title":"Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In European Conf. on Computer Vision.","author":"Li Xiujun","year":"2020","unstructured":"Xiujun Li, Xi Yin, Chunyuan Li, Xiaowei Hu, Pengchuan Zhang, Lei Zhang, Lijuan Wang, Houdong Hu, Li Dong, Furu Wei, Yejin Choi, and Jianfeng Gao. 2020. Oscar: Object-Semantics Aligned Pre-training for Vision-Language Tasks. In European Conf. on Computer Vision."},{"key":"e_1_3_2_1_25_1","volume-title":"2023 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR)","author":"Li Yanghao","year":"2022","unstructured":"Yanghao Li, Haoqi Fan, Ronghang Hu, Christoph Feichtenhofer, and Kaiming He. 2022. Scaling Language-Image Pre-Training via Masking. 2023 IEEE\/CVF Conf. on Computer Vision and Pattern Recognition (CVPR) (2022), 23390--23400."},{"key":"e_1_3_2_1_26_1","volume-title":"Proceedings of the 27th ACM SIGKDD Conf. on Knowledge Discovery and Data Mining","author":"Lin Junyang","year":"2021","unstructured":"Junyang Lin, Rui Men, An Yang, Chang Zhou, Ming Ding, Yichang Zhang, Peng Wang, Ang Wang, Le Jiang, Xianyan Jia, Jie Zhang, Jianwei Zhang, Xu Zou, Zhikang Li, Xiaodong Deng, Jie Liu, Jinbao Xue, Huiling Zhou, Jianxin Ma, Jin Yu, Yong Li, Wei Lin, Jingren Zhou, Jie Tang, and Hongxia Yang. 2021. M6: A Chinese Multimodal Pretrainer. In Proceedings of the 27th ACM SIGKDD Conf. on Knowledge Discovery and Data Mining (Virtual Event, Singapore). 3251--3261."},{"key":"e_1_3_2_1_27_1","volume-title":"Visual Instruction Tuning. ArXiv","author":"Liu Haotian","year":"2023","unstructured":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. 2023. Visual Instruction Tuning. ArXiv, Vol. abs\/2304.08485 (2023)."},{"key":"e_1_3_2_1_28_1","unstructured":"Yulong Liu Guibo Zhu Bin Zhu Qi Song Guojing Ge Haoran Chen Guanhui Qiao Ru Peng Lingxiang Wu and Jinqiao Wang. 2022. TaiSu: A 166M Large-scale High-Quality Dataset for Chinese Vision-Language Pre-training. In Neural Information Processing Systems."},{"key":"e_1_3_2_1_29_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547910"},{"key":"e_1_3_2_1_30_1","volume-title":"Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever.","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. 2021. Learning Transferable Visual Models From Natural Language Supervision. In Int'l Conf. on Machine Learning."},{"key":"e_1_3_2_1_31_1","unstructured":"Alec Radford Jeff Wu Rewon Child David Luan Dario Amodei and Ilya Sutskever. 2019. Language Models are Unsupervised Multitask Learners."},{"key":"e_1_3_2_1_32_1","volume-title":"Networking, Storage and Analysis","author":"Rajbhandari Samyam","year":"2019","unstructured":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He. 2019. ZeRO: Memory optimizations Toward Training Trillion Parameter Models. SC20: Int'l Conf. for High Performance Computing, Networking, Storage and Analysis (2019)."},{"key":"e_1_3_2_1_33_1","volume-title":"Multi-view Contrastive Learning for Image-Text Pre-training. ArXiv","author":"Shan Bin","year":"2022","unstructured":"Bin Shan, Weichong Yin, Yu Sun, Hao Tian, Hua Wu, and Haifeng Wang. 2022. ERNIE-ViL 2.0: Multi-view Contrastive Learning for Image-Text Pre-training. ArXiv, Vol. abs\/2209.15270 (2022)."},{"key":"e_1_3_2_1_34_1","volume-title":"RoFormer: Enhanced Transformer with Rotary Position Embedding. ArXiv","author":"Su Jianlin","year":"2021","unstructured":"Jianlin Su, Yu Lu, Shengfeng Pan, Bo Wen, and Yunfeng Liu. 2021. RoFormer: Enhanced Transformer with Rotary Position Embedding. ArXiv, Vol. abs\/2104.09864 (2021)."},{"key":"e_1_3_2_1_35_1","volume-title":"Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. ArXiv","author":"Sun Yu","year":"2021","unstructured":"Yu Sun, Shuohuan Wang, Shikun Feng, Siyu Ding, Chao Pang, Junyuan Shang, Jiaxiang Liu, Xuyi Chen, Yanbin Zhao, Yuxiang Lu, Weixin Liu, Zhihua Wu, Weibao Gong, Jianzhong Liang, Zhizhou Shang, Peng Sun, Wei Liu, Ouyang Xuan, Dianhai Yu, Hao Tian, Hua Wu, and Haifeng Wang. 2021. ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. ArXiv, Vol. abs\/2107.02137 (2021)."},{"key":"e_1_3_2_1_36_1","volume-title":"DeepNet: Scaling Transformers to 1, 000 Layers. ArXiv","author":"Wang Hongyu","year":"2022","unstructured":"Hongyu Wang, Shuming Ma, Li Dong, Shaohan Huang, Dongdong Zhang, and Furu Wei. 2022. DeepNet: Scaling Transformers to 1, 000 Layers. ArXiv, Vol. abs\/2203.00555 (2022)."},{"key":"e_1_3_2_1_37_1","volume-title":"VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts. ArXiv","author":"Wang Wenhui","year":"2021","unstructured":"Wenhui Wang, Hangbo Bao, Li Dong, and Furu Wei. 2021. VLMo: Unified Vision-Language Pre-Training with Mixture-of-Modality-Experts. ArXiv, Vol. abs\/2111.02358 (2021)."},{"key":"e_1_3_2_1_38_1","volume-title":"Zihang Dai, Yulia Tsvetkov, and Yuan Cao.","author":"Wang Zirui","year":"2021","unstructured":"Zirui Wang, Jiahui Yu, Adams Wei Yu, Zihang Dai, Yulia Tsvetkov, and Yuan Cao. 2021. SimVLM: Simple Visual Language Model Pretraining with Weak Supervision. ArXiv, Vol. abs\/2108.10904 (2021)."},{"key":"e_1_3_2_1_39_1","doi-asserted-by":"publisher","DOI":"10.1145\/3539618.3591844"},{"key":"e_1_3_2_1_40_1","volume-title":"Zero and R2D2: A Large-scale Chinese Cross-modal Benchmark and A Vision-Language Framework. ArXiv","author":"Xie Chunyu","year":"2022","unstructured":"Chunyu Xie, Hengyi Cai, Jianfei Song, Jincheng Li, Fanjing Kong, Xiaoyu Wu, Henrique Morimitsu, Lin Yao, Dexin Wang, Dawei Leng, Xiangyang Ji, and Yafeng Deng. 2022. Zero and R2D2: A Large-scale Chinese Cross-modal Benchmark and A Vision-Language Framework. ArXiv, Vol. abs\/2205.03860 (2022)."},{"key":"e_1_3_2_1_41_1","volume-title":"Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese. ArXiv","author":"Yang An","year":"2022","unstructured":"An Yang, Junshu Pan, Junyang Lin, Rui Men, Yichang Zhang, Jingren Zhou, and Chang Zhou. 2022. Chinese CLIP: Contrastive Vision-Language Pretraining in Chinese. ArXiv, Vol. abs\/2211.01335 (2022)."},{"key":"e_1_3_2_1_42_1","volume-title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes. arXiv: Learning","author":"You Yang","year":"2019","unstructured":"Yang You, Jing Li, Sashank J. Reddi, Jonathan Hseu, Sanjiv Kumar, Srinadh Bhojanapalli, Xiaodan Song, James Demmel, Kurt Keutzer, and Cho-Jui Hsieh. 2019. Large Batch Optimization for Deep Learning: Training BERT in 76 minutes. arXiv: Learning (2019)."},{"key":"e_1_3_2_1_43_1","volume-title":"CoCa: Contrastive Captioners are Image-Text Foundation Models. ArXiv","author":"Yu Jiahui","year":"1917","unstructured":"Jiahui Yu, Zirui Wang, Vijay Vasudevan, Legg Yeung, Mojtaba Seyedhosseini, and Yonghui Wu. 2022. CoCa: Contrastive Captioners are Image-Text Foundation Models. ArXiv, Vol. abs\/2205.01917 (2022)."},{"key":"e_1_3_2_1_44_1","volume-title":"Proceedings of the 28th ACM SIGKDD Conf. on Knowledge Discovery and Data Mining","author":"Yu Licheng","year":"2022","unstructured":"Licheng Yu, Jun Chen, Animesh Sinha, Mengjiao MJ Wang, Hugo Chen, Tamara L. Berg, and N. Zhang. 2022. CommerceMM: Large-Scale Commerce MultiModal Representation Learning with Omni Retrieval. Proceedings of the 28th ACM SIGKDD Conf. on Knowledge Discovery and Data Mining (2022)."},{"key":"e_1_3_2_1_45_1","volume-title":"TIRA in Baidu Image Advertising. 2021 IEEE 37th Int'l Conf. on Data Engineering (ICDE)","author":"Yu Tan","year":"2021","unstructured":"Tan Yu, Xuemeng Yang, Yan Jiang, Hongfang Zhang, Weijie Zhao, and Ping Li. 2021. TIRA in Baidu Image Advertising. 2021 IEEE 37th Int'l Conf. on Data Engineering (ICDE) (2021), 2207--2212."},{"key":"e_1_3_2_1_46_1","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3462924"},{"key":"e_1_3_2_1_47_1","doi-asserted-by":"publisher","DOI":"10.1145\/3539618.3591859"},{"key":"e_1_3_2_1_48_1","volume-title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models. ArXiv","author":"Zhu Deyao","year":"2023","unstructured":"Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, and Mohamed Elhoseiny. 2023. MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models. ArXiv, Vol. abs\/2304.10592 (2023)."}],"event":{"name":"CIKM '24: The 33rd ACM International Conference on Information and Knowledge Management","sponsor":["SIGIR ACM Special Interest Group on Information Retrieval"],"location":"Boise ID USA","acronym":"CIKM '24"},"container-title":["Proceedings of the 33rd ACM International Conference on Information and Knowledge Management"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3627673.3680014","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3627673.3680014","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T00:58:17Z","timestamp":1750294697000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3627673.3680014"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,10,21]]},"references-count":48,"alternative-id":["10.1145\/3627673.3680014","10.1145\/3627673"],"URL":"https:\/\/doi.org\/10.1145\/3627673.3680014","relation":{},"subject":[],"published":{"date-parts":[[2024,10,21]]},"assertion":[{"value":"2024-10-21","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}