{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,8,21]],"date-time":"2025-08-21T16:47:26Z","timestamp":1755794846226,"version":"3.44.0"},"publisher-location":"New York, NY, USA","reference-count":63,"publisher":"ACM","license":[{"start":{"date-parts":[[2025,7,20]],"date-time":"2025-07-20T00:00:00Z","timestamp":1752969600000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2025,7,20]]},"DOI":"10.1145\/3690624.3709401","type":"proceedings-article","created":{"date-parts":[[2025,4,4]],"date-time":"2025-04-04T18:42:22Z","timestamp":1743792142000},"page":"2303-2312","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Large Vison-Language Foundation Model in Baidu AIGC Image Advertising"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0009-0003-0863-2539","authenticated-orcid":false,"given":"Zhipeng","family":"Jin","sequence":"first","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-5481-4512","authenticated-orcid":false,"given":"Wen","family":"Tao","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-4841-8901","authenticated-orcid":false,"given":"Yafei","family":"Li","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-5077-4782","authenticated-orcid":false,"given":"Yi","family":"Yang","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-6516-1139","authenticated-orcid":false,"given":"Cong","family":"Han","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-7346-5258","authenticated-orcid":false,"given":"Shuanglong","family":"Li","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-7305-8940","authenticated-orcid":false,"given":"Lin","family":"Liu","sequence":"additional","affiliation":[{"name":"Baidu Inc., Beijing, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,7,20]]},"reference":[{"key":"e_1_3_2_2_1_1","doi-asserted-by":"publisher","DOI":"10.1145\/1242572.1242644"},{"key":"e_1_3_2_2_2_1","doi-asserted-by":"publisher","DOI":"10.1145\/3534678.3539061"},{"key":"e_1_3_2_2_3_1","doi-asserted-by":"publisher","DOI":"10.1109\/BigData55660.2022.10020786"},{"key":"e_1_3_2_2_4_1","doi-asserted-by":"publisher","DOI":"10.1145\/3511808.3557653"},{"key":"e_1_3_2_2_5_1","doi-asserted-by":"publisher","DOI":"10.1145\/3505243"},{"key":"e_1_3_2_2_6_1","unstructured":"James Betker Gabriel Goh Li Jing \u2020 Tim Brooks Jianfeng Wang Linjie Li \u2020 Long Ouyang \u2020 Juntang Zhuang \u2020 Joyce Lee \u2020 Yufei Guo \u2020 Wesam Manassra \u2020 Prafulla Dhariwal \u2020 Casey Chu \u2020 Yunxin Jiao and Aditya Ramesh. Improving image generation with better captions."},{"key":"e_1_3_2_2_7_1","volume-title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis. ArXiv, abs\/2307.01952","author":"Podell Dustin","year":"2023","unstructured":"Dustin Podell, Zion English, Kyle Lacey, A. Blattmann, Tim Dockhorn, Jonas Muller, Joe Penna, and Robin Rombach. Sdxl: Improving latent diffusion models for high-resolution image synthesis. ArXiv, abs\/2307.01952, 2023."},{"key":"e_1_3_2_2_8_1","first-page":"22500","volume-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Ruiz Nataniel","year":"2022","unstructured":"Nataniel Ruiz, Yuanzhen Li, Varun Jampani, Yael Pritch, Michael Rubinstein, and Kfir Aberman. Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation. 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 22500--22510, 2022."},{"key":"e_1_3_2_2_9_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICCV51070.2023.00355"},{"key":"e_1_3_2_2_10_1","doi-asserted-by":"publisher","DOI":"10.1145\/2959100.2959190"},{"key":"e_1_3_2_2_11_1","doi-asserted-by":"publisher","DOI":"10.1145\/3539618.3591844"},{"key":"e_1_3_2_2_12_1","doi-asserted-by":"publisher","DOI":"10.1145\/3539618.3591859"},{"key":"e_1_3_2_2_13_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR52729.2023.01064"},{"key":"e_1_3_2_2_14_1","doi-asserted-by":"publisher","DOI":"10.1109\/CVPR46437.2021.01246"},{"key":"e_1_3_2_2_15_1","doi-asserted-by":"publisher","DOI":"10.1109\/ICDE51399.2021.00225"},{"key":"e_1_3_2_2_16_1","doi-asserted-by":"publisher","DOI":"10.1145\/3404835.3462924"},{"key":"e_1_3_2_2_17_1","doi-asserted-by":"publisher","DOI":"10.1145\/3626772.3661350"},{"key":"e_1_3_2_2_18_1","volume-title":"European Conference on Computer Vision","author":"Chen Yen-Chun","year":"2019","unstructured":"Yen-Chun Chen, Linjie Li, Licheng Yu, Ahmed El Kholy, Faisal Ahmed, Zhe Gan, Yu Cheng, and Jingjing Liu. Uniter: Universal image-text representation learning. In European Conference on Computer Vision, 2019."},{"key":"e_1_3_2_2_19_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-030-58577-8_8"},{"key":"e_1_3_2_2_20_1","volume-title":"International Conference on Machine Learning","author":"Kim Wonjae","year":"2021","unstructured":"Wonjae Kim, Bokyung Son, and Ildoo Kim. Vilt: Vision-and-language transformer without convolution or region supervision. In International Conference on Machine Learning, 2021."},{"key":"e_1_3_2_2_21_1","volume-title":"AAAI Conference on Artificial Intelligence","author":"Li Gen","year":"2019","unstructured":"Gen Li, Nan Duan, Yuejian Fang, Daxin Jiang, and Ming Zhou. Unicoder-vl: A universal encoder for vision and language by cross-modal pre-training. In AAAI Conference on Artificial Intelligence, 2019."},{"key":"e_1_3_2_2_22_1","volume-title":"International Conference on Machine Learning","author":"Radford Alec","year":"2021","unstructured":"Alec Radford, Jong Wook Kim, Chris Hallacy, Aditya Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever. Learning transferable visual models from natural language supervision. In International Conference on Machine Learning, 2021."},{"key":"e_1_3_2_2_23_1","volume-title":"International Conference on Machine Learning","author":"Jia Chao","year":"2021","unstructured":"Chao Jia, Yinfei Yang, Ye Xia, Yi-Ting Chen, Zarana Parekh, Hieu Pham, Quoc V. Le, Yun-Hsuan Sung, Zhen Li, and Tom Duerig. Scaling up visual and visionlanguage representation learning with noisy text supervision. In International Conference on Machine Learning, 2021."},{"key":"e_1_3_2_2_24_1","volume-title":"Neural Information Processing Systems","author":"Li Junnan","year":"2021","unstructured":"Junnan Li, Ramprasaath R. Selvaraju, Akhilesh Deepak Gotmare, Shafiq R. Joty, Caiming Xiong, and Steven C. H. Hoi. Align before fuse: Vision and language representation learning with momentum distillation. In Neural Information Processing Systems, 2021."},{"key":"e_1_3_2_2_25_1","volume-title":"Vlmo: Unified visionlanguage pre-training with mixture-of-modality-experts. ArXiv, abs\/2111.02358","author":"Wang Wenhui","year":"2021","unstructured":"Wenhui Wang, Hangbo Bao, Li Dong, and Furu Wei. Vlmo: Unified visionlanguage pre-training with mixture-of-modality-experts. ArXiv, abs\/2111.02358, 2021."},{"key":"e_1_3_2_2_26_1","volume-title":"Zihang Dai, Yulia Tsvetkov, and Yuan Cao. Simvlm: Simple visual language model pretraining with weak supervision. ArXiv, abs\/2108.10904","author":"Wang Zirui","year":"2021","unstructured":"Zirui Wang, Jiahui Yu, Adams Wei Yu, Zihang Dai, Yulia Tsvetkov, and Yuan Cao. Simvlm: Simple visual language model pretraining with weak supervision. ArXiv, abs\/2108.10904, 2021."},{"key":"e_1_3_2_2_27_1","volume-title":"Coca: Contrastive captioners are image-text foundation models. ArXiv, abs\/2205.01917","author":"Yu Jiahui","year":"2022","unstructured":"Jiahui Yu, Zirui Wang, Vijay Vasudevan, Legg Yeung, Mojtaba Seyedhosseini, and Yonghui Wu. Coca: Contrastive captioners are image-text foundation models. ArXiv, abs\/2205.01917, 2022."},{"key":"e_1_3_2_2_28_1","first-page":"12888","volume-title":"International Conference on Machine Learning","author":"Li Junnan","year":"2022","unstructured":"Junnan Li, Dongxu Li, Caiming Xiong, and Steven Hoi. Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation. In International Conference on Machine Learning, pages 12888--12900. PMLR, 2022."},{"key":"e_1_3_2_2_29_1","volume-title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. ArXiv, abs\/2301.12597","author":"Li Junnan","year":"2023","unstructured":"Junnan Li, Dongxu Li, Silvio Savarese, and Steven C. H. Hoi. Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models. ArXiv, abs\/2301.12597, 2023."},{"key":"e_1_3_2_2_30_1","unstructured":"Anas Awadalla Irena Gao Josh Gardner Jack Hessel Yusuf Hanafy Wanrong Zhu Kalyani Marathe Yonatan Bitton Samir Yitzhak Gadre Shiori Sagawa Jenia Jitsev Simon Kornblith Pang Wei Koh Gabriel Ilharco Mitchell Wortsman and Ludwig Schmidt. Openflamingo: An open-source framework for training large autoregressive vision-language models. ArXiv abs\/2308.01390 2023."},{"key":"e_1_3_2_2_31_1","volume-title":"Visual instruction tuning. ArXiv, abs\/2304.08485","author":"Liu Haotian","year":"2023","unstructured":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee. Visual instruction tuning. ArXiv, abs\/2304.08485, 2023."},{"key":"e_1_3_2_2_32_1","volume-title":"Minigpt- 4: Enhancing vision-language understanding with advanced large language models. ArXiv, abs\/2304.10592","author":"Zhu Deyao","year":"2023","unstructured":"Deyao Zhu, Jun Chen, Xiaoqian Shen, Xiang Li, and Mohamed Elhoseiny. Minigpt- 4: Enhancing vision-language understanding with advanced large language models. ArXiv, abs\/2304.10592, 2023."},{"key":"e_1_3_2_2_33_1","volume-title":"Chinese clip: Contrastive vision-language pretraining in chinese. ArXiv, abs\/2211.01335","author":"Yang An","year":"2022","unstructured":"An Yang, Junshu Pan, Junyang Lin, Rui Men, Yichang Zhang, Jingren Zhou, and Chang Zhou. Chinese clip: Contrastive vision-language pretraining in chinese. ArXiv, abs\/2211.01335, 2022."},{"key":"e_1_3_2_2_34_1","volume-title":"Zero and r2d2: A large-scale chinese cross-modal benchmark and a vision-language framework. ArXiv, abs\/2205.03860","author":"Xie Chunyu","year":"2022","unstructured":"Chunyu Xie, Hengyi Cai, Jianfei Song, Jincheng Li, Fanjing Kong, Xiaoyu Wu, Henrique Morimitsu, Lin Yao, Dexin Wang, Dawei Leng, Xiangyang Ji, and Yafeng Deng. Zero and r2d2: A large-scale chinese cross-modal benchmark and a vision-language framework. ArXiv, abs\/2205.03860, 2022."},{"key":"e_1_3_2_2_35_1","volume-title":"Wukong 100 million large-scale chinese cross-modal pre-training dataset and a foundation framework. ArXiv, abs\/2202.06767","author":"Gu Jiaxi","year":"2022","unstructured":"Jiaxi Gu, Xiaojun Meng, Guansong Lu, Lu Hou, Minzhe Niu, Hang Xu, Xiaodan Liang, Wei Zhang, Xin Jiang, and Chunjing Xu. Wukong 100 million large-scale chinese cross-modal pre-training dataset and a foundation framework. ArXiv, abs\/2202.06767, 2022."},{"key":"e_1_3_2_2_36_1","volume-title":"Neural Information Processing Systems","author":"Liu Yulong","year":"2022","unstructured":"Yulong Liu, Guibo Zhu, Bin Zhu, Qi Song, Guojing Ge, Haoran Chen, Guanhui Qiao, Ru Peng, Lingxiang Wu, and Jinqiao Wang. Taisu: A 166m large-scale highquality dataset for chinese vision-language pre-training. In Neural Information Processing Systems, 2022."},{"key":"e_1_3_2_2_37_1","volume-title":"Altclip: Altering the language encoder in clip for extended language capabilities. ArXiv, abs\/2211.06679","author":"Chen Zhongzhi","year":"2022","unstructured":"Zhongzhi Chen, Guangyi Liu, Bo Zhang, Fulong Ye, Qinghong Yang, and Ledell Yu Wu. Altclip: Altering the language encoder in clip for extended language capabilities. ArXiv, abs\/2211.06679, 2022."},{"key":"e_1_3_2_2_38_1","volume-title":"Zero-shot text-to-image generation. ArXiv, abs\/2102.12092","author":"Ramesh Aditya","year":"2021","unstructured":"Aditya Ramesh, Mikhail Pavlov, Gabriel Goh, Scott Gray, Chelsea Voss, Alec Radford, Mark Chen, and Ilya Sutskever. Zero-shot text-to-image generation. ArXiv, abs\/2102.12092, 2021."},{"key":"e_1_3_2_2_39_1","first-page":"2022","article-title":"Scaling autoregressive models for content-rich text-to-image generation","author":"Yu Jiahui","year":"2022","unstructured":"Jiahui Yu, Yuanzhong Xu, Jing Yu Koh, Thang Luong, Gunjan Baid, Zirui Wang, Vijay Vasudevan, Alexander Ku, Yinfei Yang, Burcu Karagol Ayan, Benton C. Hutchinson, Wei Han, Zarana Parekh, Xin Li, Han Zhang, Jason Baldridge, and Yonghui Wu. Scaling autoregressive models for content-rich text-to-image generation. Trans. Mach. Learn. Res., 2022, 2022.","journal-title":"Trans. Mach. Learn. Res."},{"key":"e_1_3_2_2_40_1","volume-title":"International Conference on Machine Learning","author":"Arjovsky Mart\u00edn","year":"2017","unstructured":"Mart\u00edn Arjovsky, Soumith Chintala, and L\u00e9on Bottou. Wasserstein generative adversarial networks. In International Conference on Machine Learning, 2017."},{"key":"e_1_3_2_2_41_1","volume-title":"Generative adversarial nets. Advances in neural information processing systems, 27","author":"Goodfellow Ian","year":"2014","unstructured":"Ian Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, and Yoshua Bengio. Generative adversarial nets. Advances in neural information processing systems, 27, 2014."},{"key":"e_1_3_2_2_42_1","volume-title":"Auto-encoding variational bayes","author":"Lopez Romain","year":"2020","unstructured":"Romain Lopez, Pierre Boyeau, Nir Yosef, Michael I. Jordan, and Jeffrey Regier. Auto-encoding variational bayes. 2020."},{"key":"e_1_3_2_2_43_1","first-page":"22669","volume-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Bao Fan","year":"2022","unstructured":"Fan Bao, Shen Nie, Kaiwen Xue, Yue Cao, Chongxuan Li, Hang Su, and Jun Zhu. All are worth words: A vit backbone for diffusion models. 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 22669--22679, 2022."},{"key":"e_1_3_2_2_44_1","first-page":"4172","volume-title":"2023 IEEE\/CVF International Conference on Computer Vision (ICCV)","author":"William","year":"2022","unstructured":"William S. Peebles and Saining Xie. Scalable diffusion models with transformers. 2023 IEEE\/CVF International Conference on Computer Vision (ICCV), pages 4172--4182, 2022."},{"key":"e_1_3_2_2_45_1","volume-title":"Muse: Text-to-image generation via masked generative transformers. ArXiv, abs\/2301.00704","author":"Chang Huiwen","year":"2023","unstructured":"Huiwen Chang, Han Zhang, Jarred Barber, AJ Maschinot, Jos\u00e9 Lezama, Lu Jiang, Ming Yang, Kevin P. Murphy, William T. Freeman, Michael Rubinstein, Yuanzhen Li, and Dilip Krishnan. Muse: Text-to-image generation via masked generative transformers. ArXiv, abs\/2301.00704, 2023."},{"key":"e_1_3_2_2_46_1","volume-title":"Altclip: Altering the language encoder in clip for extended language capabilities. ArXiv, abs\/2211.06679","author":"Chen Zhongzhi","year":"2022","unstructured":"Zhongzhi Chen, Guangyi Liu, Bo Zhang, Fulong Ye, Qinghong Yang, and Ledell Yu Wu. Altclip: Altering the language encoder in clip for extended language capabilities. ArXiv, abs\/2211.06679, 2022."},{"key":"e_1_3_2_2_47_1","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.510"},{"key":"e_1_3_2_2_48_1","volume-title":"Taiyi-diffusion-xl: Advancing bilingual text-to-image generation with large vision-language model support. ArXiv, abs\/2401.14688","author":"Wu Xiaojun","year":"2024","unstructured":"Xiaojun Wu, Di Zhang, Ruyi Gan, Junyu Lu, Ziwei Wu, Renliang Sun, Jiaxing Zhang, Pingjian Zhang, and Yan Song. Taiyi-diffusion-xl: Advancing bilingual text-to-image generation with large vision-language model support. ArXiv, abs\/2401.14688, 2024."},{"key":"e_1_3_2_2_49_1","volume-title":"Multi-view contrastive learning for image-text pre-training. ArXiv, abs\/2209.15270","author":"Shan Bin","year":"2022","unstructured":"Bin Shan, Weichong Yin, Yu Sun, Hao Tian, Hua Wu, and Haifeng Wang. Ernievil 2.0: Multi-view contrastive learning for image-text pre-training. ArXiv, abs\/2209.15270, 2022."},{"key":"e_1_3_2_2_50_1","first-page":"3008","volume-title":"2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW)","author":"Cubuk Ekin Dogus","year":"2019","unstructured":"Ekin Dogus Cubuk, Barret Zoph, Jonathon Shlens, and Quoc V. Le. Randaugment: Practical automated data augmentation with a reduced search space. 2020 IEEE\/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), pages 3008--3017, 2019."},{"key":"e_1_3_2_2_51_1","doi-asserted-by":"publisher","DOI":"10.1145\/3503161.3547910"},{"key":"e_1_3_2_2_52_1","first-page":"2818","volume-title":"2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","author":"Cherti Mehdi","year":"2022","unstructured":"Mehdi Cherti, Romain Beaumont, Ross Wightman, Mitchell Wortsman, Gabriel Ilharco, Cade Gordon, Christoph Schuhmann, Ludwig Schmidt, and Jenia Jitsev. Reproducible scaling laws for contrastive language-image learning. 2023 IEEE\/CVF Conference on Computer Vision and Pattern Recognition (CVPR), pages 2818--2829, 2022."},{"key":"e_1_3_2_2_53_1","volume-title":"Large-scale knowledge enhanced pre-training for language understanding and generation. ArXiv, abs\/2107.02137","author":"Sun Yu","year":"2021","unstructured":"Yu Sun, Shuohuan Wang, Shikun Feng, Siyu Ding, Chao Pang, Junyuan Shang, Jiaxiang Liu, Xuyi Chen, Yanbin Zhao, Yuxiang Lu, Weixin Liu, Zhihua Wu, Weibao Gong, Jianzhong Liang, Zhizhou Shang, Peng Sun, Wei Liu, Ouyang Xuan, Dianhai Yu, Hao Tian, Hua Wu, and Haifeng Wang. Ernie 3.0: Large-scale knowledge enhanced pre-training for language understanding and generation. ArXiv, abs\/2107.02137, 2021."},{"key":"e_1_3_2_2_54_1","volume-title":"October","author":"Xue Linting","year":"2020","unstructured":"Linting Xue, Noah Constant, Adam Roberts, Mihir Kale, Rami Al-Rfou, Aditya Siddhant, Aditya Barua, and Colin Raffel. mT5: A massively multilingual pretrained text-to-text transformer. arXiv e-prints, page arXiv:2010.11934, October 2020."},{"key":"e_1_3_2_2_55_1","volume-title":"Conditional language learning with context. arXiv preprint arXiv:2406.01976","author":"Zhang Xiao","year":"2024","unstructured":"Xiao Zhang, Miao Li, and Ji Wu. Conditional language learning with context. arXiv preprint arXiv:2406.01976, 2024."},{"key":"e_1_3_2_2_56_1","doi-asserted-by":"publisher","DOI":"10.1007\/978-1-4612-4380-9_35"},{"key":"e_1_3_2_2_57_1","doi-asserted-by":"publisher","DOI":"10.1090\/conm\/443\/08555"},{"key":"e_1_3_2_2_58_1","volume-title":"Improving diffusion models's data-corruption resistance using scheduled pseudo-huber loss. arXiv preprint arXiv:2403.16728","author":"Khrapov Artem","year":"2024","unstructured":"Artem Khrapov, Vadim Popov, Tasnima Sadekova, Assel Yermekova, and Mikhail Kudinov. Improving diffusion models's data-corruption resistance using scheduled pseudo-huber loss. arXiv preprint arXiv:2403.16728, 2024."},{"key":"e_1_3_2_2_59_1","doi-asserted-by":"publisher","DOI":"10.1109\/TMM.2019.2896494"},{"key":"e_1_3_2_2_60_1","doi-asserted-by":"publisher","DOI":"10.1145\/3123266.3123366"},{"key":"e_1_3_2_2_61_1","doi-asserted-by":"publisher","DOI":"10.1145\/3447548.3467206"},{"key":"e_1_3_2_2_62_1","volume-title":"Laion-5b: An open large-scale dataset for training next generation image-text models. ArXiv, abs\/2210.08402","author":"Schuhmann Christoph","year":"2022","unstructured":"Christoph Schuhmann, Romain Beaumont, Richard Vencu, Cade Gordon, Ross Wightman, Mehdi Cherti, Theo Coombes, Aarush Katta, Clayton Mullis, Mitchell Wortsman, Patrick Schramowski, Srivatsa Kundurthy, Katherine Crowson, Ludwig Schmidt, Robert Kaczmarczyk, and Jenia Jitsev. Laion-5b: An open large-scale dataset for training next generation image-text models. ArXiv, abs\/2210.08402, 2022."},{"key":"e_1_3_2_2_63_1","volume-title":"Localization, Text Reading, and Beyond. arXiv e-prints, page arXiv:2308.12966","author":"Bai Jinze","year":"2023","unstructured":"Jinze Bai, Shuai Bai, Shusheng Yang, ShijieWang, Sinan Tan, PengWang, Junyang Lin, Chang Zhou, and Jingren Zhou. Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond. arXiv e-prints, page arXiv:2308.12966, August 2023."}],"event":{"name":"KDD '25: The 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining","sponsor":["SIGMOD ACM Special Interest Group on Management of Data","SIGKDD ACM Special Interest Group on Knowledge Discovery in Data"],"location":"Toronto ON Canada","acronym":"KDD '25"},"container-title":["Proceedings of the 31st ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.1"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3690624.3709401","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3690624.3709401","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,16]],"date-time":"2025-08-16T15:34:19Z","timestamp":1755358459000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3690624.3709401"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,7,20]]},"references-count":63,"alternative-id":["10.1145\/3690624.3709401","10.1145\/3690624"],"URL":"https:\/\/doi.org\/10.1145\/3690624.3709401","relation":{},"subject":[],"published":{"date-parts":[[2025,7,20]]},"assertion":[{"value":"2025-07-20","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}