{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T04:04:28Z","timestamp":1784261068575,"version":"3.55.0"},"publisher-location":"New York, NY, USA","reference-count":101,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,6,9]],"date-time":"2024-06-09T00:00:00Z","timestamp":1717891200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,6,9]]},"DOI":"10.1145\/3626246.3653385","type":"proceedings-article","created":{"date-parts":[[2024,5,23]],"date-time":"2024-05-23T10:26:39Z","timestamp":1716459999000},"page":"120-134","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":34,"title":["Data-Juicer: A One-Stop Data Processing System for Large Language Models"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8015-2121","authenticated-orcid":false,"given":"Daoyuan","family":"Chen","sequence":"first","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-1845-5535","authenticated-orcid":false,"given":"Yilun","family":"Huang","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-8674-5351","authenticated-orcid":false,"given":"Zhijian","family":"Ma","sequence":"additional","affiliation":[{"name":"Alibaba Group, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0009-3434-4809","authenticated-orcid":false,"given":"Hesen","family":"Chen","sequence":"additional","affiliation":[{"name":"Alibaba Group, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0002-0081-5405","authenticated-orcid":false,"given":"Xuchen","family":"Pan","sequence":"additional","affiliation":[{"name":"Alibaba Group, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-4312-0152","authenticated-orcid":false,"given":"Ce","family":"Ge","sequence":"additional","affiliation":[{"name":"Alibaba Group, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0007-3882-5189","authenticated-orcid":false,"given":"Dawei","family":"Gao","sequence":"additional","affiliation":[{"name":"Alibaba Group, Beijing, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0009-0005-6545-7882","authenticated-orcid":false,"given":"Yuexiang","family":"Xie","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-8820-5531","authenticated-orcid":false,"given":"Zhaoyang","family":"Liu","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0001-8247-1196","authenticated-orcid":false,"given":"Jinyang","family":"Gao","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4204-6096","authenticated-orcid":false,"given":"Yaliang","family":"Li","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0003-1535-9692","authenticated-orcid":false,"given":"Bolin","family":"Ding","sequence":"additional","affiliation":[{"name":"Alibaba Group, seattle, USA"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-4220-2634","authenticated-orcid":false,"given":"Jingren","family":"Zhou","sequence":"additional","affiliation":[{"name":"Alibaba Group, Hangzhou, China"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"320","published-online":{"date-parts":[[2024,6,9]]},"reference":[{"key":"e_1_3_2_1_1_1","unstructured":"Extended version of this paper. https:\/\/arxiv.org\/abs\/2309.02033."},{"key":"e_1_3_2_1_2_1","unstructured":"Ebtesam Almazrouei Hamza Alobeidli Abdulaziz Alshamsi Alessandro Cappelli Ruxandra Cojocaru Merouane Debbah Etienne Goffinet Daniel Heslow Julien Launay Quentin Malartic Badreddine Noune Baptiste Pannier and Guilherme Penedo. 2023. Falcon-40B: an open large language model with state-of-the-art performance. (2023)."},{"key":"e_1_3_2_1_3_1","unstructured":"Apache Arrow. 2023. https:\/\/arrow.apache.org\/"},{"key":"e_1_3_2_1_4_1","volume-title":"A General Language Assistant as a Laboratory for Alignment. CoRR abs\/2112.00861","author":"Askell Amanda","year":"2021","unstructured":"Amanda Askell, Yuntao Bai, Anna Chen, Dawn Drain, Deep Ganguli, Tom Henighan, Andy Jones, Nicholas Joseph, Benjamin Mann, Nova DasSarma, Nelson Elhage, Zac Hatfield-Dodds, Danny Hernandez, Jackson Kernion, Kamal Ndousse, Catherine Olsson, Dario Amodei, Tom B. Brown, Jack Clark, Sam McCandlish, Chris Olah, and Jared Kaplan. 2021. A General Language Assistant as a Laboratory for Alignment. CoRR abs\/2112.00861 (2021)."},{"key":"e_1_3_2_1_5_1","unstructured":"Stephen H. Bach Victor Sanh Zheng Xin Yong Albert Webson Colin Raffel Nihal V. Nayak Abheesht Sharma Taewoon Kim M. Saiful Bari Thibault F\u00e9vry Zaid Alyafeai Manan Dey Andrea Santilli Zhiqing Sun Srulik Ben-David Canwen Xu Gunjan Chhablani Han Wang Jason Alan Fries Maged Saeed AlShaibani Shanya Sharma Urmish Thakker Khalid Almubarak Xiangru Tang Dragomir R. Radev Mike Tian-Jian Jiang and Alexander M. Rush. 2022. Prompt-Source: An Integrated Development Environment and Repository for Natural Language Prompts. In ACL (demo). 93--104."},{"key":"e_1_3_2_1_6_1","unstructured":"Jiamu Bai Daoyuan Chen Bingchen Qian Liuyi Yao and Yaliang Li. 2024. Federated Fine-tuning of Large Language Models under Heterogeneous Language Tasks and Client Resources. arXiv:2402.11505 [cs.CL]"},{"key":"e_1_3_2_1_7_1","first-page":"2397","article-title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","volume":"202","author":"Biderman Stella","year":"2023","unstructured":"Stella Biderman, Hailey Schoelkopf, Quentin Gregory Anthony, Herbie Bradley, Kyle O'Brien, Eric Hallahan, Mohammad Aflah Khan, Shivanshu Purohit, USVSN Sai Prashanth, Edward Raff, Aviya Skowron, Lintang Sutawika, and Oskar van der Wal. 2023. Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling. In ICML, Vol. 202. 2397--2430.","journal-title":"ICML"},{"key":"e_1_3_2_1_8_1","volume-title":"Shivanshu Purohit, Laria Reynolds, Jonathan Tow, Ben Wang, and Samuel Weinbach.","author":"Black Sid","year":"2022","unstructured":"Sid Black, Stella Biderman, Eric Hallahan, Quentin Anthony, Leo Gao, Laurence Golding, Horace He, Connor Leahy, Kyle McDonell, Jason Phang, Michael Pieler, USVSN Sai Prashanth, Shivanshu Purohit, Laria Reynolds, Jonathan Tow, Ben Wang, and Samuel Weinbach. 2022. GPT-NeoX-20B: An Open-Source Autoregressive Language Model. CoRR abs\/2204.06745 (2022)."},{"key":"e_1_3_2_1_9_1","doi-asserted-by":"publisher","DOI":"10.1006\/jcss.1999.1690"},{"key":"e_1_3_2_1_10_1","unstructured":"Tom B. Brown Benjamin Mann Nick Ryder Melanie Subbiah Jared Kaplan Prafulla Dhariwal Arvind Neelakantan Pranav Shyam Girish Sastry Amanda Askell Sandhini Agarwal Ariel Herbert-Voss Gretchen Krueger Tom Henighan Rewon Child Aditya Ramesh Daniel M. Ziegler Jeffrey Wu Clemens Winter Christopher Hesse Mark Chen Eric Sigler Mateusz Litwin Scott Gray Benjamin Chess Jack Clark Christopher Berner Sam McCandlish Alec Radford Ilya Sutskever and Dario Amodei. 2020. Language Models are Few-Shot Learners. In NeurIPS."},{"key":"e_1_3_2_1_11_1","volume-title":"Yuanzhi Li, Scott M. Lundberg, Harsha Nori, Hamid Palangi, Marco T\u00falio Ribeiro, and Yi Zhang.","author":"Bubeck S\u00e9bastien","year":"2023","unstructured":"S\u00e9bastien Bubeck, Varun Chandrasekaran, Ronen Eldan, Johannes Gehrke, Eric Horvitz, Ece Kamar, Peter Lee, Yin Tat Lee, Yuanzhi Li, Scott M. Lundberg, Harsha Nori, Hamid Palangi, Marco T\u00falio Ribeiro, and Yi Zhang. 2023. Sparks of Artificial General Intelligence: Early experiments with GPT-4. CoRR abs\/2303.12712 (2023)."},{"key":"e_1_3_2_1_12_1","volume-title":"Large Language Models as Tool Makers. CoRR abs\/2305.17126","author":"Cai Tianle","year":"2023","unstructured":"Tianle Cai, Xuezhi Wang, Tengyu Ma, Xinyun Chen, and Denny Zhou. 2023. Large Language Models as Tool Makers. CoRR abs\/2305.17126 (2023)."},{"key":"e_1_3_2_1_13_1","unstructured":"Nicholas Carlini Daphne Ippolito Matthew Jagielski Katherine Lee Florian Tram\u00e8r and Chiyuan Zhang. 2023. Quantifying Memorization Across Neural Language Models. In ICLR."},{"key":"e_1_3_2_1_14_1","doi-asserted-by":"crossref","unstructured":"Moses S. Charikar. 2002. Similarity Estimation Techniques from Rounding Algorithms. In STOC. 380--388.","DOI":"10.1145\/509907.509965"},{"key":"e_1_3_2_1_15_1","volume-title":"AlpaGasus: Training A Better Alpaca with Fewer Data. CoRR abs\/2307.08701","author":"Chen Lichang","year":"2023","unstructured":"Lichang Chen, Shiyang Li, Jun Yan, Hai Wang, Kalpa Gunaratna, Vikas Yadav, Zheng Tang, Vijay Srinivasan, Tianyi Zhou, Heng Huang, and Hongxia Jin. 2023. AlpaGasus: Training A Better Alpaca with Fewer Data. CoRR abs\/2307.08701 (2023)."},{"key":"e_1_3_2_1_16_1","unstructured":"Mark Chen Jerry Tworek Heewoo Jun Qiming Yuan Henrique Pond\u00e9 de Oliveira Pinto Jared Kaplan Harrison Edwards Yuri Burda Nicholas Joseph Greg Brockman Alex Ray Raul Puri Gretchen Krueger Michael Petrov Heidy Khlaaf Girish Sastry Pamela Mishkin Brooke Chan Scott Gray Nick Ryder Mikhail Pavlov Alethea Power Lukasz Kaiser Mohammad Bavarian Clemens Winter Philippe Tillet Felipe Petroski Such Dave Cummings Matthias Plappert Fotios Chantzis Elizabeth Barnes Ariel Herbert-Voss William Hebgen Guss Alex Nichol Alex Paino Nikolas Tezak Jie Tang Igor Babuschkin Suchir Balaji Shantanu Jain William Saunders Christopher Hesse Andrew N. Carr Jan Leike Joshua Achiam Vedant Misra Evan Morikawa Alec Radford Matthew Knight Miles Brundage Mira Murati Katie Mayer PeterWelinder Bob McGrew Dario Amodei Sam McCandlish Ilya Sutskever and Wojciech Zaremba. 2021. Evaluating Large Language Models Trained on Code. CoRR abs\/2107.03374 (2021)."},{"key":"e_1_3_2_1_17_1","volume-title":"Xing","author":"Chiang Wei-Lin","year":"2023","unstructured":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E. Gonzalez, Ion Stoica, and Eric P. Xing. 2023. Vicuna: An Open-Source Chatbot Impressing GPT-4 with 90%* ChatGPT Quality. https:\/\/vicuna.lmsys.org"},{"key":"e_1_3_2_1_18_1","unstructured":"Hyung Won Chung Le Hou Shayne Longpre Barret Zoph Yi Tay William Fedus Eric Li XuezhiWang Mostafa Dehghani Siddhartha Brahma AlbertWebson Shixiang Shane Gu Zhuyun Dai Mirac Suzgun Xinyun Chen Aakanksha Chowdhery Sharan Narang Gaurav Mishra Adams Yu Vincent Y. Zhao Yanping Huang Andrew M. Dai Hongkun Yu Slav Petrov Ed H. Chi Jeff Dean Jacob Devlin Adam Roberts Denny Zhou Quoc V. Le and Jason Wei. 2022. Scaling Instruction-Finetuned Language Models. CoRR abs\/2210.11416 (2022)."},{"key":"e_1_3_2_1_19_1","unstructured":"Alibaba Cloud. 2023. https:\/\/tongyi.aliyun.com"},{"key":"e_1_3_2_1_20_1","unstructured":"Alibaba Cloud. 2023. https:\/\/www.alibabacloud.com\/en\/product\/machinelearning"},{"key":"e_1_3_2_1_21_1","doi-asserted-by":"crossref","unstructured":"Yann Collet and Murray Kucherawy. 2021. Zstandard Compression and the 'application\/zstd' Media Type. RFC 8878.","DOI":"10.17487\/RFC8878"},{"key":"e_1_3_2_1_22_1","unstructured":"Together Computer. 2023. RedPajama: An Open Source Recipe to Reproduce LLaMA training dataset. https:\/\/github.com\/togethercomputer\/RedPajama-Data"},{"key":"e_1_3_2_1_23_1","doi-asserted-by":"publisher","DOI":"10.1038\/s41467-021-22381-z"},{"key":"e_1_3_2_1_24_1","unstructured":"Common Crawl. 2023. https:\/\/commoncrawl.org\/"},{"key":"e_1_3_2_1_25_1","volume-title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT (1). 4171--4186.","author":"Devlin Jacob","year":"2019","unstructured":"Jacob Devlin, Ming-Wei Chang, Kenton Lee, and Kristina Toutanova. 2019. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. In NAACL-HLT (1). 4171--4186."},{"key":"e_1_3_2_1_26_1","unstructured":"Nan Du Yanping Huang Andrew M. Dai Simon Tong Dmitry Lepikhin Yuanzhong Xu Maxim Krikun Yanqi Zhou Adams Wei Yu Orhan Firat Barret Zoph Liam Fedus Maarten P. Bosma Zongwei Zhou Tao Wang Yu Emma Wang KellieWebster Marie Pellat Kevin Robinson Kathleen S. Meier-Hellstern Toju Duke Lucas Dixon Kun Zhang Quoc V. Le Yonghui Wu Zhifeng Chen and Claire Cui. 2022. GLaM: Efficient Scaling of Language Models with Mixture-of-Experts. In ICML. 5547--5569."},{"key":"e_1_3_2_1_27_1","unstructured":"EleutherAI. 2023. Pythia-1.4B. https:\/\/huggingface.co\/EleutherAI\/pythia-1.4b"},{"key":"e_1_3_2_1_28_1","volume-title":"Towards Revealing the Mystery behind Chain of Thought: a Theoretical Perspective. CoRR abs\/2305.15408","author":"Feng Guhao","year":"2023","unstructured":"Guhao Feng, Bohang Zhang, Yuntian Gu, Haotian Ye, Di He, and Liwei Wang. 2023. Towards Revealing the Mystery behind Chain of Thought: a Theoretical Perspective. CoRR abs\/2305.15408 (2023)."},{"key":"e_1_3_2_1_29_1","volume-title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling. CoRR abs\/2101.00027","author":"Gao Leo","year":"2021","unstructured":"Leo Gao, Stella Biderman, Sid Black, Laurence Golding, Travis Hoppe, Charles Foster, Jason Phang, Horace He, Anish Thite, Noa Nabeshima, Shawn Presser, and Connor Leahy. 2021. The Pile: An 800GB Dataset of Diverse Text for Language Modeling. CoRR abs\/2101.00027 (2021)."},{"key":"e_1_3_2_1_30_1","unstructured":"Leo Gao Jonathan Tow Stella Biderman Sid Black Anthony DiPofi Charles Foster Laurence Golding Jeffrey Hsu Kyle McDonell Niklas Muennighoff Jason Phang Laria Reynolds Eric Tang Anish Thite Ben Wang Kevin Wang and Andy Zou. 2021. A framework for few-shot language model evaluation."},{"key":"e_1_3_2_1_31_1","volume-title":"Smith","author":"Gehman Samuel","year":"2020","unstructured":"Samuel Gehman, Suchin Gururangan, Maarten Sap, Yejin Choi, and Noah A. Smith. 2020. RealToxicityPrompts: Evaluating Neural Toxic Degeneration in Language Models. In EMNLP (Findings). 3356--3369."},{"key":"e_1_3_2_1_32_1","unstructured":"Xinyang Geng and Hao Liu. 2023. OpenLLaMA: An Open Reproduction of LLaMA. https:\/\/github.com\/openlm-research\/open_llama"},{"key":"e_1_3_2_1_33_1","unstructured":"Suriya Gunasekar Yi Zhang Jyoti Aneja Caio C\u00e9sar Teodoro Mendes Allie Del Giorno Sivakanth Gopi Mojan Javaheripi Piero Kauffmann Gustavo de Rosa Olli Saarikivi Adil Salim Shital Shah Harkirat Singh Behl XinWang S\u00e9bastien Bubeck Ronen Eldan Adam Tauman Kalai Yin Tat Lee and Yuanzhi Li. 2023. Textbooks Are All You Need. arXiv:2306.11644 [cs.CL]"},{"key":"e_1_3_2_1_34_1","unstructured":"Project Gutenberg. 2023. https:\/\/www.gutenberg.org\/"},{"key":"e_1_3_2_1_35_1","doi-asserted-by":"publisher","DOI":"10.1016\/j.aiopen.2021.08.002"},{"key":"e_1_3_2_1_36_1","volume-title":"ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings. CoRR abs\/2305.11554","author":"Hao Shibo","year":"2023","unstructured":"Shibo Hao, Tianyang Liu, Zhen Wang, and Zhiting Hu. 2023. ToolkenGPT: Augmenting Frozen Language Models with Massive Tools via Tool Embeddings. CoRR abs\/2305.11554 (2023)."},{"key":"e_1_3_2_1_37_1","unstructured":"Dan Hendrycks Collin Burns Steven Basart Andy Zou Mantas Mazeika Dawn Song and Jacob Steinhardt. 2021. Measuring Massive Multitask Language Understanding. In ICLR."},{"key":"e_1_3_2_1_38_1","volume-title":"Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor. CoRR abs\/2212.09689","author":"Honovich Or","year":"2022","unstructured":"Or Honovich, Thomas Scialom, Omer Levy, and Timo Schick. 2022. Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor. CoRR abs\/2212.09689 (2022)."},{"key":"e_1_3_2_1_39_1","unstructured":"Technology Innovation Institute. 2023. Falcon-RW-1B. https:\/\/huggingface.co\/tiiuae\/falcon-rw-1b"},{"key":"e_1_3_2_1_40_1","unstructured":"Technology Innovation Institute. 2023. Falcon-RW-1B. https:\/\/huggingface.co\/FlagAlpha\/Atom-7B"},{"key":"e_1_3_2_1_41_1","volume-title":"Few-shot Learning with Retrieval Augmented Language Models. CoRR abs\/2208.03299","author":"Izacard Gautier","year":"2022","unstructured":"Gautier Izacard, Patrick S. H. Lewis, Maria Lomeli, Lucas Hosseini, Fabio Petroni, Timo Schick, Jane Dwivedi-Yu, Armand Joulin, Sebastian Riedel, and Edouard Grave. 2022. Few-shot Learning with Retrieval Augmented Language Models. CoRR abs\/2208.03299 (2022)."},{"key":"e_1_3_2_1_42_1","volume-title":"Ruhi Sharma Mittal, and Vitobha Munigala","author":"Jain Abhinav","year":"2020","unstructured":"Abhinav Jain, Hima Patel, Lokesh Nagalapatti, Nitin Gupta, Sameep Mehta, Shanmukha Guttula, Shashank Mujumdar, Shazia Afzal, Ruhi Sharma Mittal, and Vitobha Munigala. 2020. Overview and importance of data quality for machine learning tasks. In KDD. 3561--3562."},{"key":"e_1_3_2_1_43_1","volume-title":"BELLE: Be Everyone's Large Language model Engine. https:\/\/github.com\/LianjiaTech\/BELLE.","author":"Ji Yunjie","year":"2023","unstructured":"Yunjie Ji, Yong Deng, Yan Gong, Yiping Peng, Qiang Niu, Baochang Ma, and Xiangang Li. 2023. BELLE: Be Everyone's Large Language model Engine. https:\/\/github.com\/LianjiaTech\/BELLE."},{"key":"e_1_3_2_1_44_1","unstructured":"Qirui Jiao Daoyuan Chen Yilun Huang Yaliang Li and Ying Shen. 2024. Enhancing Multimodal Large Language Models with Vision Detection Models: An Empirical Study. arXiv:2401.17981 [cs.CV]"},{"key":"e_1_3_2_1_45_1","unstructured":"jsonargparse. 2023. https:\/\/github.com\/omni-us\/jsonargparse"},{"key":"e_1_3_2_1_46_1","unstructured":"Nikhil Kandpal Eric Wallace and Colin Raffel. 2022. Deduplicating Training Data Mitigates Privacy Risks in Language Models. In ICML. 10697--10707."},{"key":"e_1_3_2_1_47_1","volume-title":"Oliver Stanley, Rich\u00e1rd Nagyfi, Shahul ES, Sameer Suri, David Glushkov, Arnav Dantuluri, Andrew Maguire, Christoph Schuhmann, Huu Nguyen, and Alexander Mattick.","author":"K\u00f6pf Andreas","year":"2023","unstructured":"Andreas K\u00f6pf, Yannic Kilcher, Dimitri von R\u00fctte, Sotiris Anagnostidis, Zhi-Rui Tam, Keith Stevens, Abdullah Barhoum, Nguyen Minh Duc, Oliver Stanley, Rich\u00e1rd Nagyfi, Shahul ES, Sameer Suri, David Glushkov, Arnav Dantuluri, Andrew Maguire, Christoph Schuhmann, Huu Nguyen, and Alexander Mattick. 2023. OpenAssistant Conversations - Democratizing Large Language Model Alignment. CoRR abs\/2304.07327 (2023)."},{"key":"e_1_3_2_1_48_1","doi-asserted-by":"crossref","unstructured":"Taku Kudo and John Richardson. 2018. SentencePiece: A simple and language independent subword tokenizer and detokenizer for Neural Text Processing. In EMNLP.","DOI":"10.18653\/v1\/D18-2012"},{"key":"e_1_3_2_1_49_1","unstructured":"Hugo Lauren\u00e7on Lucile Saulnier Thomas Wang Christopher Akiki Albert Villanova del Moral Teven Le Scao Leandro von Werra Chenghao Mou Eduardo Gonz\u00e1lez Ponferrada Huu Nguyen J\u00f6rg Frohberg Mario Sasko Quentin Lhoest Angelina McMillan-Major G\u00e9rard Dupont Stella Biderman Anna Rogers Loubna Ben Allal Francesco De Toni Giada Pistilli Olivier Nguyen Somaieh Nikpoor Maraim Masoud Pierre Colombo Javier de la Rosa Paulo Villegas Tristan Thrush Shayne Longpre Sebastian Nagel Leon Weber Manuel Mu\u00f1oz Jian Zhu Daniel van Strien Zaid Alyafeai Khalid Almubarak Minh Chien Vu Itziar Gonzalez-Dios Aitor Soroa Kyle Lo Manan Dey Pedro Ortiz Suarez Aaron Gokaslan Shamik Bose David Ifeoluwa Adelani Long Phan Hieu Tran Ian Yu Suhas Pai Jenny Chim Violette Lepercq Suzana Ilic Margaret Mitchell Alexandra Sasha Luccioni and Yacine Jernite. 2022. The BigScience ROOTS Corpus: A 1.6TB Composite Multilingual Dataset. In NeurIPS."},{"key":"e_1_3_2_1_50_1","unstructured":"Katherine Lee Daphne Ippolito Andrew Nystrom Chiyuan Zhang Douglas Eck Chris Callison-Burch and Nicholas Carlini. 2022. Deduplicating Training Data Makes Language Models Better. In ACL (1). 8424--8445."},{"key":"e_1_3_2_1_51_1","doi-asserted-by":"crossref","unstructured":"Brian Lester Rami Al-Rfou and Noah Constant. 2021. The Power of Scale for Parameter-Efficient Prompt Tuning. In EMNLP (1). 3045--3059.","DOI":"10.18653\/v1\/2021.emnlp-main.243"},{"key":"e_1_3_2_1_52_1","volume-title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. In ACL. 7871--7880.","author":"Lewis Mike","year":"2020","unstructured":"Mike Lewis, Yinhan Liu, Naman Goyal, Marjan Ghazvininejad, Abdelrahman Mohamed, Omer Levy, Veselin Stoyanov, and Luke Zettlemoyer. 2020. BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension. In ACL. 7871--7880."},{"key":"e_1_3_2_1_53_1","doi-asserted-by":"crossref","unstructured":"Quentin Lhoest Albert Villanova del Moral Yacine Jernite Abhishek Thakur Patrick von Platen Suraj Patil Julien Chaumond Mariama Drame Julien Plu Lewis Tunstall Joe Davison Mario Sasko Gunjan Chhablani Bhavitvya Malik Simon Brandeis Teven Le Scao Victor Sanh Canwen Xu Nicolas Patry Angelina McMillan-Major Philipp Schmid Sylvain Gugger Cl\u00e9ment Delangue Th\u00e9o Matussi\u00e8re Lysandre Debut Stas Bekman Pierric Cistac Thibault Goehringer Victor Mustar Fran\u00e7ois Lagunas Alexander M. Rush and Thomas Wolf. 2021. Datasets: A Community Library for Natural Language Processing. In EMNLP (Demos). 175--184.","DOI":"10.18653\/v1\/2021.emnlp-demo.21"},{"key":"e_1_3_2_1_54_1","article-title":"Hyperband: A novel bandit-based approach to hyperparameter optimization","volume":"18","author":"Li Lisha","year":"2017","unstructured":"Lisha Li, Kevin Jamieson, Giulia DeSalvo, Afshin Rostamizadeh, and Ameet Talwalkar. 2017. Hyperband: A novel bandit-based approach to hyperparameter optimization. J. Mach. Learn. Res. 18 (2017), 185:1--185:52.","journal-title":"J. Mach. Learn. Res."},{"key":"e_1_3_2_1_55_1","unstructured":"Raymond Li Loubna Ben Allal Yangtian Zi Niklas Muennighoff Denis Kocetkov Chenghao Mou Marc Marone Christopher Akiki Jia Li Jenny Chim Qian Liu Evgenii Zheltonozhskii Terry Yue Zhuo Thomas Wang Olivier Dehaene Mishig Davaadorj Joel Lamy-Poirier Jo\u00e3o Monteiro Oleh Shliazhko Nicolas Gontier Nicholas Meade Armel Zebaze Ming-Ho Yee Logesh Kumar Umapathi Jian Zhu Benjamin Lipkin Muhtasham Oblokulov Zhiruo Wang Rudra Murthy V Jason Stillerman Siva Sankalp Patel Dmitry Abulkhanov Marco Zocca Manan Dey Zhihan Zhang Nour Fahmy Urvashi Bhattacharyya Wenhao Yu Swayam Singh Sasha Luccioni Paulo Villegas Maxim Kunakov Fedor Zhdanov Manuel Romero Tony Lee Nadav Timor Jennifer Ding Claire Schlesinger Hailey Schoelkopf Jan Ebert Tri Dao Mayank Mishra Alex Gu Jennifer Robinson Carolyn Jane Anderson Brendan Dolan-Gavitt Danish Contractor Siva Reddy Daniel Fried Dzmitry Bahdanau Yacine Jernite Carlos Mu\u00f1oz Ferrandis Sean Hughes Thomas Wolf Arjun Guha Leandro von Werra and Harm de Vries. 2023. StarCoder: may the source be with you! CoRR abs\/2305.06161 (2023)."},{"key":"e_1_3_2_1_56_1","volume-title":"ChatDoctor: A Medical Chat Model Fine-tuned on LLaMA Model using Medical Domain Knowledge. CoRR abs\/2303.14070","author":"Li Yunxiang","year":"2023","unstructured":"Yunxiang Li, Zihan Li, Kai Zhang, Ruilong Dan, and You Zhang. 2023. ChatDoctor: A Medical Chat Model Fine-tuned on LLaMA Model using Medical Domain Knowledge. CoRR abs\/2303.14070 (2023)."},{"key":"e_1_3_2_1_57_1","volume-title":"Shibani Santurkar, Surya Ganguli, Tatsunori Hashimoto, Thomas Icard, Tianyi Zhang, Vishrav Chaudhary, William Wang, Xuechen Li, Yifan Mai, Yuhui Zhang, and Yuta Koreeda.","author":"Liang Percy","year":"2022","unstructured":"Percy Liang, Rishi Bommasani, Tony Lee, Dimitris Tsipras, Dilara Soylu, Michihiro Yasunaga, Yian Zhang, Deepak Narayanan, Yuhuai Wu, Ananya Kumar, Benjamin Newman, Binhang Yuan, Bobby Yan, Ce Zhang, Christian Cosgrove, Christopher D. Manning, Christopher R\u00e9, Diana Acosta-Navas, Drew A. Hudson, Eric Zelikman, Esin Durmus, Faisal Ladhak, Frieda Rong, Hongyu Ren, Huaxiu Yao, Jue Wang, Keshav Santhanam, Laurel Orr, Lucia Zheng, Mert Yuksekgonul, Mirac Suzgun, Nathan Kim, Neel Guha, Niladri Chatterji, Omar Khattab, Peter Henderson, Qian Huang, Ryan Chi, Sang Michael Xie, Shibani Santurkar, Surya Ganguli, Tatsunori Hashimoto, Thomas Icard, Tianyi Zhang, Vishrav Chaudhary, William Wang, Xuechen Li, Yifan Mai, Yuhui Zhang, and Yuta Koreeda. 2022. Holistic Evaluation of Language Models. CoRR abs\/2211.09110 (2022)."},{"key":"e_1_3_2_1_58_1","doi-asserted-by":"crossref","unstructured":"Zhenqing Ling Daoyuan Chen Liuyi Yao Yaliang Li and Ying Shen. 2024. On the Convergence of Zeroth-Order Federated Tuning for Large Language Models. arXiv:2402.05926 [cs.LG]","DOI":"10.1145\/3637528.3671865"},{"key":"e_1_3_2_1_59_1","unstructured":"Mengsha Liu Daoyuan Chen Yaliang Li Guian Fang and Ying Shen. 2024. ChartThinker: A Contextual Chain-of-Thought Approach to Optimized Chart Summarization. arXiv:2403.11236 [cs.CL]"},{"key":"e_1_3_2_1_60_1","volume-title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment. CoRR abs\/2303.16634","author":"Liu Yang","year":"2023","unstructured":"Yang Liu, Dan Iter, Yichong Xu, Shuohang Wang, Ruochen Xu, and Chenguang Zhu. 2023. G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment. CoRR abs\/2303.16634 (2023)."},{"key":"e_1_3_2_1_61_1","volume-title":"Yi Tay, Denny Zhou, Quoc V. Le, Barret Zoph, Jason Wei, and Adam Roberts.","author":"Longpre Shayne","year":"2023","unstructured":"Shayne Longpre, Le Hou, Tu Vu, Albert Webson, Hyung Won Chung, Yi Tay, Denny Zhou, Quoc V. Le, Barret Zoph, Jason Wei, and Adam Roberts. 2023. The Flan Collection: Designing Data and Methods for Effective Instruction Tuning. CoRR abs\/2301.13688 (2023)."},{"key":"e_1_3_2_1_62_1","volume-title":"Domain Coverage, Quality, & Toxicity. CoRR abs\/2305.13169","author":"Longpre Shayne","year":"2023","unstructured":"Shayne Longpre, Gregory Yauney, Emily Reif, Katherine Lee, Adam Roberts, Barret Zoph, Denny Zhou, Jason Wei, Kevin Robinson, David Mimno, and Daphne Ippolito. 2023. A Pretrainer's Guide to Training Data: Measuring the Effects of Data Age, Domain Coverage, Quality, & Toxicity. CoRR abs\/2305.13169 (2023)."},{"key":"e_1_3_2_1_63_1","unstructured":"LZ4. 2023. https:\/\/www.lz4.org\/"},{"key":"e_1_3_2_1_64_1","volume-title":"On the Educational Impact of ChatGPT: Is Artificial Intelligence Ready to Obtain a University Degree? CoRR abs\/2303.11146","author":"Malinka Kamil","year":"2023","unstructured":"Kamil Malinka, Martin Peres\u00edni, Anton Firc, Ondrej Hujnak, and Filip Janus. 2023. On the Educational Impact of ChatGPT: Is Artificial Intelligence Ready to Obtain a University Degree? CoRR abs\/2303.11146 (2023)."},{"key":"e_1_3_2_1_65_1","volume-title":"Ray: A Distributed Framework for Emerging AI Applications. In OSDI. 561--577.","author":"Moritz Philipp","year":"2018","unstructured":"Philipp Moritz, Robert Nishihara, Stephanie Wang, Alexey Tumanov, Richard Liaw, Eric Liang, Melih Elibol, Zongheng Yang, William Paul, Michael I. Jordan, and Ion Stoica. 2018. Ray: A Distributed Framework for Emerging AI Applications. In OSDI. 561--577."},{"key":"e_1_3_2_1_66_1","unstructured":"Erik Nijkamp Bo Pang Hiroaki Hayashi Lifu Tu Huan Wang Yingbo Zhou Silvio Savarese and Caiming Xiong. 2023. CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis. In ICLR."},{"key":"e_1_3_2_1_67_1","volume-title":"Our approach to alignment research. OpenAI Blog (August","author":"AI.","year":"2022","unstructured":"OpenAI. 2022. Our approach to alignment research. OpenAI Blog (August 2022)."},{"key":"e_1_3_2_1_68_1","unstructured":"OpenAI. 2023. GPT-4 Technical Report. CoRR abs\/2303.08774 (2023)."},{"key":"e_1_3_2_1_69_1","unstructured":"Long Ouyang Jeffrey Wu Xu Jiang Diogo Almeida Carroll L. Wainwright Pamela Mishkin Chong Zhang Sandhini Agarwal Katarina Slama Alex Ray John Schulman Jacob Hilton Fraser Kelton Luke Miller Maddie Simens Amanda Askell Peter Welinder Paul F. Christiano Jan Leike and Ryan Lowe. 2022. Training language models to follow instructions with human feedback. In NeurIPS."},{"key":"e_1_3_2_1_70_1","volume-title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only. CoRR abs\/2306.01116","author":"Penedo Guilherme","year":"2023","unstructured":"Guilherme Penedo, Quentin Malartic, Daniel Hesslow, Ruxandra Cojocaru, Alessandro Cappelli, Hamza Alobeidli, Baptiste Pannier, Ebtesam Almazrouei, and Julien Launay. 2023. The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only. CoRR abs\/2306.01116 (2023)."},{"key":"e_1_3_2_1_71_1","doi-asserted-by":"crossref","unstructured":"Matthew E. Peters Mark Neumann Mohit Iyyer Matt Gardner Christopher Clark Kenton Lee and Luke Zettlemoyer. 2018. Deep Contextualized Word Representations. In NAACL-HLT. 2227--2237.","DOI":"10.18653\/v1\/N18-1202"},{"key":"e_1_3_2_1_72_1","doi-asserted-by":"crossref","unstructured":"Shuofei Qiao Yixin Ou Ningyu Zhang Xiang Chen Yunzhi Yao Shumin Deng Chuanqi Tan Fei Huang and Huajun Chen. 2023. Reasoning with Language Model Prompting: A Survey. arXiv:2212.09597 [cs.CL]","DOI":"10.18653\/v1\/2023.acl-long.294"},{"key":"e_1_3_2_1_73_1","unstructured":"Zhen Qin Daoyuan Chen Bingchen Qian Bolin Ding Yaliang Li and Shuiguang Deng. 2024. Federated Full-Parameter Tuning of Billion-Sized Language Models with Communication Cost under 18 Kilobytes. arXiv:2312.06353 [cs.LG]"},{"key":"e_1_3_2_1_74_1","unstructured":"Alec Radford Karthik Narasimhan Tim Salimans Ilya Sutskever et al. 2018. Improving language understanding by generative pre-training. (2018)."},{"key":"e_1_3_2_1_75_1","unstructured":"Alec Radford Jeffrey Wu Rewon Child David Luan Dario Amodei Ilya Sutskever et al. 2019. Language models are unsupervised multitask learners. OpenAI blog 1 8 (2019) 9."},{"key":"e_1_3_2_1_76_1","volume-title":"Liu","author":"Raffel Colin","year":"2020","unstructured":"Colin Raffel, Noam Shazeer, Adam Roberts, Katherine Lee, Sharan Narang, Michael Matena, Yanqi Zhou,Wei Li, and Peter J. Liu. 2020. Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer. J. Mach. Learn. Res. (2020), 140:1--140:67."},{"key":"e_1_3_2_1_77_1","doi-asserted-by":"publisher","DOI":"10.1145\/3394486.3406703"},{"key":"e_1_3_2_1_78_1","unstructured":"Teven Le Scao Angela Fan Christopher Akiki Ellie Pavlick Suzana Ilic Daniel Hesslow Roman Castagn\u00e9 Alexandra Sasha Luccioni Fran\u00e7ois Yvon Matthias Gall\u00e9 Jonathan Tow Alexander M. Rush Stella Biderman Albert Webson Pawan Sasanka Ammanamanchi Thomas Wang Beno\u00eet Sagot Niklas Muennighoff Albert Villanova del Moral Olatunji Ruwase Rachel Bawden Stas Bekman Angelina McMillan-Major Iz Beltagy Huu Nguyen Lucile Saulnier Samson Tan Pedro Ortiz Suarez Victor Sanh Hugo Lauren\u00e7on Yacine Jernite Julien Launay Margaret Mitchell Colin Raffel Aaron Gokaslan Adi Simhi Aitor Soroa Alham Fikri Aji Amit Alfassy Anna Rogers Ariel Kreisberg Nitzav Canwen Xu Chenghao Mou Chris Emezue Christopher Klamm Colin Leong Daniel van Strien David Ifeoluwa Adelani and et al. 2022. BLOOM: A 176BParameter Open-Access Multilingual Language Model. CoRR abs\/2211.05100 (2022)."},{"key":"e_1_3_2_1_79_1","doi-asserted-by":"crossref","unstructured":"Omid Shahmirzadi Adam Lugowski and Kenneth Younge. 2019. Text similarity in vector space models: a comparative study. In ICMLA. 659--666.","DOI":"10.1109\/ICMLA.2019.00120"},{"key":"e_1_3_2_1_80_1","doi-asserted-by":"publisher","DOI":"10.1109\/JPROC.2015.2494218"},{"key":"e_1_3_2_1_81_1","volume-title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism. CoRR abs\/1909.08053","author":"Shoeybi Mohammad","year":"2019","unstructured":"Mohammad Shoeybi, Mostofa Patwary, Raul Puri, Patrick LeGresley, Jared Casper, and Bryan Catanzaro. 2019. Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism. CoRR abs\/1909.08053 (2019)."},{"key":"e_1_3_2_1_82_1","unstructured":"Soldaini Luca and Lo Kyle and Kinney Rodney and Naik Aakanksha and Ravichander Abhilasha and Bhagia Akshita and Groeneveld Dirk and Schwenk Dustin and Magnusson Ian and Chandu Khyathi. 2023. The Dolma Toolkit. Apache 2.0 License Version 0.9.0 https:\/\/github.com\/allenai\/dolma."},{"key":"e_1_3_2_1_83_1","unstructured":"Streamlit. 2023. https:\/\/streamlit.io\/"},{"key":"e_1_3_2_1_84_1","volume-title":"Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. CoRR abs\/2107.02137","author":"Sun Yu","year":"2021","unstructured":"Yu Sun, Shuohuan Wang, Shikun Feng, Siyu Ding, Chao Pang, Junyuan Shang, Jiaxiang Liu, Xuyi Chen, Yanbin Zhao, Yuxiang Lu, Weixin Liu, Zhihua Wu, Weibao Gong, Jianzhong Liang, Zhizhou Shang, Peng Sun, Wei Liu, Xuan Ouyang, Dianhai Yu, Hao Tian, Hua Wu, and Haifeng Wang. 2021. ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation. CoRR abs\/2107.02137 (2021)."},{"key":"e_1_3_2_1_85_1","volume-title":"A Short Survey of Viewing Large Language Models in Legal Aspect. CoRR abs\/2303.09136","author":"Sun Zhongxiang","year":"2023","unstructured":"Zhongxiang Sun. 2023. A Short Survey of Viewing Large Language Models in Legal Aspect. CoRR abs\/2303.09136 (2023)."},{"key":"e_1_3_2_1_86_1","volume-title":"Hashimoto","author":"Taori Rohan","year":"2023","unstructured":"Rohan Taori, Ishaan Gulrajani, Tianyi Zhang, Yann Dubois, Xuechen Li, Carlos Guestrin, Percy Liang, and Tatsunori B. Hashimoto. 2023. Stanford Alpaca: An Instruction-following LLaMA model. https:\/\/github.com\/tatsu-lab\/stanford_ alpaca."},{"key":"e_1_3_2_1_87_1","volume-title":"LLaMA: Open and Efficient Foundation Language Models. CoRR abs\/2302.13971","author":"Touvron Hugo","year":"2023","unstructured":"Hugo Touvron, Thibaut Lavril, Gautier Izacard, Xavier Martinet, Marie-Anne Lachaux, Timoth\u00e9e Lacroix, Baptiste Rozi\u00e8re, Naman Goyal, Eric Hambro, Faisal Azhar, Aur\u00e9lien Rodriguez, Armand Joulin, Edouard Grave, and Guillaume Lample. 2023. LLaMA: Open and Efficient Foundation Language Models. CoRR abs\/2302.13971 (2023)."},{"key":"e_1_3_2_1_88_1","volume-title":"International Conference on Machine Learning, ICML 2022","volume":"22984","author":"Wang Thomas","year":"2022","unstructured":"Thomas Wang, Adam Roberts, Daniel Hesslow, Teven Le Scao, Hyung Won Chung, Iz Beltagy, Julien Launay, and Colin Raffel. 2022. What Language Model Architecture and Pretraining Objective Works Best for Zero-Shot Generalization?. In International Conference on Machine Learning, ICML 2022, 17--23 July 2022, Baltimore, Maryland, USA (Proceedings of Machine Learning Research, Vol. 162). 22964--22984."},{"key":"e_1_3_2_1_89_1","doi-asserted-by":"crossref","unstructured":"YizhongWang Swaroop Mishra Pegah Alipoormolabashi Yeganeh Kordi Amirreza Mirzaei Atharva Naik Arjun Ashok Arut Selvan Dhanasekaran Anjana Arunkumar David Stap Eshaan Pathak Giannis Karamanolakis Haizhi Gary Lai Ishan Purohit Ishani Mondal Jacob Anderson Kirby Kuznia Krima Doshi Kuntal Kumar Pal Maitreya Patel Mehrad Moradshahi Mihir Parmar Mirali Purohit Neeraj Varshney Phani Rohitha Kaza Pulkit Verma Ravsehaj Singh Puri Rushang Karia Savan Doshi Shailaja Keyur Sampat Siddhartha Mishra Sujan Reddy A Sumanta Patro Tanay Dixit and Xudong Shen. 2022. Super-NaturalInstructions: Generalization via Declarative Instructions on 1600 NLP Tasks. In EMNLP. 5085--5109.","DOI":"10.18653\/v1\/2022.emnlp-main.340"},{"key":"e_1_3_2_1_90_1","volume-title":"Le","author":"Wei W.","year":"2023","unstructured":"JerryW.Wei, Le Hou, Andrew K. Lampinen, Xiangning Chen, Da Huang, Yi Tay, Xinyun Chen, Yifeng Lu, Denny Zhou, Tengyu Ma, and Quoc V. Le. 2023. Symbol tuning improves in-context learning in language models. CoRR abs\/2305.08298 (2023)."},{"key":"e_1_3_2_1_91_1","volume-title":"Zero-Shot Information Extraction via Chatting with ChatGPT. CoRR abs\/2302.10205","author":"Wei Xiang","year":"2023","unstructured":"Xiang Wei, Xingyu Cui, Ning Cheng, Xiaobin Wang, Xin Zhang, Shen Huang, Pengjun Xie, Jinan Xu, Yufeng Chen, Meishan Zhang, Yong Jiang, and Wenjuan Han. 2023. Zero-Shot Information Extraction via Chatting with ChatGPT. CoRR abs\/2302.10205 (2023)."},{"key":"e_1_3_2_1_92_1","unstructured":"Wikipedia. 2023. https:\/\/en.wikipedia.org\/wiki\/Main_Page"},{"key":"e_1_3_2_1_93_1","volume-title":"Sylvain Gugger, Mariama Drame, Quentin Lhoest, and Alexander M. Rush.","author":"Wolf Thomas","year":"2020","unstructured":"Thomas Wolf, Lysandre Debut, Victor Sanh, Julien Chaumond, Clement Delangue, Anthony Moi, Pierric Cistac, Tim Rault, R\u00e9mi Louf, Morgan Funtowicz, Joe Davison, Sam Shleifer, Patrick von Platen, Clara Ma, Yacine Jernite, Julien Plu, Canwen Xu, Teven Le Scao, Sylvain Gugger, Mariama Drame, Quentin Lhoest, and Alexander M. Rush. 2020. Transformers: State-of-the-Art Natural Language Processing. In EMNLP (Demos). 38--45."},{"key":"e_1_3_2_1_94_1","volume-title":"BloombergGPT: A Large Language Model for Finance. CoRR abs\/2303.17564","author":"Wu Shijie","year":"2023","unstructured":"Shijie Wu, Ozan Irsoy, Steven Lu, Vadim Dabravolski, Mark Dredze, Sebastian Gehrmann, Prabhanjan Kambadur, David S. Rosenberg, and Gideon Mann. 2023. BloombergGPT: A Large Language Model for Finance. CoRR abs\/2303.17564 (2023)."},{"key":"e_1_3_2_1_95_1","volume-title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining. CoRR abs\/2305.10429","author":"Xie Sang Michael","year":"2023","unstructured":"Sang Michael Xie, Hieu Pham, Xuanyi Dong, Nan Du, Hanxiao Liu, Yifeng Lu, Percy Liang, Quoc V. Le, Tengyu Ma, and AdamsWei Yu. 2023. DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining. CoRR abs\/2305.10429 (2023)."},{"key":"e_1_3_2_1_96_1","volume-title":"FinGPT: Open-Source Financial Large Language Models. CoRR abs\/2306.06031","author":"Yang Hongyang","year":"2023","unstructured":"Hongyang Yang, Xiao-Yang Liu, and Christina Dan Wang. 2023. FinGPT: Open-Source Financial Large Language Models. CoRR abs\/2306.06031 (2023)."},{"key":"e_1_3_2_1_97_1","volume-title":"Zixuan Ma, Yufei Xue, Jidong Zhai, Wenguang Chen, Peng Zhang, Yuxiao Dong, and Jie Tang.","author":"Zeng Aohan","year":"2022","unstructured":"Aohan Zeng, Xiao Liu, Zhengxiao Du, Zihan Wang, Hanyu Lai, Ming Ding, Zhuoyi Yang, Yifan Xu, Wendi Zheng, Xiao Xia, Weng Lam Tam, Zixuan Ma, Yufei Xue, Jidong Zhai, Wenguang Chen, Peng Zhang, Yuxiao Dong, and Jie Tang. 2022. GLM-130B: An Open Bilingual Pre-trained Model. abs\/2210.02414 (2022)."},{"key":"e_1_3_2_1_98_1","volume-title":"Todor Mihaylov, Myle Ott, Sam Shleifer, Kurt Shuster, Daniel Simig, Punit Singh Koura, Anjali Sridhar, TianluWang, and Luke Zettlemoyer.","author":"Zhang Susan","year":"2022","unstructured":"Susan Zhang, Stephen Roller, Naman Goyal, Mikel Artetxe, Moya Chen, Shuohui Chen, Christopher Dewan, Mona T. Diab, Xian Li, Xi Victoria Lin, Todor Mihaylov, Myle Ott, Sam Shleifer, Kurt Shuster, Daniel Simig, Punit Singh Koura, Anjali Sridhar, TianluWang, and Luke Zettlemoyer. 2022. OPT: Open Pre-trained Transformer Language Models. CoRR abs\/2205.01068 (2022)."},{"key":"e_1_3_2_1_99_1","volume-title":"A Survey of Large Language Models. CoRR abs\/2303.18223","author":"Zhao Wayne Xin","year":"2023","unstructured":"Wayne Xin Zhao, Kun Zhou, Junyi Li, Tianyi Tang, Xiaolei Wang, Yupeng Hou, Yingqian Min, Beichen Zhang, Junjie Zhang, Zican Dong, Yifan Du, Chen Yang, Yushuo Chen, Zhipeng Chen, Jinhao Jiang, Ruiyang Ren, Yifan Li, Xinyu Tang, Zikang Liu, Peiyu Liu, Jian-Yun Nie, and Ji-Rong Wen. 2023. A Survey of Large Language Models. CoRR abs\/2303.18223 (2023)."},{"key":"e_1_3_2_1_100_1","volume-title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models. CoRR abs\/2304.06364","author":"Zhong Wanjun","year":"2023","unstructured":"Wanjun Zhong, Ruixiang Cui, Yiduo Guo, Yaobo Liang, Shuai Lu, Yanlin Wang, Amin Saied, Weizhu Chen, and Nan Duan. 2023. AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models. CoRR abs\/2304.06364 (2023)."},{"key":"e_1_3_2_1_101_1","doi-asserted-by":"crossref","unstructured":"Yukun Zhu Ryan Kiros Richard S. Zemel Ruslan Salakhutdinov Raquel Urtasun Antonio Torralba and Sanja Fidler. 2015. Aligning Books and Movies: Towards Story-Like Visual Explanations by Watching Movies and Reading Books. In ICCV. 19--27.","DOI":"10.1109\/ICCV.2015.11"}],"event":{"name":"SIGMOD\/PODS '24: International Conference on Management of Data","location":"Santiago AA Chile","acronym":"SIGMOD\/PODS '24","sponsor":["SIGMOD ACM Special Interest Group on Management of Data"]},"container-title":["Companion of the 2024 International Conference on Management of Data"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3626246.3653385","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3626246.3653385","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,8,22]],"date-time":"2025-08-22T11:31:04Z","timestamp":1755862264000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3626246.3653385"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,6,9]]},"references-count":101,"alternative-id":["10.1145\/3626246.3653385","10.1145\/3626246"],"URL":"https:\/\/doi.org\/10.1145\/3626246.3653385","relation":{},"subject":[],"published":{"date-parts":[[2024,6,9]]},"assertion":[{"value":"2024-06-09","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}