{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T05:05:08Z","timestamp":1750309508384,"version":"3.41.0"},"publisher-location":"New York, NY, USA","reference-count":42,"publisher":"ACM","license":[{"start":{"date-parts":[[2024,12,6]],"date-time":"2024-12-06T00:00:00Z","timestamp":1733443200000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.acm.org\/publications\/policies\/copyright_policy#Background"}],"funder":[{"name":"National Key R&D Program of China","award":["2022YFF0608000"],"award-info":[{"award-number":["2022YFF0608000"]}]}],"content-domain":{"domain":["dl.acm.org"],"crossmark-restriction":true},"short-container-title":[],"published-print":{"date-parts":[[2024,12,6]]},"DOI":"10.1145\/3709026.3709044","type":"proceedings-article","created":{"date-parts":[[2025,2,15]],"date-time":"2025-02-15T10:05:41Z","timestamp":1739613941000},"page":"197-203","update-policy":"https:\/\/doi.org\/10.1145\/crossmark-policy","source":"Crossref","is-referenced-by-count":0,"title":["Tex2Py-45K: A Parallel Corpus Dataset for Bidirectional Conversion Between LaTeX and Python"],"prefix":"10.1145","author":[{"ORCID":"https:\/\/orcid.org\/0000-0002-8891-1786","authenticated-orcid":false,"given":"Lei","family":"Li","sequence":"first","affiliation":[{"name":"Zhejiang Lab, Hangzhou, ZheJiang, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0009-0003-0333-3994","authenticated-orcid":false,"given":"Manni","family":"Duan","sequence":"additional","affiliation":[{"name":"Zhejiang Lab, Hangzhou, ZheJiang, China"}],"role":[{"role":"author","vocabulary":"crossref"}]},{"ORCID":"https:\/\/orcid.org\/0000-0002-7675-2327","authenticated-orcid":false,"given":"Yongheng","family":"Wang","sequence":"additional","affiliation":[{"name":"Zhejiang Lab, Hangzhou, ZheJiang, China"}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"320","published-online":{"date-parts":[[2025,2,15]]},"reference":[{"key":"e_1_3_3_2_1_2","doi-asserted-by":"publisher","unstructured":"Loubna Ben Allal Raymond Li Denis Kocetkov et al. 2023. SantaCoder: don't reach for the stars! CoRR abs\/2301.03988 (2023). 10.48550\/ARXIV.2301.03988 arXiv:2301.03988","DOI":"10.48550\/ARXIV.2301.03988"},{"key":"e_1_3_3_2_2_2","doi-asserted-by":"publisher","DOI":"10.1145\/3359591.3359735"},{"key":"e_1_3_3_2_3_2","doi-asserted-by":"publisher","unstructured":"Rohan Anil Andrew M. Dai Orhan Firat et al. 2023. PaLM 2 Technical Report. CoRR abs\/2305.10403 (2023). 10.48550\/ARXIV.2305.10403 arXiv:2305.10403","DOI":"10.48550\/ARXIV.2305.10403"},{"key":"e_1_3_3_2_4_2","volume-title":"AIP Conference Proceedings","volume":"2331","author":"Arifin Samsul","year":"2021","unstructured":"Samsul Arifin and Indra Bayu Muktyas. 2021. Generate a system of linear equation through unimodular matrix using Python and Latex. In AIP Conference Proceedings, Vol. 2331. AIP Publishing."},{"key":"e_1_3_3_2_5_2","doi-asserted-by":"publisher","unstructured":"Sid Black Stella Biderman Eric Hallahan et al. 2022. GPT-NeoX-20B: An Open-Source Autoregressive Language Model. CoRR abs\/2204.06745 (2022). 10.48550\/ARXIV.2204.06745 arXiv:2204.06745","DOI":"10.48550\/ARXIV.2204.06745"},{"key":"e_1_3_3_2_6_2","volume-title":"Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020","author":"Brown Tom B.","year":"2020","unstructured":"Tom B. Brown, Benjamin Mann, Nick Ryder, et al. 2020. Language Models are Few-Shot Learners. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020, December 6-12, 2020, virtual, Hugo Larochelle, Marc'Aurelio Ranzato, Raia Hadsell, Maria-Florina Balcan, and Hsuan-Tien Lin (Eds.). https:\/\/proceedings.neurips.cc\/paper\/2020\/hash\/1457c0d6bfcb4967418bfb8ac142f64a-Abstract.html"},{"key":"e_1_3_3_2_7_2","doi-asserted-by":"crossref","unstructured":"Michael L Bynum Gabriel A Hackebeil William E Hart et al. 2021. Pyomo-optimization modeling in python. Vol. 67. Springer.","DOI":"10.1007\/978-3-030-68928-5_5"},{"key":"e_1_3_3_2_8_2","unstructured":"Mark Chen Jerry Tworek Heewoo Jun et al. 2021. Evaluating Large Language Models Trained on Code. CoRR abs\/2107.03374 (2021). arXiv:2107.03374 https:\/\/arxiv.org\/abs\/2107.03374"},{"key":"e_1_3_3_2_9_2","article-title":"PaLM: Scaling Language Modeling with Pathways","volume":"24","author":"Chowdhery Aakanksha","year":"2023","unstructured":"Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, et al. 2023. PaLM: Scaling Language Modeling with Pathways. J. Mach. Learn. Res. 24 (2023), 240:1\u2013240:113. http:\/\/jmlr.org\/papers\/v24\/22-1144.html","journal-title":"J. Mach. Learn. Res."},{"key":"e_1_3_3_2_10_2","unstructured":"Silvia Crafa Fabio Marcuzzi Marco Virgulin et al. 2014. Computing from LaTeX: automated numerical computing from LaTeX expressions. (2014)."},{"key":"e_1_3_3_2_11_2","volume-title":"QLoRA: Efficient Finetuning of Quantized LLMs. In Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023","author":"Dettmers Tim","year":"2023","unstructured":"Tim Dettmers, Artidoro Pagnoni, Ari Holtzman, and Luke Zettlemoyer. 2023. QLoRA: Efficient Finetuning of Quantized LLMs. In Advances in Neural Information Processing Systems 36: Annual Conference on Neural Information Processing Systems 2023, NeurIPS 2023, New Orleans, LA, USA, December 10 - 16, 2023, Alice Oh, Tristan Naumann, Amir Globerson, Kate Saenko, Moritz Hardt, and Sergey Levine (Eds.). http:\/\/papers.nips.cc\/paper_files\/paper\/2023\/hash\/1feb87871436031bdc0f2beaa62a049b-AbstractConference.html"},{"key":"e_1_3_3_2_12_2","doi-asserted-by":"publisher","DOI":"10.1145\/3639477.3639719"},{"key":"e_1_3_3_2_13_2","doi-asserted-by":"publisher","unstructured":"Qingxiu Dong Li Dong Ke Xu et al. 2023. Large Language Model for Science: A Study on P vs. NP. CoRR abs\/2309.05689 (2023). 10.48550\/ARXIV.2309.05689 arXiv:2309.05689","DOI":"10.48550\/ARXIV.2309.05689"},{"key":"e_1_3_3_2_14_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICASSP43922.2022.9747049"},{"key":"e_1_3_3_2_15_2","doi-asserted-by":"publisher","DOI":"10.1108\/AJIM-08-2018-0185"},{"key":"e_1_3_3_2_16_2","doi-asserted-by":"publisher","unstructured":"Suriya Gunasekar Yi Zhang Jyoti Aneja et al. 2023. Textbooks Are All You Need. CoRR abs\/2306.11644 (2023). 10.48550\/ARXIV.2306.11644 arXiv:2306.11644","DOI":"10.48550\/ARXIV.2306.11644"},{"key":"e_1_3_3_2_17_2","doi-asserted-by":"publisher","unstructured":"Jordan Hoffmann Sebastian Borgeaud Arthur Mensch et al. 2022. Training Compute-Optimal Large Language Models. CoRR abs\/2203.15556 (2022). 10.48550\/ARXIV.2203.15556 arXiv:2203.15556","DOI":"10.48550\/ARXIV.2203.15556"},{"key":"e_1_3_3_2_18_2","volume-title":"DOBF: A Deobfuscation Pre-Training Objective for Programming Languages. In Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021","author":"Lachaux Marie-Anne","year":"2021","unstructured":"Marie-Anne Lachaux, Baptiste Rozi\u00e8re, Marc Szafraniec, and Guillaume Lample. 2021. DOBF: A Deobfuscation Pre-Training Objective for Programming Languages. In Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021, NeurIPS 2021, December 6-14, 2021, virtual, Marc'Aurelio Ranzato, Alina Beygelzimer, Yann N. Dauphin, Percy Liang, and Jennifer Wortman Vaughan (Eds.). 14967\u201314979. https:\/\/proceedings.neurips.cc\/paper\/2021\/hash\/7d6548bdc0082aacc950ed35e91fcccb-Abstract.html"},{"key":"e_1_3_3_2_19_2","doi-asserted-by":"publisher","unstructured":"Yujia Li David H. Choi Junyoung Chung et al. 2022. Competition-Level Code Generation with AlphaCode. CoRR abs\/2203.07814 (2022). 10.48550\/ARXIV.2203.07814 arXiv:2203.07814","DOI":"10.48550\/ARXIV.2203.07814"},{"key":"e_1_3_3_2_20_2","doi-asserted-by":"publisher","DOI":"10.1145\/3479547"},{"key":"e_1_3_3_2_21_2","doi-asserted-by":"publisher","unstructured":"Tuan Dung Nguyen Yuan-Sen Ting Ioana Ciuca et al. 2023. AstroLLaMA: Towards Specialized Foundation Models in Astronomy. CoRR abs\/2309.06126 (2023). 10.48550\/ARXIV.2309.06126 arXiv:2309.06126","DOI":"10.48550\/ARXIV.2309.06126"},{"key":"e_1_3_3_2_22_2","doi-asserted-by":"publisher","DOI":"10.1109\/ACCESS.2021.3063715"},{"key":"e_1_3_3_2_24_2","volume-title":"Integrating Tree Path in Transformer for Code Representation. In Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021","author":"Peng Han","year":"2021","unstructured":"Han Peng, Ge Li, Wenhan Wang, Yunfei Zhao, and Zhi Jin. 2021. Integrating Tree Path in Transformer for Code Representation. In Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021, NeurIPS 2021, December 6-14, 2021, virtual, Marc'Aurelio Ranzato, Alina Beygelzimer, Yann N. Dauphin, Percy Liang, and Jennifer Wortman Vaughan (Eds.). 9343\u20139354. https:\/\/proceedings.neurips.cc\/paper\/2021\/hash\/4e0223a87610176ef0d24ef6d2dcde3a-Abstract.html"},{"key":"e_1_3_3_2_25_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-long.645"},{"key":"e_1_3_3_2_26_2","unstructured":"Jack W. Rae Sebastian Borgeaud Trevor Cai et al. 2021. Scaling Language Models: Methods Analysis & Insights from Training Gopher. CoRR abs\/2112.11446 (2021). arXiv:2112.11446 https:\/\/arxiv.org\/abs\/2112.11446"},{"key":"e_1_3_3_2_27_2","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-demo.45"},{"key":"e_1_3_3_2_28_2","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2308.12950"},{"key":"e_1_3_3_2_29_2","volume-title":"Unsupervised Translation of Programming Languages. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020","author":"Rozi\u00e8re Baptiste","year":"2020","unstructured":"Baptiste Rozi\u00e8re, Marie-Anne Lachaux, Lowik Chanussot, and Guillaume Lample. 2020. Unsupervised Translation of Programming Languages. In Advances in Neural Information Processing Systems 33: Annual Conference on Neural Information Processing Systems 2020, NeurIPS 2020, December 6-12, 2020, virtual, Hugo Larochelle, Marc'Aurelio Ranzato, Raia Hadsell, Maria-Florina Balcan, and Hsuan-Tien Lin (Eds.). https:\/\/proceedings.neurips.cc\/paper\/2020\/hash\/ed23fbf18c2cd35f8c7f8de44f85c08d-Abstract.html"},{"volume-title":"Generating Natural Language IsiZulu Text From Mathematical Expressions. Ph. D. Dissertation. Bachelor's Thesis","author":"Smith Shannon","key":"e_1_3_3_2_30_2","unstructured":"Shannon Smith. 2020. Generating Natural Language IsiZulu Text From Mathematical Expressions. Ph. D. Dissertation. Bachelor's Thesis. University of Cape Town."},{"key":"e_1_3_3_2_31_2","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.2307.02502"},{"key":"e_1_3_3_2_32_2","doi-asserted-by":"publisher","DOI":"10.1109\/ICSEC51790.2020.9375339"},{"key":"e_1_3_3_2_33_2","doi-asserted-by":"publisher","unstructured":"Hugo Touvron Thibaut Lavril Gautier Izacard et al. 2023. LLaMA: Open and Efficient Foundation Language Models. CoRR abs\/2302.13971 (2023). 10.48550\/ARXIV.2302.13971 arXiv:2302.13971","DOI":"10.48550\/ARXIV.2302.13971"},{"key":"e_1_3_3_2_34_2","doi-asserted-by":"publisher","unstructured":"Hugo Touvron Louis Martin Kevin Stone et al. 2023. Llama 2: Open Foundation and Fine-Tuned Chat Models. CoRR abs\/2307.09288 (2023). 10.48550\/ARXIV.2307.09288 arXiv:2307.09288","DOI":"10.48550\/ARXIV.2307.09288"},{"key":"e_1_3_3_2_35_2","doi-asserted-by":"publisher","DOI":"10.7717\/PEERJ-CS.161"},{"key":"e_1_3_3_2_36_2","doi-asserted-by":"publisher","DOI":"10.1109\/EDUCON52537.2022.9766732"},{"key":"e_1_3_3_2_37_2","volume-title":"GPT-J-6B: a 6 billion parameter autoregressive language model","author":"Wang Ben","year":"2021","unstructured":"Ben Wang and Aran Komatsuzaki. 2022. GPT-J-6B: a 6 billion parameter autoregressive language model (2021). URL https:\/\/github. com\/kingoflolz\/mesh-transformer-jax (2022)."},{"key":"e_1_3_3_2_38_2","doi-asserted-by":"publisher","DOI":"10.1145\/3395027.3419580"},{"key":"e_1_3_3_2_39_2","doi-asserted-by":"publisher","DOI":"10.1007\/S10032-020-00360-2"},{"key":"e_1_3_3_2_40_2","volume-title":"Madrid Larra\u00f1aga","author":"Witzel Wayne M.","year":"2020","unstructured":"Wayne M. Witzel, Warren D. Craft, Robert D. Carr, and Joaqu\u00edn E. Madrid Larra\u00f1aga. 2020. Prove-It: A Proof Assistant for Organizing and Verifying General Mathematical Knowledge. CoRR abs\/2012.10987 (2020). arXiv:2012.10987 https:\/\/arxiv.org\/abs\/2012.10987"},{"key":"e_1_3_3_2_41_2","volume-title":"Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021","author":"Ying Chengxuan","year":"2021","unstructured":"Chengxuan Ying, Tianle Cai, Shengjie Luo, et al. 2021. Do Transformers Really Perform Badly for Graph Representation?. In Advances in Neural Information Processing Systems 34: Annual Conference on Neural Information Processing Systems 2021, NeurIPS 2021, December 6-14, 2021, virtual, Marc'Aurelio Ranzato, Alina Beygelzimer, Yann N. Dauphin, Percy Liang, and Jennifer Wortman Vaughan (Eds.). 28877\u201328888. https:\/\/proceedings.neurips.cc\/paper\/2021\/hash\/f1c1592588411002af340cbaedd6fc33-Abstract.html"},{"key":"e_1_3_3_2_42_2","volume-title":"The Eleventh International Conference on Learning Representations, ICLR 2023","author":"Zeng Aohan","year":"2023","unstructured":"Aohan Zeng, Xiao Liu, Zhengxiao Du, et al. 2023. GLM-130B: An Open Bilingual Pre-trained Model. In The Eleventh International Conference on Learning Representations, ICLR 2023, Kigali, Rwanda, May 1-5, 2023. OpenReview.net. https:\/\/openreview.net\/forum?id=-Aw0rrrPUF"},{"key":"e_1_3_3_2_43_2","doi-asserted-by":"publisher","DOI":"10.7763\/IJCTE.2017.V9.1180"}],"event":{"name":"CSAI 2024: 2024 8th International Conference on Computer Science and Artificial Intelligence (CSAI)","acronym":"CSAI 2024","location":"Beijing China"},"container-title":["Proceedings of the 2024 8th International Conference on Computer Science and Artificial Intelligence"],"original-title":[],"link":[{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3709026.3709044","content-type":"unspecified","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/dl.acm.org\/doi\/pdf\/10.1145\/3709026.3709044","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,6,19]],"date-time":"2025-06-19T01:17:56Z","timestamp":1750295876000},"score":1,"resource":{"primary":{"URL":"https:\/\/dl.acm.org\/doi\/10.1145\/3709026.3709044"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2024,12,6]]},"references-count":42,"alternative-id":["10.1145\/3709026.3709044","10.1145\/3709026"],"URL":"https:\/\/doi.org\/10.1145\/3709026.3709044","relation":{},"subject":[],"published":{"date-parts":[[2024,12,6]]},"assertion":[{"value":"2025-02-15","order":3,"name":"published","label":"Published","group":{"name":"publication_history","label":"Publication History"}}]}}