{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T13:14:54Z","timestamp":1783602894220,"version":"3.55.0"},"publisher-location":"Singapore","reference-count":44,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819533428","type":"print"},{"value":"9789819533435","type":"electronic"}],"license":[{"start":{"date-parts":[[2025,11,23]],"date-time":"2025-11-23T00:00:00Z","timestamp":1763856000000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2025,11,23]],"date-time":"2025-11-23T00:00:00Z","timestamp":1763856000000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2026]]},"DOI":"10.1007\/978-981-95-3343-5_24","type":"book-chapter","created":{"date-parts":[[2025,11,22]],"date-time":"2025-11-22T06:31:00Z","timestamp":1763793060000},"page":"307-321","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["TaxBen: Benchmarking the\u00a0Chinese Tax Knowledge of\u00a0Large Language Models"],"prefix":"10.1007","author":[{"given":"Yating","family":"Chen","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Siqi","family":"Lv","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Peiyuan","family":"Xia","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhenxu","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yiming","family":"Qin","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Qingqing","family":"Wang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Gang","family":"Hu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2025,11,23]]},"reference":[{"key":"24_CR1","unstructured":"Bai, J., Bai, et\u00a0al.: Qwen technical report. arXiv preprint arXiv:2309.16609 (2023)"},{"key":"24_CR2","unstructured":"Brown, T., Mann, B., et al.: Language models are few-shot learners. Adv. Neural. Inf. Process. Syst. 33, 1877\u20131901 (2020)"},{"key":"24_CR3","doi-asserted-by":"crossref","unstructured":"Cai, Y., Wang, L., et\u00a0al.: MedBench: a large-scale Chinese benchmark for evaluating medical large language models. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol.\u00a038, pp. 17709\u201317717 (2024)","DOI":"10.1609\/aaai.v38i16.29723"},{"key":"24_CR4","doi-asserted-by":"crossref","unstructured":"Chang, Y., Wang, X., et\u00a0al.: A survey on evaluation of large language models. ACM Trans. Intell. Syst. Technol. 15(3), 1\u201345 (2024)","DOI":"10.1145\/3641289"},{"key":"24_CR5","unstructured":"Chen, Y., Wang, Z., et\u00a0al.: BianQue: balancing the questioning and suggestion ability of health LLMs with multi-turn health conversations polished by ChatGPT. arXiv preprint arXiv:2310.15896 (2023)"},{"key":"24_CR6","doi-asserted-by":"crossref","unstructured":"Chen, Y., Xing, X., et\u00a0al.: SoulChat: improving LLMs\u2019 empathy, listening, and comfort abilities through fine-tuning with multi-turn empathy conversations. In: Findings of the Association for Computational Linguistics, pp. 1170\u20131183 (2023)","DOI":"10.18653\/v1\/2023.findings-emnlp.83"},{"key":"24_CR7","unstructured":"Dai, Y., Feng, D., et\u00a0al.: LAiW: a Chinese legal large language models benchmark. arXiv preprint arXiv:2310.05620 (2023)"},{"key":"24_CR8","doi-asserted-by":"crossref","unstructured":"Fei, Z., Shen, X., et\u00a0al.: LawBench: Benchmarking legal knowledge of large language models. arXiv preprint arXiv:2309.16289 (2023)","DOI":"10.18653\/v1\/2024.emnlp-main.452"},{"key":"24_CR9","unstructured":"Gao, L., Tow, J., Abbasi, B., et\u00a0al.: A framework for few-shot language model evaluation (2024)"},{"key":"24_CR10","unstructured":"GLM, T., Zeng, A., et\u00a0al.: ChatGLM: A family of large language models from GLM-130B to GLM-4 all tools. arXiv preprint arXiv:2406.12793 (2024)"},{"key":"24_CR11","doi-asserted-by":"crossref","unstructured":"Goutte, C., Gaussier, E.: A probabilistic interpretation of precision, recall and f-score, with implication for evaluation. In: European Conference on Information Retrieval, pp. 345\u2013359. Springer (2005)","DOI":"10.1007\/978-3-540-31865-1_25"},{"key":"24_CR12","doi-asserted-by":"crossref","unstructured":"Gu, Z., Zhu, X., et\u00a0al.: Xiezhi: an ever-updating benchmark for holistic domain knowledge evaluation. In: Proceedings of the AAAI Conference on Artificial Intelligence. vol.\u00a038, pp. 18099\u201318107 (2024)","DOI":"10.1609\/aaai.v38i16.29767"},{"key":"24_CR13","unstructured":"Guo, D., Yang, D., et\u00a0al.: DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning. arXiv preprint arXiv:2501.12948 (2025)"},{"key":"24_CR14","unstructured":"Hu, G., Qin, K., et\u00a0al.: No language is an island: Unifying Chinese and English in financial large language models, instruction data, and benchmarks. arXiv preprint arXiv:2403.06249 (2024)"},{"key":"24_CR15","doi-asserted-by":"crossref","unstructured":"Huang, Y., Bai, Y., et\u00a0al.: C-Eval: a multi-level multi-discipline Chinese evaluation suite for foundation models. Adv. Neural Inf. Process. Syst. 36 (2024)","DOI":"10.52202\/075280-2749"},{"key":"24_CR16","unstructured":"Hyun, H.: Tax law dataset raw (2025). https:\/\/hf-mirror.com\/datasets\/hhyun\/Tax_Law_dataset_raw. Accessed 04 Apr 2025"},{"key":"24_CR17","doi-asserted-by":"crossref","unstructured":"Huang, J., Zhu, H., et\u00a0al.: AuditWen: an open-source large language model for audit. In: Proceedings of the 23rd Chinese National Conference on Computational Linguistics, pp. 1351\u20131365 (2024)","DOI":"10.1007\/978-981-97-8367-0_30"},{"key":"24_CR18","unstructured":"Jing, P., Tang, M., et\u00a0al.: SecBench: A comprehensive multi-dimensional benchmarking dataset for LLMs in cybersecurity. arXiv preprint arXiv:2412.20787 (2024)"},{"key":"24_CR19","unstructured":"Kim, K., Zhou, X., et\u00a0al.: How are we detecting inconsistent method names? An empirical study from code review perspective. ACM Transactions on Software Engineering and Methodology (2023)"},{"key":"24_CR20","doi-asserted-by":"crossref","unstructured":"Li, H., Zhang, Y., et\u00a0al.: CMMLU: Measuring massive multitask language understanding in Chinese. arXiv preprint arXiv:2306.09212 (2023)","DOI":"10.18653\/v1\/2024.findings-acl.671"},{"key":"24_CR21","unstructured":"Li, Y., Zhao, J., et\u00a0al.: CLEVA: Chinese language models evaluation platform. arXiv preprint arXiv:2308.04813 (2023)"},{"key":"24_CR22","unstructured":"Luo, Y., Kong, et\u00a0al.: YAYI 2: Multilingual open-source large language models. arXiv preprint arXiv:2312.14862 (2023)"},{"key":"24_CR23","unstructured":"Naudet, L.B.: Livre des proc\u00c3dures fiscales, non-instruct (2023). https:\/\/hf-mirror.com\/datasets\/louisbrulenaudet\/lpf (2023)"},{"key":"24_CR24","unstructured":"Singh, S.: Fake tax form dataset (2025). https:\/\/hf-mirror.com\/datasets\/singhsays\/fake-w2-us-tax-form-dataset. Accessed 04 Apr 2025"},{"key":"24_CR25","unstructured":"Steinigen, D., Namysl, M., et\u00a0al.: Semantic extraction of key figures and their properties from tax legal texts using neural models. In: ASAIL@ ICAIL, pp. 60\u201371 (2023)"},{"key":"24_CR26","unstructured":"Team, G., Mesnard, T., et\u00a0al.: Gemma: Open models based on Gemini research and technology. arXiv preprint arXiv:2403.08295 (2024)"},{"key":"24_CR27","unstructured":"Touvron, H., Martin, L., et\u00a0al.: Llama 2: Open foundation and fine-tuned chat models. arXiv preprint arXiv:2307.09288 (2023)"},{"key":"24_CR28","unstructured":"Wang, H., Liu, C., et\u00a0al.: HuaTuo: Tuning LLaMA model with Chinese medical knowledge. arXiv preprint arXiv:2304.06975 (2023)"},{"key":"24_CR29","unstructured":"Wang, X., Chen, G., et\u00a0al.: CMB: A comprehensive medical benchmark in Chinese. arXiv preprint arXiv:2308.08833 (2023)"},{"key":"24_CR30","doi-asserted-by":"crossref","unstructured":"Xie, Q., Han, W., et\u00a0al.: PIXIU: a comprehensive benchmark, instruction dataset and large language model for finance. In: 37th International Conference on Neural Information Processing Systems (2023)","DOI":"10.52202\/075280-1454"},{"key":"24_CR31","unstructured":"Xie, Q., Han, et\u00a0al.: The FinBen: An holistic financial benchmark for large language models. arXiv preprint arXiv:2402.12659 (2024)"},{"key":"24_CR32","unstructured":"Xu, L., Li, A., et\u00a0al.: SuperCLUE: A comprehensive Chinese large language model benchmark. arXiv preprint arXiv:2307.15020 (2023)"},{"key":"24_CR33","unstructured":"Yang, A., Xiao, B., et\u00a0al.: Baichuan 2: Open large-scale language models. arXiv preprint arXiv:2309.10305 (2023)"},{"key":"24_CR34","unstructured":"Yu, J., et\u00a0al.: TaoLi LLaMA. https:\/\/github.com\/blcuicall\/taoli (2023)"},{"key":"24_CR35","first-page":"27263","volume":"34","author":"W Yuan","year":"2021","unstructured":"Yuan, W., Neubig, G., Liu, P.: BARTScore: evaluating generated text as text generation. Adv. Neural. Inf. Process. Syst. 34, 27263\u201327277 (2021)","journal-title":"Adv. Neural. Inf. Process. Syst."},{"key":"24_CR36","unstructured":"Yue, S., Chen, W., et\u00a0al.: DISC-LawLLM: Fine-tuning large language models for intelligent legal services. arXiv preprint arXiv:2309.11325 (2023)"},{"key":"24_CR37","unstructured":"Zeng, H.: Measuring massive multitask Chinese understanding. arXiv preprint arXiv:2304.12986 (2023)"},{"key":"24_CR38","doi-asserted-by":"crossref","unstructured":"Zeng, H., Xue, J., et\u00a0al.: Evaluating the generation capabilities of large Chinese language models. arXiv preprint arXiv:2308.04823 (2023)","DOI":"10.2139\/ssrn.4578709"},{"key":"24_CR39","unstructured":"Zhang, L., Cai, et\u00a0al.: FinEval: A Chinese financial domain knowledge evaluation benchmark for large language models. arXiv preprint arXiv:2308.09975 (2023)"},{"key":"24_CR40","unstructured":"Zhang, T., Kishore, V., et\u00a0al.: BERTScore: Evaluating text generation with BERT. arXiv preprint arXiv:1904.09675 (2019)"},{"key":"24_CR41","unstructured":"Zhang, X., Li, C., et\u00a0al.: Evaluating the performance of large language models on GAOKAO benchmark. arXiv preprint arXiv:2305.12474 (2023)"},{"key":"24_CR42","doi-asserted-by":"crossref","unstructured":"Zhong, W., Cui, R., et\u00a0al.: AGIEval: A human-centric benchmark for evaluating foundation models. arXiv preprint arXiv:2304.06364 (2023)","DOI":"10.18653\/v1\/2024.findings-naacl.149"},{"key":"24_CR43","unstructured":"Zhou, R., Hua, W., et\u00a0al.: RuleArena: A benchmark for rule-guided reasoning with LLMs in real-world scenarios. arXiv preprint arXiv:2412.08972 (2024)"},{"key":"24_CR44","unstructured":"Zhou, Z., Shi, J.X., et\u00a0al.: LawGPT: A Chinese legal knowledge-enhanced large language model. arXiv preprint arXiv:2406.04614 (2024)"}],"container-title":["Lecture Notes in Computer Science","Natural Language Processing and Chinese Computing"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-95-3343-5_24","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,9]],"date-time":"2026-07-09T12:28:38Z","timestamp":1783600118000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-95-3343-5_24"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,11,23]]},"ISBN":["9789819533428","9789819533435"],"references-count":44,"URL":"https:\/\/doi.org\/10.1007\/978-981-95-3343-5_24","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,11,23]]},"assertion":[{"value":"23 November 2025","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"NLPCC","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"CCF International Conference on Natural Language Processing and Chinese Computing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Urumqi","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"China","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2025","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"7 August 2025","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"9 August 2025","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"14","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"nlpcc2025","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/tcci.ccf.org.cn\/conference\/2025\/index.php","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}