{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,5,14]],"date-time":"2026-05-14T16:52:23Z","timestamp":1778777543118,"version":"3.51.4"},"reference-count":32,"publisher":"Emerald","issue":"4","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2025,8,19]]},"abstract":"<jats:sec>\n                  <jats:title>Purpose<\/jats:title>\n                  <jats:p>Research data sets are typically distributed across different data repositories and lack standardized classification information, which hinders effective discovery and access. This study aims to develop an automated method that assigns Chinese Library Classification (CLC) codes to data sets to facilitate user searching and browsing data sets.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Design\/methodology\/approach<\/jats:title>\n                  <jats:p>This study experiments with a three-step method for the automatic classification of research data sets: firstly, a multilingual classification model is trained to identify data sets with valid descriptions; subsequently, a multilingual generative large language model fine-tuned with book bibliographic data is used to generate CLC codes for data sets based on their valid descriptions; and, finally, the generated CLC codes are validated and corrected by a prefix tree constructed with valid CLC codes.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Findings<\/jats:title>\n                  <jats:p>Experimental results demonstrate that the proposed three-step method effectively classifies data sets. The CLC codes generated by the model are highly consistent with the classification information provided by the data set contributors, achieving a classification accuracy of 0.8520 for the first-level category and 0.4080 at the full CLC code level.<\/jats:p>\n               <\/jats:sec>\n               <jats:sec>\n                  <jats:title>Originality\/value<\/jats:title>\n                  <jats:p>This study proposes a method for the hierarchical classification of multilingual research data sets by accurately identifying data sets with valid descriptions, generating classification codes and correcting faulty codes. It provides a scalable and effective solution for data set classification and management.<\/jats:p>\n               <\/jats:sec>","DOI":"10.1108\/el-02-2025-0042","type":"journal-article","created":{"date-parts":[[2025,6,9]],"date-time":"2025-06-09T03:46:17Z","timestamp":1749440777000},"page":"600-618","source":"Crossref","is-referenced-by-count":2,"title":["Automatic classification of research data sets into the Chinese Library Classification with generative large language model"],"prefix":"10.1108","volume":"43","author":[{"given":"Pengcheng","family":"Luo","sequence":"first","affiliation":[{"name":"Peking University Peking University Library, , Beijing,","place":["China"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lingzi","family":"Hong","sequence":"additional","affiliation":[{"name":"University of North Texas College of Information, , Denton, ,","place":["Texas, USA"]}],"role":[{"role":"author","vocabulary":"crossref"}]},{"given":"Lei","family":"Nie","sequence":"additional","affiliation":[{"name":"Beijing Foreign Studies University Country and Area Studies Academy, , Beijing,","place":["China"]}],"role":[{"role":"author","vocabulary":"crossref"}]}],"member":"140","published-online":{"date-parts":[[2025,6,10]]},"reference":[{"key":"2025090509271353200_ref001","doi-asserted-by":"publisher","first-page":"230","DOI":"10.1007\/978-3-031-16802-4_18","volume-title":"26th International Conference on Theory and Practice of Digital Libraries","author":"Abdelrahman","year":"2022"},{"key":"2025090509271353200_ref002","doi-asserted-by":"publisher","first-page":"667","DOI":"10.1007\/978-3-030-62466-8_41","volume-title":"19th International Semantic Web Conference","author":"Benjelloun","year":"2020"},{"key":"2025090509271353200_ref003","unstructured":"Bu, S.\n           (2017), \u201cChinese Library Classification (CLC)\u201d, available at:www.isko.org\/cyclo\/clc (accessed 28 December 2024)."},{"issue":"1","key":"2025090509271353200_ref004","doi-asserted-by":"publisher","first-page":"107","DOI":"10.2218\/ijdc.v7i1.218","article-title":"Making data a first class scientific output: data citation and publication by NERC\u2019s environmental data centres","volume":"7","author":"Callaghan","year":"2012","journal-title":"International Journal of Digital Curation"},{"key":"2025090509271353200_ref005","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.wpi.2020.101968","article-title":"Parameter tuning na\u00efve Bayes for automatic patent classification","volume":"61","author":"Cassidy","year":"2020","journal-title":"World Patent Information"},{"issue":"1","key":"2025090509271353200_ref006","doi-asserted-by":"publisher","first-page":"251","DOI":"10.1007\/s00778-019-00564-x","article-title":"Dataset search: a survey","volume":"29","author":"Chapman","year":"2020","journal-title":"The VLDB Journal"},{"key":"2025090509271353200_ref007","unstructured":"Danil\u00e1k, M.\n           (2021), \u201cLangdetect\u201d, available at:https:\/\/github.com\/Mimino666\/langdetect (accessed 28 December 2024)."},{"key":"2025090509271353200_ref008","doi-asserted-by":"publisher","first-page":"218658","DOI":"10.1109\/ACCESS.2020.3041651","article-title":"An AI-based methodology for the automatic classification of a multi-class ebook collection using information from the tables of contents","volume":"8","author":"Giannopoulou","year":"2020","journal-title":"IEEE Access"},{"issue":"1","key":"2025090509271353200_ref009","doi-asserted-by":"publisher","first-page":"18","DOI":"10.2478\/jdis-2020-0003","article-title":"Automatic classification of Swedish metadata using Dewey decimal classification: a comparison of approaches","volume":"5","author":"Golub","year":"2020","journal-title":"Journal of Data and Information Science"},{"issue":"5","key":"2025090509271353200_ref010","doi-asserted-by":"publisher","first-page":"1057","DOI":"10.1108\/JD-01-2022-0026","article-title":"Automated Dewey decimal classification of Swedish library metadata using Annif software","volume":"80","author":"Golub","year":"2024","journal-title":"Journal of Documentation"},{"issue":"3","key":"2025090509271353200_ref011","doi-asserted-by":"publisher","first-page":"1239","DOI":"10.1007\/s11192-019-03246-1","article-title":"Analysis of the effect of data properties in automated patent classification","volume":"121","author":"Gomez","year":"2019","journal-title":"Scientometrics"},{"key":"2025090509271353200_ref012","volume-title":"The Fourth Paradigm: Data-Intensive Scientific Discovery","author":"Hey","year":"2009"},{"key":"2025090509271353200_ref013","unstructured":"Hu, E.J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L. and Chen, W. (2021), \u201cLora: low-rank adaptation of large language models\u201d, available at:https:\/\/arxiv.org\/abs\/2106.09685 (accessed 28 December 2024)."},{"key":"2025090509271353200_ref014","unstructured":"Kostina, A., Dikaiakos, M.D., Stefanidis, D. and Pallis, G. (2025), \u201cLarge language models for text classification: case study and comprehensive review\u201d, available at:https:\/\/arxiv.org\/abs\/2501.08457 (accessed 29 March 2025)."},{"issue":"3","key":"2025090509271353200_ref015","doi-asserted-by":"publisher","first-page":"755","DOI":"10.1108\/JD-06-2020-0092","article-title":"Automatic classification of older electronic texts into the Universal Decimal Classification\u2013UDC","volume":"77","author":"Kragelj","year":"2021","journal-title":"Journal of Documentation"},{"key":"2025090509271353200_ref016","doi-asserted-by":"publisher","first-page":"345","DOI":"10.1109\/JCDL.2019.00063","volume-title":"ACM\/IEEE Joint Conference on Digital Libraries (JCDL \u201819)","author":"Lyu","year":"2019"},{"key":"2025090509271353200_ref017","doi-asserted-by":"publisher","first-page":"196","DOI":"10.11588\/heibooks.979.c13729","volume-title":"E-Science-Tage 2021","author":"Martens","year":"2021"},{"key":"2025090509271353200_ref018","first-page":"2825","article-title":"Scikit-learn: machine learning in Python","volume":"12","author":"Pedregosa","year":"2011","journal-title":"The Journal of Machine Learning Research"},{"key":"2025090509271353200_ref019","unstructured":"Re3data\n           (2024), \u201cRegistry of research data repositories\u201d, available at:www.re3data.org\/ (accessed 28 December 2024)."},{"key":"2025090509271353200_ref020","doi-asserted-by":"crossref","unstructured":"Reimers, N. and Gurevych, I. (2019), \u201cSentence-Bert: sentence embeddings using Siamese Bert-networks\u201d, available at:https:\/\/arxiv.org\/abs\/1908.10084 (accessed 29 March 2025).","DOI":"10.18653\/v1\/D19-1410"},{"key":"2025090509271353200_ref021","doi-asserted-by":"publisher","first-page":"896","DOI":"10.1109\/ICMCSI64620.2025","volume-title":"The 6th International Conference on Mobile Computing and Sustainable Informatics","author":"Sujitha","year":"2025"},{"key":"2025090509271353200_ref022","unstructured":"Sun, X., Li, X., Li, J., Wu, F., Guo, S., Zhang, T. and Wang, G. (2023), \u201cText classification via large language models\u201d, available at:https:\/\/arxiv.org\/abs\/2305.08377 (accessed 29 March 2025)."},{"key":"2025090509271353200_ref023","doi-asserted-by":"publisher","first-page":"33","DOI":"10.1145\/3677779.3677785","article-title":"Efficient fine-tuning of short text classification based on large language model","volume-title":"Proceedings of the International Conference on Modeling, Natural Language Processing and Machine Learning","author":"Wang","year":"2024"},{"issue":"1","key":"2025090509271353200_ref024","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1038\/sdata.2016.18","article-title":"The FAIR guiding principles for scientific data management and stewardship","volume":"3","author":"Wilkinson","year":"2016","journal-title":"Scientific Data"},{"issue":"3","key":"2025090509271353200_ref025","doi-asserted-by":"publisher","first-page":"219","DOI":"10.5771\/0943-7444-2021-3-219","article-title":"Evaluating utility and automatic classification of subject metadata from research data Australia","volume":"48","author":"Wu","year":"2021","journal-title":"Knowledge Organization"},{"key":"2025090509271353200_ref026","unstructured":"Wu, M., Gregory, K., L\u00f6ffler, F., Mathiak, B., Psomopoulos, F., Schindler, U., Aryani, A., Bodera, J. and Jael, L. (2024), \u201cTen principles to improve dataset discoverability\u201d, available at:www.rd-alliance.org\/groups\/data-discovery-paradigms-ig\/outputs\/?output=142966 (accessed 28 December 2024)."},{"issue":"6","key":"2025090509271353200_ref027","doi-asserted-by":"publisher","first-page":"1","DOI":"10.1016\/j.xinn.2023.100525","article-title":"Artificial intelligence for science\u2014bridging data to wisdom","volume":"4","author":"Xu","year":"2023","journal-title":"The Innovation"},{"key":"2025090509271353200_ref028","unstructured":"Yang, A., Yang, B., Hui, B., Zheng, B., Yu, B., Zhou, C. and Fan, Z. (2024), \u201cQwen2 technical report\u201d, available at:https:\/\/arxiv.org\/abs\/2407.10671 (accessed 28 December 2024)."},{"issue":"13\/14","key":"2025090509271353200_ref029","doi-asserted-by":"publisher","first-page":"9283","DOI":"10.1007\/s11042-019-7400-3","article-title":"Bibliographic automatic classification algorithm based on semantic space transformation","volume":"79","author":"Yu","year":"2020","journal-title":"Multimedia Tools and Applications"},{"key":"2025090509271353200_ref030","unstructured":"Zhang, S., Wu, M. and Zhang, X. (2023), \u201cUtilising a large language model to annotate subject metadata: a case study in an Australian national research data catalogue\u201d, available at:https:\/\/arxiv.org\/abs\/2310.11318 (accessed 28 December 2024)."},{"issue":"4","key":"2025090509271353200_ref031","doi-asserted-by":"publisher","first-page":"104","DOI":"10.13530\/j.cnki.jlis.2022034","article-title":"Construction of a practical application-oriented automatic classification engine for scientific literature","volume":"48","author":"Zhang","year":"2022","journal-title":"Journal of Library Science in China"},{"key":"2025090509271353200_ref032","unstructured":"Zhao, W.X., Zhou, K., Li, J., Tang, T., Wang, X., Hou, Y., Min, Y., Zhang, B., Zhang, J., Dong, Z., Du, Y., Yang, C., Chen, Y., Chen, Z., Jiang, J., Ren, R., Li, Y., Tang, X., Liu, Z., Liu, P., Nie, J.Y. and Wen, J.R. (2023), \u201cA survey of large language models\u201d, available at:https:\/\/arxiv.org\/abs\/2303.18223 (accessed 28 December 2024)."}],"container-title":["The Electronic Library"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/www.emerald.com\/insight\/content\/doi\/10.1108\/EL-02-2025-0042\/full\/xml","content-type":"application\/xml","content-version":"vor","intended-application":"text-mining"},{"URL":"https:\/\/www.emerald.com\/el\/article-pdf\/43\/4\/600\/10075651\/el-02-2025-0042en.pdf","content-type":"application\/pdf","content-version":"vor","intended-application":"syndication"},{"URL":"https:\/\/www.emerald.com\/el\/article-pdf\/43\/4\/600\/10075651\/el-02-2025-0042en.pdf","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,9,5]],"date-time":"2025-09-05T13:31:22Z","timestamp":1757079082000},"score":1,"resource":{"primary":{"URL":"https:\/\/www.emerald.com\/el\/article\/43\/4\/600\/1265105\/Automatic-classification-of-research-data-sets"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,6,10]]},"references-count":32,"journal-issue":{"issue":"4","published-print":{"date-parts":[[2025,8,19]]}},"URL":"https:\/\/doi.org\/10.1108\/el-02-2025-0042","relation":{},"ISSN":["0264-0473","1758-616X"],"issn-type":[{"value":"0264-0473","type":"print"},{"value":"1758-616X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,6,10]]}}}