{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,15]],"date-time":"2026-07-15T16:14:52Z","timestamp":1784132092291,"version":"3.55.0"},"reference-count":57,"publisher":"Tsinghua University Press","issue":"2","content-domain":{"domain":[],"crossmark-restriction":false},"short-container-title":["Big Data Min. Anal."],"published-print":{"date-parts":[[2025,4]]},"DOI":"10.26599\/bdma.2024.9020068","type":"journal-article","created":{"date-parts":[[2025,1,28]],"date-time":"2025-01-28T18:53:58Z","timestamp":1738090438000},"page":"430-446","source":"Crossref","is-referenced-by-count":15,"title":["Federated Transfer Learning for On-Device LLMs Efficient Fine Tuning Optimization"],"prefix":"10.26599","volume":"8","author":[{"given":"Chuantao","family":"Li","sequence":"first","affiliation":[{"name":"Qilu University of Technology,Key Laboratory of Computing Power Network and Information Security, Shandong Computer Science Center (National Supercomputer Center in Jinan), (Shandong Academy of Sciences),Jinan,China,250000"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Bruce","family":"Gu","sequence":"additional","affiliation":[{"name":"Qilu University of Technology,Key Laboratory of Computing Power Network and Information Security, Shandong Computer Science Center (National Supercomputer Center in Jinan), (Shandong Academy of Sciences),Jinan,China,250000"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Zhigang","family":"Zhao","sequence":"additional","affiliation":[{"name":"Qilu University of Technology,Key Laboratory of Computing Power Network and Information Security, Shandong Computer Science Center (National Supercomputer Center in Jinan), (Shandong Academy of Sciences),Jinan,China,250000"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Youyang","family":"Qu","sequence":"additional","affiliation":[{"name":"Qilu University of Technology,Key Laboratory of Computing Power Network and Information Security, Shandong Computer Science Center (National Supercomputer Center in Jinan), (Shandong Academy of Sciences),Jinan,China,250000"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guomao","family":"Xin","sequence":"additional","affiliation":[{"name":"TelChina Group Co. Ltd.,Jinan,China,250000"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Jidong","family":"Huo","sequence":"additional","affiliation":[{"name":"Qilu University of Technology,Key Laboratory of Computing Power Network and Information Security, Shandong Computer Science Center (National Supercomputer Center in Jinan), (Shandong Academy of Sciences),Jinan,China,250000"}],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Longxiang","family":"Gao","sequence":"additional","affiliation":[{"name":"Qilu University of Technology,Key Laboratory of Computing Power Network and Information Security, Shandong Computer Science Center (National Supercomputer Center in Jinan), (Shandong Academy of Sciences),Jinan,China,250000"}],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"11138","reference":[{"key":"ref1","first-page":"27730","article-title":"Training language models to follow instructions with human feedback","volume-title":"Proc. 36th Int. Conf. Neural Information Processing Systems","author":"Ouyang"},{"key":"ref2","article-title":"Teach LLMs to personalizean approach inspired by writing education","author":"Li","year":"2023","journal-title":"arXiv preprint"},{"key":"ref3","doi-asserted-by":"publisher","DOI":"10.1145\/3580305.3599790"},{"key":"ref4","first-page":"30016","article-title":"Training compute-optimal large language models","volume-title":"Proc. 36th Int. Conf. Neural Information Processing System","author":"Hoffmann"},{"key":"ref5","article-title":"Will we run out of data? An analysis of the limits of scaling datasets in machine learning","author":"Villalobos","year":"2022","journal-title":"arXiv preprint"},{"key":"ref6","doi-asserted-by":"publisher","DOI":"10.1007\/978-3-319-57959-7"},{"key":"ref7","first-page":"1273","article-title":"Communication-efficient learning of deep networks from decentralized data","volume-title":"Proc. 20th Int. Conf. Artificial Intelligence and Statistics","author":"McMahan"},{"key":"ref8","doi-asserted-by":"publisher","DOI":"10.3390\/s21103335"},{"key":"ref9","first-page":"38831","article-title":"FedSR: A simple and effective domain generalization method for federated learning","volume-title":"Proc. 36th Int. Conf. Neural Information Processing System","author":"Nguyen"},{"key":"ref10","doi-asserted-by":"publisher","DOI":"10.1109\/TII.2021.3088057"},{"key":"ref11","doi-asserted-by":"publisher","DOI":"10.1109\/TII.2022.3210597"},{"key":"ref12","doi-asserted-by":"publisher","DOI":"10.26599\/BDMA.2022.9020046"},{"key":"ref13","article-title":"FATE-LLM: A industrial grade federated learning framework for large language models","author":"Fan","year":"2023","journal-title":"arXiv preprint"},{"key":"ref14","article-title":"Offsite-tuning: Transfer learning without full model","author":"Xiao","year":"2023","journal-title":"arXiv preprint"},{"key":"ref15","doi-asserted-by":"publisher","DOI":"10.1145\/3637528.3671573"},{"key":"ref16","article-title":"Federated large language model: A position paper","author":"Chen","year":"2023","journal-title":"arXiv preprint"},{"key":"ref17","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.eacl-main.39"},{"key":"ref18","article-title":"LoRA: Low-rank adaptation of large language models","author":"Hu","year":"2022","journal-title":"arXiv preprint"},{"key":"ref19","article-title":"A comparative study between full-parameter and LoRA-based fine-tuning on Chinese instruction data for instruction following large language model","author":"Sun","year":"2023","journal-title":"arXiv preprint"},{"key":"ref20","first-page":"30318","article-title":"LLM.int8(): 8-bit matrix multiplication for transformers at scale","volume-title":"Proc. 36th Int. Conf. Neural Information Processing Systems","author":"Dettmers"},{"key":"ref21","article-title":"MiniLLM: Knowledge distillation of large language models","author":"Gu","year":"2023","journal-title":"arXiv preprint"},{"key":"ref22","article-title":"Sheared LLaMA: Accelerating language model pre-training via structured pruning","author":"Xia","year":"2024","journal-title":"arXiv preprint"},{"key":"ref23","article-title":"Baichuan 2: Open large-scale language models","author":"Yang","year":"2023","journal-title":"arXiv preprint"},{"key":"ref24","doi-asserted-by":"publisher","DOI":"10.18653\/vl\/N19-142"},{"key":"ref25","volume-title":"Improving language understanding by generative pre-training","author":"Radford","year":"2023"},{"key":"ref26","first-page":"1877","article-title":"Language models are few-shot learners","volume-title":"Proc. 34th Int. Conf. Neural Information Processing Systems","author":"Brown"},{"key":"ref27","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-long.26"},{"key":"ref28","article-title":"Emergent abilities of large language models","author":"Wei","year":"2022","journal-title":"arXiv preprint"},{"key":"ref29","article-title":"LLaMA: Open and efficient foundation language models","author":"Touvron","year":"2023","journal-title":"arXiv preprint"},{"key":"ref30","article-title":"DISC-MedLLM: Bridging general large language models and real-world medical consultation","author":"Bao","year":"2023","journal-title":"arXiv preprint"},{"key":"ref31","first-page":"2790","article-title":"Parameter-efficient transfer learning for NLP","volume-title":"Proc. 36th Int. Conf. Machine Learning","author":"Houlsby"},{"key":"ref32","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acllong.353"},{"key":"ref33","article-title":"Towards a unified view of parameter-efficient transfer learning","author":"He","year":"2022","journal-title":"arXiv preprint"},{"key":"ref34","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2024.naacl-long.481"},{"key":"ref35","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.emnlp-main.252"},{"key":"ref36","doi-asserted-by":"publisher","DOI":"10.48550\/ARXIV.1706.03762"},{"key":"ref37","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2023.acl-short.107"},{"key":"ref38","article-title":"VeRA: Vector-based random matrix adaptation","author":"Kopiczko","year":"2023","journal-title":"arXiv preprint"},{"key":"ref39","doi-asserted-by":"publisher","DOI":"10.1016\/j.neucom.2021.07.045"},{"key":"ref40","first-page":"10088","article-title":"QLORA: Efficient finetuning of quantized LLMs","volume-title":"Proc. 37th Int. Conf. Neural Information Processing Systems","author":"Dettmers"},{"key":"ref41","doi-asserted-by":"publisher","DOI":"10.1371\/journal.pone.0279743"},{"key":"ref42","doi-asserted-by":"publisher","DOI":"10.7759\/cureus.40895"},{"key":"ref43","article-title":"MedAlpaca-An open-source collection of medical conversational AI models and training data","author":"Han","year":"2023","journal-title":"arXiv preprint"},{"key":"ref44","doi-asserted-by":"publisher","DOI":"10.1007\/s41666-020-00082-4"},{"key":"ref45","article-title":"Measuring the intrinsic dimension of objective landscapes","author":"Li","year":"2018","journal-title":"arXiv preprint"},{"key":"ref46","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2021.acl-long.568"},{"key":"ref47","article-title":"DeBERTaV3: Improving DeBERTa using ELECTRA-style pre-training with gradient-disentangled embedding sharing","author":"He","year":"2021","journal-title":"arXiv preprint"},{"key":"ref48","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/W18-5446"},{"key":"ref49","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/D16-1264"},{"key":"ref50","article-title":"PyTorch: An imperative style, high-performance deep learning library","author":"Paszke","year":"2019","journal-title":"arXiv preprint"},{"key":"ref51","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.acl-short.1"},{"key":"ref52","article-title":"Decoupled weight decay regularization","author":"Loshchilov","year":"2019","journal-title":"arXiv preprint"},{"key":"ref53","doi-asserted-by":"publisher","DOI":"10.18653\/v1\/2022.emnlp-demos.10"},{"key":"ref54","article-title":"InstructIE: A Chinese instruction-based information extraction dataset","author":"Gui","year":"2023","journal-title":"arXiv preprint"},{"key":"ref55","volume-title":"Vicuna: An open-source Chatbot impressing GPT -4 with 90%* ChatGPT quality","author":"Chiang","year":"2023"},{"key":"ref56","first-page":"1308","article-title":"AlpacaFarm: A simulation framework for methods that learn from human feedback","volume-title":"Proc. 37th Int. Conf. Neural Information Processing Systems","author":"Dubois"},{"key":"ref57","article-title":"Judging LLM-as-a-judge with MT-bench and Chatbot arena","author":"Zheng","year":"2023","journal-title":"arXiv preprint"}],"container-title":["Big Data Mining and Analytics"],"original-title":[],"link":[{"URL":"http:\/\/xplorestaging.ieee.org\/ielx8\/8254253\/10856852\/10856857.pdf?arnumber=10856857","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2025,1,29]],"date-time":"2025-01-29T19:16:24Z","timestamp":1738178184000},"score":1,"resource":{"primary":{"URL":"https:\/\/ieeexplore.ieee.org\/document\/10856857\/"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2025,4]]},"references-count":57,"journal-issue":{"issue":"2"},"URL":"https:\/\/doi.org\/10.26599\/bdma.2024.9020068","relation":{},"ISSN":["2096-0654","2097-406X"],"issn-type":[{"value":"2096-0654","type":"print"},{"value":"2097-406X","type":"electronic"}],"subject":[],"published":{"date-parts":[[2025,4]]}}}