{"status":"ok","message-type":"work","message-version":"1.0.0","message":{"indexed":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T13:12:56Z","timestamp":1784207576645,"version":"3.55.0"},"publisher-location":"Singapore","reference-count":32,"publisher":"Springer Nature Singapore","isbn-type":[{"value":"9789819234349","type":"print"},{"value":"9789819234356","type":"electronic"}],"license":[{"start":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T00:00:00Z","timestamp":1784246400000},"content-version":"tdm","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"},{"start":{"date-parts":[[2026,7,17]],"date-time":"2026-07-17T00:00:00Z","timestamp":1784246400000},"content-version":"vor","delay-in-days":0,"URL":"https:\/\/www.springernature.com\/gp\/researchers\/text-and-data-mining"}],"content-domain":{"domain":["link.springer.com"],"crossmark-restriction":false},"short-container-title":[],"published-print":{"date-parts":[[2027]]},"DOI":"10.1007\/978-981-92-3435-6_12","type":"book-chapter","created":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T12:18:11Z","timestamp":1784204291000},"page":"136-147","update-policy":"https:\/\/doi.org\/10.1007\/springer_crossmark_policy","source":"Crossref","is-referenced-by-count":0,"title":["Steering into Weights: Persistent Behavioral Editing for Targeted Harm Categories"],"prefix":"10.1007","author":[{"ORCID":"https:\/\/orcid.org\/0009-0004-3699-1691","authenticated-orcid":false,"given":"Xinyuan","family":"Liu","sequence":"first","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Ding","family":"Cao","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuchen","family":"Cai","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Yuqing","family":"Huang","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]},{"given":"Guiquan","family":"Liu","sequence":"additional","affiliation":[],"role":[{"vocabulary":"crossref","role":"author"}]}],"member":"297","published-online":{"date-parts":[[2026,7,17]]},"reference":[{"key":"12_CR1","volume-title":"Jailbreaking leading safety-aligned llms with simple adaptive attacks","author":"M Andriushchenko","year":"2025","unstructured":"Andriushchenko, M., Croce, F., Flammarion, N.: Jailbreaking leading safety-aligned llms with simple adaptive attacks. In, ICLR (2025)"},{"key":"12_CR2","doi-asserted-by":"publisher","DOI":"10.52202\/079017-4322","volume-title":"Refusal in language models is mediated by a single direction","author":"A Arditi","year":"2024","unstructured":"Arditi, A., et al.: Refusal in language models is mediated by a single direction. In, NeurIPS (2024)"},{"key":"12_CR3","unstructured":"Cao, N.D., Aziz, W., Titov, I.: Editing factual knowledge in language models. In: EMNLP (2021)."},{"issue":"5","key":"12_CR4","doi-asserted-by":"publisher","first-page":"378","DOI":"10.1037\/h0031619","volume":"76","author":"JL Fleiss","year":"1971","unstructured":"Fleiss, J.L.: Measuring nominal scale agreement among many raters. Psychol. Bull. 76(5), 378 (1971)","journal-title":"Psychol. Bull."},{"key":"12_CR5","doi-asserted-by":"crossref","unstructured":"Gao, L., Geng, J., Zhang, X., Nakov, P., Chen, X.: Shaping the safety boundaries: Understanding and defending against jailbreaks in large language models. In: ACL, pp. 25378\u201325398 (2025).","DOI":"10.18653\/v1\/2025.acl-long.1233"},{"key":"12_CR6","doi-asserted-by":"crossref","unstructured":"Geva, M., Caciularu, A., Wang, K.R., Goldberg, Y.: Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space. In: EMNLP, pp. 30\u201345 (2022).","DOI":"10.18653\/v1\/2022.emnlp-main.3"},{"key":"12_CR7","doi-asserted-by":"crossref","unstructured":"Geva, M., Schuster, R., Berant, J., Levy, O.: Transformer feed-forward layers are key-value memories. In: EMNLP, pp. 5484\u20135495 (2021).","DOI":"10.18653\/v1\/2021.emnlp-main.446"},{"key":"12_CR8","doi-asserted-by":"crossref","unstructured":"Gu, J., et al.: Model editing harms general abilities of large language models: Regularization to the rescue. In: EMNLP, pp. 16801\u201316819 (2024).","DOI":"10.18653\/v1\/2024.emnlp-main.934"},{"key":"12_CR9","doi-asserted-by":"crossref","unstructured":"Han, S., et al.: Wildguard: Open one-stop moderation tools for safety risks, jailbreaks, and refusals of llms. In: NeurIPS (2024).","DOI":"10.52202\/079017-0261"},{"key":"12_CR10","unstructured":"Hu, E.J., et al.: Lora: Low-rank adaptation of large language models. In: ICLR (2022)."},{"key":"12_CR11","unstructured":"Huang, B., et al.: Model editing as a double-edged sword: steering agent ethical behavior toward beneficence or harm. CoRR. abs\/2506.20606 (2025)"},{"key":"12_CR12","unstructured":"Karaman, B.K., Zabir, I., Benhaim, A., Chaudhary, V., Sabuncu, M.R., Song, X.: Porover: Improving safety and reducing overrefusal in large language models with overgeneration and preference optimization. In: ICML (2025)."},{"key":"12_CR13","unstructured":"Lee, B.W., et al.: Programming refusal with conditional activation steering. In: ICLR (2025)."},{"key":"12_CR14","unstructured":"Lee, S., et al.: Probing the difficulty perception mechanism of large language models. CoRR. abs\/2510.05969 (2025)"},{"key":"12_CR15","doi-asserted-by":"crossref","unstructured":"Li, K., Patel, O., Vi\u00e9gas, F.B., Pfister, H., Wattenberg, M.: Inference-time intervention: Eliciting truthful answers from a language model. In: NeurIPS (2023).","DOI":"10.52202\/075280-1797"},{"key":"12_CR16","doi-asserted-by":"crossref","unstructured":"Li, Y., Jiang, H., Wei, Z.: Detam: Defending llms against jailbreak attacks via targeted attention modification. In: ACL, pp. 11781\u201311797 (2025).","DOI":"10.18653\/v1\/2025.findings-acl.613"},{"key":"12_CR17","doi-asserted-by":"crossref","unstructured":"Meng, K., Bau, D., Andonian, A., Belinkov, Y.: Locating and editing factual associations in GPT. In: NeurIPS (2022).","DOI":"10.52202\/068431-1262"},{"key":"12_CR18","unstructured":"Meng, K., Sharma, A.S., Andonian, A.J., Belinkov, Y., Bau, D.: Mass-editing memory in a transformer. In: ICLR (2023),"},{"key":"12_CR19","doi-asserted-by":"crossref","unstructured":"Pan, L., Tong, Y., Zhang, X., Zhang, X., Zhou, J., Chu, Z.: Understanding and mitigating overrefusal in LLMs from an unveiling perspective of safety decision boundary. In: EMNLP, pp. 21068\u201321086 (2025).","DOI":"10.18653\/v1\/2025.emnlp-main.1065"},{"key":"12_CR20","unstructured":"Qwen, et al.: Qwen2.5 technical report. CoRR https:\/\/arxiv.org\/abs\/2412.15115 (2025)."},{"key":"12_CR21","doi-asserted-by":"crossref","unstructured":"Rimsky, N., Gabrieli, N., Schulz, J., Tong, M., Hubinger, E., Turner, A.: Steering llama 2 via contrastive activation addition. In: ACL, pp. 15504\u201315522 (2024).","DOI":"10.18653\/v1\/2024.acl-long.828"},{"key":"12_CR22","unstructured":"Song, M., Kim, H., Kim, J., Shin, S., Son, S.: Refusal is not an option: Unlearning safety alignment of large language models. In: USENIX Security, pp. 319\u2013338 (2025)."},{"key":"12_CR23","doi-asserted-by":"crossref","unstructured":"Sun, Y., Stolfo, A., Sachan, M.: Probing for arithmetic errors in language models. CoRR https:\/\/arxiv.org\/abs\/2507.12379 (2025).","DOI":"10.18653\/v1\/2025.emnlp-main.411"},{"key":"12_CR24","unstructured":"Todd, E., Li, M.L., Sharma, A.S., Mueller, A., Wallace, B.C., Bau, D.: Function vectors in large language models. In: ICLR (2024)."},{"key":"12_CR25","unstructured":"Touvron, H., et al.: Llama 2: Open foundation and fine-tuned chat models. CoRR https:\/\/arxiv.org\/abs\/2307.09288 (2023)."},{"key":"12_CR26","unstructured":"Turner, A.M., et al.: Steering language models with activation engineering. CoRR https:\/\/arxiv.org\/abs\/2308.10248 (2023)."},{"key":"12_CR27","unstructured":"Wei, B., et al.: Assessing the brittleness of safety alignment via pruning and low-rank modifications. In: ICML (2024)."},{"key":"12_CR28","unstructured":"Wollschl\u00e4ger, T., Elstner, J., Geisler, S., Cohen-Addad, V., G\u00fcnnemann, S., Gasteiger, J.: The geometry of refusal in large language models: Concept cones and representational independence. In: ICML (2025)."},{"key":"12_CR29","unstructured":"Youssef, P., Zhao, Z., Braun, D., Schl\u00f6tterer, J., Seifert, C.: Position: Editing large language models poses serious safety risks. In: ICML (2025)."},{"key":"12_CR30","unstructured":"Zhao, J., Huang, J., Wu, Z., Bau, D., Shi, W.: Llms encode harmfulness and refusal separately. CoRR https:\/\/arxiv.org\/abs\/2507.11878 (2025)."},{"key":"12_CR31","doi-asserted-by":"crossref","unstructured":"Zheng, Y., Zhang, R., Zhang, J., Ye, Y., Luo, Z.: LlamaFactory: Unified efficient fine-tuning of 100+ language models. In: ACL, pp. 400\u2013410 (2024).","DOI":"10.18653\/v1\/2024.acl-demos.38"},{"key":"12_CR32","unstructured":"Zou, A., et al.: Representation engineering: A top-down approach to AI transparency. CoRR https:\/\/arxiv.org\/abs\/2310.01405 (2023)."}],"container-title":["Lecture Notes in Computer Science","Advanced Intelligent Computing Technology and Applications"],"original-title":[],"language":"en","link":[{"URL":"https:\/\/link.springer.com\/content\/pdf\/10.1007\/978-981-92-3435-6_12","content-type":"unspecified","content-version":"vor","intended-application":"similarity-checking"}],"deposited":{"date-parts":[[2026,7,16]],"date-time":"2026-07-16T12:18:18Z","timestamp":1784204298000},"score":1,"resource":{"primary":{"URL":"https:\/\/link.springer.com\/10.1007\/978-981-92-3435-6_12"}},"subtitle":[],"short-title":[],"issued":{"date-parts":[[2026,7,17]]},"ISBN":["9789819234349","9789819234356"],"references-count":32,"URL":"https:\/\/doi.org\/10.1007\/978-981-92-3435-6_12","relation":{},"ISSN":["0302-9743","1611-3349"],"issn-type":[{"value":"0302-9743","type":"print"},{"value":"1611-3349","type":"electronic"}],"subject":[],"published":{"date-parts":[[2026,7,17]]},"assertion":[{"value":"17 July 2026","order":1,"name":"first_online","label":"First Online","group":{"name":"ChapterHistory","label":"Chapter History"}},{"value":"ICIC","order":1,"name":"conference_acronym","label":"Conference Acronym","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"International Conference on Intelligent Computing","order":2,"name":"conference_name","label":"Conference Name","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Toronto","order":3,"name":"conference_city","label":"Conference City","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"Canada","order":4,"name":"conference_country","label":"Conference Country","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"2026","order":5,"name":"conference_year","label":"Conference Year","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22 July 2026","order":7,"name":"conference_start_date","label":"Conference Start Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"26 July 2026","order":8,"name":"conference_end_date","label":"Conference End Date","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"22","order":9,"name":"conference_number","label":"Conference Number","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"icic2026a","order":10,"name":"conference_id","label":"Conference ID","group":{"name":"ConferenceInfo","label":"Conference Information"}},{"value":"http:\/\/www.ic-icc.cn\/2026\/index.htm","order":11,"name":"conference_url","label":"Conference URL","group":{"name":"ConferenceInfo","label":"Conference Information"}}]}}