arXiv 自然语言处理· Jungseob Lee, Dongyub Jude Lee, Sugyeong Eo, Seongtae Hong, Seungyoon Lee, Heuiseok Lim·· 7 小时前AI 评分45
拒答可定位但破坏会转移:少样本微调下的大语言模型安全层研究
Refusal Localizes, the Damage Relocates: Safety Layers Under Few-Sample Fine-Tuning
AI 导读
最新研究表明,基于定位大语言模型安全层的防御机制在自适应微调攻击下容易失效,安全破坏会转移至未受保护区域。在4个模型家族的6个检查点测试中,即使冻结关键安全层,100个有害样本微调仍使拒答率接近归零。在 Llama-3.1-8B 上,攻击者通过分散参数更新即可击破奇异方向修复机制,局部冻结仅在少量有害样本意外混入时有效。
来源:arXiv 自然语言处理 · arxiv.org