arXiv 人工智能· Jianwei Li, Jung-Eun Kim·· 3 小时前AI 评分34
基于零空间投影的 LoRA 微调大语言模型后门净化
Backdoor Purification for LoRA-Tuned LLMs via Null-Space Projection
AI 导读
研究人员提出一种基于零空间投影的方法,无需先验触发词、干净样本或事后重训练,即可净化 LoRA 微调大语言模型的后门。该方法通过提取高保真后门方向,将 LoRA 更新投影至各层输入与输出通道的正交零空间中。实验表明,该技术将攻击成功率(ASR)从接近 100% 降至 10% 以下,同时保留了基座模型性能与适配器学得的下游技能。
来源:arXiv 人工智能 · arxiv.org