跳到正文
原文
arXiv 人工智能· Jianwei Li, Min-Seon Kim, Jung-Eun Kim·· 4 小时前AI 评分43

基于专家隔离与关停的大语言模型后门遏制

Backdoor Containment via Expert Quarantine and Shutdown in LLMs

AI 导读

研究人员提出大语言模型后门遏制策略 QES,通过在训练中将后门行为分流至指定隔离专家并在部署时关停,有效消除后门威胁。该方法在类 MoE 架构中为模型添加专家专属 LoRA 分支与轻量路由器,部署时仅需常数时间将隔离专家权重置零,无需筛查触发器或更新模型权重。实验显示,QES 在多数设置下将攻击成功率 ASR 从 100% 降至 0-10%,且下游任务能力基本不受影响。

来源:arXiv 人工智能 · arxiv.org